matrix_w4 天前
10877 的 prefill 是 batch 64 这句太关键了,之前看记录还以为是单流,吓了一跳。想问 5080(16G)跑 NVFP4 的小模型有戏吗?比如 27B 压到 16G 内。
站内记录 #31 那条 171.10 tok/s / prefill 10877 tok/s 的数据是我们实验室跑出来的,这里把复现条件写全,免得有人拿到卡对不上数。
环境:RTX PRO 6000 Blackwell 96G,SGLang 0.5.x,模型 Qwen3.8-27B NVFP4 量化版,CUDA 13.0。
要点:
对比同卡 FP8 的 SGLang 记录(31.5 decode / 5089 prefill),NVFP4 decode 快 5 倍以上,精度损失在我们评测集上 < 1%。Blackwell 的第五代 Tensor Core 对 FP4 的支持是实打实的。
有问题欢迎楼下问。
10877 的 prefill 是 batch 64 这句太关键了,之前看记录还以为是单流,吓了一跳。想问 5080(16G)跑 NVFP4 的小模型有戏吗?比如 27B 压到 16G 内。
引用 matrix_w:10877 的 prefill 是 batch 64 这句太关键了,之前看记录还以为是单流,吓了一跳。想问 5080(16G)跑 NVFP4 的小模型有戏吗?比如 27B 压到 16G 内。
27B NVFP4 纯权重 13.5G 左右,5080 16G 理论上塞得下但 kv cache 只剩 2G,context 开不大,而且 5080 的显存带宽只有 PRO 6000 的三分之一,decode 估计 40-50 tok/s。能玩,但别指望复制我们这条数。
登录后即可回复,与社区交流部署经验。
登录后回复