指南已收录

SGLang NVFP4 在 RTX PRO 6000 Blackwell 上跑 Qwen3.8-27B:171 tok/s 复现要点

bit_squeezer4 天前2 条回复

站内记录 #31 那条 171.10 tok/s / prefill 10877 tok/s 的数据是我们实验室跑出来的,这里把复现条件写全,免得有人拿到卡对不上数。

环境:RTX PRO 6000 Blackwell 96G,SGLang 0.5.x,模型 Qwen3.8-27B NVFP4 量化版,CUDA 13.0。

要点:

  1. 必须开 cuda graph(默认开),NVFP4 的 decode kernel 小,不开 graph launch overhead 能吃掉 30%
  2. mem-fraction-static 调到 0.92,96G 的卡别客气
  3. prefill 10877 这个数字是 batch=64 的吞吐,单流 prefill 没这么高,别误会
  4. 显存 88.32G 是含 kv cache 池的占用,不是纯权重

对比同卡 FP8 的 SGLang 记录(31.5 decode / 5089 prefill),NVFP4 decode 快 5 倍以上,精度损失在我们评测集上 < 1%。Blackwell 的第五代 Tensor Core 对 FP4 的支持是实打实的。

有问题欢迎楼下问。

回复(2)

matrix_w4 天前

10877 的 prefill 是 batch 64 这句太关键了,之前看记录还以为是单流,吓了一跳。想问 5080(16G)跑 NVFP4 的小模型有戏吗?比如 27B 压到 16G 内。

bit_squeezer4 天前
引用 matrix_w:10877 的 prefill 是 batch 64 这句太关键了,之前看记录还以为是单流,吓了一跳。想问 5080(16G)跑 NVFP4 的小模型有戏吗?比如 27B 压到 16G 内。

27B NVFP4 纯权重 13.5G 左右,5080 16G 理论上塞得下但 kv cache 只剩 2G,context 开不大,而且 5080 的显存带宽只有 PRO 6000 的三分之一,decode 估计 40-50 tok/s。能玩,但别指望复制我们这条数。

登录后即可回复,与社区交流部署经验。

登录后回复