SGLang NVFP4 在 RTX PRO 6000 Blackwell 上跑 Qwen3.8-27B:171 tok/s 复现要点
站内记录 #31 那条 171.10 tok/s / prefill 10877 tok/s 的数据是我们实验室跑出来的,这里把复现条件写全,免得有人拿到卡对不上数。 环境:RTX PRO 6000 Blackwell 96G,SGLang
Ask questions, share benchmark results, and swap deployment notes. Community posts are not verified by this site.
站内记录 #31 那条 171.10 tok/s / prefill 10877 tok/s 的数据是我们实验室跑出来的,这里把复现条件写全,免得有人拿到卡对不上数。 环境:RTX PRO 6000 Blackwell 96G,SGLang
一直在本站查数据做选型,先感谢维护。 一个建议:现在记录里有 decode/prefill/显存,但对自建 NAS/家庭服务器的人来说,功耗其实是很关键的维度。3090 和 7900 XTX 跑同一个模型,tok/s 可能差不多,但功耗差
给老卡党们汇报一个邪道玩法:Ternary Bonsai 2 27B 是个三进制(ternary)模型,权重只有 {-1, 0, +1},配合 PTQ1_0 打包,整模 7.03G 显存,我的老 3080 10G 全 offload 还剩
最近在两台机器上都部署了 DeepSeek-V4-Flash 的 UD-IQ2_XXS(这模型 FP8 原版太大,IQ2 档是甜点位),站内两条记录都是我提交的,这里展开讲讲。 2×5090(站内记录 #21): decode 19.39
先贴站内已有的三条 7900 XTX + Qwen3.8-27B 记录: | 量化 | decode | prefill | |---|---|---| | Q4KM | 124.10 tok/s | 156 tok/s | | IQ3S
周末把 Qwen3.6-27B 的 Q5KS 搬到我的单张 3090 上跑了一晚上,llama.cpp 全 offload。 实测 decode 46.57 tok/s,prefill 1201 tok/s,显存占用 21.53G——24G
6 items