Community

Ask questions, share benchmark results, and swap deployment notes. Community posts are not verified by this site.

Start a discussion

6 topics

GuideVerified

SGLang NVFP4 在 RTX PRO 6000 Blackwell 上跑 Qwen3.8-27B:171 tok/s 复现要点

站内记录 #31 那条 171.10 tok/s / prefill 10877 tok/s 的数据是我们实验室跑出来的,这里把复现条件写全,免得有人拿到卡对不上数。 环境:RTX PRO 6000 Blackwell 96G,SGLang

bit_squeezer4 days ago2 replies
Feedback

建议:记录页能否增加每瓦性能(tok/s/W)字段?

一直在本站查数据做选型,先感谢维护。 一个建议:现在记录里有 decode/prefill/显存,但对自建 NAS/家庭服务器的人来说,功耗其实是很关键的维度。3090 和 7900 XTX 跑同一个模型,tok/s 可能差不多,但功耗差

matrix_w5 days ago2 replies
ShowcaseVerified

RTX 3080 10G 跑 27B 模型?Ternary Bonsai 2 三进制 PTQ1_0 只要 7G 显存

给老卡党们汇报一个邪道玩法:Ternary Bonsai 2 27B 是个三进制(ternary)模型,权重只有 {-1, 0, +1},配合 PTQ1_0 打包,整模 7.03G 显存,我的老 3080 10G 全 offload 还剩

江南卡皇6 days ago2 replies
GuideVerified

DeepSeek-V4-Flash 部署笔记:2×5090 与 4×3090 上 UD-IQ2_XXS 的对比

最近在两台机器上都部署了 DeepSeek-V4-Flash 的 UD-IQ2_XXS(这模型 FP8 原版太大,IQ2 档是甜点位),站内两条记录都是我提交的,这里展开讲讲。 2×5090(站内记录 #21): decode 19.39

bit_squeezer8 days ago3 replies

6 items