晒成果已收录

3090 单卡跑 Qwen3.6-27B Q5_K_S:46.6 tok/s,显存 21.5G 刚刚好

matrix_w11 天前2 条回复

周末把 Qwen3.6-27B 的 Q5_K_S 搬到我的单张 3090 上跑了一晚上,llama.cpp 全 offload。

实测 decode 46.57 tok/s,prefill 1201 tok/s,显存占用 21.53G——24G 的卡留了 2G 多给系统和桌面,不爆。

数据已经提交到本站记录里了(关联在下方)。几个心得:

  • Q5_K_S 比 Q4_K_M 只慢了不到 20%,但长上下文的幻觉明显少,27B 这个档位我觉得值得上 Q5
  • context 开到 32k 以上显存就吃紧了,16k 是甜点
  • 风扇拉满,热点温度 82°C,夏天估计得降压

有同卡跑这个模型的欢迎来对数。

回复(2)

江南卡皇11 天前

同 3090 路过。我跑的 Q4_K_M 是 57.02 tok/s(站内也有这条记录),跟你的差值基本就是 Q4→Q5 的代价,比例对得上。prefill 我 1299 比你高一点,可能是你 desktop 还占了点显存。

matrix_w11 天前
引用 江南卡皇:同 3090 路过。我跑的 Q4KM 是 57.02 tok/s(站内也有这条记录),跟你的差值基本就是 Q4→Q5 的代价,比例对得上。prefill 我 1299 比你高一点,可能是你 desktop 还占了点显存。

对,我开着浏览器和 IDE 跑的,纯 CLI 应该还能再挤一点。你那 57 tok/s 日常码字已经够流畅了,我是为了长文档总结才上的 Q5。

登录后即可回复,与社区交流部署经验。

登录后回复