HelpVerified

7900 XTX 跑 Qwen3.8-27B:IQ3_S 只有 22 tok/s,Q4_K_M 反而 124?是我姿势不对吗

江南卡皇10 days ago2 replies

The author has marked this as solved

先贴站内已有的三条 7900 XTX + Qwen3.8-27B 记录:

量化 decode prefill
Q4_K_M 124.10 tok/s 156 tok/s
IQ3_S 22.03 tok/s 422 tok/s
IQ3_S(另一条) 31.43 tok/s 553 tok/s

我自己复现出来跟 IQ3_S 那两条差不多, decode 慢得离谱。Q4_K_M 那条 124 tok/s 我看着很怀疑人生——量化更低反而快 5 倍?

环境:ROCm 6.4,llama.cpp b6xxx,-ngl 99。是不是 ik_llama 的分支差异?还是 IQ3_S 在 ROCm 上 kernel 没优化?求指点。

Replies (2)

bit_squeezer9 days ago

这现象是正常的,不是姿势问题。IQ 系的量化矩阵格式在 GPU 上的 kernel 效率普遍不如 K 系,尤其在 ROCm 上——IQ3_S 的 dot kernel 在 RDNA3 基本走 fallback 路径。Q4_K_M 那 124 tok/s 是 Q4_K 的 kernel 在 ROCm 上有专门优化(mmq),所以倒挂是真的。

另外注意 Q4_K_M 那条 prefill 只有 156,比 IQ3_S 的 422 还低,说明两条记录的 prompt 处理参数(-b 之类)可能不一样,对比时记得看条件。

江南卡皇8 days ago
Quoted bit_squeezer:这现象是正常的,不是姿势问题。IQ 系的量化矩阵格式在 GPU 上的 kernel 效率普遍不如 K 系,尤其在 ROCm 上——IQ3S 的 dot kernel 在 RDNA3 基本走 fallback 路径。Q4KM 那 124 to

懂了,就是 kernel 覆盖度的问题。那我日常就 Q4_K_M 了,IQ3_S 留给 CPU offload 场景。谢谢!

Sign in to reply and join the discussion.

Sign in to reply