matrix_w6 days ago
7G 跑 27B,离谱。PTQ1_0 这个量化标记是字面意思「每参数 1 bit」吗?那 27B×1bit 应该是 3.4G 左右,剩下的 3.6G 是 embedding 和 kv cache?
给老卡党们汇报一个邪道玩法:Ternary Bonsai 2 27B 是个三进制(ternary)模型,权重只有 {-1, 0, +1},配合 PTQ1_0 打包,整模 7.03G 显存,我的老 3080 10G 全 offload 还剩 3G 开 context。
llama.cpp 实测 decode 52.18 tok/s,prefill 1210 tok/s(站内记录 #36)。
质量方面:跟原版 27B 比肯定有损,但日常问答、代码补全完全可用,比同显存能跑的任何 7B/8B 模型强一档。感觉三进制路线对消费级显卡是真友好。
缺点也说说:模型生态还小,fine-tune 工具链不成熟;prompt 格式比较挑,建议直接用官方 chat template。
7G 跑 27B,离谱。PTQ1_0 这个量化标记是字面意思「每参数 1 bit」吗?那 27B×1bit 应该是 3.4G 左右,剩下的 3.6G 是 embedding 和 kv cache?
Quoted matrix_w:7G 跑 27B,离谱。PTQ1_0 这个量化标记是字面意思「每参数 1 bit」吗?那 27B×1bit 应该是 3.4G 左右,剩下的 3.6G 是 embedding 和 kv cache?
差不多,ternary 实际是 log2(3)≈1.58 bit/weight,27B 下来 5.3G 上下,再加一些 fp16 的敏感层(embedding、norm),7G 合理。kv cache 是另外算的,我 context 开的 8k。
Sign in to reply and join the discussion.
Sign in to reply