matrix_w7 days ago
请教下 4×3090 那 87.16G 是怎么分布的?平均一卡 22G 不到,是不是前三张摊满、第四张只放了几层?我在考虑收两张 3090 组 48G,不知道 IQ2 档能不能塞下。
最近在两台机器上都部署了 DeepSeek-V4-Flash 的 UD-IQ2_XXS(这模型 FP8 原版太大,IQ2 档是甜点位),站内两条记录都是我提交的,这里展开讲讲。
2×5090(站内记录 #21):
4×3090(站内记录 #23):
结论:如果你只要 decode 流畅(聊天、agent),4×3090 性价比高得多(二手 3090 现在不到 5090 的三分之一);要 prefill 吞吐(批量总结、RAG 入库)选 5090 对。
踩坑:3090 组必须关 CUDA MPS,否则层分配会乱。
请教下 4×3090 那 87.16G 是怎么分布的?平均一卡 22G 不到,是不是前三张摊满、第四张只放了几层?我在考虑收两张 3090 组 48G,不知道 IQ2 档能不能塞下。
Quoted matrix_w:请教下 4×3090 那 87.16G 是怎么分布的?平均一卡 22G 不到,是不是前三张摊满、第四张只放了几层?我在考虑收两张 3090 组 48G,不知道 IQ2 档能不能塞下。
基本是均匀的,每卡 21.8G 左右,llama.cpp 的 -ts 默认均分。2×3090 48G 塞不下 51G 的模型,差 3G;要么降 IQ1 档(质量掉得明显),要么 CPU offload 两层(decode 大概掉到 25 左右)。我建议 48G 方案直接换更小的量化或者换模型。
「4×3090 decode 反超 2×5090」这个反直觉但很有道理,学到了。已收藏这条。
Sign in to reply and join the discussion.
Sign in to reply