GuideVerified

DeepSeek-V4-Flash 部署笔记:2×5090 与 4×3090 上 UD-IQ2_XXS 的对比

bit_squeezer8 days ago3 replies

最近在两台机器上都部署了 DeepSeek-V4-Flash 的 UD-IQ2_XXS(这模型 FP8 原版太大,IQ2 档是甜点位),站内两条记录都是我提交的,这里展开讲讲。

2×5090(站内记录 #21):

  • decode 19.39 tok/s,prefill 692 tok/s,显存 51.17G
  • 单卡 32G,两张正好装下,NVLink 没有,走 PCIe 5.0 x16 对拆
  • 优点:安静、省电,整卡功耗不到 900W

4×3090(站内记录 #23):

  • decode 35.68 tok/s,prefill 420 tok/s,显存 87.16G
  • 层摊得薄,decode 反而更快——这个模型 expert 数多,tensor 并行切细了之后访存效率上来了
  • prefill 反而低,多卡同步开销,意料之中

结论:如果你只要 decode 流畅(聊天、agent),4×3090 性价比高得多(二手 3090 现在不到 5090 的三分之一);要 prefill 吞吐(批量总结、RAG 入库)选 5090 对。

踩坑:3090 组必须关 CUDA MPS,否则层分配会乱。

Replies (3)

matrix_w7 days ago

请教下 4×3090 那 87.16G 是怎么分布的?平均一卡 22G 不到,是不是前三张摊满、第四张只放了几层?我在考虑收两张 3090 组 48G,不知道 IQ2 档能不能塞下。

bit_squeezer7 days ago
Quoted matrix_w:请教下 4×3090 那 87.16G 是怎么分布的?平均一卡 22G 不到,是不是前三张摊满、第四张只放了几层?我在考虑收两张 3090 组 48G,不知道 IQ2 档能不能塞下。

基本是均匀的,每卡 21.8G 左右,llama.cpp 的 -ts 默认均分。2×3090 48G 塞不下 51G 的模型,差 3G;要么降 IQ1 档(质量掉得明显),要么 CPU offload 两层(decode 大概掉到 25 左右)。我建议 48G 方案直接换更小的量化或者换模型。

江南卡皇6 days ago

「4×3090 decode 反超 2×5090」这个反直觉但很有道理,学到了。已收藏这条。

Sign in to reply and join the discussion.

Sign in to reply