指南
大模型低成本运行:不只取决于显存,取决于整机数据搬运和调度能力
本地推理瓶颈已从 VRAM 转到整机数据搬运 + 调度。同卡同模型 llama.cpp ~50 tok/s vs Strata 70 tok/s(+40%)。3060 12GB 整机方案 ¥2500 = 4090 77% 性能 / 38% 价格。
来源: araoai
大模型低成本运行:不只取决于显存,取决于整机数据搬运和调度能力
这是一句反对"显存党"的判断——也是 2026 年本地推理的真正分水岭。
为什么"显存党"out 了
旧认知:能装下 = 跑得动。模型 16GB + 卡 12GB = 装不下 = 跑不动。
2026 年变了——模型权重可以分块 offload 到 RAM/SSD,问题不再是"装得下",而是"搬得快"。
新瓶颈:整机数据搬运 + 调度
三个数据搬运路径:
- GPU ↔ VRAM(显存带宽,HBM/GDDR 决定)
- RTX 5090: 1.79 TB/s
- RTX 3060 12GB: 360 GB/s
- CPU ↔ RAM(DDR5 内存带宽)
- DDR5 5600 双通道: 89.6 GB/s
- DDR4 3200 双通道: 51.2 GB/s
- SSD ↔ CPU(NVMe 顺序读)
- PCIe 4.0 NVMe: 7 GB/s
- PCIe 3.0 NVMe: 3.5 GB/s
- 机械硬盘: 0.2 GB/s(拖死)
调度决定上下限:
| 框架 | 调度方式 | RTX 3060 12GB 跑 27B IQ2_XS |
|---|---|---|
| llama.cpp | 默认分块 GPU+CPU | ~50 tok/s |
| Strata | 三层 offload 自动调度 | 70 tok/s(+40%) |
| Strata + MTP | 推测解码 | 79 tok/s(+58%) |
调度差 = 40-58%——比"加一张卡"便宜。
整机 vs 单卡
| 方案 | 整机能力 | 跑 27B tok/s | 整机成本 |
|---|---|---|---|
| 单卡 24GB(4090) | 仅 GPU | 91 tok/s | ¥12000 |
| 单卡 12GB(3060)+ 64GB DDR5 + NVMe | 三层 offload | 70 tok/s | ¥4500 |
| 单卡 6GB(1080 二手)+ 64GB DDR5 + NVMe | 三层 offload(forward-looking) | 接近 5090(待 Strata v0.6) | ¥1500 |
3060 12GB 整机方案 = 70 tok/s,成本是 4090 的 38%,性能是 77%。
升级路径(已有 PC)
按"成本-收益"比排序:
| 优先级 | 升级项 | 成本 | 收益 |
|---|---|---|---|
| 🥇 | RAM: DDR4 16G → DDR5 32G | ¥600 | +30% tok/s |
| 🥈 | SSD: HDD → NVMe 4.0 | ¥500 | +20% tok/s |
| 🥉 | GPU: 8GB → 12GB | ¥1500 | +15% tok/s |
| 4️⃣ | GPU: 12GB → 24GB | ¥10000 | +30% tok/s |
性价比最高:先加 RAM + 换 SSD,不换卡。
证据分层
- 91/70/79 tok/s:本地 DB benchmark_record id 51, 52, 53
- 显存带宽:NVIDIA 官方 spec
- DDR5/DDR4 带宽:JEDEC 官方 spec
- 二手 1080 接近 5090:Niko Veit @coldniko 2026-10-06 推文(forward-looking)
数据来源
- 整机党判断:综合 Strata 实测 + 硬件规格
- 升级优先级:基于 tok/s 增量与升级成本比