← 新闻
指南

大模型低成本运行:不只取决于显存,取决于整机数据搬运和调度能力

本地推理瓶颈已从 VRAM 转到整机数据搬运 + 调度。同卡同模型 llama.cpp ~50 tok/s vs Strata 70 tok/s(+40%)。3060 12GB 整机方案 ¥2500 = 4090 77% 性能 / 38% 价格。

来源: araoai

大模型低成本运行:不只取决于显存,取决于整机数据搬运和调度能力

这是一句反对"显存党"的判断——也是 2026 年本地推理的真正分水岭。

为什么"显存党"out 了

旧认知:能装下 = 跑得动。模型 16GB + 卡 12GB = 装不下 = 跑不动。

2026 年变了——模型权重可以分块 offload 到 RAM/SSD,问题不再是"装得下",而是"搬得快"。

新瓶颈:整机数据搬运 + 调度

三个数据搬运路径:

  1. GPU ↔ VRAM(显存带宽,HBM/GDDR 决定)
    • RTX 5090: 1.79 TB/s
    • RTX 3060 12GB: 360 GB/s
  2. CPU ↔ RAM(DDR5 内存带宽)
    • DDR5 5600 双通道: 89.6 GB/s
    • DDR4 3200 双通道: 51.2 GB/s
  3. SSD ↔ CPU(NVMe 顺序读)
    • PCIe 4.0 NVMe: 7 GB/s
    • PCIe 3.0 NVMe: 3.5 GB/s
    • 机械硬盘: 0.2 GB/s(拖死)

调度决定上下限:

框架 调度方式 RTX 3060 12GB 跑 27B IQ2_XS
llama.cpp 默认分块 GPU+CPU ~50 tok/s
Strata 三层 offload 自动调度 70 tok/s(+40%)
Strata + MTP 推测解码 79 tok/s(+58%)

调度差 = 40-58%——比"加一张卡"便宜。

整机 vs 单卡

方案 整机能力 跑 27B tok/s 整机成本
单卡 24GB(4090) 仅 GPU 91 tok/s ¥12000
单卡 12GB(3060)+ 64GB DDR5 + NVMe 三层 offload 70 tok/s ¥4500
单卡 6GB(1080 二手)+ 64GB DDR5 + NVMe 三层 offload(forward-looking) 接近 5090(待 Strata v0.6) ¥1500

3060 12GB 整机方案 = 70 tok/s,成本是 4090 的 38%,性能是 77%。

升级路径(已有 PC)

按"成本-收益"比排序:

优先级 升级项 成本 收益
🥇 RAM: DDR4 16G → DDR5 32G ¥600 +30% tok/s
🥈 SSD: HDD → NVMe 4.0 ¥500 +20% tok/s
🥉 GPU: 8GB → 12GB ¥1500 +15% tok/s
4️⃣ GPU: 12GB → 24GB ¥10000 +30% tok/s

性价比最高:先加 RAM + 换 SSD,不换卡。

证据分层

  • 91/70/79 tok/s:本地 DB benchmark_record id 51, 52, 53
  • 显存带宽:NVIDIA 官方 spec
  • DDR5/DDR4 带宽:JEDEC 官方 spec
  • 二手 1080 接近 5090:Niko Veit @coldniko 2026-10-06 推文(forward-looking)

数据来源

  • 整机党判断:综合 Strata 实测 + 硬件规格
  • 升级优先级:基于 tok/s 增量与升级成本比