← 新闻
动态

Strata 让 180B 模型在 12GB 消费卡上跑出 79 tok/s:分层内存 + MTP 推测解码

Strata 通过 GPU/RAM/SSD 三层内存架构 + MTP 推测解码 + AVX-512 VNNI 内核,让 Qwen3.8-Flash-Next(180B 总 / 6B 激活 MoE)在 RTX 5070 12GB + 64GB DDR5 上达到 IQ2_XS 79 tok/s decode / 2090 tok/s prompt。

来源: Strata GitHub DETAILS.md + AGI Hunt

是什么

Strata 给出了一种新范式:让 180B 模型在消费级 12GB 显卡上跑出可用的速度。这不是简单的 CPU offload,而是三层内存协同:

  • GPU/VRAM(12GB):缓存最常用专家 + 常驻计算部分
  • 系统 RAM(64GB+):存放全部 24,576 个路由专家副本(512 专家 × 48 层)
  • SSD:存储 28.8GB 的 n-gram 查找表,由 OS page cache 按需读取

叠加两项关键优化:

  • MTP 推测解码:用模型自带的 draft layer 一次验证多个 token,提升 1.6–1.8 倍
  • AVX-512 VNNI 内核:专为 Q2_0 量化优化,CPU 端权重解压加速

实测数据(RTX 5070 12GB + Ryzen 5 7600 + 64GB DDR5)

量化 短对话 decode 128K 上下文 decode prompt 处理
Q2_0 93 tok/s 74 tok/s 2,170 tok/s
IQ2_XS(推荐档) 79 tok/s 63 tok/s 2,090 tok/s
IQ3_XXS 62 tok/s 49 tok/s 1,750 tok/s
IQ3_S 53 tok/s 46 tok/s 1,620 tok/s
Coder (IQ1_M) 55 tok/s 43 tok/s 2,180 tok/s

为什么是真正的突破

传统思路是"权重必须全部在内存里",于是 180B 模型被挡在 64GB+ 内存工作站门外。Strata 把权重分层到 SSD,让 n-gram 查找表这种冷数据走磁盘,主干计算走 RAM+GPU。这把消费级硬件本地跑 180B 从"理论可行"推到"日常可用"。

与 llama.cpp 同硬件对比

框架 RTX 5070 12GB IQ2_XS decode
Strata ~65.1 tok/s
llama.cpp ~15 tok/s

差距来源主要是三层内存 + MTP 推测这两件 llama.cpp 没有的设计。

本地部署角度

最低门槛是 12GB 消费卡 + 64GB DDR5 + 一块 NVMe SSD;操作系统层面建议 Linux + 大页(hugepages)+ IO 调度器切到 none 或 mq-deadline,避免 page cache 抖动拖慢 n-gram 读取。