动态
Strata 让 180B 模型在 12GB 消费卡上跑出 79 tok/s:分层内存 + MTP 推测解码
Strata 通过 GPU/RAM/SSD 三层内存架构 + MTP 推测解码 + AVX-512 VNNI 内核,让 Qwen3.8-Flash-Next(180B 总 / 6B 激活 MoE)在 RTX 5070 12GB + 64GB DDR5 上达到 IQ2_XS 79 tok/s decode / 2090 tok/s prompt。
是什么
Strata 给出了一种新范式:让 180B 模型在消费级 12GB 显卡上跑出可用的速度。这不是简单的 CPU offload,而是三层内存协同:
- GPU/VRAM(12GB):缓存最常用专家 + 常驻计算部分
- 系统 RAM(64GB+):存放全部 24,576 个路由专家副本(512 专家 × 48 层)
- SSD:存储 28.8GB 的 n-gram 查找表,由 OS page cache 按需读取
叠加两项关键优化:
- MTP 推测解码:用模型自带的 draft layer 一次验证多个 token,提升 1.6–1.8 倍
- AVX-512 VNNI 内核:专为 Q2_0 量化优化,CPU 端权重解压加速
实测数据(RTX 5070 12GB + Ryzen 5 7600 + 64GB DDR5)
| 量化 | 短对话 decode | 128K 上下文 decode | prompt 处理 |
|---|---|---|---|
| Q2_0 | 93 tok/s | 74 tok/s | 2,170 tok/s |
| IQ2_XS(推荐档) | 79 tok/s | 63 tok/s | 2,090 tok/s |
| IQ3_XXS | 62 tok/s | 49 tok/s | 1,750 tok/s |
| IQ3_S | 53 tok/s | 46 tok/s | 1,620 tok/s |
| Coder (IQ1_M) | 55 tok/s | 43 tok/s | 2,180 tok/s |
为什么是真正的突破
传统思路是"权重必须全部在内存里",于是 180B 模型被挡在 64GB+ 内存工作站门外。Strata 把权重分层到 SSD,让 n-gram 查找表这种冷数据走磁盘,主干计算走 RAM+GPU。这把消费级硬件本地跑 180B 从"理论可行"推到"日常可用"。
与 llama.cpp 同硬件对比
| 框架 | RTX 5070 12GB IQ2_XS decode |
|---|---|
| Strata | ~65.1 tok/s |
| llama.cpp | ~15 tok/s |
差距来源主要是三层内存 + MTP 推测这两件 llama.cpp 没有的设计。
本地部署角度
最低门槛是 12GB 消费卡 + 64GB DDR5 + 一块 NVMe SSD;操作系统层面建议 Linux + 大页(hugepages)+ IO 调度器切到 none 或 mq-deadline,避免 page cache 抖动拖慢 n-gram 读取。