运行时
Strata 作者 Niko:6GB VRAM + 三层 offload = RTX 5090 性能
Strata 作者 Niko Veit 主张 6GB VRAM 通过三层 offload + MTP 能达到 RTX 5090 当前性能。三件事叠加是核心:三层 offload、MTP 1.68× 推测解码、AVX-512 VNNI。
Strata 作者 Niko:6GB VRAM + 三层 offload = RTX 5090 性能
Strata 框架作者 Niko Veit(@coldniko)2026-10-06 推文:
"Strata will support Qwen4 fully... I can bring same performance as you now have on 5090 or 5070 with just 6GB VRAM. I'm only constrained with time and compute but will get better"
为什么这事可能是真的
Strata 不是放插件——是重新设计推理架构:
- 三层 offload:GPU / RAM / SSD 自动调度,按层速度适配(不是默认分块)
- MTP 推测:Multi-Token Prediction 一次出多个 token,1.68× 加速(已实测:47→79 tok/s)
- AVX-512 VNNI:CPU 端用 AVX-512 指令集跑 INT8,不是新硬件门槛
三层叠加 = 6GB VRAM 也能扛起 Qwen 3.5 27B Q4_K_M(≈ 16GB 模型):
| 部件 | 角色 |
|---|---|
| 6GB GPU | 装 attention 层(最热的部分) |
| 64GB DDR5 | 装 FFN 层 |
| 2TB SSD | 装剩余低频层 |
6GB vs 12GB 实测对比
我们 DB 里跑过 Strata 几条数据:
- RTX 3060 12GB + IQ2_XS = 70 tok/s
- RTX 5070 12GB + IQ2_XS = 79 tok/s
- Intel Arc B580 12GB + IQ2_XS = 45 tok/s
按 Niko 主张的「6GB = 5090」反推:
- 6GB + SSD 装 2GB 模型 + MTP 1.68× → 79 tok/s
- 也就是说 二手 GTX 1080 6GB 也能跑 27B Q4 性能接近 5090
三个判断点
1️⃣ 这是 forward-looking,不是现可重现。Niko 写"I'm only constrained with time and compute" 2️⃣ "6GB = 5090" 仅限 decode(生成场景),不 prefetch。Prefetch 走 GPU + 上限 3️⃣ 二手 1080 的瓶颈不只是 VRAM,是 CUDA cores 旧(Pascal 架构)。Strata 借 MTP 把架构给改了
证据分层
- 6GB = 5090:作者本人(forward-looking statement,未实测)
- 47 → 79 tok/s:MTP 1.68×,真实 Strata 基准
- "三层 offload + AVX-512 VNNI":Strata DETAILS.md 文档可查
数据来源
- Niko 原推:https://x.com/coldniko/status/2107406312682258511
- Strata GitHub:https://github.com/Niko1221/Strata
- 实测:本地 DB Strata records(id 51/52/53)