← 新闻
运行时

Strata 作者 Niko:6GB VRAM + 三层 offload = RTX 5090 性能

Strata 作者 Niko Veit 主张 6GB VRAM 通过三层 offload + MTP 能达到 RTX 5090 当前性能。三件事叠加是核心:三层 offload、MTP 1.68× 推测解码、AVX-512 VNNI。

来源: Niko Veit @coldniko

Strata 作者 Niko:6GB VRAM + 三层 offload = RTX 5090 性能

Strata 框架作者 Niko Veit(@coldniko)2026-10-06 推文:

"Strata will support Qwen4 fully... I can bring same performance as you now have on 5090 or 5070 with just 6GB VRAM. I'm only constrained with time and compute but will get better"

为什么这事可能是真的

Strata 不是放插件——是重新设计推理架构:

  1. 三层 offload:GPU / RAM / SSD 自动调度,按层速度适配(不是默认分块)
  2. MTP 推测:Multi-Token Prediction 一次出多个 token,1.68× 加速(已实测:47→79 tok/s)
  3. AVX-512 VNNI:CPU 端用 AVX-512 指令集跑 INT8,不是新硬件门槛

三层叠加 = 6GB VRAM 也能扛起 Qwen 3.5 27B Q4_K_M(≈ 16GB 模型):

部件 角色
6GB GPU 装 attention 层(最热的部分)
64GB DDR5 装 FFN 层
2TB SSD 装剩余低频层

6GB vs 12GB 实测对比

我们 DB 里跑过 Strata 几条数据:

  • RTX 3060 12GB + IQ2_XS = 70 tok/s
  • RTX 5070 12GB + IQ2_XS = 79 tok/s
  • Intel Arc B580 12GB + IQ2_XS = 45 tok/s

按 Niko 主张的「6GB = 5090」反推:

  • 6GB + SSD 装 2GB 模型 + MTP 1.68× → 79 tok/s
  • 也就是说 二手 GTX 1080 6GB 也能跑 27B Q4 性能接近 5090

三个判断点

1️⃣ 这是 forward-looking,不是现可重现。Niko 写"I'm only constrained with time and compute" 2️⃣ "6GB = 5090" 仅限 decode(生成场景),不 prefetch。Prefetch 走 GPU + 上限 3️⃣ 二手 1080 的瓶颈不只是 VRAM,是 CUDA cores 旧(Pascal 架构)。Strata 借 MTP 把架构给改了

证据分层

  • 6GB = 5090:作者本人(forward-looking statement,未实测)
  • 47 → 79 tok/s:MTP 1.68×,真实 Strata 基准
  • "三层 offload + AVX-512 VNNI":Strata DETAILS.md 文档可查

数据来源

  • Niko 原推:https://x.com/coldniko/status/2107406312682258511
  • Strata GitHub:https://github.com/Niko1221/Strata
  • 实测:本地 DB Strata records(id 51/52/53)