同硬件下 Strata 65 tok/s vs llama.cpp 15 tok/s:差距从哪来?
在 RTX 5070 12GB + 64GB DDR5 同配置下,Strata 跑 Qwen3.8-Flash-Next IQ2_XS 约 65.1 tok/s,llama.cpp 约 15 tok/s。差距主要来自 SSD 流式权重 + MTP 推测 + AVX-512 VNNI 内核三件套。
是什么
同一台 RTX 5070 12GB + Ryzen 5 7600 + 64GB DDR5-5600 工作站,Strata 与 llama.cpp 跑 Qwen3.8-Flash-Next IQ2_XS 的差距是 4.3 倍:
| 框架 | decode | prompt 处理 |
|---|---|---|
| Strata | ~65.1 tok/s | ~2,090 tok/s |
| llama.cpp | ~15 tok/s | ~330 tok/s |
| 差距 | 4.3× | 6.3× |
差距的三个来源
-
SSD 流式权重:llama.cpp 默认要求权重全部在 RAM 里,遇到 180B + 64GB RAM 装不下就只能大量 CPU↔RAM 抖动;Strata 把权重分层到 SSD(28.8GB n-gram + 64GB RAM 主专家),避开了这一抖动
-
MTP 推测解码:Qwen3.8-Flash-Next 自带 draft layer,Strata 直接消费它做 1.6–1.8× 推测;llama.cpp 的 speculative decoding 还在实验分支,主线没合并
-
AVX-512 VNNI 内核:Strata 为 Q2_0 量化写了专用 CPU 解压路径,吃满现代桌面 CPU 的 SIMD 带宽;llama.cpp 的量化矩阵 kernel 偏通用,VNNI 加速不充分
为什么 llama.cpp 慢不一定是"落后"
llama.cpp 的设计目标是通用性 + 跨平台——从 4-bit ARM CPU 到 Apple Silicon 到 NVIDIA 消费卡都跑。Strata 专攻 Qwen3.8-Flash-Next + 桌面 CPU/GPU 这一个细分场景,把所有优化都砸在它身上。这种"专才 vs 通才"的取舍,在 12GB 跑 180B 这种边缘场景里差距会被放大到 4 倍。
选择建议
- 跑 Qwen3.8-Flash-Next 180B 在 12–16GB 显卡 + 64GB RAM:选 Strata
- 跑 Llama、Mistral、DeepSeek 等其他模型:选 llama.cpp(生态最广)
- 跑多模型工作流(同时 5+ 个不同模型):选 llama.cpp / Ollama
- 跑多卡 A100/H100 服务端:选 vLLM / SGLang
本地部署角度
Strata 仅针对 Qwen3.8-Flash-Next 优化(含未来的 Qwen4 代号 qwen4exp 系列)。如果你只用这一代 Qwen Flash 档,Strata 是桌面侧最强方案;如果还要跑别的模型,llama.cpp 更稳。