运行时
本地推理三选一:Strata / llama.cpp / vLLM 决策框架
看场景不是看谁强:二手卡选 Strata +40% 速度,兼容性选 llama.cpp GGUF 全,服务化高并发选 vLLM PagedAttention。
本地推理三选一:Strata / llama.cpp / vLLM 决策框架
之前铺垫过 Strata 是什么 / Niko 的 6GB 主张 / 二手机怎么决策。本条出装机决策。
三选一决策表
| 场景 | 推荐 | 原因 |
|---|---|---|
| 笔记本 / 8GB 以下 VRAM | llama.cpp | 成熟稳、GGUF 全、文档多 |
| 二手卡 1080/2060/3060 | Strata | 三层 offload 让 6GB 跑 27B |
| 单卡 12-24GB 跑 27B/30B | Strata | +40% 速度(实测 70 vs 50 tok/s) |
| 多卡 4090/5090 服务器 | vLLM | PagedAttention + 连续批处理,吞吐高 |
| 兼容性优先 / 模型覆盖广 | llama.cpp | GGUF 全社区、所有量化格式 |
| 服务化 / 高并发 API | vLLM | 长 context + 调度器成熟 |
| 想用最新模型(Qwen 4 / Llama 5) | llama.cpp | 等 Strata v0.6 / vLLM 适配 |
| 实验 / 折腾 / 装新东西 | Strata | v0.5.x 是研究版,体验新思路 |
为什么不是"看谁强"
每个框架解决的问题不一样:
- llama.cpp 解决"广泛兼容"——GGUF 是事实标准,所有量化都跑
- vLLM 解决"高吞吐"——PagedAttention 减少显存碎片,连续批处理
- Strata 解决"小显存跑大模型"——三层 offload + MTP 推测解码
实测数据(同模型同卡:Qwen 3.5 27B IQ2_XS)
| 框架 | RTX 3060 12GB | RTX 5070 12GB | Arc B580 12GB |
|---|---|---|---|
| llama.cpp | ~50 tok/s | ~62 tok/s | ~32 tok/s |
| Strata | 70 tok/s | 79 tok/s | 45 tok/s |
| vLLM | 装不下(GGUF 不原生) | 装不下 | 装不下 |
三个判断点
1️⃣ vLLM 和 GGUF 兼容差——vLLM 主要吃 HF safetensors。要跑 GGUF 走 llama.cpp 2️⃣ Strata v0.5.x 模型覆盖有限——Qwen 3.x / Llama 3.x / DeepSeek V3 跑;Qwen 4 / Llama 5 完整支持 = v0.6 3️⃣ 三者可叠加用:vLLM 服务化主力 + Strata 跑小模型 + llama.cpp 兜底兼容