← 新闻
运行时

本地推理三选一:Strata / llama.cpp / vLLM 决策框架

看场景不是看谁强:二手卡选 Strata +40% 速度,兼容性选 llama.cpp GGUF 全,服务化高并发选 vLLM PagedAttention。

本地推理三选一:Strata / llama.cpp / vLLM 决策框架

之前铺垫过 Strata 是什么 / Niko 的 6GB 主张 / 二手机怎么决策。本条出装机决策。

三选一决策表

场景 推荐 原因
笔记本 / 8GB 以下 VRAM llama.cpp 成熟稳、GGUF 全、文档多
二手卡 1080/2060/3060 Strata 三层 offload 让 6GB 跑 27B
单卡 12-24GB 跑 27B/30B Strata +40% 速度(实测 70 vs 50 tok/s)
多卡 4090/5090 服务器 vLLM PagedAttention + 连续批处理,吞吐高
兼容性优先 / 模型覆盖广 llama.cpp GGUF 全社区、所有量化格式
服务化 / 高并发 API vLLM 长 context + 调度器成熟
想用最新模型(Qwen 4 / Llama 5) llama.cpp 等 Strata v0.6 / vLLM 适配
实验 / 折腾 / 装新东西 Strata v0.5.x 是研究版,体验新思路

为什么不是"看谁强"

每个框架解决的问题不一样:

  • llama.cpp 解决"广泛兼容"——GGUF 是事实标准,所有量化都跑
  • vLLM 解决"高吞吐"——PagedAttention 减少显存碎片,连续批处理
  • Strata 解决"小显存跑大模型"——三层 offload + MTP 推测解码

实测数据(同模型同卡:Qwen 3.5 27B IQ2_XS)

框架 RTX 3060 12GB RTX 5070 12GB Arc B580 12GB
llama.cpp ~50 tok/s ~62 tok/s ~32 tok/s
Strata 70 tok/s 79 tok/s 45 tok/s
vLLM 装不下(GGUF 不原生) 装不下 装不下

三个判断点

1️⃣ vLLM 和 GGUF 兼容差——vLLM 主要吃 HF safetensors。要跑 GGUF 走 llama.cpp 2️⃣ Strata v0.5.x 模型覆盖有限——Qwen 3.x / Llama 3.x / DeepSeek V3 跑;Qwen 4 / Llama 5 完整支持 = v0.6 3️⃣ 三者可叠加用:vLLM 服务化主力 + Strata 跑小模型 + llama.cpp 兜底兼容