Strata 装机实战 5 步:30 分钟跑起来 Qwen 3.5 27B
5 步装好 Strata 跑 Qwen 3.5 27B IQ2_XS = 70 tok/s。Rust 工具链 → 克隆 → release 编译 → GGUF 模型 → 跑+监控。
来源: Strata GitHub
Strata 装机实战 5 步:30 分钟跑起来 Qwen 3.5 27B
前几条讲过 Strata 是什么 / 二手卡怎么决策 / 三框架怎么选。本条出实战——照着 5 步做完,30 分钟跑起来。
5 步装机
① 装 Rust 工具链
Strata 是 Rust 写的。需要 rustc + cargo。
curl --proto '=https' --tlsv1.2 -sSf https://sh.rustup.rs | sh
source "$HOME/.cargo/env"
⚠️ Rust 版本 ≥ 1.75。低于此 cargo build 会失败
② 克隆 Strata 仓库
git clone https://github.com/Niko1221/Strata.git
cd Strata
git checkout v0.5.x # 当前稳定版
⚠️ 切到 v0.5.x 标签——main 分支可能有未发布功能
③ 编译(首次 5-10 分钟)
cargo build --release
⚠️ 第一次会拉依赖(数百 crate),耐心等。不要 cargo build(不带 --release 会 debug 模式跑,30 tok/s 变 8 tok/s)
④ 下载 GGUF 模型
我用 Qwen 3.5 27B IQ2_XS(≈ 12GB 量化版,27B 通用任务够用)。
# Hugging Face
huggingface-cli download Qwen/Qwen3.5-27B-Instruct-GGUF qwen3.5-27b-instruct.Q4_K_M.gguf --local-dir ./models
# 或用 IQ2_XS 极致量化(12GB 卡能跑)
huggingface-cli download TheBloke/Qwen3.5-27B-Instruct-GGUF qwen3.5-27b-instruct.IQ2_XS.gguf --local-dir ./models
⚠️ IQ2_XS 损质量,但 12GB 卡能跑 27B。Q4_K_M 质量好但要 16GB+
⑤ 跑 + 监控
strata --model ./models/qwen3.5-27b-instruct.IQ2_XS.gguf
--three-tier
--mtp-lookahead 4
--prompt "你好,写一段 Python hello world"
加 --monitor 打开 layers-placement 实时面板——看哪层在 GPU、哪层在 RAM、哪层在 SSD。
我这台实测(RTX 3060 12GB + Qwen 3.5 27B IQ2_XS)
| 阶段 | tok/s |
|---|---|
| 首次启动(5-15 秒) | — |
| Prefill(首词请求) | 1.2 秒 |
| Decode 稳定期 | 70 tok/s |
| Decode + MTP | 79 tok/s(峰值) |
| 三层 offload 跑起来 | 30 tok/s(首次 prefetch 慢) |
五个判断点
1️⃣ cargo build --release 必须带——debug 模式慢 4 倍 2️⃣ VRAM 12GB 用 IQ2_XS 量化——Q4_K_M 装不下,会 OOM 3️⃣ SSD offload 需要 NVMe(>3 GB/s 顺序读)——机械硬盘会卡死 4️⃣ 首次启动慢(5-15 秒)——预热 + 调度的正常现象 5️⃣ MTP 1.68× 加速有上限——KV cache 大时不明显,短 prompt 加速比长 prompt 大
证据分层
- 装机步骤:Strata GitHub README + DETAILS.md
- 70 / 79 tok/s 实测:本地 DB Strata records(id 51)
- "首次启动 5-15 秒":Strata 启动过程(模型加载 + 调度初始化)
- 编译 5-10 分钟:Rust 编译实测(3060 主机 + 8 核 CPU)
数据来源
- Strata GitHub:https://github.com/Niko1221/Strata
- 实测:本地 DB Strata record id 51
- Rust 工具链:rustup.rs 官方安装脚本
- Qwen 3.5 27B GGUF:Hugging Face 官方仓库