动态
Qwen3.8-Flash-Next 架构深度:48 层混合(Gated DeltaNet + Sparse Attention)+ 6B 激活 / 180B 总
拆解 Qwen3.8-Flash-Next:48 层(36 Gated DeltaNet + 12 Qwen Sparse Attention)、512 路由专家 top-10 + 1 共享、原生 262K 上下文(YaRN 扩到 1M)、180B 总参数仅 6B 激活、llama.cpp 内部代号 qwen4exp(Qwen4 架构预览)。
是什么
Qwen3.8-Flash-Next 是阿里 Qwen 团队 2026 年 8 月 26 日发布的"Flash 档"旗舰 MoE——180B 总参数、仅 6B 激活(每个 token)。它把"在消费级硬件上跑得动"作为首要目标,于是采用了一套非常少见的混合架构。
关键参数
| 维度 | 数值 |
|---|---|
| 总参数 | 约 180B(125B 主模型 + 51B n-gram 嵌入 + 4B MTP head) |
| 激活参数 | 约 6B / token |
| 层数 | 48 层 |
| 注意力机制 | 36 层 Gated DeltaNet + 12 层 Qwen Sparse Attention |
| 路由专家 | 512 个,top-10 激活 + 1 个共享 |
| 上下文 | 原生 262K,YaRN 可扩到 1M |
| 多模态 | 视觉 + 文本 |
| 许可证 | Qwen Community License 1.0 |
| llama.cpp 代号 | qwen4exp(Qwen4 架构预览) |
为什么"6B 激活"是关键
180B 总参数放 SSD/RAM 上没问题——但每个 token 真正计算只涉及 6B,于是 GPU 显存压力瞬间从"装下全部权重"降到"装下 6B 激活 + KV cache"。这是 Strata 等分层内存方案能跑通的核心前置。
DeltaNet + Sparse Attention 混合的代价
36 层 Gated DeltaNet 是线性注意力(O(n) 而非 O(n²)),能极快处理长上下文;12 层 Sparse Attention 保留全注意力,处理需要精确对齐的 token(比如代码、数学)。混合的好处是 1M 上下文也能维持 decode 速度不崩;坏处是工程实现复杂,框架支持滞后于纯 Transformer。
与同类对比(180B 档)
| 模型 | 总参数 | 激活 | 上下文 | 架构 |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | 180B | 6B | 262K (1M YaRN) | DeltaNet + Sparse Attention MoE |
| DeepSeek-V4.1-Flash | 256B | ~8B | 1M | Dense-MoE + MLA |
| GLM-5.3-Flash | 200B | ~6B | 200K | Dense-MoE |
本地部署角度
跑这个模型,框架选择优先级:Strata > llama.cpp(最新 main 分支持 qwen4exp)> vLLM(SGLang 暂未跟进)。量化首选 IQ2_XS(45GB 权重 + 64GB RAM 装下),质量敏感场景用 IQ3_XXS(76GB,需 96GB RAM)。