← 新闻
动态

Qwen3.8-Flash-Next 架构深度:48 层混合(Gated DeltaNet + Sparse Attention)+ 6B 激活 / 180B 总

拆解 Qwen3.8-Flash-Next:48 层(36 Gated DeltaNet + 12 Qwen Sparse Attention)、512 路由专家 top-10 + 1 共享、原生 262K 上下文(YaRN 扩到 1M)、180B 总参数仅 6B 激活、llama.cpp 内部代号 qwen4exp(Qwen4 架构预览)。

来源: RunAIHome + HuggingFace ISTA-DASLab

是什么

Qwen3.8-Flash-Next 是阿里 Qwen 团队 2026 年 8 月 26 日发布的"Flash 档"旗舰 MoE——180B 总参数、仅 6B 激活(每个 token)。它把"在消费级硬件上跑得动"作为首要目标,于是采用了一套非常少见的混合架构。

关键参数

维度 数值
总参数 约 180B(125B 主模型 + 51B n-gram 嵌入 + 4B MTP head)
激活参数 约 6B / token
层数 48 层
注意力机制 36 层 Gated DeltaNet + 12 层 Qwen Sparse Attention
路由专家 512 个,top-10 激活 + 1 个共享
上下文 原生 262K,YaRN 可扩到 1M
多模态 视觉 + 文本
许可证 Qwen Community License 1.0
llama.cpp 代号 qwen4exp(Qwen4 架构预览)

为什么"6B 激活"是关键

180B 总参数放 SSD/RAM 上没问题——但每个 token 真正计算只涉及 6B,于是 GPU 显存压力瞬间从"装下全部权重"降到"装下 6B 激活 + KV cache"。这是 Strata 等分层内存方案能跑通的核心前置。

DeltaNet + Sparse Attention 混合的代价

36 层 Gated DeltaNet 是线性注意力(O(n) 而非 O(n²)),能极快处理长上下文;12 层 Sparse Attention 保留全注意力,处理需要精确对齐的 token(比如代码、数学)。混合的好处是 1M 上下文也能维持 decode 速度不崩;坏处是工程实现复杂,框架支持滞后于纯 Transformer。

与同类对比(180B 档)

模型 总参数 激活 上下文 架构
Qwen3.8-Flash-Next 180B 6B 262K (1M YaRN) DeltaNet + Sparse Attention MoE
DeepSeek-V4.1-Flash 256B ~8B 1M Dense-MoE + MLA
GLM-5.3-Flash 200B ~6B 200K Dense-MoE

本地部署角度

跑这个模型,框架选择优先级:Strata > llama.cpp(最新 main 分支持 qwen4exp)> vLLM(SGLang 暂未跟进)。量化首选 IQ2_XS(45GB 权重 + 64GB RAM 装下),质量敏感场景用 IQ3_XXS(76GB,需 96GB RAM)。