动态
DeepSeek V4.1 Flash 开源:每 token KV Cache 仅 890 字节,百万上下文不再昂贵
DeepSeek 发布并开源 V4.1 Flash(MIT 许可):552B 非对称 MoE,每 token 全局 KV Cache 仅 890 字节、约为上代 1/4,1M 上下文 KV 仅约 890MB;Agent 基准超越 V4 Pro,API 输入 $0.30/百万 token、闲时半价。
发布与开源
2026 年 9 月 10 日,DeepSeek 发布并开源 DeepSeek V4.1 Flash,权重以 MIT 许可上架 Hugging Face 与 ModelScope(仓库 deepseek-ai/DeepSeek-V4.1-Flash,48 个分片),随附 51 页技术报告《Pushing the Limits of KV Cache Compression》、prompt 编码参考与最小化 PyTorch 推理实现。同日还开源了 DeepJIT 内核 JIT 编译库与 Harness v0.1.5 Agent 框架。
核心亮点:把 KV Cache 压到极限
- 每 token 全局 KV Cache 仅 890 字节——约为上代 V4 Flash(3,514 B)的 1/4,相比初代压缩 437 倍
- 1M 上下文的全局 KV 仅约 890MB(V3.2 同口径为 48GB)
- 关键技术:CSA2 三种层模式、FP4 缓存、滑动窗口注意力有界重放、跨层注意力复用
- HBM 显存需求降至上代 1/4,SSD 需求降至 1/8
对长上下文 Agent 会话而言,这是最直接的降本——KV Cache 正是长会话显存账单的大头。
架构规格
- Causal Encoder-Decoder(CED)非对称 MoE:20 层编码器 + 20 层解码器
- 总参数 552B(另有 196B Engram 参数 + ViT 视觉编码器,原生支持图像输入)
- 激活参数:Prefill 仅 8B,Decode 16B
- 384 个路由专家 + 1 共享专家,每 token 激活 6 个,FP4 专家权重
- 上下文 100 万 token(最大位置编码 1,048,576),最大输出 384K
性能与定价
- Agent 基准 DeepSWE v1.1 74.2%、Terminal-Bench 2.1 90.6%,超越 V4 Pro
- 发布时登顶 Artificial Analysis 开放权重榜(智能指数 40)
- API 统一为
deepseek-flash:输入 $0.30/百万 token、输出 $1.20/百万 token,闲时半价,缓存命中输入低至 $0.006/M - V4 Pro 自 9 月 14 日起被路由至 V4.1 Flash 并按 Flash 单价计费
对本地部署意味着什么
官方自部署门槛约 2000 张 GPU + 存储集群,仍然高不可攀;但社区已有人在 4 台 DGX Spark + vLLM 上跑通轻量方案。KV Cache 压缩到 1/4 意味着同等显存下上下文可以拉得更长——这正是本站关注的方向,我们已收录 DeepSeek-V4.1-Flash,可持续关注其量化发布的落地情况。