← 新闻
动态

Cloudflare 开源 Clef 与 Clef-flash:Qwen 架构的端到端决策模型,输出概率不输出文本

Cloudflare 发布两款 Apache 2.0 开源决策模型:Clef(27B)与 Clef-flash(9B,~39ms 延迟),输出概率而非自由文本,专为 AI 智能体编排与端到端决策设计,与 TypeSafe AI 的 Jev API 兼容。

来源: AI 日报(ai6s.net)

是什么

10 月 3 日,Cloudflare 在官方博客发布两款决策模型 Clef(27B)与 Clef-flash(9B),采用 Apache 2.0 协议开源。两款模型都基于 Qwen 架构改造,但训练目标与传统对话模型不同——输出的是概率分布,而非自由文本。

关键设计

  • Clef(27B):旗舰版本,主打精度
  • Clef-flash(9B):轻量版本,首 token 延迟约 39 毫秒,面向在线编排与高频调用
  • API 兼容:与 TypeSafe AI 的 Jev API 兼容,已在 Cloudflare 内部替代部分 Bot Manager 分类链路

为什么值得关注

传统 LLM 用于决策时需要"先编出文本再解析回结构",对 token 预算和延迟都不友好。Clef 把这条链路压成"prompt → 概率分布 → 决策",对 AI 智能体编排场景更友好——也呼应了 10 月初 OpenAI、Google 等厂商把"智能体基础设施"提到台面的趋势。

本地部署角度

基于 Qwen 架构意味着 GGUF/llama.cpp 一线工具链原生支持;27B 版本在 24GB 显存显卡上可量化到 Q4_K_M 运行,9B 版本更是单卡消费级即可。本站后续会跟踪社区量化版的发布。