← 新闻
动态

阿里发布 Qwen3.8-Omni-Flash:1M 上下文原生全模态,音频成本降 98%

阿里千问发布 Qwen3.8-Omni-Flash:基于 Qwen3.8-Flash-Next 架构的原生全模态模型,支持文本/图像/音频/视频输入与 1M 上下文,输入 $0.15/百万 token,每小时音频输入成本较上代降超 98%;仅 API 提供,未开放权重。

来源: DataCamp

发布

2026 年 9 月 18 日,阿里千问团队发布 Qwen3.8-Omni-Flash——基于 Qwen3.8-Flash-Next 架构的原生全模态模型,定位 Flash 层级(高性价比、高吞吐)。

模态与上下文

  • 输入:文本、图像、音频、视频四类原生支持;输出为文本(不做语音/视频生成)
  • 1M token 上下文:最大输入约 99.1 万 token,最大输出 13.1 万,思考模式推理预算 262K
  • 音频支持 113 种语言与方言,双声道与 4 声道空间音频理解;会议场景说话人分离错误率从 88% 降至 3%

性能与成本

  • 官方称 29 项评测平均分较上代 Qwen3.5-Omni-Plus 提升超 25%
  • Agentic 模式在 OmniVideoBench 上从 63.4 提升至 67.8,同时 token 消耗降低约 45.7%
  • API 定价:输入 $0.15/百万 token(缓存输入 $0.016),输出 $0.47/百万 token
  • 每小时音频输入成本较上代下降超 98%,音视频联合输入下降超 93%

配套开源与接入

  • 配套开源 Qwen-MM-Plugins(智能体插件套件)与 Qwen-Live Harness(实时交互运行时,配合 Realtime 版本)
  • 通过阿里云百炼提供 API(兼容 DashScope 与 OpenAI 协议),已上线北京、新加坡、香港、东京、法兰克福、弗吉尼亚等区域
  • 仅 API 提供,未发布开放权重——对本地部署玩家而言,可继续关注我们收录的 Qwen3.8-Flash-Next 等开放权重型号