← 新闻
动态

微软开源 MAI-Voice-2.1 与 MAI-Transcribe-2-Streaming:23/60 语言原生口音,150ms/100ms 延迟

微软 MAI 团队 10 月 3 日发布两款开源语音栈模型:MAI-Voice-2.1(23 种语言原生口音,Flash 版 150ms 首包延迟)与 MAI-Transcribe-2-Streaming(60 种语言实时转写,首批延迟 ~100ms)。

来源: AI 日报(ai6s.net)

是什么

10 月 3 日,微软 MAI(Microsoft AI)团队发布两款开源语音栈模型:

  • MAI-Voice-2.1:TTS 模型,23 种语言原生口音(非通用英文转写方言),Flash 版首包延迟约 150 毫秒
  • MAI-Transcribe-2-Streaming:实时转写模型,60 种语言,首批延迟约 100 毫秒,流式输出

与既有方案的差异

与 Whisper-large-v3 / CosyVoice 等主流开源语音栈相比:

维度 MAI-Voice-2.1 CosyVoice-2 Whisper-large-v3
实时流式 ✓(Flash 150ms) ✓(部分) ✗(离线为主)
原生口音 23 种 中文方言为主 N/A(仅识别)
首包延迟 150ms ~200ms N/A
许可证 开源 开源(社区) MIT
维度 MAI-Transcribe-2-Streaming Whisper-large-v3 Paraformer
流式 ✓ ✗ ✓
语种数 60 99 中英
首批延迟 100ms N/A ~300ms

本地部署角度

Flash 版 TTS 面向实时对话/客服场景,单张消费级 GPU 即可;流式转写对内存与 CPU 调度敏感,建议 16GB+ 工作站或云端推理服务。社区量化与 ONNX 导出版待跟踪。