动态
微软开源 MAI-Voice-2.1 与 MAI-Transcribe-2-Streaming:23/60 语言原生口音,150ms/100ms 延迟
微软 MAI 团队 10 月 3 日发布两款开源语音栈模型:MAI-Voice-2.1(23 种语言原生口音,Flash 版 150ms 首包延迟)与 MAI-Transcribe-2-Streaming(60 种语言实时转写,首批延迟 ~100ms)。
来源: AI 日报(ai6s.net)
是什么
10 月 3 日,微软 MAI(Microsoft AI)团队发布两款开源语音栈模型:
- MAI-Voice-2.1:TTS 模型,23 种语言原生口音(非通用英文转写方言),Flash 版首包延迟约 150 毫秒
- MAI-Transcribe-2-Streaming:实时转写模型,60 种语言,首批延迟约 100 毫秒,流式输出
与既有方案的差异
与 Whisper-large-v3 / CosyVoice 等主流开源语音栈相比:
| 维度 | MAI-Voice-2.1 | CosyVoice-2 | Whisper-large-v3 |
|---|---|---|---|
| 实时流式 | ✓(Flash 150ms) | ✓(部分) | ✗(离线为主) |
| 原生口音 | 23 种 | 中文方言为主 | N/A(仅识别) |
| 首包延迟 | 150ms | ~200ms | N/A |
| 许可证 | 开源 | 开源(社区) | MIT |
| 维度 | MAI-Transcribe-2-Streaming | Whisper-large-v3 | Paraformer |
|---|---|---|---|
| 流式 | ✓ | ✗ | ✓ |
| 语种数 | 60 | 99 | 中英 |
| 首批延迟 | 100ms | N/A | ~300ms |
本地部署角度
Flash 版 TTS 面向实时对话/客服场景,单张消费级 GPU 即可;流式转写对内存与 CPU 调度敏感,建议 16GB+ 工作站或云端推理服务。社区量化与 ONNX 导出版待跟踪。