科技媒体 TestingCatalog 报道,微软正在测试其首款原生实时语音模型 MAI Realtime。该模型支持 16 种语言、2 种语音风格,可在对话中实现听说并行,并支持自动识别和中途切换语言——这意味着用户无需等待 AI 说完才能开口,对话体验将无限逼近真人交流。

MAI Realtime 采用双向、全双工交互方式,打破了传统语音助手"用户说完、模型再答"的轮次交替模式。系统依靠端点检测技术识别说话的开始、停顿和结束,当用户中途插话时,模型能即时调整输出,实现同步聆听与回应。这是微软 MAI 语音模型家族从单向走向双向的关键一步——此前发布的 MAI-Voice-2 和 MAI-Transcribe-1.5 均只能分别完成语音合成或语音识别的单向任务。
两种语音风格更自然,但暂时不会唱歌
在语言覆盖上,MAI Realtime 支持中文、英语、日语、韩语、法语、德语、阿拉伯语等 16 种语言。用户可主动指定对话语言,也可启用自动检测功能,模型能在对话过程中自动识别并切换语言。语音风格方面,测试版本提供 Victoria 和 grant 两种声音,据称比 Copilot 目前的语音模式更加自然。
不过该模型的定位仍是对话系统,不支持唱歌或生成非语音音效。调试面板可实时显示延迟数据、模型思考内容和处理步骤,样本分享功能有望在测试范围扩大后向更多平台用户开放。目前微软已邀请部分合作伙伴在 MAI Playground 平台进行测试,但何时上线 Microsoft Foundry、何时扩展至 Copilot 语音功能,尚无明确时间表。从单向到全双工,从轮次交替到同步对话,微软正在用 MAI Realtime 向业界宣告——AI 语音交互的"对讲机时代"或将成为过去式。
[免责声明]如需转载请注明原创来源;本站部分文章和图片来源网络编辑,如存在版权问题请发送邮件至398879136@qq.com,我们会在3个工作日内处理。非原创标注的文章,观点仅代表作者本人,不代表本站立场。
