微软测试首款自研全双工语音模型 MAI Realtime 支持16种语言

8月4日 08:13
该模型支持16种语言及两种自然语音风格,实现听说并行交互,目前处于合作伙伴内测阶段,未来计划接入Microsoft Foundry与Copilot产品体系。

科技媒体TestingCatalog于8月2日发布消息,指出微软正在测试其首款原生实时语音模型MAI Realtime。该模型已作为隐藏功能出现在MAI Playground平台,并邀请部分合作伙伴进行早期访问。MAI Realtime采用双向全双工交互架构,打破了传统语音助手必须遵循“用户说完、模型再答”的轮次限制,系统能够同时接收用户输入并输出回复。这种机制依赖端点检测技术来识别说话的开始、停顿与结束,并在用户中途插话时即时调整输出内容,从而实现同步聆听与回应。该模型被定位为对话系统,不支持生成歌曲或非语音音效,主要目标在于提升人机对话的自然度与流畅性。

在功能参数方面,MAI Realtime支持中文、英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、荷兰语、印地语、印度尼西亚语、阿拉伯语、俄语、土耳其语、越南语及泰语共16种语言。用户既可以在对话前指定单一语言,也可以启用自动检测功能,使模型在交流过程中自动识别并切换所使用的语言。测试阶段提供Victoria和Grant两种语音风格,官方描述其表现比当前Copilot的语音模式更为自然。调试面板允许实时查看延迟数据、模型思考过程及处理步骤,样本分享功能预计将在测试范围扩大后向更多平台用户开放。

从技术演进角度看,这是微软MAI语音模型家族从单向任务向双向交互的关键转折。此前发布的MAI-Voice-2及其Flash版本专注于语音合成,MAI-Transcribe-1.5则用于语音识别,均属于单向模型。MAI Realtime的推出标志着微软在自研实时语音能力上的突破,旨在减少对Azure服务中外部组件的依赖。尽管该模型未来计划通过Microsoft Foundry向开发者开放并集成至Copilot语音功能,但目前尚未公布具体的上线时间表。行业观察认为,此举措意在应对OpenAI GPT Live 1等竞品在实时交互领域的布局,推动AI语音交互从传统轮替模式向类真人同步对话演进。