数码影音频道 频道

微软测试首款自研全双工AI语音模型MAI Realtime:支持中文等16种语言

“AI摘要”

微软正在测试其首款原生全双工实时语音AI模型MAI Realtime,支持16种语言(含中文),提供Victoria和Grant两种自然语音风格。该模型采用双向交互,允许用户随时打断,同步聆听和回应,接近人类对话体验。它支持语言自动检测和中途切换,定位为对话系统,不支持唱歌。调试面板可显示实时延迟和思考内容,便于开发者评估。目前仅邀请部分合作伙伴在MAI Playground测试,正式上线时间未定。这标志着微软在对话式AI语音技术上从单向模型向全双工交互的重要突破。

据科技媒体TestingCatalog报道,微软正在测试其首款原生全双工实时语音AI模型MAI Realtime。该模型支持包括中文在内的16种语言,提供两种语音风格,可在对话中实现"听说并行",并支持自动识别和中途切换语言。

MAI Realtime采用双向、全双工交互方式,无需严格按照"用户说完、模型再答"的轮次交替模式,可同步聆听和回应。这种交互方式更接近人类之间的自然对话,用户可以随时插话打断,模型也能够实时调整输出内容。

在语言覆盖方面,MAI Realtime支持英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、中文、荷兰语、印地语、印尼语、阿拉伯语、俄语、土耳其语和越南语共16种语言。用户可主动指定语言,也可以启用自动检测功能。

语音风格方面,该模型目前提供Victoria和Grant两种语音,据称比Copilot当前的语音模式更加自然。不过该模型定位为对话系统,不支持唱歌或生成非语音音效。

调试面板可显示实时延迟、模型思考内容和处理步骤,便于开发者评估模型性能。目前微软已邀请部分合作伙伴在MAI Playground平台上测试该模型,但尚不清楚何时会正式上线Microsoft Foundry或扩展到Copilot语音功能。

此前微软发布的MAI语音模型均为单向模型,包括用于语音合成的MAI-Voice-2及其Flash版本,以及用于语音识别的MAI-Transcribe-1.5。MAI Realtime是微软在对话式AI语音交互领域的首个全双工自研模型,标志着微软在AI语音技术上的重要突破。


0
相关文章