微软测试首款自研全双工AI语音模型MAI Realtime:支持中文等16种语言
据科技媒体TestingCatalog报道,微软正在测试其首款原生全双工实时语音AI模型MAI Realtime。该模型支持包括中文在内的16种语言,提供两种语音风格,可在对话中实现"听说并行",并支持自动识别和中途切换语言。
MAI Realtime采用双向、全双工交互方式,无需严格按照"用户说完、模型再答"的轮次交替模式,可同步聆听和回应。这种交互方式更接近人类之间的自然对话,用户可以随时插话打断,模型也能够实时调整输出内容。
在语言覆盖方面,MAI Realtime支持英语、德语、西班牙语、法语、意大利语、葡萄牙语、日语、韩语、中文、荷兰语、印地语、印尼语、阿拉伯语、俄语、土耳其语和越南语共16种语言。用户可主动指定语言,也可以启用自动检测功能。
语音风格方面,该模型目前提供Victoria和Grant两种语音,据称比Copilot当前的语音模式更加自然。不过该模型定位为对话系统,不支持唱歌或生成非语音音效。
调试面板可显示实时延迟、模型思考内容和处理步骤,便于开发者评估模型性能。目前微软已邀请部分合作伙伴在MAI Playground平台上测试该模型,但尚不清楚何时会正式上线Microsoft Foundry或扩展到Copilot语音功能。
此前微软发布的MAI语音模型均为单向模型,包括用于语音合成的MAI-Voice-2及其Flash版本,以及用于语音识别的MAI-Transcribe-1.5。MAI Realtime是微软在对话式AI语音交互领域的首个全双工自研模型,标志着微软在AI语音技术上的重要突破。
0
相关文章