AI语音进入表演时代:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
2026年7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在全球第三方权威榜单Artificial Analysis中斩获冠军。新模型通过细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面的系统性提升,让合成语音从"能说话"走向"会表达",标志着AI语音合成正式进入"表演时代"。
细粒度控制:从情绪到呼吸
Qwen-Audio-3.0-TTS在上一代freestyle模式基础上实现关键跃迁。用户现在可直接在文本中嵌入结构化标签——例如[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)——将控制精度从整段情绪细化到"哪个字后面该倒吸一口气"。这种细粒度控制能力适用于叙事、游戏、配音等需要精确表达细节的专业场景。模型包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,音频输出从24kHz提升至48kHz,达到录音棚和影视配音规格,单次语音合成可长达3分钟。
多语种与方言全面覆盖
在全球化场景方面,Qwen-Audio-3.0-TTS覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语和菲律宾语。CV3-Eval基准测试显示,在16种语言的词错误率评测中,该家族在10种语言中取得最优,韩语和马来语领先幅度最大;在说话人相似度评测中,Plus版本包揽全部16种语言第 一。针对方言痛点,团队专门设计方言强化训练,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言,让模型在韵律、声调与口语表达上接近母语者水平。模型还在高噪声、高混响条件下具备语音增强能力,可从嘈杂环境中精确提取目标音色。
0
相关文章