数码影音频道 频道

AI语音进入表演时代:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

“AI摘要”

2026年7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在全球权威榜单中夺冠。该模型通过细粒度标签控制(如[gasp]、[giggles])、freestyle指令遵循,实现从情绪到呼吸的精确表达,支持48kHz高质量输出,最长3分钟合成。多语种覆盖16种语言,在CV3-Eval测试中10种语言词错误率最优;方言覆盖20种,包括广东、四川等。模型还具备高噪声环境下的语音增强能力,标志着AI语音合成进入“表演时代”。

2026年7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在全球第三方权威榜单Artificial Analysis中斩获冠军。新模型通过细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面的系统性提升,让合成语音从"能说话"走向"会表达",标志着AI语音合成正式进入"表演时代"。

细粒度控制:从情绪到呼吸

Qwen-Audio-3.0-TTS在上一代freestyle模式基础上实现关键跃迁。用户现在可直接在文本中嵌入结构化标签——例如[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)——将控制精度从整段情绪细化到"哪个字后面该倒吸一口气"。这种细粒度控制能力适用于叙事、游戏、配音等需要精确表达细节的专业场景。模型包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,音频输出从24kHz提升至48kHz,达到录音棚和影视配音规格,单次语音合成可长达3分钟。

多语种与方言全面覆盖

在全球化场景方面,Qwen-Audio-3.0-TTS覆盖中、英、日、韩、德等16种语言,新增阿拉伯语、越南语、马来语和菲律宾语。CV3-Eval基准测试显示,在16种语言的词错误率评测中,该家族在10种语言中取得最优,韩语和马来语领先幅度最大;在说话人相似度评测中,Plus版本包揽全部16种语言第 一。针对方言痛点,团队专门设计方言强化训练,覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言,让模型在韵律、声调与口语表达上接近母语者水平。模型还在高噪声、高混响条件下具备语音增强能力,可从嘈杂环境中精确提取目标音色。

0
相关文章