数码影音频道 频道

阿里、字节、MiniMax扎堆卷语音,语音模型之战选优选强?

“AI摘要”

阿里推出CosyVoice Studio,定位国内首个一站式AI语音生产力平台,将录音整理、配音生成、语音客服整合于一个App,替代过去需三个工具的流程。平台包含CosyFlow(录音转写)、CosyCreative(音频创作)、CosyAgent(语音客服)三功能,目前限时免费。文章对比了2026年7-8月密集发布的语音模型,如字节SeedRealtime、MiniMax H3、腾讯Hy ASR 3.0、SALMONN-2等,指出各模型侧重不同,选择时应基于具体需求,而非追求功能全面。最终强调没有“最好”的模型,只有“最适合”场景的工具,用户需明确用途。

8 月 7 日,阿里推出 CosyVoice Studio。它把自己定义为国内第 一个一站式 AI 语音生产力平台,把录音整理、配音生成、语音客服三件事放进了同一个 App。

这不是一次普通的功能更新。过去你要做这三件事,得开三个工具。现在一个入口全包了。

一个平台,三件事

CosyFlow,管的是录音整理。 你对着它说话,它吐出一份干净文字,去掉"嗯、啊、那个"这些口头禅,还把不同发言人的话分开。开会、访谈、上课要整理的人,最用得上。

CosyCreative,管的是音频创作。 你丢一份文档或者一个链接进去,它用上千种音色,给你生成对话式播客、多角色有声书。做自媒体、有声书、课程的人,以前要找配音、要剪辑,现在一步到位。

CosyAgent,管的是语音客服。 你说一句需求,它搭出一个能接电话、能实时对答的语音智能体。有客服、电话营销需求的企业,不用再从头组建一套对话系统。

三件事,过去是三个工具、三笔开销。现在一个 App 里全有,目前还限时免费,后两者是白名单邀请制。

把市面上的语音工具摊开看,本来是三类玩家,各管一摊。

转写、会议类,有讯飞听见、腾讯会议 AI 纪要。配音、克隆类,有 ElevenLabs、剪映、即梦、MiniMax。实时对话类,有豆包、智谱 GLM-4-Voice、海螺。

CosyVoice 的特别之处,是一个平台把三类都包了。但包得全,不等于每一项都最深。一站式很方便,可如果你只想要一个超好用的配音,单点工具可能更顺手,也未必更贵。选工具的第 一步,不是看谁功能多,是弄清楚你要的是哪件事。

这波开源,把选择题摊开了

2026 年的七、八月,语音和音频模型像约好了似的集中冒头。把阿里之外几个有代表性的摆出来,你会发现它们不在同一个擂台上打架,而是各自占了一个坑。

做一站式语音生产力的,还有字节。8 月 5 日它发了 SeedRealtime,原生音视频全双工,已经在豆包全量上线,主打"边看边听边说"。它更像把能力直接塞进产品,目前不是开源路线。

做全模态、把声音当其中一环的,有 MiniMax 和腾讯。MiniMax 在 7 月 31 日发布、8 月 3 日开源了 H3,33B 单流架构,把文本、图像、视频、音频统一进一个模型,能直接生成带原生立体声的短视频,声音只是它多模态里的一部分。腾讯 8 月 4 日推出 Hy ASR 3.0,把中文识别错误率压到 3.34%,偏"听得准",是转写这一环的专精。

做音频理解的,有 SALMONN-2。它 8 月 7 日开源,是清华、上海人工智能实验室、剑桥联合做的通用音频大模型,8B 参数。它不帮你配音,而是帮你鉴别声音真假、听出环境里发生了什么,能直接做声音事件检测、伪造语音识别、语音质量评分。

海外也有开源声音模型,但大多是更早的积累。最常被拿来当标杆的是 Sesame 在 2025 年开源的 CSM,一个 10 亿参数的对话语音模型,自然度到今天还被很多人认为领先。它更像给开发者研究用的,不是给普通人开箱即用的产品。

这波模型不是"谁比谁强",是"谁比谁更知道自己干嘛用"。想做配音和播客,看 CosyVoice、ElevenLabs、剪映。想做实时对话客服,看 SeedRealtime、豆包、智谱。想自己部署、改代码,看 SALMONN-2 这类开源权重。

阿里把三件事合一个平台,是给用户省心。但真挑的时候,还是得回到那句话:你要的是哪件事。

比什么:普通人能看懂的几个维度

中文够不够地道。 方言、口音、多音字准不准,这是国产工具相对 ElevenLabs 这类海外产品的优势,也是 SALMONN-2、Hy ASR 这类国产模型扎进去的地方。

声音像不像人。 能不能克隆你的声音、带不带情绪,别一听就是机器念稿。

能不能实时对答。 延迟高不高,会不会你说话它还在念上一句。SeedRealtime 和豆包比的就是这一项。

贵不贵、好不好上手。 要不要写代码,按字数还是按时长收费,小白能不能直接玩。想自己部署的,就看有没有开源权重、能不能本地跑。

别盯着榜单排名看。先看你的场景落在哪条线上,再看那一维谁做得好。

没有最好的,只有最合适的

没有"最好的语音模型",只有"最适合你那件事的"。

从七月的 MiniMax H3,到八月的 SeedRealtime、CosyVoice Studio、SALMONN-2,这一波密集发布和开源,把语音能力的门槛又往下拉了一截。但 2026 年里真正决定你用得顺不顺的,还是你在打开工具前想没想清楚:我要用它干嘛。

0
相关文章