腾讯混元Hy ASR 3.0 preview发布:语音识别从"听清"走向"听懂"
8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。这款基于最新大语言模型Hy3构建的语音识别系统,标志着ASR(自动语音识别)技术从传统的"逐字转写、单点优化"范式,正式向"理解语境、兼容场景、一键直出"的新阶段迈进。
在语音识别领域深耕十年的人都知道,这一行长期解决的核心问题只有一个——"听清"。你说什么,系统尽量一字不差地写出来。但"听清"和"听懂"之间有本质区别:同音词怎么区分?方言怎么处理?在嘈杂环境中如何保持准确率?这些都是传统ASR模型难以逾越的障碍。腾讯混元Hy ASR 3.0 preview的突破正在于此——它不再只是一个声学信号到文字的转换器,而是一个融合了深度语义理解能力的智能系统。
从技术指标来看,Hy ASR 3.0 preview在多个开源评测集上表现领先。中文普通话词错误率(WER)仅为3.34%,英语WER低至2.62%,粤语WER为3.12%——在多语种场景下WER都控制在3%左右的水平,这在行业中是相当出色的成绩。但这只是基础指标,更关键的升级体现在四个核心维度。
首先在通用识别方面,模型在普通话、方言、中英混说等复杂场景下的识别准确性大幅提升,有效减少了错字、漏字以及长音频中的错误累积。其次在上下文感知能力上,模型能够结合对话的语境精准捕捉用户意图,智能纠错同音词,消除语义歧义——比如在一段关于"苹果发布新手机"的对话中,它不会再困惑这是水果还是科技公司。第三是场景鲁棒性的大幅增强,无论是在菜市场、地铁车厢还是嘈杂的工地上,识别效果都保持了高度稳定。第四是方言覆盖的显著拓展,使更多非普通话用户能够获得高质量的语音识别体验。
目前Hy ASR 3.0 preview已上线腾讯云官网对外提供API服务,可广泛应用于智能客服、内容理解、语音搜索等场景。腾讯旗下产品"元宝"已完成首发上线并免费开放方言识别、上下文纠错等功能;WorkBuddy等产品也在陆续接入中。从更宏观的视角看,Hy ASR 3.0 preview补齐了腾讯混元在全模态AI版图上的关键一块——此前Hy3大模型已在文本生成与推理领域建立口碑,ASR模型的加入使混元生态覆盖了"听—说—读—写"的完整能力闭环,对微信语音输入、腾讯会议实时转写、游戏语音交互等场景具有直接的赋能价值。
有意思的是,Hy ASR 3.0 preview的发布恰逢国内语音识别赛道的一波密集迭代期。7月底,阿里发布了通义听悟Qwen-Audio-3.0-ASR-Flash,其离线版本错字率低至1.7%;同一时间,云知声完成了U2-ASR的多语种升级。腾讯这一入场,标志着国内头部云厂商在ASR赛道上的最新布局悉数落定,也意味着语音识别领域的竞争正从单纯的技术精度比拼,转向语义理解与场景落地的综合较量。