阿里语音识别模型重大升级,行业词识别率突破95%且长音频不丢词
7月31日,阿里巴巴发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度系统性升级,同时具备语音润色能力,可直接输出结构化文本。
目前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证,离线版本曾在全球权威AI评测平台Artificial Analysis以1.7%的错字率位列全球第 一。
识准专业词汇,是ASR模型走向行业落地的"最后一公里",也是本次升级的核心。Qwen-Audio-3.0-ASR-Flash新增长音频Context能力:模型在转写当前语音片段时,可参考近期已识别的上下文,延续同一话题中的关键词与语义线索,从而减少同音词误判。在一场长达数小时的会议录音中,同一位发言人的名字、同一个技术概念,不会因为跨了多个语音片段就被忘记或认错。
在行业词识别方面,研究团队构建了覆盖医疗、IT编程、股票、社会名人等领域的高质量词库,并基于这些实体词合成相关训练数据。在最新的行业词汇内部评测中,新模型的行业词召回率均有显著提升,其中医疗场景突破95.36%。
热词定制方面,Qwen-Audio-3.0-ASR-Flash采用模型结合声学证据与上下文进行智能判断的方式,而非简单替换。在传入热词的条件下,热词定制化准确率在所有测试集均达到90%以上,多数场景更是突破99%。
此外,该模型还具备语音润色能力:口语中的填充词被直接去除,自我修正只保留最终意图,散乱的口述可自动整理为结构化表达。这些润色由ASR模型在识别环节一步完成,无需再调用下游文本大模型。即日起,该模型已在阿里云百炼平台开放调用。
0
相关文章