该模型于7月31日推出,重点优化长音频上下文一致性、行业术语识别及结构化文本输出能力,在医疗场景内部评测听中率达95.36%。
阿里巴巴于7月31日正式推出名为Qwen-Audio-3.0-ASR-Flash的语音识别大模型,旨在提升人工智能在复杂语境下对专业词汇的识别准确率。该模型通过系统性升级,聚焦于上下文一致性保持、行业特定术语识别以及热词定制化功能,并新增语音润色能力,能够直接生成结构化文本格式。此次发布针对长音频场景中的同音词歧义问题进行了专项优化,使模型在处理长达数小时的会议或直播内容时,能够依据历史对话线索准确判断当前发音对应的具体词汇。
在技术细节方面,Qwen-Audio-3.0-ASR-Flash构建了覆盖医疗、IT编程、股票交易及社会名人等多个领域的高质量词库。研究团队利用从这些行业挖掘的实体词合成训练数据,增强了模型对低频专业术语和冷门词汇的识别能力,无需依赖人工维护词表即可实现自动进化。在最新的内部评测中,该模型在医疗场景下的关键词“听中率”突破了95.36%。此前,Qwen-Audio-ASR系列的离线版本已在AI评测平台Artificial Analysis上以1.7%的错字率获得全球第一的成绩。目前,该系列技术已应用于会议纪要整理、实时字幕生成、教育录播及智能客服等多个实际业务场景。
随着版本的迭代,语音识别技术正从单纯的声学转写向语义理解深度延伸。Qwen-Audio-3.0-ASR-Flash的推出标志着模型在解决长音频丢词和跨片段术语一致性问题上取得了进展。该系列现已通过阿里云百炼平台对外开放调用,提供包括支持最长5分钟时长的Qwen-Audio-3.0-ASR-Flash、离线文件转写专用版Qwen-Audio-3.0-ASR-Filetrans以及实时流式识别版Qwen-Audio-3.0-ASR-Streaming三个版本。这一布局意在满足从即时通讯到长文档处理的不同用户需求,进一步降低行业落地的技术门槛。