腾讯混元发布Hy ASR 3.0 preview语音识别模型

8月4日 16:21
该模型于8月4日上线,融合Hy3大语言模型语义理解能力,在开源测试集中文普通话、英语及粤语词错误率均控制在3%左右,并率先接入元宝应用提供免费使用。

腾讯混元团队于8月4日正式推出新一代语音识别模型Hy ASR 3.0 preview。该版本基于Hy3大语言模型构建,核心改进在于将高精度语音识别技术与深度语义理解能力进行深度融合。官方指出,这一技术架构的更新推动语音处理从传统的逐字转写模式,向理解语境、兼容多场景及一键直出结果的方向演进,旨在更准确地解析复杂真实输入中的用户意图。

在性能指标方面,Hy ASR 3.0 preview在多个开源评测集上取得了具体数据表现:中文普通话的词错误率(WER)为3.34%,英语为2.62%,粤语为3.12%,整体水平维持在3%左右。此外,该模型在自建评测集中针对通用识别、十余种方言、上下文语义理解、专业术语提取以及高噪声和耳语等复杂声学场景进行了专项测试,WER数值均保持在较低水平。技术实现路径上,新模型采用了兼顾效率与性能的MoE架构,基座升级为Hy3大模型,并引入自研的无监督语音Encoder。训练过程依托数千万小时级语音数据,通过语音Encoder与大语言模型的联合预训练覆盖多方言与多口音场景,并在后训练阶段利用涵盖20余个方言小片区的SFT数据集及多阶段强化学习,优化复杂环境下的识别准确率。

应用落地层面,Hy ASR 3.0 preview已通过腾讯云官网对外提供API服务,支持智能客服、内容理解及语音搜索等商业场景。腾讯旗下AI助手“元宝”已完成首发接入,用户可通过语音输入直接体验方言识别、上下文智能纠错及复杂环境稳定转写等功能,且相关能力目前处于免费开放状态。同时,WorkBuddy等产品也在规划接入该模型。行业观察认为,此次更新标志着语音交互技术向更精准理解用户意图的阶段迈进,将对多场景下的语音输入体验产生实质性影响。