小米开源目标说话人语音识别大模型 CocktailASR-1

9月11日 14:51
模型以一段参考音频作为声纹提示,从多人交叠语音中提取并转录指定对象的内容,同时对非目标语音进行拒识,并兼容单人说话场景,官方在 GitHub 与 Hugging Face 提供了入口。

小米技术在9月11日公开了名为 Xiaomi-CocktailASR-1 的工业级目标说话人语音识别大模型,并将其以开源形式发布。该模型面向多人同时发声导致常规语音识别精度下降的场景,目标是让系统在一组混合语音中只保留并转录指定对象的内容。

架构上属于端到端的大语言模型管线,前端使用 D2V2 音频编码器,随后经过 Adapter 接入大模型解码器,整套参数集中在单一检查点中。调用时通常先放入目标说话人的参考音频,再拼接待处理的单声道音频,并在两段之间加入一秒静音作为边界。模型根据参考音频提取声纹特征,用来锁定对应说话人,同时抑制其他说话者、混响和背景噪声;如果目标说话人未出现在音频里,系统会给出空文本,以避免把无关语音当成有效结果。官方还提到,该模型支持思维链推理模式,可以为输出提供可理解的推理说明。

公开材料给出的基准信息显示,LibriMix2mix 与 LibriSpeechMix2mix 两项模拟多说话人测试的字错率分别为 4.11% 和 2.90%。在更难的 LibriMix3mix 设置下,该模型字错率为 12.29%,而报告列出的部分受比较模型在同一设置中的字错率范围为 76% 到 121%。在 AMI SDM 与 AliMeeting Far 等更接近真实会议的录音数据上,该模型也被放入评测范围,并被描述为优于既有解决方案。就单人对话而言,官方称其识别能力与常规 ASR 模型接近,因此不必在单人和多人场景之间切换不同模型。相关资源已在 GitHub 与 Hugging Face 页面提供入口。