千问发布Qwen3.8-LiveTranslate同传模型

9月19日 15:14
9月19日推出的Qwen3.8-LiveTranslate同声传译模型面向跨语言实时沟通场景,在原有60种语言基础上增加说话人分离、原文译文同屏和长上下文消歧,并把字均延迟缩短到2.3秒。

9月19日,阿里千问推出同声传译大模型Qwen3.8-LiveTranslate。该产品把流式理解、文本输出与语音合成放在一条时序链路上处理,使实时翻译的字均延迟由上一代的2.8秒降低到2.3秒,同时继续覆盖60种语言,并针对多人交替发言、双语显示和专业词指代补齐能力。

在底层实现上,该模型借助Hybrid MoE形成Thinker–Talker两段式工作流,并以交错方式连接识别、生成与配音。Thinker将画面、声音、源文本和目标文本放入同一个沿时间展开的序列,按前后顺序持续推导,让理解过程与翻译过程无需拆成独立环节;Talker接收已生成的译文和原始录音,输出近似保留说话人特征的朗读语音。此次新增的功能指向三类常见问题:多人轮流讲话时判断语句归属,屏幕上同步呈现源语言和译文,利用前轮话语澄清专有名词或代词指代。在Omnilingua-MSpeaker这类含14个语向的多说话人长音频测试中,结果显示其在忠实度、流畅度、简洁度及DER指标上的表现好于现有常见实时同传方案。在FLEURS公开数据评估的70个语言方向中,公开基准结果显示其翻译质量、字均延迟、语音识别准确率与语音合成质量高于上一代及当前主流实时同传方案。

这款模型的实用焦点是低等待时间的跨语言传递。过去实时同传常遇到归属混乱、译文落后、界面难以对照、专有名词因缺乏上下文而失真等情况。新版把说话人区分和双语呈现做成内置能力,并继续压缩端到端耗时,可用于需要边听边读且对等待时间敏感的跨语言链路。目前尝鲜体验和API已开放,千问AI平台可作为开发接入通道。后续规划包括继续缩短端到端时延、支持跨越多次对话的记忆能力,以及扩展更多语言覆盖。