千问发布五款Qwen-Audio-3.1模型并降价

9月23日 15:15
本次上线五个音频模型,覆盖识别、合成、实时交互、理解和创作,主要接口已进入千问AI平台,下一代理解接口待开放;价格表同步呈现下调后的计费区间,便于会议、播客、有声书和智能硬件接入。

9月23日,千问推出 Qwen-Audio-3.1 系列语音模型,涉及 ASR、ASR-Next、TTS、TTS-Next、Realtime 五条产品线,把识别、理解、合成与实时交流放入同一组合。调用侧主要落在千问 AI 平台,除 ASR-Next API 仍处待上线状态外,其余接口已对外可用。

识别方向上,Qwen-Audio-3.1-ASR 扩大语音到文字的处理范围,能力覆盖 30 种语言与 16 种中文方言,并利用长音频历史上下文维持人名、术语等专业实体稳定。它可在端到端链路内一并返回发言人标识、对应时刻和对应文字,支持轮流发言、短暂插话和重叠语音等复杂情形;新加入的转写整理机制能够去掉语气词、删减重复表达并重新组织语句,服务会议、访谈和对话分析中的结构化记录需求。流式传输场景下,首字延迟约为 160 毫秒。

ASR-Next 进一步把处理对象扩展为音频整体,而非只关注语音里的文字。此类能力可围绕人物情绪、环境声和机械声进行描述、事件定位与问答推理,也可面对夹杂对白、背景音乐和现场声音的材料给出多层次解析。语音合成方面,常规 TTS 能在同一音色基础上完成跨语言输出,并以指令调节情绪和语速;TTS-Next 则面向音频内容制作,统一生成人声、音效与环境声,支持多角色音色复制、细粒度时间戳与 48kHz 输出,适配播客、有声书、影视和游戏等制作场景。

Realtime 强调全双工连续交互,用户可以随时打断,模型也能在多语言之间切换、感知情绪并在对话过程内调用外部工具。这一形态正在结合 Qoder、千问办公等智能体产品与千问 AI 眼镜等终端设备,用于探索语音作为人机交互入口的应用。

商业层面,本次调价给出三组降幅:TTS 约 70%,Realtime 约 85%,ASR 达 95%。明细价例显示,Qwen-Audio-3.1-ASR-Flash 输入 0.8 元、输出 2.7 元/百万tokens;Qwen-Audio-3.1-TTS-Flash 输入 1.5 元、输出 12 元/百万tokens;Qwen-Audio-3.1-TTS-Next 输入 6 元、输出 12 元/百万tokens;Qwen-Audio-3.1-Realtime-Plus 按档位输入 5~40 元、输出 40~150 元/百万tokens。性能数据同时列出若干评测结果:KeSpeech 与 WSYue 相关子集平均字错误率 4.55%,其中 11 个子集中的 6 个优于 Doubao-ASR 和 Tencent Hy-ASR-3.0-preview;中文方言自建集平均字错误率 10.38%;方言转普通话平均语义句准率 82.10%。在 9 月 22 日开启的 2026 云栖大会语境中,相关模型曾被提前预告,并附带同声传译模型 Qwen3.8-LiveTranslate 的信息。