该模型面向开发者与音视频 Agent 场景,可在同一模型内读取文字、图片、声音和画面,并把视频剪辑、会议分析与工具链执行串联成工作流;API 音频输入每小时成本降幅超过 98%,音视频超过 93%。
阿里巴巴旗下 Qwen 团队于 9 月 18 日推出 Qwen3.8-Omni-Flash,该模型已经在千问 AI 平台提供体验。它将文本、图像、音频和视频四类输入放入同一处理路径,支持 1M 上下文,并把重点放在音视频 Agent、长程任务和媒体内容生产流程。
在官方列出的累计 30 项评测中,Qwen3.8-Omni-Flash 相对前代 Qwen3.5-Omni-Plus 的平均得分提高超过 26%。分项结果显示,WildClawBench-MM 提高 36.5 分,AgenticVBench 提高 22.3 分,UniClawBench 为 69.6 分;LongAudioSpan 提高 8.3 分,OmniVideoBench 提高 9.6 分,OmniCap-IF 的 CSR 和 ISR 分别提高 8.5 分和 14.1 分。AliMeeting 说话人错误率 DER 由 88.11 降至 3.35,带说话人归属的词错误率 cpWER 由 89.61 降至 17.18。音频对照中,WildClawBench-MM、DailyOmni、SpotSoundBench 与 MMAU 的数据高于 Gemini 3.8 Flash;AgenticVBench 为 36.8 对 45.0,OmniGAIA 为 74.0 对 78.6,说明其优势集中在音频与整体音视频表现。
价格层面,API 每小时音频输入成本降低超过 98%,每小时音视频输入成本降低超过 93%。国际区域公开的每百万 Token 输入价格为 0.15 美元,报道标题所列百万 Token 图文音视频输入价格为 0.8 元。为适配长音视频,团队扩展了 Qwen-MM-Plugins,使其负责按需感知、工具调用与执行,并开源 Qwen-Live Harness,用于实时、连续的全模态交互。长音视频功能包括按需描述、主动取证、会议任务推进和视频深度研究报告;可控音视频描述可以设定对象、时间范围、信息粒度与输出格式。启用 Agentic Understanding 模式后,OmniVideoBench 准确率由 63.4 提升到 67.8,Token 消耗由 145,736 下降到 79,117,降幅约 45.7%。
在涉及研发环节的实验里,系统在 12 小时内自行选择评测集、构建数据并完成 4 轮迭代,共构造 3,413 条训练样本,使 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。这类原生多模态架构与分离式视听模块存在技术路径差异。它与 Gemini 3.8 Flash 的对照表明,成本、音频理解与工具化能力构成主要差异点,部分视频 Agent 指标仍有差距。开放 Qwen-MM-Plugins 与 Qwen-Live Harness 后,开发者可将其用于会议、视频、音乐影像制作和多媒体分析等流程。