微软发布 MAI-Transcribe-2 转录模型

9月4日 08:11
它接入 Microsoft Foundry、MAI Playground 和 OpenRouter,覆盖60种语言,支持混用对话、说话人分离、逐词时间戳与两种转写风格,上市价每小时0.10美元。

微软于9月3日公布 MAI-Transcribe-2,官方称其在速度、准确性与费用方面具备优势。系统覆盖60种语言,能够自动检测录音语言,也可处理同一会话中交替出现多种语言的情况,并已进入 Microsoft Foundry、MAI Playground 与 OpenRouter 供开发者接入,上市阶段执行每小时0.10美元的限时价格,优惠截至2026年年底。

在 FLEURS 测试集上,微软给出的数据显示,该模型在强制指定语言和自动推断语言两种模式下的平均词错误率均为5.2%。作为对照,Gemini 3.1 Pro 的两项数值分别为5.3%和5.8%,GPT-Transcribe 为10.4%和10.6%,Whisper v3-Large 为22.8%和23.5%。处理速度方面,官方引用 Artificial Analysis 的结果称,其速度约为 GPT-Transcribe 的10倍、Scribe v2 的7倍、Gemini 3.5 Transcribe 的5倍。

功能层面,该产品加入说话人分离,能够在一段录音中区分不同发言者并把文本归到相应人员;逐词时间戳可为每个词标记位置,服务于音频检索、导航、编辑与字幕对齐。转写风格可按任务调整,其中 verbatim 保留语气词与口误,适合合规审核和材料分析;clean 去除口语冗余,用于字幕、笔记与对外发布文本。此外还包含关键词偏置、语言切换、噪声环境转写等设置。

从行业位置看,这一模型把较低的小时计价和多语种能力放进公开调用渠道,与 Gemini、GPT、Whisper 等同类方案形成直接对照。其速度指标和转写选项使字幕制作、音频资料检索、发布文本整理等场景可以直接调用该模型完成处理。