微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研模型

7月24日 08:00
7月23日微软宣布推出面向高质量图像生成及高并发语音交互的自研模型,强调未采用第三方蒸馏技术,并已集成至Bing、PowerPoint等产品线。

微软于当地时间7月23日正式推出两款自主研发的人工智能模型,分别为MAI-Image-2.5-Pro和MAI-Voice-2-Flash,目前两者均进入公开预览阶段。这一举措标志着微软在构建基于内部训练流程的专用模型方面取得进展,旨在利用经过清洗、可追踪且符合企业级标准的数据进行训练,不再依赖对第三方模型的蒸馏处理,底层设计直接服务于微软产品生态的用户需求。

MAI-Image-2.5-Pro定位为微软当前精度最高的图像生成模型,主要应用于主视觉图片创作、细节微调及图像内文字渲染等高要求场景。该模型优化了文字生成的准确性,并支持通过自然语言指令对生成内容进行编辑。在Bing Image Creator中,该模型已成为默认生成引擎;在PowerPoint中用于图像到图像的编辑功能;部署于OneDrive后,相关场景的保存成功率提升了26%,P95延迟降低约25%,中等负载生产环境效率提升2.5倍。与GPT-Image-2相比,其GPU成本最高可降低84%。定价方面,文本输入每100万个Token收费5美元,图像输出每100万个Token收费106美元。

另一款模型MAI-Voice-2-Flash针对高频语音应用进行了优化,相比前代MAI-Voice-2,其处理速度提升约2倍,成本降低32%,能够在维持自然语调和高质量语音输出的同时,为大规模语音服务提供低延迟支持。该模型已接入Dynamics 365 Contact Center,服务于T-Mobile、EasyJet等客户,GPU成本最高可降低89%。同时,微软将其集成至Azure Voice Live服务,以支持开发者构建语音到语音的交互智能体。定价设定为每100万个字符15美元,适用于客服中心及语音助手等场景。此外,同系列的MAI-Transcribe-1.5已应用于医疗领域的Dragon Copilot解决方案,被17万名医疗服务提供者使用。

此次发布的两款模型体现了微软在AI基础设施自主可控上的战略调整,通过摆脱对第三方模型的依赖并优化训练数据源,试图在图像与语音生成领域建立更稳固的技术护城河。随着模型逐步落地至Bing、Office套件及企业级云服务,预计将在提升产品响应速度与降低运营成本方面产生持续影响,同时为开发者提供更底层的自研能力支持。