MiniMax H3 正式发布并接入 PixPix 支持原生 2K 视频生成

8月1日 21:18
该模型于 8 月 1 日推出,具备多模态理解能力,支持文本、图片及音频输入,承诺未来开源并率先由 PixPix 平台完成集成应用。

MiniMax 在 2026 年 8 月 1 日正式发布其旗舰视频生成模型 H3。该模型的核心特性在于能够同步理解文本、图像、视频及音频数据,并直接输出时长最长达 15 秒、分辨率为原生 2K 且包含立体声的视频内容。与以往侧重单一画质提升不同,H3 的设计逻辑侧重于将参考素材生成与后期编辑环节整合至同一上下文环境中,旨在解决多模态素材在生成过程中人物形象、商品细节、文字内容及音画同步难以保持一致的痛点。

在商业化落地方面,MiniMax H3 已确认接入视频创作平台 PixPix。对于电商及品牌内容团队而言,这一集成意味着可以通过自然语言指令,结合商品主图或参考片段直接生成符合要求的视频素材,无需再依赖多套工具分别处理画面、配音及动作参考。关于成本定价,报道显示该模型的使用价格设定为每生成 1 秒视频内容需支付 0.5 元人民币。此外,MiniMax 方面已公开表示 H3 模型未来将采取开源策略,这一动向被视为对该领域底层技术生态的重要补充。

当前 AI 视频行业虽在应用层涌现大量数字人及短剧产品,但底层基础模型的选择相对有限。H3 的推出为市场提供了除现有头部模型外的新选项,其将制作流程多步骤简化的能力,可能改变创作者处理素材与后期调整的工作流。该模型的发布标志着 AI 视频生成技术正从单纯的“内容创造”向“全流程完成”方向演进,对依赖标准化视频产出的商业场景具有潜在的技术替代意义。