MiniMax发布开源多模态模型H3支持15秒2K生成

7月31日 01:37
该模型于7月31日推出,采用统一架构处理文本图像视频音频,将视频编辑能力列入全球榜首,定价策略旨在降低多模态内容创作门槛。

7月31日,稀宇科技(MiniMax)正式推出新一代全模态生成模型MiniMax H3,并宣布将于近期向公众开放模型权重。该模型标志着公司从单一任务特化模型向通用多模态智能的转型,能够同时接收文本、图像、视频和声音作为输入,通过统一框架理解创作意图,直接输出带有原生双声道音频的高清视频内容。在性能指标上,H3最高支持生成时长为15秒、分辨率为2K的视频片段,并在人工分析(Artificial Analysis)评测中位居全球视频编辑能力榜首。

在技术架构与成本控制方面,MiniMax H3摒弃了传统按任务拆分的专家模型模式,转而采用H3-Omni Transformer统一预训练框架,使端到端训练吞吐量提升近30%。通过自研的H3-VAE架构及高压缩Tokenizer技术,模型有效降低了高分辨率下的推理成本与Token消耗。其2K分辨率生成价格定为0.8元/秒,约为市场同类旗舰模型的三分之一;768P分辨率下价格为同类720P模型的二分之一。在超分方案上,H3未采用常规外部超分模块,而是利用基础模型对低分辨率结果进行上下文(In-context)重生成,以复用基模能力还原细节。此外,模型具备V2V Motion Transfer(视频到视频动作迁移)功能,在品牌Logo、文字信息及UI/UX动态演示的呈现准确率上较前代有显著提升,能够精准响应复杂的多维度编辑指令。

此次发布被视为国产视频生成大模型首次面向社区开放权重的重要节点,旨在推动开源生态建设并加速国产芯片适配。MiniMax在文本与多模态领域均坚持自研路线,此前已开源三代M系列文本模型,H3是其首款开源多模态生成模型。该模型的商用定位明确覆盖广告、电商、品牌宣传、游戏开发及产品设计等场景,通过降低高质量视频内容的制作门槛与成本,试图改变目前闭源模型主导市场的格局。公司表示将在符合法律法规前提下分阶段开放模型代码与权重,目前已有多家企业表达合作意向,后续计划通过持续扩展模型上限及融合H系列与M系列能力以进一步提升性能。