该模型于 8 月 3 日正式面向全球开发者发布,作为全模态生成系统统一处理文本图像音视频数据,并实现摩尔线程、壁仞科技等国产算力厂商的当日快速适配。
8 月 3 日,人工智能企业 MiniMax 正式开源其新一代通用视频模型 MiniMax H3。该系统被定位为全模态生成工具,能够统一理解并处理由文本、图像、视频及音频构成的复杂多模态上下文。模型设计以任务泛化为导向,在预训练阶段即构建了跨模态知识表征,使其无需针对特定场景微调即可执行包括文生视频、图生视频及多模态指令遵循在内的多种生成任务。
在输出规格与性能指标方面,MiniMax H3 支持生成时长为 4 至 15 秒的视频片段,帧率为每秒 24 帧,并集成 32 kHz 原生立体声音频。分辨率方面,模型默认将短边固定为 768 像素,同时提供多种宽高比选项(包括 21:9、16:9、4:3、1:1、3:4 及 9:16)。通过 H3-Regenerate-2K 专项模块,用户可进一步将输出分辨率提升至 2K 标准。输入模式分为两类:H3-Base-FL2VA 支持首尾帧控制,允许输入 0 至 2 张图像以分别实现纯文本生成、首帧引导、尾帧引导或首尾帧协同生成;H3-Base-Ref2VA 则支持全模态参考,单次请求最多可容纳 9 张图像、3 段视频及 3 段音频,总文件数上限为 12 个。语言支持涵盖阿拉伯语、中文、英语等 11 种主要语种。
开源发布当日,国产算力生态迅速响应。摩尔线程团队利用 MTT S5000 智算卡与 MUSA 软件栈,在 3 小时内完成从推理框架到高性能算子库的完整适配,实现模型在硬件上的稳定运行。壁仞科技亦基于自研 SGLang 框架,在壁砺系列 GPU 上完成了该模型的快速部署与调优。根据相关榜单数据,H3 在视频编辑能力评测中表现突出,且 2K 分辨率生成成本约为每秒 0.8 元。这一开源动作与本土硬件的即时适配,标志着多模态大模型技术在降低应用门槛与推动产业链自主可控方面的具体进展。