MiniMax M3模型正式开源,总参数428B激活23B

6月15日 23:12
稀宇科技于6月12日提前开放权重并发布MSA论文,正式开源的M3模型两周内在Artificial Analysis排名全球第一,输出速度从30 TPS优化至80 TPS并计划再提速。

稀宇科技(MiniMax)于6月15日正式对外宣布开源其原生多模态旗舰模型MiniMax M3的权重文件,该动作紧随上月12日发布的MSA(MiniMax Sparse Attention)技术论文之后。作为行业内首个从训练初始阶段即执行多模态混合训练的开源大模型,M3在发布后的两周内登上Artificial Analysis综合智能指数排行榜,获得全球开源模型最高排名。此次开源不仅包含模型权重,还向开发者社区公开了相关技术文档与工具包,标志着该架构进入开放协作阶段。

在技术参数方面,MiniMax M3的总参数量设定为428B,通过动态激活机制将实际运算参数控制在23B规模,以平衡性能与推理成本。模型采用文本、图像、音频等多模态数据交叉训练模式,构建了统一的跨模态语义空间,使其在处理长周期任务及超长文本序列时具备显著优势。官方指出,引入的稀疏注意力机制可将计算资源消耗降低40%以上,同时支持中英文双语环境下的复杂对话与内容生成。针对发布初期因访问量激增导致的服务延迟问题,开发团队在两周内完成了三轮性能迭代,将模型输出速度从初期的约30 TPS提升至目前的80 TPS。官方透露后续计划通过架构优化继续提升30%至40%的处理效率,以保障高负载下的交互流畅度。

在垂直领域能力上,M3在编码与智能体评测中表现出行业顶尖水准,具备自主拆解复杂任务、调用外部工具及多步推理的能力。官方强调该模型生成的代码旨在直接达到交付标准,区别于传统模型输出“需人工大量修改”的半成品,预计能显著降低开发者的工作负荷。目前已有超过200家企业参与模型测试,覆盖多种应用场景。随着AI技术向生产环境渗透,M3通过开源策略降低了企业级应用门槛,其动态参数激活技术为降低推理成本提供了新路径,同时也面临高并发下的稳定性与大规模部署成本效益比的持续验证。