小米开源MiMo-V2.6模型 AA综合智能指数46分

9月22日 06:24
系列包含Pro和Flash两个原生全模态版本,面向复杂编程、智能体和多模态任务,不到六天的大规模强化学习训练推动能力跃升,并开放权重、技术报告与七千余项环境。

9月22日,小米发布并开源 Xiaomi MiMo-V2.6 系列,包含 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两款原生全模态模型,并同步推出面向低延迟场景的 Pro-UltraSpeed 模式。小米将该系列定位为探索递归自我改进路径的一步,其能力主要来自强化学习阶段的计算扩展。在 Artificial Analysis Intelligence Index v4.3.2 中,Pro 版本取得 46 分,较 Kimi K3、Qwen3.8 Max 和 GLM-5.3 等此前上榜开源权重模型处于更高位次;同时,相关说明指出其与 Claude Fable 5.1、GPT-6 Astra 等闭源模型仍存在差距。

架构与规模上,两款模型均为稀疏混合专家结构,原生支持文本、图像、视频和音频输入,最长上下文窗口为 100 万 Token。Pro 拥有 1.02 万亿总参数,每次推理激活约 420 亿参数;Flash 拥有 3090 亿总参数,激活约 150 亿参数。两者共用视觉与音频编码器,并配置五层多 Token 预测模块用于推测式解码。训练过程对外直播了不到六天的强化学习流程,Flash 与 Pro 分别完成 30 步,累计约 75 万条轨迹,成本约 85 万美元和 262 万美元,合计约 347 万美元。单次更新使用 1568 个样本,可在 100 万上下文条件下训练,单步训练 Token 达 3.5 至 3.7B。Pro 与 Flash 的任务平均通过率相对提升 25% 和 12%,DeepSWE v1.1 分别从 48.8 升至 65.7、从 58.4 升至 72.6;在 Code Arena WebDev 中 Pro 首测得到 1628 分,较上一代增加 153 分,Toolathlon-verified 得到 76.9 分,高于 GPT-5.6 Sol 的 74.9。

产品与生态方面,MiMo Desktop 与 Xiaomi MiMo 开放平台同步上线,会员既可调用 Pro 和 Flash,也可自行配置 API Key;Pro-UltraSpeed 被描述为保持模型质量前提下最高 20 倍输出速度的低延迟选项。API 价格延续 V2.5:Flash 每百万 Token 输入 1 元、输出 2 元,Pro 输入 3 元、输出 6 元,并提供缓存折扣;小米同时在 HuggingFace 开放权重、技术报告、训练框架和 7000 余个 RL 任务环境。应用场景上,小米列举了金属材料研究辅助工作,称其可用于文献检索、候选方案提出与计算模拟筛选,并把一类涉及永久性污染物吸附的设计流程从约一个月缩短至两三天;在数学形式化证明中,Pro 协助在 Lean 4 中完成 Li–Yorke 论文主定理证明,产出 6000 余行源码并通过内核核验。本轮更新距离小米于 2025 年 4 月发布首个开源大模型不到一年半。