小米直播 MiMo-V2.6 强化学习训练并公开成本

9月17日 12:54
围绕强化学习可拓展边界,小米把Pro与Flash两套训练日志并列展示,包含步数、样本量、Token消耗和累计支出,并计划在数周内释出更多技术细节。

2026年9月17日,小米MiMo大模型团队把MiMo-V2.6系列的在线训练状态对外开放,并用实时看板展示这一代模型仍处于强化学习阶段的过程。相关信息由项目账号发布,页面并列列出Pro与Flash两条链路,同时记录训练步数、样本量、Token消耗、任务通过率、评测得分和累计费用,面板数据取自日志原始读数,新系列仍在推进中。本次公开的重点,是把RL规模化路径转化为可连续观察的中间态,而不是只给出结束后的结论。

从技术路线看,团队将本次扩展分成三类。第一类对应算力吞吐,当前节奏大约为每步约二十亿Token,并以1,568个Prompt配合16条Rollout异步运行。第二类对应智能体交互,尝试在同一次实验中混合多任务与多个外部框架,使模型在更接近真实开发流程的环境里获得经验。第三类对应评估本身,即让Grader Compute也获得额外算力,使用Agentic In-group Credit Assignment,通过测试用例与评分规则对轨迹分配奖励。看板的不同时刻显示,MiMo-V2.6-Pro曾在step 12附近出现,随后推进到第14步并进入第15步;MiMo-V2.6-Flash则长期处于step 17并向第18步推进。DeepSWE v1.1代码任务通过率在该界面中分别为65.78%和60.77%。

成本维度被放在同一面板上可见。不同时间点读到的累计值呈阶梯式增长,较早快照中Pro约806,349美元、Flash约354,499美元,较晚快照中两者分别约93万美元与41.6万美元;按小时折算的成本大致落在3.08万至3.09万美元,折合人民币约20.72万元。由于数据动态刷新,绝对金额不宜视为固定结论,但它反映出长时间运行Agent强化学习的基础设施开销。更长的产品线上,MiMo此前在V2-Flash材料中讨论过混合滑动窗口注意力、多Token预测与多教师在线策略蒸馏;这次则把重心推向后训练阶段的规模验证。外部AI从业者也对这种透明形式作出反应,认为公开训练过程有助于提升外界对研发节奏的判断。