因全球开发者申请量超6.6万且需求旺盛,官方决定延后下线时间以保障更多用户接入该在通用GPU上突破1000 tokens/s推理速度的模型服务
小米团队于6月23日发布公告,宣布推迟MiMo-V2.5-Pro-UltraSpeed模型的限时体验窗口结束时间。此次调整旨在应对自该功能上线以来产生的大量接入需求,让更多开发者和企业有机会测试其1000 tokens/s的推理能力。公告指出,极致的推理速度预计将推动行业使用场景的范式变革,因此团队决定延长聊天体验与API接入服务的期限。具体下线日期将依据资源占用状况另行确定,官方承诺提前通知以便用户完成迁移准备。
截至6月23日,小米已收到超过6.6万份使用申请,申请者构成包含世界500强企业、各行业的头部公司以及个人开发者,覆盖领域涉及法律、金融、通信、物流、汽车制造、文化传媒及高校科研等。在延期措施生效期间,未提交申请的用戶仍可继续申请内测资格,而此前已通过审核的用户则保留继续使用服务的权限。此次MiMo-V2.5-Pro-UltraSpeed是小米与TileRT合作推出的成果,作为全球首个在通用GPU上实现1000 tokens/s推理速度的万亿参数模型,其刷新了旗舰模型的推理速度纪录。
该模型版本于6月8日正式发布,同步上线的API服务采用限时体验定价策略,价格为标准版MiMo-V2.5-Pro的三倍,同时提供约10倍的速度提升。此次延期反映了市场对高性能大模型推理服务的迫切需求,也体现了厂商在资源受限环境下平衡服务质量与用户公平性的考量。行业观察认为,这一动作有助于加速高算力场景的落地验证,并可能影响后续同类产品的技术路线规划与市场策略调整。