该模型于7月15日发布,统一支持场景生成、轨迹迁移、交互视频及通用图像编辑四类任务,在WorldArena基准评测中位列全球第一。
小米公司于7月15日正式发布并开源名为Xiaomi-Robotics-U0的多模态自回归具身生成基础模型。该模型参数量达到380亿,是目前具身智能领域中首个能够统一处理四类核心任务的基础模型,旨在打通机器人图片与视频数据的生成及编辑全流程。通过引入FlashAR+推理加速方案,模型在保持几何一致性的前提下,将生成效率较原始自回归范式提升了近83倍,为规模化生成具身训练数据提供了可控且高效的工程化路径。
Xiaomi-Robotics-U0具备四大核心功能模块:首先是具身场景生成,支持依据文本描述为指定机器人本体构建多视角初始环境,覆盖桌面、仓库及开放世界等多种场景;其次是具身迁移能力,可将现有机器人轨迹适配至新环境,在调整光照、背景或物体材质时保留机械臂位姿与空间布局;第三是机器人交互视频生成,基于初始观测与指令输出连贯视频,支持零样本泛化;第四是通用文生图与图像编辑功能,将互联网视觉知识迁移至具身任务。模型采用五维解耦结构化控制范式,允许独立调整工作台、物体、杂物、光照及背景,避免画面元素修改导致的位姿错位或空间畸变。在兼容性方面,该模型适配方舟无限、智元多款及松灵PiPER等多种机器人本体,支持生成室内、户外甚至海底等复杂环境数据。
在性能验证环节,Xiaomi-Robotics-U0于WorldArena评测基准中获得总分第一名,参评对象包含全球126个模型。针对真机测试表现,模型能够处理未知环境下的任务需求。该技术的推出解决了传统方法中场景、轨迹及视频生成模型相互割裂的问题,有效降低了采集极端、危险及长尾场景数据的成本与难度,为具身智能模型通过数据增强提升效果提供了新的解决方案。