该模型面向机器人真实场景,把视觉、语言、动作与三维空间数据纳入统一表征,并于2026年9月7日公布其在RoboColiseum的Robustness子榜取得0.692平均分的结果。
2026年9月7日,智象未来(HiDream.ai)推出面向机器人物理环境的具身世界模型 HiDream-O1-Embodied。该模型延续原生全模态路线,将视觉、语言、动作和三维空间信息置于同一表征体系中,用于支持真实场景中的动态预判、场景理解和任务执行。同日公布的评测信息显示,该模型首次参加 RoboColiseum,在 Robustness 子榜以 0.692 的平均分位列第一。
RoboColiseum 依托高保真仿真环境构建评测任务,覆盖指令跟随、空间理解、扰动适应和通用操作四个方向,共计 78 项测试内容。其中扰动适应环节重点观察模型在背景更换、光照变化、材质替换、机器人初始状态改变、相机位置移动、图像质量下降和指令表达变化等条件下的表现。公开材料称相关扰动因素超过 20 种,平台服务对象包括高校、科研机构、模型企业和研究者。
在模型层面,研发工作围绕语言理解、多视角视觉感知和容错机制展开。语言部分处理不同动词、句式及相近表达的等价指令,以降低对固定关键词和模板化说法的依赖。视觉部分融合多个摄像头输入,当某个视角存在遮挡、相机位移或偏差时,系统可利用其余视角继续判断场景状态。容错训练则主动加入相机抖动、画面污损和视野缺失等异常条件,使模型在信息不稳定或缺失时仍具备决策能力。
训练数据方面,团队采用真实基座加生成增强的组合方式,并提及与诺亦腾合作获取高精度真人动作捕捉素材作为基础样本,随后利用模型完成百倍规模的数据扩展。在此过程中,背景、光照强度和物体形态等参数可在保持物理约束的前提下被调整,使单段真实动作衍生出数千个训练变体。该模型与此前发布的 HiDream-O1-World 形成互补:后者侧重数字环境推演,并在 WBench 导航任务中获得 80.9 分;前者聚焦物理世界的操作执行。