9月10日,宇树将面向通用人形机器人的新一代具身基座模型完全开放,依托多模态感知与交互式世界建模,真机统筹64项桌面及全身移动操作,并支持跨任务、跨末端执行器场景。
9月10日,宇树科技对外公布 UnifoLM-WLA-1.0 具身基座模型进入完全开源阶段。该模型面向通用人形机器人,承担连接多模态感知、空间理解与控制生成的基础层角色。其突出点是用统一模型同时处理桌面操作与全身移动操作,并在真机环节中完成64个任务的统筹。
从技术说明看,该模型建立在大规模通用多模态感知与理解数据之上,并结合以交互为中心的世界建模方式,以提升空间感知与理解能力。性能表述包括其在多项具身推理任务中优于国内外开源方案,也能与头部闭源方案接近,并被概括为在全球开源模型多项评测中达到最佳成绩。应用侧强调一模驱动、全身协同,即在同一模型内承接不同任务迁移与多种末端执行器适配,避免每个任务单独建立专用控制策略。
背景方面,宇树科技在此之前已经开放 UnifoLM-VLA-0 视觉-语言-动作大模型和 UnifoLM-WMA-0 世界模型-动作架构,构成覆盖 VLA 与 WMA 两类路径的开源组合。UnifoLM-VLA-0 在 LIBERO 仿真基准的综合分数为98.7分,空间理解、物体识别、目标规划和长序列操作分别记录为99.0、100、99.4与96.2。新发布的 WLA-1.0 被放入更完整的具身智能共享框架中,开放内容涉及模型架构、训练代码、预训练权重与基准测试集,可为开发者复用和集成提供基础。研制周期被标注为两年,涉及计算机视觉、自然语言处理与机器人控制等多个方向。