该研究揭示多模态直接融合导致机器人任务成功率骤降,提出混合专家架构与VQ-VAE编码器实现异构感知独立处理,并在包含200种物品的数据集上完成验证。
由李飞飞等学者领衔的跨国科研团队在具身智能领域取得突破性进展,针对传统多模态融合策略在精细操作场景中失效的问题,提出了名为T-Rex的新框架。研究发现,当将触觉信号直接注入以视觉为主导的经典模型(如π0.5)时,由于视觉与触觉信号的时间尺度存在根本性差异,导致机器人任务执行成功率从17%急剧下降至6%。这一反直觉现象表明,简单堆叠不同模态数据无法实现智能涌现,反而因频率错配引发系统干扰。
为解决上述结构性矛盾,新框架采用了混合专家架构(Mixture-of-Transformers),将处理流程拆解为三个独立通道:潜在专家负责整合视觉与语言信息以预测场景趋势;动作专家以每秒5次的频率生成基础运动轨迹;触觉专家则在接触瞬间启动,利用毫秒级精度修正操作力度。这种异步协作机制确保各感知模态在各自适配的时间尺度下运行。技术核心在于时空触觉编码器,团队利用VQ-VAE技术将连续的力数据压缩为离散的“触觉词汇”,有效保留动态特征并过滤传感器噪声。
在数据构建方面,研究团队摒弃了传统的任务导向采集方式,创建了一个包含200余种日常物品和22种基础动作的同步数据集,通过排列组合生成了7700余条运动轨迹,使模型能够学习通用的触觉与动作映射关系。训练过程采用分层递进策略,首先利用2.2万小时(报道二具体为22,889小时)的人类操作视频进行预训练以建立手部交互认知,随后使用机器人触觉数据进行跨模态对齐。该方案在翻书页、转移生鸡蛋等12项精细操作测试中表现出优于基线模型的性能,为具身智能在复杂物理环境中的落地提供了新的技术路径。