此次推出的全模态模型从零训练,统一接收文本、图像、视频与三维数据,并可凭相机位姿参数生成最长一分钟的1440p内容,当前只向部分伙伴开放测试。
由李飞飞参与创办的空间智能公司 World Labs 推出名为 Atlas 的世界模型,并将其定义为全球首个多模态世界模型。产品在官方博客公布演示,采用从零开始的预训练路径,把文本、图像、视频与三维信息置入共享空间上下文进行处理,以便依据已观察内容继续生成新的画面和几何结果。
Atlas 将相机位置和拍摄轨迹作为可直接写入模型的输入,而非仅依赖自然语言描述镜头。模型在已知输入视图之间建立相对位置关系,并按用户指定的角度与运动路径生成新画面;视频输出时长上限为一分钟,分辨率达到 1440p。除相机控制生成外,Atlas 还包括空间重建、时空模拟与图像生成三类能力:空间重建可由较少输入照片生成新视角帧,并输出点云或三维高斯泼溅等显式三维结果;时空模拟用于解析视频中的空间与时间关系,从而重排画面、服务机器人真实到仿真流程;图像生成覆盖文字生成图像与 360 度全景。
在开放策略上,Atlas 当前未开源,仅向部分合作伙伴提供抢先体验,早期访问将在未来数周内推进。World Labs 将该模型纳入 Marble 及其他后续产品的技术底座。部分报道给出的比较结果显示,在指定运镜任务中,94%的评审认为其结果优于 Seedance 2.5,81%认为优于 Gemini Omni Flash;其他模型因架构限制,有时需要把相机轨迹转成文字提示再输入。就应用面而言,影视制作、游戏开发、虚拟现实、机器人仿真等领域可能需要更少的现场拍摄角度,并借助模型补全未拍摄区域。