李飞飞团队的 Atlas 出来了,视频、3D、机器人仿真做进了一个模型

李飞飞团队的新一代世界模型 Atlas 放出来了,从零训练,视频生成、3D 重建、机器人仿真三件事塞进同一个模型。把看下来的几点记一记。

先说这三样在工程上的距离。过去基本是三条互不相干的管线,数据格式不一样,评估标准也不一样:视频那边追求的是看着顺,帧与帧之间别抖别闪;3D 那边追求几何对,形状能不能站得住;机器人仿真追的是物理量能不能对上真机,差一点动作就废。三套指标,平时根本聊不到一块去。

硬塞进一个模型,赌的其实是一句话:这三件事底下是同一个问题——模型对空间和时间到底有没有连贯的理解。有这套理解,视频只是它投影出来的一个面,3D 和仿真是另外两个面。赌对了三条管线并成一条,赌错了就是三件事都做到六十分。

我自己更在意仿真那一头。视频好不好看,人眼一秒就能判断,也最容易做成给人看的东西;仿真出来的一段抓取动作能不能迁移到真机,那是骗不了人的硬指标,做过这块的都知道 sim2real 的落差有多离谱,仿真里跑得稳稳当当,上真机可能连姿势都摆不对。Atlas 要是在这条上真站得住,它的意义就不只是又一个视频生成器。

从零训练这个说法也挺关键,意味着不是拿现成的视频模型接个头微调,代价大概率压在数据和算力那头。

做机械臂那阵仿真里跑得飞起,上真机抓个杯子都能滑出去

世界模型这个词现在用得有点泛了,各家定义都不太一样,得看具体做了什么

蹲论文