拿视频生成模型当机器人的物理先验,这个思路提了有两年,Black Forest Labs 这回是把它做成了一个统一 backbone:图像、视频、音频、动作预测塞进同一套里,架构叫 Self-Flow。
关键在视频骨干那部分。大规模视频预训练之后,模型对物体怎么运动、接触时怎么形变、事件的先后因果这些已经有了粗糙的表征,机器人这边就不必从零去学物理。官方给的说法是同一个任务大约只要一半的微调数据,更早的实验里数据量最多能降一个数量级。
从工程角度看,这种统一 backbone 最实在的收益其实不是省数据,是省掉了维护四套模型和四条数据管线。代价也明摆着:任何一端动一下都会牵到全身,版本管理只会更难。