FLUX 3 把视频骨干直接拿去喂机器人了

拿视频生成模型当机器人的物理先验,这个思路提了有两年,Black Forest Labs 这回是把它做成了一个统一 backbone:图像、视频、音频、动作预测塞进同一套里,架构叫 Self-Flow。

关键在视频骨干那部分。大规模视频预训练之后,模型对物体怎么运动、接触时怎么形变、事件的先后因果这些已经有了粗糙的表征,机器人这边就不必从零去学物理。官方给的说法是同一个任务大约只要一半的微调数据,更早的实验里数据量最多能降一个数量级。

从工程角度看,这种统一 backbone 最实在的收益其实不是省数据,是省掉了维护四套模型和四条数据管线。代价也明摆着:任何一端动一下都会牵到全身,版本管理只会更难。

架构收敛这一步迟早得走,各做各的太浪费算力了

省数据是结果,能共享表征才是原因,这条说得清楚

蹲后续

1 个赞

一半微调数据的对比基线是什么没交代,这类数字水分一般都不小

动一处崩全身这个我太有体会了,上个项目就是这么塌的

音频也塞进同一个 backbone,我比较好奇它是怎么对齐时间轴的

对比基线没交代我也注意到了,一半这个数字太漂亮了

机器人那头最缺的就是数据,能拿视频先验顶一段是真省钱

对齐我猜还是同一条时间轴切片,真要严格对上口型估计得再加一层