能同时预测画面和动作的模型,可能才是视频生成的下一步

一直有个疙瘩:现在的视频模型学的是画面像不像,没人教它物体接下来会怎么动。所以杯子掉地上会穿模,手伸过去抓东西直接穿过去——看着对,物理上完全不成立。

最近在琢磨 Flex-π 这个路子。它训练时不只盯着 RGB,而是让一个模型同时预测未来的画面、3D 点图、DINO 那套语义特征,还有动作,几路信号一块儿当监督。等于把几何和语义硬塞进训练目标,逼它长出一点空间直觉,而不是背像素的统计规律。

工程上更香的是部署:同一个权重,既能当纯动作策略跑,也能当完整世界模型跑,或者夹在中间某一档,不用为不同场景各训一套。

跟我们平时玩的生成模型看着是两条线,我倒觉得会撞到一起。往后拼的不是分辨率,是模型脑子里有没有一个说得通的世界。

1 个赞

现在的视频模型是真不懂物理,杯子掉地上那个例子太写实了

一个权重能按几种模式部署,工程上省下来的成本不小

几何和语义一起当监督,本质上是把 3D 先验塞进去,长期看方向应该没错

倒水那种镜头我试过,水杯边缘直接吃进桌面里

让它学动作而不是学像,方向我信,就是这类数据上哪弄是个问题