一直有个疙瘩:现在的视频模型学的是画面像不像,没人教它物体接下来会怎么动。所以杯子掉地上会穿模,手伸过去抓东西直接穿过去——看着对,物理上完全不成立。
最近在琢磨 Flex-π 这个路子。它训练时不只盯着 RGB,而是让一个模型同时预测未来的画面、3D 点图、DINO 那套语义特征,还有动作,几路信号一块儿当监督。等于把几何和语义硬塞进训练目标,逼它长出一点空间直觉,而不是背像素的统计规律。
工程上更香的是部署:同一个权重,既能当纯动作策略跑,也能当完整世界模型跑,或者夹在中间某一档,不用为不同场景各训一套。
跟我们平时玩的生成模型看着是两条线,我倒觉得会撞到一起。往后拼的不是分辨率,是模型脑子里有没有一个说得通的世界。