回看 Sora 的技术方向,有个点一直在脑子里转:他们把大规模视频生成训练当成通往通用物理世界模拟器的路径。具体做法是在不同时长、分辨率、宽高比的视频和图像上联合训练文本条件扩散模型,用 transformer 在视频和图像 latent 的时空 patch 上操作,最大的模型能生成一分钟高保真视频。
把视频帧切成时空 patch 当 token 处理这个抽象我觉得很关键,跟语言模型处理文本 token 是一个味道,规模一上去涌现出对物理规律的粗略理解。
当然它学到的是统计意义上的物理,不是真解方程,所以才有各种穿模和违反常识的翻车。但方向上,拿生成模型逼近世界模拟器,比单纯追求画质有想象力多了。