设想一下:你在一个由一句话生成的 3D 场景里往前走,走到拐角转身,身后那一面模型从来没见过,它得在你转身的那一刻现编出来;等你再转回去,刚才看过的东西还得对得上,不能换了个样。
这就是交互式 3D 世界跟生成一段视频的根本区别。视频的镜头是模型自己定的,它只要把这几秒拍连贯;交互式的视角在玩家手上,你往哪看、什么时候回头,它都得接住。一句话或者一张图直接生出一个能走进去的世界,做游戏的盯这个方向盯了很久,原因也在这。
所以难点几乎全压在一致性上。很多演示第一眼很惊艳,走两步地面就开始飘。这种问题光看一段剪好的录屏是看不出来的,得自己上手,绕着同一个东西来回多走几圈才知道。
对我们来说还有一道硬门槛,就是能不能进生产管线:要么吐出可用的几何和贴图,要么至少给一个稳定的场景表示,后面的流程才接得住。只能在它自家播放器里逛一逛的东西,再好看,对我们的价值也有限。
这次开放到什么程度,先看看再说。