世界模型和视频模型别再混着说了,这俩不是一回事

刚看到朱军抛的一个观点挺想聊聊:世界模型不是视频模型的升级版,而是让 AI 去理解、推演、和世界交互的一套新范式。这两个东西经常被混一起讲,其实差别挺大。

视频模型本质还是在学像素分布怎么变,画得像、动得顺就行;世界模型强调的是背后那套因果和物理逻辑,模型得知道’为什么’会这样变,还能顺着往下推演。

按这个定义,评价标准也得跟着换,光盯着生成画面好不好看就没意义了。不知道大家怎么看这个分界线。

分清楚这俩确实重要,天天有人拿视频模型当世界模型吹

问题是现在大部分号称世界模型的 demo,看着还是个视频生成

蹲后续

推演和交互才是硬骨头,光生成早就不稀奇了 :thinking:

朱军说话一向比较克制,这个定义我觉得站得住

1 个赞