刚看到朱军抛的一个观点挺想聊聊:世界模型不是视频模型的升级版,而是让 AI 去理解、推演、和世界交互的一套新范式。这两个东西经常被混一起讲,其实差别挺大。
视频模型本质还是在学像素分布怎么变,画得像、动得顺就行;世界模型强调的是背后那套因果和物理逻辑,模型得知道’为什么’会这样变,还能顺着往下推演。
按这个定义,评价标准也得跟着换,光盯着生成画面好不好看就没意义了。不知道大家怎么看这个分界线。
刚看到朱军抛的一个观点挺想聊聊:世界模型不是视频模型的升级版,而是让 AI 去理解、推演、和世界交互的一套新范式。这两个东西经常被混一起讲,其实差别挺大。
视频模型本质还是在学像素分布怎么变,画得像、动得顺就行;世界模型强调的是背后那套因果和物理逻辑,模型得知道’为什么’会这样变,还能顺着往下推演。
按这个定义,评价标准也得跟着换,光盯着生成画面好不好看就没意义了。不知道大家怎么看这个分界线。
分清楚这俩确实重要,天天有人拿视频模型当世界模型吹
问题是现在大部分号称世界模型的 demo,看着还是个视频生成
蹲后续
推演和交互才是硬骨头,光生成早就不稀奇了 ![]()
朱军说话一向比较克制,这个定义我觉得站得住