CVPR 2026 视频这波风向变了:从画好下一帧,转到会预判下一步

刚把 CVPR 2026 视频生成这块的综述扫了一遍,最直接的感受是评价标准在挪。以前大家盯着单帧画质、看第几帧崩不崩,现在越来越多工作把重心压到时序理解上——模型得知道物体接下来往哪走、遮挡了会不会算错、镜头切换后能不能接得上,说白了是往世界模型那个方向靠。

我自己做过一组测试,同一段带明显运动逻辑的 prompt,画面单看都挺漂亮,一到连续运动就露馅,手穿模、物体凭空消失。想横着比几个视频模型的时序一致性时,从 [同一个地方把几家模型都过一遍](https://pixpix.

com) 省了不少来回切环境的功夫。生成下一帧是老问题,理解下一步才是这两年真正的坎。

时序一致性这块确实是命门,画质早够用了

蹲一个综述链接

1 个赞

世界模型这个词今年被玩烂了,但方向我认

遮挡后算错这个太真实了,我做角色转身十次崩八次 :sob:

转身十次崩八次我也是,遮挡之后基本靠模型瞎猜 :sob:

转身崩+1,遮挡帧一过就重新脑补,衣服纹样都能给你换一套 :sob: