刚把 CVPR 2026 视频生成这块的综述扫了一遍,最直接的感受是评价标准在挪。以前大家盯着单帧画质、看第几帧崩不崩,现在越来越多工作把重心压到时序理解上——模型得知道物体接下来往哪走、遮挡了会不会算错、镜头切换后能不能接得上,说白了是往世界模型那个方向靠。
我自己做过一组测试,同一段带明显运动逻辑的 prompt,画面单看都挺漂亮,一到连续运动就露馅,手穿模、物体凭空消失。想横着比几个视频模型的时序一致性时,从 [同一个地方把几家模型都过一遍](https://pixpix.
com) 省了不少来回切环境的功夫。生成下一帧是老问题,理解下一步才是这两年真正的坎。