图生视频早期的两条路:先算轨迹,还是整段一起去噪

图生视频早期分岔成两条路,一条把「动」当成可以先算出来的东西,一条把「动」当成和画面一起长出来的东西。

第一条是两阶段。先盯着那张静止图,推每个像素接下来往哪儿走,先得到一套运动轨迹;然后再上一个带运动增强的时序注意力,顺着这套轨迹去合成后面的帧。等于先规划再作画——路线先定死,画笔只负责照着走。好处很直接:你想让镜头往哪推、让人物哪只手抬起来,改的是轨迹那一层,比在一团噪声里许愿要好使得多。代价是整条链子吊在轨迹估计上,第一步把运动方向猜歪了,后面画得再细也是往错的方向细。

第二条是时空扩散。不分阶段,直接在 Unet 里把时间当成一个维度,跟着空间一起做下采样和上采样,整段视频被当成一个时空体一块儿去噪。Lumiere 就是这挂的代表。它的好处是从头到尾没有「交接班」这回事,帧和帧之间的关系是网络一次性摆平的,不存在中间哪一步没对齐、误差往后传。坏处也在这——一次要吃下整段的时空,算力就明明白白摊在那儿,跑过的都懂。

现在的模型多半不站队,两种思想的影子都能扒出来。

两阶段思路上更清楚,可中间一断误差就传下去了,端到端糊归糊胜在稳