身边不少人问文生视频模型是啥,我按自己理解捋一下,说错了欢迎拍。核心思路和文生图一脉相承,都是扩散模型那套:从噪声一步步去噪还原,只不过多了时间这一维,要保证前后帧的物体、光影、运动是连贯的,不能这一帧手在左边下一帧手飞了。
难点基本都卡在时序一致性和算力上,帧数越多、时长越长,显存和推理时间就爆炸式涨。所以你会看到多数产品先锁死几秒的短片,再靠插帧和超分往上堆。
具体每家用的架构和训练数据我没把握,就不瞎说了。想直观理解的话,可以先把它当成会动的文生图,剩下的复杂度全花在让画面别抽风上。
身边不少人问文生视频模型是啥,我按自己理解捋一下,说错了欢迎拍。核心思路和文生图一脉相承,都是扩散模型那套:从噪声一步步去噪还原,只不过多了时间这一维,要保证前后帧的物体、光影、运动是连贯的,不能这一帧手在左边下一帧手飞了。
难点基本都卡在时序一致性和算力上,帧数越多、时长越长,显存和推理时间就爆炸式涨。所以你会看到多数产品先锁死几秒的短片,再靠插帧和超分往上堆。
具体每家用的架构和训练数据我没把握,就不瞎说了。想直观理解的话,可以先把它当成会动的文生图,剩下的复杂度全花在让画面别抽风上。
时序一致性这块解释得挺到位,我自己跑短片最头疼的就是人物脸每帧都在微变。
求教程
补一个理解:运动幅度大的镜头更容易崩,想稳就把提示词里的动作写克制点。
显存那句太真实了,我本地想跑长一点直接劝退,只能切云端。
本地跑视频真劝退,我24G的卡跑几秒就爆,最后老实切云端了
扩散加时间维这条捋得清楚,实际跑下来最难的还是让同一张脸活过十秒
动作写克制这条实测管用,我把跑改成慢慢走,崩的概率直接少一半