最近在研究先出高质量静帧、再把静帧喂给视频模型做动态延展这套流程,图负责画面质感、视频负责运动和转场,两边职责分开之后可控性明显好很多。我踩的一个坑是静帧的构图要给运镜留余地,主体贴边太满,后面推拉摇移就容易穿帮。
刷到外网那几套刷屏的玩法,本质都是同一个逻辑:先把关键帧的审美锁死,再让视频模型只管动起来,而不是指望一句话直接生成完美视频。
提示词分层写、图和视频各写各的,出片率比一把梭高太多。想跟着复现的话,建议先从单主体、简单运镜练手。
最近在研究先出高质量静帧、再把静帧喂给视频模型做动态延展这套流程,图负责画面质感、视频负责运动和转场,两边职责分开之后可控性明显好很多。我踩的一个坑是静帧的构图要给运镜留余地,主体贴边太满,后面推拉摇移就容易穿帮。
刷到外网那几套刷屏的玩法,本质都是同一个逻辑:先把关键帧的审美锁死,再让视频模型只管动起来,而不是指望一句话直接生成完美视频。
提示词分层写、图和视频各写各的,出片率比一把梭高太多。想跟着复现的话,建议先从单主体、简单运镜练手。
先出静帧再动这个思路我一直在用,确实稳
mark
先定静帧再动这套我也一直用,画面锁死,视频只管运动,返工少一半