理解那端非得上大模型吗?我这条线用的是 Qwen3-VL 的 2B,意外的够用,显存压力小很多。
生成端接的是 Wan2.1,走参考图到视频:给一张人加目标物的参考,让它在视频里保持这个人和这件东西的一致性,而不是每帧各画各的。Wan2.1 的运动质量也挺能打。
目前卡在长一点的片段身份会飘,物体细节也会掉,估计还得在参考注入那块调。有在啃这条线的,一起聊聊怎么稳住一致性。
理解那端非得上大模型吗?我这条线用的是 Qwen3-VL 的 2B,意外的够用,显存压力小很多。
生成端接的是 Wan2.1,走参考图到视频:给一张人加目标物的参考,让它在视频里保持这个人和这件东西的一致性,而不是每帧各画各的。Wan2.1 的运动质量也挺能打。
目前卡在长一点的片段身份会飘,物体细节也会掉,估计还得在参考注入那块调。有在啃这条线的,一起聊聊怎么稳住一致性。
码住
一致性飘这个是通病,参考帧密度加大会不会好点
这条线我也想试,有demo能看吗
人物和物体一起锁,难点在物体,人脸反而好办些。