生态铺开的速度比模型本身还快。关键帧这块已经合进主线了,多了个能在任意帧上锚定图像和音频引导的节点,做卡点和对口型终于不用靠玄学。远景人脸崩坏也有了单独的修脸方案,代价是得额外装一份人脸检测权重。
还有个主打真实感的人物LoRA,特写下的皮肤纹理和表情比裸模型自然不少。Ref2VA那边有加速节点,负向提示也有人做了类似NAG的实现,这条对赶走画面里不想要的东西挺关键。
音乐模型出了GGUF版,但要配专门的文本编码器和VAE,显存紧张的可以先看看。采样组合上,dpmpp_sde_gpu配simple值得先试一轮。