折腾了两个晚上,终于把 InfiniteTalk 的 Video2Video 工作流在 ComfyUI 里跑通了,来分享点实操心得。
这玩意儿是音频驱动的对口型模型,最大的卖点就是视频长度不限,一段音频喂进去,嘴型能跟得很准,头部和身体的动作也算自然。我之前用 MultiTalk,手部经常抽搐、脸会崩,InfiniteTalk 在这块明显收敛了不少,畸变少了很多。
核心要下的模型有六个,diffusion 那两个 fp16 的最占显存,Wan2_1-InfiniTetalk-Single 和 wan2.1_i2V_480p_14B 都得放到对应目录。还有个中文 wav2vec2 是自动下载的,不用手动管。
显存这块我得提醒一句,官方标的最低要 24G,我 4090 跑 480p 勉强够,一开 720p 直接 OOM。真要上高分辨率得 48G 往上。如果爆显存,把 low mem load 打开、换 fp8 版本能救一下。
提示词写得特别简单就行,反而是输入的音频质量要高,我第一次拿个压过的 mp3,出来嘴型糊得一塌糊涂。