InfiniteTalk 上手记:让静态肖像开口说话,比 MultiTalk 稳多了

折腾了两个晚上,终于把 InfiniteTalk 的 Video2Video 工作流在 ComfyUI 里跑通了,来分享点实操心得。

这玩意儿是音频驱动的对口型模型,最大的卖点就是视频长度不限,一段音频喂进去,嘴型能跟得很准,头部和身体的动作也算自然。我之前用 MultiTalk,手部经常抽搐、脸会崩,InfiniteTalk 在这块明显收敛了不少,畸变少了很多。

核心要下的模型有六个,diffusion 那两个 fp16 的最占显存,Wan2_1-InfiniTetalk-Single 和 wan2.1_i2V_480p_14B 都得放到对应目录。还有个中文 wav2vec2 是自动下载的,不用手动管。

显存这块我得提醒一句,官方标的最低要 24G,我 4090 跑 480p 勉强够,一开 720p 直接 OOM。真要上高分辨率得 48G 往上。如果爆显存,把 low mem load 打开、换 fp8 版本能救一下。

提示词写得特别简单就行,反而是输入的音频质量要高,我第一次拿个压过的 mp3,出来嘴型糊得一塌糊涂。

480p 的画质能看吗,感觉脸部细节会丢

24G 只能算门槛,实际跑起来还是得堆显存啊

对口型这块比 wav2lip 那种老方案强太多了

求问竖屏视频要单独调 input dimension 是吧

手部不崩这点就够我换了,MultiTalk 的手真是噩梦

音频质量要求高这条太真实了,我也踩过

楼主能发段成品看看吗,光看参数没概念