以前做一条短片,配音要另外找,角色动作得自己 K,剪完还得回头补音画对不上的地方。这几天把手上几个开源模型串了一遍,发现链路能接起来了。
IndexTTS-2.5 只有 0.8B,音色克隆、情绪、语速、读音都能单独控,配音这段基本不用再外求。角色驱动交给 Wan2.2-Animate,一张角色图复刻真人的动作和表情,也能把视频里的人整个替换掉,做口播很顺手。NAVA 是 6.3B 的原生音画模型,FP8 大概占 18GB,24GB 卡能出 720p,用它兜住音画同步。收尾用 LTX-2.5,原生支持多镜头,配了 9 套 ComfyUI 工作流,16GB 显存只是启动线,真要精修还得往上堆。
我现在的顺序是 TTS 出声 → Animate 驱动角色 → NAVA 做同步 → LTX 多镜头精修。加上前面 H3 把开源视频这块带起来,这边总算不只是产五秒素材了。权重和工作流去 huggingface.co 翻。