接了个单子要给客户的角色立绘配一段口播,试了 MultiTalk 这套东西,MeiGen 做的开源框架,思路就是丢一张图加一段音频,嘴型表情自己对上。
我在 ComfyUI 里跑的官方那个 image2video 工作流,红节点照着 Manager 里装缺失的就行。真正劝退的是显存,作者写要 48G 显存才稳,我这张卡勉强能动但分辨率不敢拉高,跑高清直接爆。音频驱动那块用的是 chinese-wav2vec2,中文口型对得比我预想的好。
有个小坑,prompt 里要带 lora 的触发词 detailz,忘了加画面就糊。步数别乱改,作者说这工作流已经卡在边缘了,我信了。素材图尽量清晰高质量,糊图进去出来更糊。整体下来单人立绘念诗、唱歌都能玩,多人对话也支持,就是对机器要求是真的高。