折腾了一下午 MultiTalk,把一张立绘变成会说话的角色

接了个单子要给客户的角色立绘配一段口播,试了 MultiTalk 这套东西,MeiGen 做的开源框架,思路就是丢一张图加一段音频,嘴型表情自己对上。

我在 ComfyUI 里跑的官方那个 image2video 工作流,红节点照着 Manager 里装缺失的就行。真正劝退的是显存,作者写要 48G 显存才稳,我这张卡勉强能动但分辨率不敢拉高,跑高清直接爆。音频驱动那块用的是 chinese-wav2vec2,中文口型对得比我预想的好。

有个小坑,prompt 里要带 lora 的触发词 detailz,忘了加画面就糊。步数别乱改,作者说这工作流已经卡在边缘了,我信了。素材图尽量清晰高质量,糊图进去出来更糊。整体下来单人立绘念诗、唱歌都能玩,多人对话也支持,就是对机器要求是真的高。

48G显存这门槛劝退一半人了

中文口型能对上就已经赢了,很多模型一到中文就垮

步数不能改这句话害我调了俩小时才信

detailz这种触发词最容易忘

多人对话真能同步?还是各说各的

接单党表示这活儿报价可以往上提了

本地跑不动,只能云上租卡了

接过类似口播单,MultiTalk表情比早期那批自然多了,本地是真跑不动

中文口型能对上就赢一半,好多模型一到中文嘴型全乱套