H3 本地跑通,ref2va 的一致性问题一次过基本解决了

在 ComfyUI 上把 MiniMax H-3 跑起来了,这几天一直在压 ref2va,图片、视频、音频参考混着喂,一次生成下来的一致性和连贯性表现,比我预期好太多,之前那些角色跑着跑着就变脸的老问题基本没再出现。

硬件是单卡 RTX6000 PRO 96G,采样统一 20 步,几组数字放这儿供参考:2 秒 1344x768 大概三分钟出头,5 秒 1696x736 也差不多是这个量级,10 秒同分辨率九分钟,15 秒 1344x768 十二分四十五。

用三张参考图做 reference to video,15 秒 864x480 三分钟左右。

真正拖时间的是加视频参考,同样的 15 秒 864x480,参考里塞进一段 15 秒视频之后直接涨到八分十四,差不多五倍。等我把这批实验整理完会写篇细的。

慕了 :sob:

1 个赞

等个教程

96G 的数据对我这种 24G 卡没啥参考价值,还是蹲量化版本吧

加视频参考直接翻五倍,这代价换来的连贯性值不值还得看具体活

ref2va 里的音频参考到底是控口型还是控节奏,这块一直没搞明白

写教程的时候顺带讲讲多个参考之间怎么排优先级,冲突了听谁的

我的体感是音频主要管节奏,口型那块还得靠画面参考顶着

跟你结论一致,我塞了一段人声进去,口型基本没动,节奏倒是跟上了