翻出一篇老文,早期国产图生视频 I2VGen-XL 的实测记录

职业病,看到别人做的测试记录就想扒来看看方法严不严谨。这篇是达摩院那个 I2VGen-XL 的图生视频实测,虽然是老模型了,但作者的测试思路我觉得挺值得学。

模型分两阶段,第一阶段图转短视频,第二阶段把短视频升成高清,参数量三十多亿。作者是在云 GPU 上跑的,说要 50G 左右显存,他拿 48G 的 A6000 凑合上了。

有意思的是测试维度铺得挺开:先是人像肖像,然后加英文文字提示、加中文提示、加长中文提示,还专门试了 16:9 和 1:1 的输入图对比,最后换了小丑、蜥蜴人、城堡画、多角色网格这些不同素材。

结论比较实在:一致性不够,从源图到视频人物经常变样,小丑跑完基本认不出了;反倒是蜥蜴人这种原创角色因为没有参照,不一致反而能接受。多角色那个更逗,四个人被它扩成八个各自动。文字提示加了跟没加区别不大。

作者最后说技术有意思但离实用还有距离,这话放当时挺中肯,现在回头看进步是真快。

这种把维度铺开挨个测的思路确实规范

小丑跑完认不出,早期图生视频通病

四个人扩成八个笑死,模型自作主张

原创角色不一致反而能接受,这个观察挺妙

48G凑50G的需求,作者也是够拼

现在的图生视频比这强太多了,两年不到

中文提示词效果一般,说明训练数据也没那么偏中文