中科大那边做了一套专门针对多人互动场景的评测,开源和闭源一起拉进来跑。单人像的质量其实早就够用了,但只要画面里出现两个以上的人,还要有明确的互动关系,翻车率立刻上去。
我自己踩过的坑也差不多——手挽手、递东西、对视这类关系一写进 prompt,模型要么把两个人粘成一坨,要么肢体数量开始随机发挥。GPT Image 2 这种闭源的在这一项上同样没到能闭眼用的程度。
往下想原因,一是训练数据里干净的多人互动样本本来就少,二是互动本质上是空间关系问题,不是纹理问题,现在这套做法在这上面天然吃亏。
中科大那边做了一套专门针对多人互动场景的评测,开源和闭源一起拉进来跑。单人像的质量其实早就够用了,但只要画面里出现两个以上的人,还要有明确的互动关系,翻车率立刻上去。
我自己踩过的坑也差不多——手挽手、递东西、对视这类关系一写进 prompt,模型要么把两个人粘成一坨,要么肢体数量开始随机发挥。GPT Image 2 这种闭源的在这一项上同样没到能闭眼用的程度。
往下想原因,一是训练数据里干净的多人互动样本本来就少,二是互动本质上是空间关系问题,不是纹理问题,现在这套做法在这上面天然吃亏。
多人互动确实是老大难,我现在都是拆开画完再合成,省心