中科大做了个多人互动的图像生成测评,结果不太好看

刷到中科大那边放出来的一份评测,专门盯多人互动这一类图像生成——不是站一排拍合影,是两个人以上真的有动作关系的那种。他们把开源和闭源的一批模型放在一起打分,GPT Image 2 也在名单里。

指向挺明确:这块是普遍短板。单人图的质感已经卷到很高了,可一旦要求“A 的手搭在 B 肩上”这种关系,模型经常就糊弄过去,手和身体的归属开始错乱,多一只少一只都算常规操作。

我自己跑图也是这个体感,凡是两人以上就得靠 controlnet 或者干脆拆开画再合,纯文生图基本靠碰。具体每家拿了多少分我没细看,等完整榜单出来再说。做多人场景的朋友现在都怎么绕过去的?