中科大把多人互动的图像生成单拎出来测了一遍,开源闭源都在名单里

画一个人,现在的模型基本都能糊弄过去;画两个人有互动,问题就全冒出来了。中科大那边把这块单独拎出来做了评测,开源和闭源模型一起测,GPT Image 2 这种也在名单里,最后是打了分的。分数我就不搬了,反正结论是这一块整体都不算干净。

我自己跑图的体感也差不多。两个人握手、拥抱、一个人递东西给另一个人,这类需要身体接触的场景,最容易翻车:手指粘一块、胳膊数量对不上、谁的手接在谁身上都分不清。人一多,模型就开始靠糊弄过关,远处那几个直接给你画成模糊团。

提示词写得再细也压不住,因为这不是描述不清楚,是模型压根没把「两个人之间的空间关系」当成一个整体去建模。

确实