上交大发问:AI图像生成器到底懂不懂因果逻辑?

看到上交大他们联合抛的这个问题,挺想聊两句。AI生图现在画面质量是真上去了,但它是不是真明白因果关系,还是纯粹在概率上把常见的搭配拼出来,这两回事。

比如你让它画一杯打翻的水,桌上该有的水渍、湿掉的纸、滚落的杯子,这一串前因后果它能不能自洽地全带上,还是只画个漂亮的杯子倒在那就完事。我平时用下来的感觉是,越是需要多步推理的场景越容易露馅,单帧好看不代表它理解发生了什么。

这个问题往深了想其实关系到模型能不能用在更严肃的地方。你们觉得现在的生图模型是真有因果概念,还是背下来的相关性?

相关性居多吧,反事实一测就崩,让它画不合常理的组合基本抓瞎

训练数据里没见过的因果链它就编,本质还是补全

镜子倒影和影子方向这种物理约束经常错,说明没真懂

求教程

倒影那个我专门测过,让它画镜子里反着的字基本没成过,纯拼常见搭配。