别再说模型能"看懂"画了,它其实是在读一串数字

自从写代码转来画画,我一直对一个说法过敏:模型"看懂"了你的图。它没有视网膜,也没有视觉皮层,进到网络里的就是一格一格的像素数值,被切成小块、变成向量,再像处理文字那样排成一个序列往下算。

所谓识别,本质是分类:给输入贴个标签,而不是理解标签背后的东西。CLIP更明显,它不知道什么是猫,它只是学会了"猫的图"和"猫这个词"在同一个空间里离得近,是相关性不是语义。

想通这点之后我用图生图心态平和多了——它不是在跟你共情画面,是在做一场极其陌生的数值翻译,像给盲文版的油画。你觉得它工作得好,是因为这套错觉刚好够用。

1 个赞

分类和理解这个区分点很关键,很多争论其实都卡在这

所以prompt写不准的时候,本质是你没落到它那个相关性分布里

mark

braille版油画这个比喻我记下了,形容得挺准

这个角度挺对,说白了就是你没描述到它训练时见过的那类分布里去