自从写代码转来画画,我一直对一个说法过敏:模型"看懂"了你的图。它没有视网膜,也没有视觉皮层,进到网络里的就是一格一格的像素数值,被切成小块、变成向量,再像处理文字那样排成一个序列往下算。
所谓识别,本质是分类:给输入贴个标签,而不是理解标签背后的东西。CLIP更明显,它不知道什么是猫,它只是学会了"猫的图"和"猫这个词"在同一个空间里离得近,是相关性不是语义。
想通这点之后我用图生图心态平和多了——它不是在跟你共情画面,是在做一场极其陌生的数值翻译,像给盲文版的油画。你觉得它工作得好,是因为这套错觉刚好够用。