现在图像模型排行榜那套打分,可能压根不能信

越来越怀疑现在满天飞的图像生成评测榜。所谓最流行的那套打分标准,看着精致、有分数有排名,实际上可能是一种误导——它衡量的东西和我们真正在意的出图质量未必是一回事。

问题出在几个地方。一是打分维度和真实使用脱节,榜上高分的模型放到具体活里未必顺手;二是不少评测用的 prompt 和场景高度趋同,模型只要在这些套路上过拟合就能刷分;三是主观投票很容易被出图的第一眼观感带跑,而观感好不等于可控、不等于能改。

我自己的做法是不看总榜,按活挑:做电商图看细节和文字,做概念图看构图和风格控制,各留一小组自己的私测 prompt 反复对比。榜单当个粗筛可以,真要选生产力工具还得自己跑一遍。

太对了,榜首那个我拿来做商品图,文字全糊,根本不能用。

过拟合评测集这事在文本模型早就是老问题了,图像这边只是晚来一步。

主观投票被第一眼观感带跑这点戳中了,好看和好用真是两码事。