图像模型也开始排 Elo,这东西参考价值大吗?

Elo这种排法本来是下棋算胜率的,搬到图像模型上,做的是两两盲测让人选更喜欢哪张。参考价值有,但别当圣旨。

它测的是大众平均审美偏好,而你的活儿可能是电商白底图、是二次元、是特定甲方风格,榜单高的模型在你这条赛道未必占优。而且投票样本、题目类型一变,排名就抖。我一般拿它做初筛,真正定用哪个还得自己拿业务图去跑一轮。

Elo我只当初筛,真定用哪个还得拿自己电商白底图跑

盲测选好看那不就是选大众口味嘛,甲方的怪需求它测不出来

题目一换排名就抖,上次看两个榜同一个模型差好几名

参考价值是有的,起码帮你排除掉明显拉胯的

我更信自己那套体检图,榜单第一在我这系列一致性上崩过

投票的人多是玩家不是干活的,偏好本来就不一样

下棋算胜率搬过来其实挺勉强,图这东西哪有绝对输赢

路过