Elo这种排法本来是下棋算胜率的,搬到图像模型上,做的是两两盲测让人选更喜欢哪张。参考价值有,但别当圣旨。
它测的是大众平均审美偏好,而你的活儿可能是电商白底图、是二次元、是特定甲方风格,榜单高的模型在你这条赛道未必占优。而且投票样本、题目类型一变,排名就抖。我一般拿它做初筛,真正定用哪个还得自己拿业务图去跑一轮。
Elo这种排法本来是下棋算胜率的,搬到图像模型上,做的是两两盲测让人选更喜欢哪张。参考价值有,但别当圣旨。
它测的是大众平均审美偏好,而你的活儿可能是电商白底图、是二次元、是特定甲方风格,榜单高的模型在你这条赛道未必占优。而且投票样本、题目类型一变,排名就抖。我一般拿它做初筛,真正定用哪个还得自己拿业务图去跑一轮。
Elo我只当初筛,真定用哪个还得拿自己电商白底图跑
盲测选好看那不就是选大众口味嘛,甲方的怪需求它测不出来
题目一换排名就抖,上次看两个榜同一个模型差好几名
参考价值是有的,起码帮你排除掉明显拉胯的
我更信自己那套体检图,榜单第一在我这系列一致性上崩过
投票的人多是玩家不是干活的,偏好本来就不一样
下棋算胜率搬过来其实挺勉强,图这东西哪有绝对输赢
路过