AI图像生成领域现在最流行的那套评测标准,可能本身就是一场精致的误导。这个话题我早就想吐槽了。
平时看各家模型发布,动不动就是我在某某榜上分数第一、某某胜率超过对手多少。可真自己拿来生图,榜单高的未必就顺手,出图审美、指令跟随、手指崩不崩,这些体感的东西榜单经常反映不出来。有些评测还是模型互评或者小样本人工打分,稍微设计一下就能刷上去。
大家平时是看榜选模型,还是干脆自己跑一批同prompt横评?我个人越来越不信榜,宁可自己攒一套测试图。你们怎么看这套评测体系的问题?
AI图像生成领域现在最流行的那套评测标准,可能本身就是一场精致的误导。这个话题我早就想吐槽了。
平时看各家模型发布,动不动就是我在某某榜上分数第一、某某胜率超过对手多少。可真自己拿来生图,榜单高的未必就顺手,出图审美、指令跟随、手指崩不崩,这些体感的东西榜单经常反映不出来。有些评测还是模型互评或者小样本人工打分,稍微设计一下就能刷上去。
大家平时是看榜选模型,还是干脆自己跑一批同prompt横评?我个人越来越不信榜,宁可自己攒一套测试图。你们怎么看这套评测体系的问题?
榜单这东西,发榜的和上榜的经常是一拨人
我只信自己那二十张固定prompt横评
审美没法量化,可它恰恰最影响出图能不能用
小样本人工打分水太深,换批标注员结论就翻
跟着榜单选模型迟早踩坑,还是自己拿二十张固定prompt横评靠谱,起码知道它在哪露馅