看多了拿学术数据集做的对比,说实话对我们实际接单没太大参考价值。这家平台的做法我比较认——不用合成测试,直接拿平台上真实跑过的活来打分,这一季测了8个模型、一万两千多个推理任务,从质量、单图成本、p95延迟三个维度评。
测的都是企业头像、电商产品图、创意人像这些客户真正会下单的场景。质量分是自动评的,FID看跟高质量参考集的分布相似度,CLIP看输出跟提示词和参考图对不对得上,再加500对的人工盲测A/B。
综合分里FID占四成、CLIP三成、人工三成。对要选模型接活的人来说,这种贴着真实workload的数据比刷榜靠谱多了。