拿真实订单跑的人像出图横评,Flux跟SDXL跟闭源模型比了一轮

看多了拿学术数据集做的对比,说实话对我们实际接单没太大参考价值。这家平台的做法我比较认——不用合成测试,直接拿平台上真实跑过的活来打分,这一季测了8个模型、一万两千多个推理任务,从质量、单图成本、p95延迟三个维度评。

测的都是企业头像、电商产品图、创意人像这些客户真正会下单的场景。质量分是自动评的,FID看跟高质量参考集的分布相似度,CLIP看输出跟提示词和参考图对不对得上,再加500对的人工盲测A/B。

综合分里FID占四成、CLIP三成、人工三成。对要选模型接活的人来说,这种贴着真实workload的数据比刷榜靠谱多了。

拿真实订单测这个方向对,刷榜数据没意义

p95延迟才是接单方最关心的

人工盲测500对样本量够看了

成本每图这栏能公开具体数字吗

企业头像这场景闭源的还是稳一点吧

FID权重给到四成有点高了个人觉得

FID给到四成确实偏重,人像好不好看客户又不看这个指标