总有人拿AI生图跑偏来证明模型有多蠢,其实大多数所谓的偏见和局限,根子都在训练数据的分布上。你让它画医生默认西装白男,画护士默认女性,这不是算法故意歧视,是喂进去的图本身就这个比例。
同理它画不好复杂结构、画不对小语种文化的东西,也是因为那类样本又少又脏。指望靠调提示词硬掰,效果有限;真正能改善的还是数据侧的清洗和配比。
把锅全甩给算法既不公平也解决不了问题,搞清楚偏差从哪来,才知道该在哪一环下手。
总有人拿AI生图跑偏来证明模型有多蠢,其实大多数所谓的偏见和局限,根子都在训练数据的分布上。你让它画医生默认西装白男,画护士默认女性,这不是算法故意歧视,是喂进去的图本身就这个比例。
同理它画不好复杂结构、画不对小语种文化的东西,也是因为那类样本又少又脏。指望靠调提示词硬掰,效果有限;真正能改善的还是数据侧的清洗和配比。
把锅全甩给算法既不公平也解决不了问题,搞清楚偏差从哪来,才知道该在哪一环下手。
数据分布决定一切,这话对得不能再对
确实
提示词硬掰那段太真实了,写一长串负面词也就那样
围观
但数据清洗成本高到离谱,厂商大多睁只眼闭只眼罢了
配比这事说起来容易,少数样本本身就难搞到干净的
说到点了,一堆人张口就骂算法歧视,连数据是啥都没搞明白 ![]()
+1
其实还有标注环节的偏差,不全是原始数据的问题,这块也值得聊
标注这环节值得单独开一贴,同一张图不同标注员给的词能差出一个风格