做安全这行,回头看 DALL·E 2 当年为了放开给大众用做的那批预训练阶段的防护措施,思路到现在还挺有参考价值。核心是在模型训练之前就动手,把违规内容的风险从源头削下去,而不是全靠事后过滤。
事后拦截总是被动,防不住的花样太多;从训练数据和预训练阶段就设护栏,等于把地基打牢。
现在这么多开源生图模型一放出来就裸奔,出了事再打补丁,反而显得当年这套前置治理的路子更值得抄。
做安全这行,回头看 DALL·E 2 当年为了放开给大众用做的那批预训练阶段的防护措施,思路到现在还挺有参考价值。核心是在模型训练之前就动手,把违规内容的风险从源头削下去,而不是全靠事后过滤。
事后拦截总是被动,防不住的花样太多;从训练数据和预训练阶段就设护栏,等于把地基打牢。
现在这么多开源生图模型一放出来就裸奔,出了事再打补丁,反而显得当年这套前置治理的路子更值得抄。
前置治理确实比事后过滤靠谱
开源模型基本裸奔,出事才想起来补
从数据源头动手是对的,就是成本高
+1
地基没打好,后面全是补丁摞补丁
这块业界一直不够重视,赞一个 ![]()