虽然平时泡这个圈子多是讨论怎么把图画好,但模型“遗忘”这块其实跟大家都相关——版权角色、特定人脸、有害内容,都是靠 unlearning 技术从模型里抹掉的。刚看到一个叫 AutoAnchor 的方法,专门解决 Stable Diffusion 概念擦除不稳定的老问题。
它的观察是:现在要么手动挑一个替代概念当锚点,主观性太强容易擦偏;要么干脆用空提示词,又因为潜空间没约束,擦得不牢。作者从流形假设出发,说缺一个贴近流形的锚点,就会在法向空间产生漂移,把效果搞坏。它的办法是自动合成锚点,再用一个 cross-attention 一致性损失当流形邻近度的廉价替身,省掉直接做几何优化的天价开销。
对咱们的意义在于,擦得干净又不误伤别的画风,才是模型平台敢开放的前提。哪天你发现某个底模死活画不出某个角色,背后多半就是这类东西在起作用。