这篇思路挺对我们生图圈胃口的,虽然实验是拿一堆 LoRA 做的,但玩明白 LoRA 的人一看就懂。常规防投毒都在想办法"检测"脏数据,这篇反过来问:能不能让模型压根就学不到某些恶意更新。
做法是把微调的可动方向约束在一批可信 LoRA 张成的子空间里——有用的适应照样能学,但一些恶意方向在几何上直接够不着。举的例子很实际:公司拿用户或外部来的大数据微调,里面掺一点点毒,就能埋个被特定词触发的后门;再比如本地端上不断适应用户的小助手,你不希望它啥都学,只希望它在"已知可信行为"的变体里调整。
作者在近两百个公开适配器上测,连专门为绕过设计的自适应攻击也扛住了,攻击成功率掉得很狠,正常能力基本没伤到。
对天天下 LoRA 的人来说,这个"来源可信才让它影响权重"的角度值得琢磨。