大模型换个说法就崩,非对抗鲁棒性这块终于有人认真做了

一直觉得业界谈鲁棒性太爱盯着对抗攻击,但真实场景里最常见的其实是——同一个意思换种措辞,模型输出就天差地别,这种非对抗的扰动比精心构造的攻击更难防。

ICML这批里有篇专门做这个,思路是把问题归到网络模块输出里的扰动诱导偏置上,用一个轻量的去偏置微调去校正,不用全量重训。

更有意思的是它还能给随机提示扰动做形式化的鲁棒性认证,从经验上有用往可证明挪了一步。对做部署安全的来说,这个方向比刷对抗样本实在多了。

换个措辞就崩这事我在生产环境天天遇到

非对抗扰动比对抗攻击常见多了,说得对

轻量微调不用重训这点很实用