扫了下 ICML 这次的 Spotlight,挑几篇和生图圈直接相关的:一篇针对图像编辑模型的视觉越狱,用箭头标记这类视觉提示夹带违规指令,对 Nano Banana Pro 和 GPT-Image-1.
5 的成功率报到了 80.9% 和 70.1%,视觉提示这条新攻击面得当心;还有一篇对齐引导的分数匹配,不用奖励模型,直接在 score 层面改文图对齐,GenEval 计数准确率提了 35% 以上,SD1.
5/SDXL/SD3 都能接;另一篇讲弱扩散先验在逆问题里其实够用,观测信息足时表现很好。安全和对齐这两块今年明显更热了。