浏览器智能体注入成功率压到零,是模型变强还是外面套了两层壳

129 个浏览器智能体场景下提示词注入成功率为零,这个数字得连着前提一起看:零是在产品开了 Auto Mode 的状态下拿到的,那个模式外面叠了输入扫描和执行拦截两层。单看模型本身,通用注入测试里 15 次尝试后的成功率是 2.

0%,上一代是 5.5%,降了一半多,但不是零。两个数混在一起讲,很容易被读成模型已经免疫。按我这行的习惯,这就是纵深防御的标准形态,终端加固归终端加固,网关该拦的还是得拦,指望任何单层做到百分之百都是在赌。

何况 15 次只是测试口径,真有人盯上你的智能体,尝试次数是不封顶的。

2% 和 0% 是两码事,一个是模型本体,一个是加了扫描和拦截,混着说容易误导

这不就是纵深防御那一套,端点再硬网关也不能拆