隐晦提示词诱导AI出违规内容这事,其实是老问题的新变种

社交平台上流传用隐晦提示词绕开审核、诱导模型生成低俗违规图像,这类越狱式攻击从生成模型普及那天就存在。作为教相关课程的,我在课上常跟学生讲,提示词工程是把双刃剑,同样的技巧既能提升创作也能被用来钻空子。

平台的内容安全护栏和这些规避手段一直在拉锯。

指望纯技术手段一劳永逸不现实,更要紧的是使用者的边界意识和平台的持续治理。这话题值得严肃对待,而不是猎奇。

越狱和护栏就是长期拉锯,没有终点

1 个赞

老师说得对,别当猎奇看

边界意识这块教育确实缺位

平台审核永远慢半拍

严肃话题 +1