社交平台上流传用隐晦提示词绕开审核、诱导模型生成低俗违规图像,这类越狱式攻击从生成模型普及那天就存在。作为教相关课程的,我在课上常跟学生讲,提示词工程是把双刃剑,同样的技巧既能提升创作也能被用来钻空子。
平台的内容安全护栏和这些规避手段一直在拉锯。
指望纯技术手段一劳永逸不现实,更要紧的是使用者的边界意识和平台的持续治理。这话题值得严肃对待,而不是猎奇。
社交平台上流传用隐晦提示词绕开审核、诱导模型生成低俗违规图像,这类越狱式攻击从生成模型普及那天就存在。作为教相关课程的,我在课上常跟学生讲,提示词工程是把双刃剑,同样的技巧既能提升创作也能被用来钻空子。
平台的内容安全护栏和这些规避手段一直在拉锯。
指望纯技术手段一劳永逸不现实,更要紧的是使用者的边界意识和平台的持续治理。这话题值得严肃对待,而不是猎奇。
越狱和护栏就是长期拉锯,没有终点
老师说得对,别当猎奇看
边界意识这块教育确实缺位
平台审核永远慢半拍
严肃话题 +1