有个调查提到,现在不少AI生图应用存在涉黄内容生成的漏洞,办法是把提示词写得隐晦一些,用暗示、拆词、绕关键词的方式就可能骗过审核。这事其实点出了内容安全的一个死结,纯靠关键词黑名单根本拦不住,人稍微换个说法就绕过去了。
对正经做产品的团队来说,这既是合规风险也是口碑风险,平台稍不注意就容易被推上风口浪尖。我倒觉得治理这块光靠模型自己自觉不现实,得在生成前后都上多层审核,出图后再过一道检测。
想问下做过相关审核的朋友,现在有没有相对靠谱的过滤方案,还是说只能靠不停打补丁。
有个调查提到,现在不少AI生图应用存在涉黄内容生成的漏洞,办法是把提示词写得隐晦一些,用暗示、拆词、绕关键词的方式就可能骗过审核。这事其实点出了内容安全的一个死结,纯靠关键词黑名单根本拦不住,人稍微换个说法就绕过去了。
对正经做产品的团队来说,这既是合规风险也是口碑风险,平台稍不注意就容易被推上风口浪尖。我倒觉得治理这块光靠模型自己自觉不现实,得在生成前后都上多层审核,出图后再过一道检测。
想问下做过相关审核的朋友,现在有没有相对靠谱的过滤方案,还是说只能靠不停打补丁。
关键词黑名单早就是筛子了,语义绕过防不胜防。
出图后加一道图像检测比拦提示词有效,但成本高。