说个我一直担心的事,很多AI应用的内容过滤其实就是在提示词层面做关键词匹配,稍微把话说得隐晦一点、换几个近义词,模型就照画不误。最近曝出好几款应用能被绕过去生成违规内容,本质上不是模型的问题,是审核那一层做得太糙。
做过后端的都知道,纯靠敏感词表拦请求早就不够看了,得在输出侧再上一道图像识别复检,两头卡才稳。
可惜为了省算力和延迟,很多产品直接把这步砍了。这种漏洞一旦被大规模利用,最后挨监管的还是平台自己。
说个我一直担心的事,很多AI应用的内容过滤其实就是在提示词层面做关键词匹配,稍微把话说得隐晦一点、换几个近义词,模型就照画不误。最近曝出好几款应用能被绕过去生成违规内容,本质上不是模型的问题,是审核那一层做得太糙。
做过后端的都知道,纯靠敏感词表拦请求早就不够看了,得在输出侧再上一道图像识别复检,两头卡才稳。
可惜为了省算力和延迟,很多产品直接把这步砍了。这种漏洞一旦被大规模利用,最后挨监管的还是平台自己。
顶
输出侧复检确实是刚需,光拦输入拦不住的
关键词表这东西天生就是漏的,改俩字就过
怕就怕整改一刀切,正常需求也跟着被误伤
省算力省到审核上,出事就晚了 ![]()
一刀切这担心不多余,见过整改完连正常人像都拦的,误伤一大片