现在这些AI生图应用的内容审核到底靠不靠谱

说个我一直担心的事,很多AI应用的内容过滤其实就是在提示词层面做关键词匹配,稍微把话说得隐晦一点、换几个近义词,模型就照画不误。最近曝出好几款应用能被绕过去生成违规内容,本质上不是模型的问题,是审核那一层做得太糙。

做过后端的都知道,纯靠敏感词表拦请求早就不够看了,得在输出侧再上一道图像识别复检,两头卡才稳。

可惜为了省算力和延迟,很多产品直接把这步砍了。这种漏洞一旦被大规模利用,最后挨监管的还是平台自己。

输出侧复检确实是刚需,光拦输入拦不住的

关键词表这东西天生就是漏的,改俩字就过

怕就怕整改一刀切,正常需求也跟着被误伤

省算力省到审核上,出事就晚了 :man_facepalming:

1 个赞

一刀切这担心不多余,见过整改完连正常人像都拦的,误伤一大片