涉黄内容被隐晦提示词绕过生成这类漏洞,说白了是内容安全一直没解决好的老问题。做安全的应该都清楚,纯靠关键词过滤就是筛子,用户换个隐喻、拆词、用外语或者分步引导,很容易就滑过去了。
真正难的是理解语义和意图,而不是匹配字符串。现在多款应用都栽在这上面,本质是审核模型和生成模型的能力没跟上,或者根本没上审核这道成本。
平台愿不愿意为这块投入,才是关键。指望厂商自觉,多半是出了事再补。这类漏洞短期内很难根治,能做到发现快、封堵快就算负责了。
涉黄内容被隐晦提示词绕过生成这类漏洞,说白了是内容安全一直没解决好的老问题。做安全的应该都清楚,纯靠关键词过滤就是筛子,用户换个隐喻、拆词、用外语或者分步引导,很容易就滑过去了。
真正难的是理解语义和意图,而不是匹配字符串。现在多款应用都栽在这上面,本质是审核模型和生成模型的能力没跟上,或者根本没上审核这道成本。
平台愿不愿意为这块投入,才是关键。指望厂商自觉,多半是出了事再补。这类漏洞短期内很难根治,能做到发现快、封堵快就算负责了。
关键词黑名单确实是最偷懒的做法
语义审核成本高,很多小厂根本不做
说到点子上了,意图识别才是硬骨头