看到有AI生图应用能生成儿童不雅图片,说实话挺后背发凉的。这类问题的根子在训练数据被污染,模型挺有收获不该学的东西,光在输出端加关键词过滤是堵不住的,稍微换个说法就绕过去了。
真要治得从数据清洗、来源审计这些底层做起,上线前的红队测试也不能省。做技术的都懂,安全不是最后贴个补丁的事,得从管线设计阶段就嵌进去。
平台方在这块不能装看不见,出了事不是罚款的问题,是底线问题。
看到有AI生图应用能生成儿童不雅图片,说实话挺后背发凉的。这类问题的根子在训练数据被污染,模型挺有收获不该学的东西,光在输出端加关键词过滤是堵不住的,稍微换个说法就绕过去了。
真要治得从数据清洗、来源审计这些底层做起,上线前的红队测试也不能省。做技术的都懂,安全不是最后贴个补丁的事,得从管线设计阶段就嵌进去。
平台方在这块不能装看不见,出了事不是罚款的问题,是底线问题。
这种必须严查,没什么好讨论的
关键词过滤就是掩耳盗铃,绕过太容易
输出端过滤太好绕,源头清洗数据才是根本,就是没人愿花那成本