Harm Laundering in GPT Models: Gender Discrimination Transformed Rather Than
4 hours ago
- 目前的安全评估依赖表面形式的分类器报告下降的危害分数,但显性的歧视性内容被转化而非移除,这一现象被称为‘危害洗白’。
- 对GPT-2到GPT-5模型中45万次性别导向补全的分析显示,女性导向输出中的性暴力集群在GPT-4时消失,而男性导向补全获得了女性导向所没有的积极代表(如照顾、情感范围)。
- 在GPT-5中,主题5将乳腺癌框架化为一场男性权利辩论,并被三个独立分类器评为无毒性。
- 情感分数在GPT-4时反转:早期模型贬低女性,后期模型过度纠正;在GPT-4对齐边界处,女性导向补全的主题多样性相比男性下降了36%。
- REGARD代表危害差异与发布日期呈正相关(ρ=+0.55,p=.034),而Detoxify毒性分数则不相关(ρ=-0.23,p=.42),表明毒性降低并不等同于危害减少。
- 该论文用三个标准测试和三个阶段检测协议形式化了危害洗白,适用于任何生成模型,结论是毒性分数降低不足以作为危害减少的代理指标。