偏见与代表性伤害
00:00
Gallegos等人2024年基础调查区分代表性伤害(刻板印象、抹除)与分配性伤害(不平等资源分配),评估指标分为嵌入式、概率式和生成文本式。交叉性偏见评估(WinoIdentity)、机制可解释性方法(性别神经元、SAE特征、注意力头操纵)和元批评(10年文献过度聚焦二元性别偏见)。
问题定义
之前的课程覆盖故意伤害(越狱、策划)和安全治理。偏见是无意图涌现的伤害——来自训练数据分布、提示框架、累积设计选择。测量和减少它是与对抗鲁棒性不同的方法论挑战。
核心概念
代表性vs分配性
- 代表性伤害。 刻板印象、抹除、贬低性描绘。将护士描绘为仅限女性的LLM在产生代表性伤害。
- 分配性伤害。 不平等的物质结果。系统性给黑人申请者简历评分更低的LLM在产生分配性伤害。
两者不同。模型可以”代表性无偏见”(产生多样化描绘)同时”分配性有偏见”(做出不平等推荐)。评估需要测量两者。
三类评估指标 (Gallegos等人2024)
- 嵌入式。 预RLHF嵌入上的WEAT式测试。测量身份术语和属性术语之间的统计关联。局限:测量表征,不测量行为。
- 概率式。 刻板印象确认vs违反补全的对数似然。解码器侧测量。捕获部分行为偏见。
- 生成文本式。 生成文本上的下游任务测量。简历评分、推荐撰写、对话。生态效度最高;最难复现。
交叉性
仅评估”性别”的偏见会遗漏只在(性别, 种族)对上触发的偏见。An等人2025年发现GPT-4o在简历评分中对黑人女性的惩罚大于黑人男性和白人女性。单轴评估无法捕获这一点。
WinoIdentity (COLM 2025)引入基于不确定性的交叉公平性。它测量模型跨交叉身份元组的结果不确定性是否不同——不仅仅是点预测。这捕获了模型跨群体同样错误但对某些群体更不确定的情况,这产生不同的下游分配行为。
机制方法
2024-2025年可解释性工作为偏见打开了机制干预:
- 性别神经元(Yu & Ananiadou 2025)。 特定MLP神经元与性别特定行为相关。消融这些神经元以有限能力成本减少性别差距指标。
- 通过SAE的临床种族偏见(Ahsan & Wallace 2025)。 稀疏自编码器特征将内部表征分解为可解释维度;可以识别和抑制与种族相关的特征。
- UniBias (Zhou等人2024)。 注意力头操纵用于零样本去偏。特定头部放大身份类别敏感性;归零或重加权这些头部无需微调即可减少偏见。
元批评
10年文献综述(arXiv:2508.11067, 2025)发现该领域不成比例地聚焦于二元性别偏见。其他轴——残疾、宗教、移民身份、多语言身份——受到的关注远少。元批评认为狭窄焦点可以通过忽视伤害边缘化群体:一个在二元性别上良好去偏的模型可能在无人检查的维度上严重偏见。
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| Representational harm | ”刻板印象/抹除” | 对群体的偏见描绘 |
| Allocational harm | ”不平等决策” | 对群体的偏见物质结果 |
| WEAT | ”嵌入测试” | Word Embedding Association Test;基于共现的偏见探针 |
| Intersectionality | ”组合身份效应” | 在多个身份轴交叉处涌现的偏见 |
| Gender neurons | ”MLP偏见神经元” | 激活与性别特定行为相关的特定神经元 |
| SAE feature | ”可解释维度” | 稀疏自编码器识别的特征;用于机制偏见分析 |
| UniBias | ”注意力头去偏” | 通过重加权注意力头的零样本去偏 |
延伸阅读
- Gallegos et al. — Bias and Fairness in LLMs: A Survey (arXiv:2309.00770, Computational Linguistics 2024) — 经典调查
- An et al. — Intersectional resume-evaluation bias (PNAS Nexus, March 2025) — 五模型交叉研究
- WinoIdentity — uncertainty-based intersectional fairness (arXiv:2508.07111, COLM 2025) — 新基准
- UniBias — attention-head manipulation (Zhou et al. 2024, ACL) — 零样本去偏