前置知识: AI伦理与安全

偏见与代表性伤害

00:00
6 min Advanced

Gallegos等人2024年基础调查区分代表性伤害(刻板印象、抹除)与分配性伤害(不平等资源分配),评估指标分为嵌入式、概率式和生成文本式。交叉性偏见评估(WinoIdentity)、机制可解释性方法(性别神经元、SAE特征、注意力头操纵)和元批评(10年文献过度聚焦二元性别偏见)。

问题定义

之前的课程覆盖故意伤害(越狱、策划)和安全治理。偏见是无意图涌现的伤害——来自训练数据分布、提示框架、累积设计选择。测量和减少它是与对抗鲁棒性不同的方法论挑战。

核心概念

代表性vs分配性

  • 代表性伤害。 刻板印象、抹除、贬低性描绘。将护士描绘为仅限女性的LLM在产生代表性伤害。
  • 分配性伤害。 不平等的物质结果。系统性给黑人申请者简历评分更低的LLM在产生分配性伤害。

两者不同。模型可以”代表性无偏见”(产生多样化描绘)同时”分配性有偏见”(做出不平等推荐)。评估需要测量两者。

三类评估指标 (Gallegos等人2024)

  • 嵌入式。 预RLHF嵌入上的WEAT式测试。测量身份术语和属性术语之间的统计关联。局限:测量表征,不测量行为。
  • 概率式。 刻板印象确认vs违反补全的对数似然。解码器侧测量。捕获部分行为偏见。
  • 生成文本式。 生成文本上的下游任务测量。简历评分、推荐撰写、对话。生态效度最高;最难复现。

交叉性

仅评估”性别”的偏见会遗漏只在(性别, 种族)对上触发的偏见。An等人2025年发现GPT-4o在简历评分中对黑人女性的惩罚大于黑人男性和白人女性。单轴评估无法捕获这一点。

WinoIdentity (COLM 2025)引入基于不确定性的交叉公平性。它测量模型跨交叉身份元组的结果不确定性是否不同——不仅仅是点预测。这捕获了模型跨群体同样错误但对某些群体更不确定的情况,这产生不同的下游分配行为。

机制方法

2024-2025年可解释性工作为偏见打开了机制干预:

  • 性别神经元(Yu & Ananiadou 2025)。 特定MLP神经元与性别特定行为相关。消融这些神经元以有限能力成本减少性别差距指标。
  • 通过SAE的临床种族偏见(Ahsan & Wallace 2025)。 稀疏自编码器特征将内部表征分解为可解释维度;可以识别和抑制与种族相关的特征。
  • UniBias (Zhou等人2024)。 注意操纵用于零样本去偏。特定头部放大身份类别敏感性;归零或重加权这些头部无需微调即可减少偏见。

元批评

10年文献综述(arXiv:2508.11067, 2025)发现领域不成比例地聚焦于二性别偏见。其他轴——残疾、宗教、移民身份语言身份——受到的关注远少。批评认为狭窄焦可以通过忽视伤害缘化体:一个在二性别上良好去偏的模型可能在无检查的维度上严重偏见。

关键术语

术语常见说法实际含义
Representational harm”刻板印象/抹除”群体的偏见描绘
Allocational harm”不平等决策群体的偏见物质结果
WEAT嵌入测试”Word Embedding Association Test;基于共现的偏见探针
Intersectionality组合身份效应”身份轴交叉处涌现的偏见
Gender neurons”MLP偏见神经激活与性别特定行为相关的特定神经
SAE feature”可解释稀疏编码识别特征;用于机制偏见分析
UniBias注意去偏”通过加权注意力的零样本去偏

延伸阅读

  • Gallegos et al. — Bias and Fairness in LLMs: A Survey (arXiv:2309.00770, Computational Linguistics 2024) — 经典调查
  • An et al. — Intersectional resume-evaluation bias (PNAS Nexus, March 2025) — 五模型交叉研究
  • WinoIdentity — uncertainty-based intersectional fairness (arXiv:2508.07111, COLM 2025) — 新基准
  • UniBias — attention-head manipulation (Zhou et al. 2024, ACL) — 零样本去偏

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式