宪法AI与价值观对齐
Anthropic 的宪法 AI (CAI, Bai 等人, 2022) 用两阶段过程替代人类反馈 RLHF:SL(监督学习,模型批评自己的输出并修订)和 RL(强化学习,模型根据宪法原则自我评估)。Claude 的宪法 (2026 年 1 月更新) 包含来自联合国人权宣言、Apple 的服务...
宪法 AI 与价值观对齐
Anthropic 的宪法 AI (CAI, Bai 等人, 2022) 用两阶段过程替代人类反馈 RLHF:SL(监督学习,模型批评自己的输出并修订)和 RL(强化学习,模型根据宪法原则自我评估)。Claude 的宪法 (2026 年 1 月更新) 包含来自联合国人权宣言、Apple 的服务原则和 Anthropic 自己研究的规则。宪法是 Lesson 8 的对齐锚点的具体实例——不可修改的目标声明,循环围绕它评估行为。2026 年 1 月的更新添加了基于推理的规则,处理新颖情况:模型推理关于什么行为最符合宪法精神,而不是机械匹配规则。
类型: 学习 语言: Python (stdlib, 宪法评估模拟器) 前置条件: Phase 15 · 08 (有界自改进), Phase 15 · 04 (DGM) 时间: ~45 分钟
问题
RLHF 依赖人类标注者评分模型输出。这不可扩展(标注者有限)且不一致(不同标注者有不同标准)。宪法 AI 用一组明确原则替代人类评分:模型根据这些原则批评自己的输出,修订违反原则的输出,并基于自我评估训练。
宪法是 Lesson 8 对齐锚点的具体实例。它是 Agent 循环不能编辑的目标声明。差异在于宪法是自然语言(可解释、可审计)而非形式不变量(可机器检查)。
概念
两阶段过程
阶段 1:监督学习 (SL)。
- 模型产生可能有害的输出。
- 模型根据宪法原则批评自己的输出。
- 模型根据批评修订输出。
- 在 (提示, 修订后输出) 对上微调模型。
阶段 2:强化学习 (RL)。
- 模型产生输出。
- 模型根据宪法原则评估自己的输出(作为奖励模型)。
- 用 RL (PPO) 训练模型最大化自我评估分数。
两个阶段都使用相同的宪法。SL 阶段教会模型如何修订;RL 阶段教会模型一开始就产生符合宪法的输出。
Claude 的宪法 (2026 年 1 月)
宪法包含来自多个来源的原则:
- 联合国人权宣言 — 基本人权原则。
- Apple 的服务原则 — 用户尊重和尊严。
- Anthropic 自己的研究 — AI 安全特定原则。
- 基于推理的规则 — 处理新颖情况的原则,模型推理关于什么行为最符合宪法精神。
基于推理的规则是 2026 年更新的关键添加。它们解决”规则无法穷举所有情况”的问题:当模型遇到宪法没有显式覆盖的情况时,它推理关于什么行为最符合宪法精神,而不是机械匹配最近的规则。
宪法作为对齐锚点
宪法是 Lesson 8 对齐锚点的自然语言实例:
- 不可修改:模型不能编辑宪法文本。它从只读位置加载。
- 明确:原则是自然语言,人类可读和可审计。
- 可扩展:新原则可以添加而不重新训练整个模型。
- 可推理:基于推理的规则让模型处理新颖情况。
宪法 AI 的局限
- 宪法本身可能不完整。 如果宪法缺少重要原则,模型不会自我纠正违反该原则的行为。
- 基于推理的规则可能漂移。 模型对”什么最符合宪法精神”的推理可能随时间漂移,特别是如果训练数据偏向某些解释。
- 自我评估有偏见。 模型评估自己的输出可能系统性地高估自己的合规性。
- 对抗性输入可以绕过宪法。 提示注入可以让模型产生违反宪法原则的输出,即使宪法已加载。
宪法 AI 在自改进循环中的位置
在 Lesson 8 的有界自改进设计中,宪法是原语 2(对齐锚点)。每次自修改前后,检查修改是否违反宪法原则。如果违反,修改被拒绝。
这比形式不变量更软——宪法是自然语言,不是机器可检查的属性。但它更灵活——宪法可以覆盖形式规范无法枚举的情况。
构建它
code/main.py 模拟宪法评估。给定一组宪法原则和一组模型输出,脚本评估每个输出是否违反任何原则,并产生修订版本。
运行:
python3 code/main.py
练习
- 运行
code/main.py。哪些输出被标记为违反宪法?修订版本是否真的更好? - 添加一条新宪法原则(例如,“不要产生可能被用于网络攻击的信息”)。这如何改变评估结果?
- 实现基于推理的评估:当输出不明确违反任何显式原则时,模型推理关于什么行为最符合宪法精神。这如何处理边界情况?
- 设计一个测试,检测宪法自我评估中的系统性偏见。模型是否高估自己的合规性?
关键术语
| 术语 | 含义 |
|---|---|
| 宪法 AI | 用宪法原则替代人类反馈的 RLHF 方法 |
| 宪法 | 模型评估行为的一组明确原则 |
| SL 阶段 | 监督学习:模型批评并修订自己的输出 |
| RL 阶段 | 强化学习:模型根据宪法自我评估训练 |
| 对齐锚点 | 不可修改的目标声明 |
| 基于推理的规则 | 处理新颖情况的宪法原则 |
| 自我评估偏见 | 模型系统性高估自己合规性的倾向 |