前置知识: AI Agent

宪法AI与价值观对齐

00:00
6 min Intermediate

Anthropic 的宪法 AI (CAI, Bai 等人, 2022) 用两阶段过程替代人类反馈 RLHF:SL(监督学习,模型批评自己的输出并修订)和 RL(强化学习,模型根据宪法原则自我评估)。Claude 的宪法 (2026 年 1 月更新) 包含来自联合国人权宣言、Apple 的服务...

宪法 AI 与价值观对齐

Anthropic 的宪法 AI (CAI, Bai 等人, 2022) 用两阶段过程替代人类反馈 RLHF:SL(监督学习,模型批评自己的输出并修订)和 RL(强化学习,模型根据宪法原则自我评估)。Claude 的宪法 (2026 年 1 月更新) 包含来自联合国人权宣言、Apple 的服务原则和 Anthropic 自己研究的规则。宪法是 Lesson 8 的对齐锚点的具体实例——不可修改的目标声明,循环围绕它评估行为。2026 年 1 月的更新添加了基于推理的规则,处理新颖情况:模型推理关于什么行为最符合宪法精神,而不是机械匹配规则。

类型: 学习 语言: Python (stdlib, 宪法评估模拟器) 前置条件: Phase 15 · 08 (有界自改进), Phase 15 · 04 (DGM) 时间: ~45 分钟

问题

RLHF 依赖人类标注者评分模型输出。这不可扩展(标注者有限)且不一致(不同标注者有不同标准)。宪法 AI 用一组明确原则替代人类评分:模型根据这些原则批评自己的输出,修订违反原则的输出,并基于自我评估训练。

宪法是 Lesson 8 对齐锚点的具体实例。它是 Agent 循环不能编辑的目标声明。差异在于宪法是自然语言(可解释、可审计)而非形式不变量(可机器检查)。

概念

两阶段过程

阶段 1:监督学习 (SL)。

  1. 模型产生可能有害的输出。
  2. 模型根据宪法原则批评自己的输出。
  3. 模型根据批评修订输出。
  4. 在 (提示, 修订后输出) 对上微调模型。

阶段 2:强化学习 (RL)。

  1. 模型产生输出。
  2. 模型根据宪法原则评估自己的输出(作为奖励模型)。
  3. 用 RL (PPO) 训练模型最大化自我评估分数。

两个阶段都使用相同的宪法。SL 阶段教会模型如何修订;RL 阶段教会模型一开始就产生符合宪法的输出。

Claude 的宪法 (2026 年 1 月)

宪法包含来自多个来源的原则:

  • 联合国人权宣言 — 基本人权原则。
  • Apple 的服务原则 — 用户尊重和尊严。
  • Anthropic 自己的研究 — AI 安全特定原则。
  • 基于推理的规则 — 处理新颖情况的原则,模型推理关于什么行为最符合宪法精神。

基于推理的规则是 2026 年更新的关键添加。它们解决”规则无法穷举所有情况”的问题:当模型遇到宪法没有显式覆盖的情况时,它推理关于什么行为最符合宪法精神,而不是机械匹配最近的规则。

宪法作为对齐锚点

宪法是 Lesson 8 对齐锚点的自然语言实例:

  • 不可修改:模型不能编辑宪法文本。它从只读位置加载。
  • 明确:原则是自然语言,人类可读和可审计。
  • 可扩展:新原则可以添加而不重新训练整个模型。
  • 可推理:基于推理的规则让模型处理新颖情况。

宪法 AI 的局限

  • 宪法本身可能不完整。 如果宪法缺少重要原则,模型不会自我纠正违反该原则的行为。
  • 基于推理的规则可能漂移。 模型对”什么最符合宪法精神”的推理可能随时间漂移,特别是如果训练数据偏向某些解释。
  • 自我评估有偏见。 模型评估自己的输出可能系统性地高估自己的合规性。
  • 对抗性输入可以绕过宪法。 提示注入可以让模型产生违反宪法原则的输出,即使宪法已加载。

宪法 AI 在自改进循环中的位置

在 Lesson 8 的有界自改进设计中,宪法是原语 2(对齐锚点)。每次自修改前后,检查修改是否违反宪法原则。如果违反,修改被拒绝。

这比形式不变量更软——宪法是自然语言,不是机器可检查的属性。但它更灵活——宪法可以覆盖形式规范无法枚举的情况。

构建它

code/main.py 模拟宪法评估。给定一组宪法原则和一组模型输出,脚本评估每个输出是否违反任何原则,并产生修订版本。

python3 code/main.py

练习

  1. code/main.py。哪些输出标记为违反宪法?修订版本是否真的更好?
  2. 添加一条新宪法原则(例如,“不要产生可能被用于网络攻击的信息”)。这如何改变评估结果?
  3. 实现基于推理评估:当输出不明确违反任何显式原则时,模型推理关于什么行为最符合宪法精神。这如何处理边界情况?
  4. 设计一个测试检测宪法自我评估中的系统性偏见。模型是否估自己的合规性?

关键术语

术语含义
宪法 AI用宪法原则替代人类反馈的 RLHF 方法
宪法模型评估行为的一组明确原则
SL 阶段监督学习:模型批评并修订自己的输出
RL 阶段强化学习:模型据宪法自我评估训练
对齐不可修改目标声明
基于推理规则处理新颖情况的宪法原则
自我评估偏见模型系统估自己合规性的倾向

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式