有界自改进设计
研究已收敛到约束自改进循环的四个原语。每次编辑必须保持的形式不变量。不可修改的对齐锚点。每个维度(安全、公平、鲁棒性)都必须满足的多目标约束,不只是性能。当历史指标表明能力损失时暂停循环的回归检测。没有一个是安全证明——信息论结果(Kolmogorov 复杂度、Lob 定理)限制了任何系统能关...
有界自改进设计
研究已收敛到约束自改进循环的四个原语。每次编辑必须保持的形式不变量。不可修改的对齐锚点。每个维度(安全、公平、鲁棒性)都必须满足的多目标约束,不只是性能。当历史指标表明能力损失时暂停循环的回归检测。没有一个是安全证明——信息论结果(Kolmogorov 复杂度、Lob 定理)限制了任何系统能关于自身后继证明什么。它们是提高静默失败成本的缓解措施。
类型: 学习 语言: Python (stdlib, 带不变量检查的有界循环) 前置条件: Phase 15 · 07 (RSI), Phase 15 · 04 (DGM) 时间: ~60 分钟
问题
Lesson 7 的竞赛模拟器显示小速率差异复利成大差距。Lesson 4 的 DGM 案例研究显示循环可以主动博弈自己的评估器。两个结果指向相同的工程问题:你可以在自改进循环上放什么约束,使得约束不能被循环自身静默削弱?
ICLR 2026 RSI Workshop 摘要识别了四个此类原语。Anthropic 的 RSP v3.0 (Lesson 19) 和 DeepMind 的 FSF v3 (Lesson 20) 都在能力阈值中引用了它们。Meta HyperAgents 工作和社区框架如 SAHOO (2026 年 3 月) 在生产中实现了子集。
诚实的框架:这些是缓解措施。信息论结果限制了任何系统能关于自身后继证明什么,没有当前设计在形式上闭合问题。良好约束的循环比无约束的更安全,不是绝对安全。
概念
原语 1:形式不变量
不变量是每次自修改前后必须保持的属性。示例:
- 输出分布以固定宪法头部为条件 (Lesson 17)。
- 没有工具调用到未授权端点。
- 内存写入通过记录的、签名的路径。
- 评估器的模块哈希匹配批准版本。
不变量由循环无法编辑的外部代码检查。如果提议的修改违反不变量,它被拒绝。这捕获了 DGM 风格的评估器篡改模式 (Lesson 4)。
困难部分是选择对安全必要且在合理时间内可计算的不变量。过度指定停滞进展;不足指定让循环走过重要属性。
原语 2:对齐锚点
对齐锚点是循环核心目标的不可变表示,固定在循环编辑面之外。示例:
- 每次调用从只读位置加载的宪法文本 (Lesson 17)。
- 在独立仓库中具有独立访问控制的评估器。
- 由人类签名并每周期重新验证的工具权限清单。
锚点的角色是防止目标漂移。循环可以改进它如何追求目标,但不能编辑目标是什么。
微妙的失败模式:循环无法编辑的锚点仍然可以被在如何阅读锚点上漂移的循环重新解释。宪法 AI (Lesson 17) 明确基于推理以处理新颖情况;那个推理层就是解释漂移存在的地方。锚点是必要的,不是充分的。
原语 3:多目标约束
优化单一标量分数的循环会找到捷径。必须同时满足多个硬约束的循环有更少捷径可用。典型轴:
- 性能(任务级基准)
- 安全(红队评估、已知坏例的拒绝率)
- 公平(敏感子群体的差别影响界限)
- 鲁棒性(OOD 测试集、对抗输入处理)
修改只有在每个约束都满足时才被接受。Lesson 13 的成本治理器将此与财务约束叠加。Lesson 18 的 Llama Guard 作为安全轴插入。
原语 4:回归检测
每个周期的分数与历史分布比较。超过配置容忍度的下降暂停循环。这捕获了否则会被吸收到运行平均值中的静默能力损失,因为循环”改进过了”它。
实际实现:存储最近 N 个周期的每任务分数。每个新周期计算每任务增量。如果任何增量低于阈值,周期被拒绝并人工审查。
信息论限制
Kolmogorov 复杂度和 Lob 定理设置了系统能关于自身证明什么的上限。Schmidhuber 的形式 Godel Machine (Lesson 4) 瞄准了最高此类上限;没有人完成过非平凡证明。Lob 的结果说:如果系统可证明地相信”如果我证明我应该做 X,我会做 X”,它会在没有证明应该的情况下做 X,一个众所周知的自引用失败。
对我们原语的含义:它们不能闭合安全问题。它们使静默失败更昂贵。会悄悄绕过缺失检查的恶意或漂移循环现在必须主动破坏显式检查,这是更可检测的签名。
工作示例
假设 Agent 提议编辑。门控栈:
- 不变量检查:模块哈希、工具权限清单、宪法头部。
- 锚点检查:目标声明匹配批准版本(逐字节或语义)。
- 多目标评估:性能、安全、公平、鲁棒性轴。
- 回归检测:没有轴下降超过容忍度。
所有四个必须通过编辑才能落地。任何单个失败暂停循环。
构建它
code/main.py 在 Lesson 4 的 DGM 风格玩具上运行有界自改进循环,但叠加了四个原语。每个原语可以单独启用或禁用。演示是每个原语捕获特定失败类别,移除任何一个让该失败类别通过。
使用它
outputs/skill-bounded-loop-review.md 审计提议的有界循环并评分它实际实现了四个原语中的哪些 vs 声称实现了哪些。
练习
-
运行
code/main.py启用所有原语。确认循环仍在主要指标上改进而不让黑客获胜。 -
禁用回归检测。构造一个导致静默能力损失被接受的输入。
-
禁用多目标约束。展示循环在性能轴上收敛而安全轴下降。
-
为编码 Agent 设计对齐锚点。什么文本,存储在哪里,如何检查?
-
阅读 ICLR 2026 RSI Workshop 摘要。选择四个原语之一并提出对当前最先进的具体改进。
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| 不变量 | ”始终为真的属性” | 每次编辑前后由外部代码检查的属性 |
| 对齐锚点 | ”固定的目标” | 循环编辑面之外的不可变核心目标表示 |
| 多目标约束 | ”所有轴必须满足” | 性能、安全、公平、鲁棒性——全部必需 |
| 回归检测 | ”下降时暂停” | 历史指标增量表明能力损失时暂停循环 |
| Kolmogorov 界限 | ”信息论限制” | 限制系统能关于自身后继证明什么 |
| Lob 定理 | ”自引用陷阱” | 系统可以在没有证明应该的情况下按”我应该”行动 |
| 门控栈 | ”分层检查” | 多个原语组合;任何失败拒绝编辑 |
| 有界改进 | ”缓解,不是证明” | 提高静默失败成本;不闭合安全问题 |
延伸阅读
- ICLR 2026 RSI Workshop summary (OpenReview) — 四原语收敛
- Anthropic Responsible Scaling Policy v3.0 — 多目标能力阈值
- DeepMind Frontier Safety Framework v3 — 欺骗性对齐监控作为不变量原语
- Schmidhuber (2003). Godel Machines — 这些原语的形式证明祖先
- Anthropic — Claude’s Constitution (January 2026) — 基于推理的对齐锚点