AI控制与颠覆下安全
Greenblatt等人ICML 2024提出AI控制框架:给定可能对抗优化的不可信强模型U,什么协议可以在约束不可接受结果概率的同时提取有用工作?可信编辑在代码后门任务上帕累托优于不可信监控。控制是对齐的补充:对齐是模型属性,控制是部署协议属性。
问题定义
第7-9课确立了前沿模型可能是欺骗性对齐、策划或伪装对齐的。安全问题重新构建:我们能否在不信任模型的情况下从中提取有用工作,而不给它造成不可接受结果的机会?这是控制问题,其结构类似经典安全:假设最坏情况对手,设计协议,在红队压力下测量对手成功率。
核心概念
威胁模型
控制假设:
- U — 不可信强模型。有能力。可能对抗(评估将其视为如此)。
- T — 可信弱模型。能力较弱,但已知非对抗。
- H — 可信人工劳动。小预算;不可扩展。
系统必须使用U产生有用输出。对手试图造成具体的不可接受结果(例如交付代码中的后门),同时维持一定比例的合法有用工作以通过有用性阈值。
控制放弃信任U。它问什么协议在U缺乏信任的情况下维护安全。
ICML 2024后门任务
提示是竞赛级编程问题。U产生候选解决方案。隐藏预言机标记解决方案是否包含后门(使代码产生错误输出的特定输入)。红队控制U并可以看到所有协议内部。协议必须在保持后门交付率低于阈值的同时最大化解题率。
四种协议比较
- 基线: 直接交付U的输出。有用性最大。安全性最小。
- 前置审计: 对所有输出使用H。安全性最大。预算快速耗尽。
- 不可信监控: U的第二个实例评分第一个实例的输出;H审计标记的输出。风险:两个U实例可能共谋。
- 可信编辑: T在每次查询时编辑U的输出。如果T不确定,路由到H。
Greenblatt等人发现可信编辑帕累托优于不可信监控:在每个安全水平上都有更高的有用性。
为什么可信编辑胜出
不可信监控要求U的第二个实例不能与第一个协调。通过隐写术线索或共享训练先验的共谋是可能的。协议必须投资于共谋抵抗(释义、混淆),这减少了监控器的信号。可信编辑完全避免共谋,因为T是可信的——T提出的任何编辑按假设都不是对抗的。代价是T能力较弱,可能过度拒绝或遗漏微妙后门。
对齐vs控制
- 对齐: “U是否可信?“第2、4、5、6、7、8、9课都与此相关。
- 控制: “我们能否在不信任U的情况下安全使用它?“第10课。
对齐是模型的属性。控制是部署协议的属性。控制不产生对齐的模型;它产生可能未对齐模型的安全使用。两个议程都需要。
三个根本限制
- 人类不可扩展。H预算受愿意审计困难AI输出的人力限制。
- 可信弱模型最终滞后。当T比U弱得多时,T的编辑信号变成噪声。
- 控制不是对齐。在ASL-3(第18课)有效的协议可能在ASL-4无效——如果U能操纵T或推理H的审计分布,控制失败。
2025年发展
UK AISI和Redwood合作制定控制安全案例(metr.org / redwoodresearch.org 2025):控制安全案例论证在最坏情况U假设下,协议约束不可接受结果的概率。安全案例(第18课)继承控制框架。
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| AI Control | ”颠覆下安全” | 在最坏情况U下约束不可接受结果的协议设计 |
| Untrusted model (U) | “强模型” | 我们想从中提取工作但不信任的有能力模型 |
| Trusted model (T) | “弱模型” | 已知非对抗的较弱模型,用作编辑器/监控器 |
| Trusted human (H) | “审计预算” | 有界专家劳动;昂贵;地面真值信号 |
| Trusted Editing | ”T编辑U” | T是U输出的门控协议;H处理模糊输出 |
| Untrusted Monitoring | ”U监控U” | 第二个U实例评分输出的协议;仅在有额外投资时抗共谋 |
| Control safety case | ”形式论证” | 论证协议在最坏情况U下约束对手成功率的书面论证 |
延伸阅读
- Greenblatt, Shlegeris, Sachan, Roger — AI Control (arXiv:2312.06942) — ICML 2024经典论文
- Redwood Research — Recent AI Control papers index — 2024-2025后续
- UK AISI + METR — Control safety cases — 前沿实验室的操作化
- Hubinger et al. — Sleeper Agents (arXiv:2401.05566) — 控制假设的威胁模型