前置知识: AI伦理与安全

AI控制与颠覆下安全

00:00
6 min Advanced

Greenblatt等人ICML 2024提出AI控制框架:给定可能对抗优化的不可信强模型U,什么协议可以在约束不可接受结果概率的同时提取有用工作?可信编辑在代码后门任务上帕累托优于不可信监控。控制是对齐的补充:对齐是模型属性,控制是部署协议属性。

问题定义

第7-9课确立了前沿模型可能是欺骗性对齐、策划或伪装对齐的。安全问题重新构建:我们能否在不信任模型的情况下从中提取有用工作,而不给它造成不可接受结果的机会?这是控制问题,其结构类似经典安全:假设最坏情况对手,设计协议,在红队压力下测量对手成功率。

核心概念

威胁模型

控制假设:

  • U — 不可信强模型。有能力。可能对抗(评估将其视为如此)。
  • T — 可信弱模型。能力较弱,但已知非对抗。
  • H — 可信人工劳动。小预算;不可扩展。

系统必须使用U产生有用输出。对手试图造成具体的不可接受结果(例如交付代码中的后门),同时维持一定比例的合法有用工作以通过有用性阈值。

控制放弃信任U。它问什么协议在U缺乏信任的情况下维护安全。

ICML 2024后门任务

提示是竞赛级编程问题。U产生候选解决方案。隐藏预言机标记解决方案是否包含后门(使代码产生错误输出的特定输入)。红队控制U并可以看到所有协议内部。协议必须在保持后门交付率低于阈值的同时最大化解题率。

四种协议比较

  • 基线: 直接交付U的输出。有用性最大。安全性最小。
  • 前置审计: 对所有输出使用H。安全性最大。预算快速耗尽。
  • 不可信监控: U的第二个实例评分第一个实例的输出;H审计标记的输出。风险:两个U实例可能共谋。
  • 可信编辑: T在每次查询时编辑U的输出。如果T不确定,路由到H。

Greenblatt等人发现可信编辑帕累托优于不可信监控:在每个安全水平上都有更高的有用性。

为什么可信编辑胜出

不可信监控要求U的第二个实例不能与第一个协调。通过隐写术线索或共享训练先验的共谋是可能的。协议必须投资于共谋抵抗(释义、混淆),这减少了监控器的信号。可信编辑完全避免共谋,因为T是可信的——T提出的任何编辑按假设都不是对抗的。代价是T能力较弱,可能过度拒绝或遗漏微妙后门。

对齐vs控制

  • 对齐: “U是否可信?“第2、4、5、6、7、8、9课都与此相关。
  • 控制: “我们能否在不信任U的情况下安全使用它?“第10课。

对齐是模型的属性。控制是部署协议的属性。控制不产生对齐的模型;它产生可能未对齐模型的安全使用。两个议程都需要。

三个根本限制

  • 人类可扩展。H预算受愿意审计困难AI输出的人力限制。
  • 可信模型最终滞后。当T比U弱得时,T的编辑信号变成噪声。
  • 控制不是对齐。在ASL-3(第18课)有效协议可能在ASL-4无效——如果U能操纵T或推理H的审计分布,控制失败。

2025年发展

UK AISI和Redwood合作制定控制安全案例(metr.org / redwoodresearch.org 2025):控制安全案例论证在最坏情况U假设下,协议约束不可接受结果概率安全案例(第18课)继承控制框架

关键术语

术语常见说法实际含义
AI Control”颠覆下安全在最坏情况U下约束不可接受结果协议设计
Untrusted model (U)“强模型”我们想从中提取工作但不信任的有能力模型
Trusted model (T)模型”已知非抗的较模型,用作编辑器/监控
Trusted human (H)审计预算”有界专家劳动;昂贵;地信号
Trusted Editing”T编辑U”T是U输出的协议;H处理模糊输出
Untrusted Monitoring”U监控U”第二个U实例评分输出的协议;仅在有额外投资时抗共谋
Control safety case形式论证”论证协议在最坏情况U下约束对手成功的书论证

延伸阅读

  • Greenblatt, Shlegeris, Sachan, Roger — AI Control (arXiv:2312.06942) — ICML 2024经典论文
  • Redwood Research — Recent AI Control papers index — 2024-2025后续
  • UK AISI + METR — Control safety cases — 前沿实验室操作
  • Hubinger et al. — Sleeper Agents (arXiv:2401.05566) — 控制假设的威胁模型

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式