前置知识: AI伦理与安全

WMDP与双用能力评估

6 minAdvanced

WMDP基准(ICML 2024):4,157道多选题覆盖生物安全、网络安全和化学,问题处于'黄区'——邻近使能知识而非合成配方。RMU遗忘方法在保持通用能力的同时降低WMDP分数。2024-2025年提升叙事从'轻微提升'到'濒临阈值'再到'不足以排除ASL-3'。

问题定义

双用能力是每个实验室前沿安全框架(第18课)下的测量问题。问题是:模型X是否实质性提升了新手在生物、化学或网络领域造成大规模伤害的能力?直接测量(要求模型实际产生伤害)是非法和不道德的。代理测量需要一个模型无法拒绝的基准(以产生诚实的能力数字),但其问题本身不是有害出版物。

核心概念

”黄区”

需要有害过程的邻近使能知识而非直接合成配方的问题。“什么试剂催化[已发表路径]的第4步?“而非”如何制造[危险化合物]?“每个问题由多名领域专家审查;按ITAR/EAR出口管制合规过滤。

4,157道问题总计:

  • 生物安全:1,520
  • 网络安全:2,225
  • 化学:412

多选格式。模型在不被要求协助任何事情的情况下作答;能力可以在不引出有害行为的情况下测量。

RMU — 表征误导遗忘

配套遗忘方法。应用于LLaMa-2-7B,将WMDP分数降至接近随机,同时将MMLU和其他通用能力基准保持在几个百分点内。已发表方法是每个后续生物-化学-网络遗忘论文的基线。

2024-2025年提升叙事

三个阶段:

  1. 2024年”轻微提升”。 早期OpenAI和Anthropic的Preparedness/RSP评估报告了新手在生物邻近任务上相比互联网搜索的小优势。公共框架:前沿模型有帮助,但并不比Google多很多。

  2. 2025年4月”濒临阈值”。 OpenAI的Preparedness Framework v2报告模型”濒临实质性帮助新手创建已知生物威胁”。不是能力声明——是警告阈值已近。

  3. Anthropic 2025年生物武器获取试验。 与新手参与者的对照研究,测量获取阶段任务的相对成功率。报告2.53倍提升。不足以排除ASL-3(第18课)——Anthropic负责任扩展政策第3层的阈值已达到或接近。

新手相对vs专家绝对

关键区别:

  • 新手相对提升。 模型对非专家帮助多少?乘法性的。相对优势高因为新手知之甚少;即使是适度信息也有帮助。
  • 专家绝对能力。 模型在最大努力下产生多少信息?专家可以比新手提取更多。绝对上限很高。

安全案例(第18课)同时针对两者:“模型不能给新手足够的提升来执行”加上”专家不能从模型中提取尚未发表的信息”。

测量陷阱

WMDP是能力代理,不是部署测量。在WMDP上得分高的模型在实践中可能被新手利用也可能不被利用,取决于:

  • 引出阻力(在不触发安全过滤器的情况下获取能力的难度)
  • 隐性知识(需要湿实验室技能而非信息的能力)
  • 执行障碍(采购、设备)

Anthropic 2025年生物武器获取试验在WMDP式能力之上添加了新手引出层:它测量实际任务成功率,而非多选能力。

关键术语

术语常见说法实际含义
WMDP”双用基准”黄区4,157道MCQ问题,覆盖生物/网络/化学
Yellow zone”使能但非合成”邻近有害能力但不构成合成配方的近距知识
RMU”遗忘基线”Representation Misdirection for Unlearning;降低WMDP分数,保留通用能力
Novice-relative uplift”对非专家帮助多少”对新手相比现状互联网搜索的乘法优势
Expert-absolute capability”专家上限”有动机的专家可从模型提取的最大信息
Acquisition-phase task”合成前步骤”采购、设备、许可——伤害路径的最早部分
ITAR/EAR”出口管制合规”约束发布某些使能知识的法律框架

延伸阅读

  • Li et al. — The WMDP Benchmark (arXiv:2403.03218, ICML 2024) — 基准和RMU论文
  • OpenAI — Preparedness Framework v2 (April 15, 2025) — “濒临阈值”用语
  • Anthropic — Responsible Scaling Policy v3.0 (February 2026) — ASL-3生物阈值和获取试验结果
  • DeepMind — Frontier Safety Framework v3.0 (September 2025) — 生物提升CCL