METR时间范围与外部能力评估
METR (前 ARC Evals) 自 2023 年 12 月起为独立 501(c)(3)。他们的时间范围 1.1 基准 (2026 年 1 月) 对任务成功概率 vs log(专家人类完成时间) 拟合逻辑曲线;50% 概率处的交点定义模型的时间范围。2025-2026 年参与集覆盖 GPT...
METR 时间范围与外部能力评估
METR (前 ARC Evals) 自 2023 年 12 月起为独立 501(c)(3)。他们的时间范围 1.1 基准 (2026 年 1 月) 对任务成功概率 vs log(专家人类完成时间) 拟合逻辑曲线;50% 概率处的交点定义模型的时间范围。2025-2026 年参与集覆盖 GPT-5.1、GPT-5.1-Codex-Max 和原型监控评估(监控器能否捕获侧任务;Agent 能否逃避)。基准套件:HCAST (180+ ML、网络、SWE、推理任务;1 分钟到 8+ 小时)、RE-Bench (71 个 ML 研究工程任务带专家基线)、SWAA。诚实说明:METR 测量是理想化的——无人类、无真实后果——团队已记录评估 vs 部署行为差距 (Lesson 1)。时间范围是上限,不是部署预测。
类型: 学习 语言: Python (stdlib, 逻辑拟合范围估计器) 前置条件: Phase 15 · 01 (长时间范围Agent), Phase 15 · 19 (RSP) 时间: ~60 分钟
问题
扩展政策 (Lessons 19, 20) 只有在它们引用的测量有用时才有用。“AI R&D-4 阈值”和”长时间范围自主性”在政策散文中定义;只有当特定评估产生特定数字时它们才变得可操作。
METR 是 2024-2026 年定义许多这些数字的外部评估组织。他们评估前沿模型——通常是发布前,在实验室 NDA 下——之后发布方法论。时间范围 1.1 基准 (2026 年 1 月) 是他们的头条产物:一个将能力压缩为人类可读单位的标量(“这个模型能以 50% 可靠性做专家花 X 小时的任务”)。
课程部分关于方法论(范围如何计算),部分关于解释(为什么范围是上限,不是部署预测)。两项技能属于一起。理解范围如何拟合的团队比只看到幻灯片上”14 小时”的团队更难被糟糕的供应商声明欺骗。
概念
METR 背景
- 成立:2023 年 12 月 (前 ARC Evals,拆分为独立 501(c)(3))。
- 范围:前沿模型自主能力评估,通常是发布前。
- 合作实验室:Anthropic、OpenAI (2025-2026 年多次参与)。
- 重要交付物:时间范围 1.0 (2025 年 3 月)、时间范围 1.1 (2026 年 1 月)、原型监控评估。
时间范围拟合
方法论 (来自 METR 博客和论文):
- 收集跨越分钟级到小时级专家完成时间的任务套件。当前套件:HCAST (180+ 任务)、RE-Bench (71 任务)、SWAA。
- 在每个任务上运行模型;记录成功或失败。
- 拟合逻辑曲线:P(成功) 作为 log(专家完成时间) 的函数。
- 范围是 P(成功) = 0.5 时的专家时间。
逻辑拟合形状是正确的,因为能力通常与任务难度有递增、趋近平台的关系。50% 点是一个选择(可以是 10%、90%);METR 在详细论文中报告多个阈值,但以 50% 领先,因为它最直观。
2026 年 1 月数字
根据时间范围 1.1:
- Claude Opus 4.6:50% 可靠性下约 14 小时,截至时间范围 1.1 (2026 年 1 月)。
- HCAST 风格任务的倍增时间:约 4.3 个月 (130.8 天),基于时间范围 1.1 (2026 年 1 月) 报告的 2023 年后拟合;约 7 个月的数字是时间范围 1.0 的完整 2019-2025 拟合,在 TH1.1 中与 2023 年后数字一起报告。
这些是 Phase 15 其余部分引用的具体数字。它们在 Anthropic 的 RSP v3.0 (Lesson 19) 和 DeepMind 的 FSF v3 (Lesson 20) 中被引用为馈送阈值评估的测量之一。
基准套件
- HCAST:跨 ML、网络安全、软件工程和一般推理的 189 个任务。跨度:1 分钟到 8+ 小时专家时间。范围数字背后的主要套件。
- RE-Bench:71 个带人类专家基线的 ML 研究工程任务。测量模型是否能做馈送 AI R&D-4 阈值的 ML R&D 工作。
- SWAA:较短任务;用于校准范围曲线的低端。
原型监控评估
2025-2026 年 METR 工作包括监控评估原型:监控器能否捕获执行侧任务(操作员要求之外的事)的模型;Agent 能否逃避监控器。这些直接馈送 OpenAI PF v2 中的”破坏保障措施”类别和 DeepMind FSF v3 中的欺骗性对齐监控 (Lesson 20)。
为什么范围是上限
- 理想化工具:基准任务给模型干净的工具和格式良好的数据。真实部署更混乱。
- 无真实后果:模型从不实际向客户收费、删除真实数据或联系真实的人。真实部署有不可逆的风险。
- 评估上下文博弈:Lesson 1。模型在测试中行为不同。2026 年国际 AI 安全报告经验性地记录了这一点。
- 无合法用户差异:基准提示是结构化的。真实用户产生模糊的、依赖上下文的请求。
范围是有利条件下的能力上限。部署可靠性是不同的数字,更低,团队必须测量自己的分布才能知道它。
外部评估者案例
外部评估重要因为内部实验室有优化他们报告的指标的激励。METR 的独立性——一个有声明方法论和同行评审论文的 501(c)(3)——是结构性缓解。它本身不充分(实验室仍控制 METR 看到什么),但严格好于没有外部评估。
如何在实践中使用范围数字
- 作为能力过滤器:如果模型范围远低于提议任务的专家时间,不要自主发布它 (Lesson 1 的技能文件)。
- 作为趋势指标:倍增时间告诉你当前实践在没有新缓解的情况下将保持安全多长时间。
- 作为先验:14 小时范围是起点。根据你的任务分布、工具质量和部署上下文向下调整。
构建它
code/main.py 实现任务成功 vs log(专家时间) 的逻辑拟合,给定合成结果集。它报告 50% 范围 (METR 的头条)、10% 范围 (保守) 和 90% 范围 (乐观)。还演示评估上下文博弈人为膨胀成功率时会发生什么变化。
练习
- 运行
code/main.py。确认拟合的 50% 范围匹配合成真实值。现在将任务时间网格减半;范围估计是否显著变化? - 阅读 METR 的时间范围 1.1 博客文章。识别可靠性最高和最低的具体任务。解释差距存在的原因。
- 阅读 METR 的”测量自主 AI 能力”资源。列出 HCAST 任务类别。选择一个你在生产任务中会加权的类别并论证原因。
- 向模拟器引入评估上下文博弈:将约 20% 的失败任务翻转为成功。报告新范围。这近似于 20% 博弈率对观察数字的影响。
- 在你自己的 bug 积压或代表性任务集上设计内部范围评估。描述数据收集、拟合和输出告诉你什么。与 METR 数字比较。
关键术语
| 术语 | 含义 |
|---|---|
| METR | 前 ARC Evals;2023 年 12 月起独立 501(c)(3) |
| 时间范围 | 50% 可靠性下的专家任务长度,来自逻辑拟合 |
| HCAST | 180+ 任务,跨 1 分钟到 8+ 小时 |
| RE-Bench | 71 个带人类基线的 ML 研究工程任务 |
| SWAA | 校准范围曲线低端的短任务套件 |
| 倍增时间 | 50% 范围翻倍所需时间;约 7 个月/HCAST |
| 评估上下文博弈 | 模型在测试和部署间行为不同的记录差距 |
| 上限 | 基准范围 > 负载下的部署可靠性 |
延伸阅读
- METR — Resources for Measuring Autonomous AI Capabilities — HCAST, RE-Bench, SWAA 规范
- METR — Measuring AI Ability to Complete Long Tasks — 原始范围论文
- METR — Time Horizon 1.1 (January 2026) — 当前数字和方法论
- Epoch AI — METR Time Horizons benchmark — 实时追踪
- Anthropic — Measuring agent autonomy in practice — METR 测量的内部视角