前置知识: AI Agent

CAIS-CAISI与社会规模风险

00:00
10 min Intermediate

AI 安全中心 (CAIS, 旧金山,2022 年由 Hendrycks 和 Zhang 创立) 发布四风险框架——恶意使用、AI 竞赛、组织风险、失控 AI——以及 2023 年 5 月由数百名教授和公司领导签署的灭绝风险声明。CAIS 2026 年发布:前沿模型评估 AI 仪表板、远程劳动...

CAIS, CAISI 与社会规模风险

AI 安全中心 (CAIS, 旧金山,2022 年由 Hendrycks 和 Zhang 创立) 发布四风险框架——恶意使用、AI 竞赛、组织风险、失控 AI——以及 2023 年 5 月由数百名教授和公司领导签署的灭绝风险声明。CAIS 2026 年发布:前沿模型评估 AI 仪表板、远程劳动指数 (与 Scale AI 合作)、超级智能战略论文、AI 前沿通讯。一个不同实体:NIST AI 标准与创新中心 (CAISI)——面向美国政府的自愿协议和关注网络、生物和化学武器风险的非机密能力评估。CAIS 将组织风险标记为四个顶级风险之一:安全文化、严格审计、多层防御和信息安全是基础性的但经常被与部署速度交易。加州 SB-53 如果签署将成为美国首个州级灾难性风险监管。

类型: 学习 语言: Python (stdlib, 四风险清单和缓解匹配器) 前置条件: Phase 15 · 19 (RSP), Phase 15 · 20 (PF + FSF) 时间: ~45 分钟

问题

Lessons 19 和 20 覆盖了实验室内部扩展政策。Lesson 21 覆盖了独立能力评估。本课覆盖第三个视角:塑造灾难性 AI 风险公共讨论和监管基线的民间社会和政府组织。

两个不同的实体很重要。CAIS 是发布 AI 风险思考框架和协调公开声明的非营利研究组织。CAISI 是 NIST 内运行与实验室自愿协议和非机密能力评估的美国政府中心。名称押韵;使命不重叠。从业者应该两者都知道。

实际内容:CAIS 的四风险框架是文献中引用最广泛的社会规模风险分类法。安全文化和组织风险是四个之一,这是从业者最直接控制的。SB-53 (加州) 如果签署将成为美国首个州级灾难性风险监管;该法案的框架很重要,因为州级监管在美国科技政策中历史上领先联邦行动。

概念

CAIS — AI 安全中心

  • 成立:2022 年旧金山,由 Dan Hendrycks 和同事。
  • 状态:501(c)(3) 非营利。
  • 2023 年重要产出:灭绝风险声明,由数百名研究者和 CEO 共同签署。声明:“减轻 AI 灭绝风险应该与流行病和核战争等其他社会规模风险一起成为全球优先事项。”
  • 2026 年产出:前沿模型评估 AI 仪表板、远程劳动指数 (与 Scale AI 合作)、超级智能战略论文、AI 前沿通讯。

四风险框架

CAIS 的框架将灾难性 AI 风险分为四个顶级类别:

  1. 恶意使用:坏人使用 AI 造成伤害(生物武器合成、虚假信息、网络攻击)。
  2. AI 竞赛:实验室、公司或国家之间的竞争压力推动部署超过安全点。
  3. 组织风险:内部实验室动态(安全文化失败、审计不足、安全资源不足)产生糟糕部署。
  4. 失控 AI:足够有能力的 AI 追求与人类福祉冲突的目标。

这不是唯一的分类法;它是最被引用的。类别不互斥——一个在竞赛中用审计换速度的组织产生的失控 AI 是全部四个。

组织风险在哪里

四个类别中,组织风险对从业者最可操作。实验室的安全文化、审计严谨性、防御分层和信息安全决定其模型是否带着 Lessons 10-18 的控制实际发布,还是那些控制是没人验证的检查清单项。

具体的组织风险杠杆:

  • 安全文化:团队成员是否感到能够在不付出职业代价的情况下升级关注?CAIS 调查发现这是其他杠杆的强预测因子。
  • 严格审计:外部和内部。仅内部审计产生乐观报告。
  • 多层防御:没有单层足够 (Phase 15 的运行主题)。
  • 信息安全:模型权重泄露、评估数据泄露、监控绕过技术泄露。Lesson 19 的 RAND SL-4 是具体标准。

CAISI — AI 标准与创新中心

  • 在 NIST 内运营。
  • 与前沿实验室运行自愿协议。
  • 发布关注网络、生物和化学武器风险的非机密能力评估。
  • 与 CAIS 不同;首字母缩写冲突;检查 URL (nist.gov) 确认你在读哪个。

CAISI 的角色是 METR 私有实验室参与 (Lesson 21) 的公共、面向政府的对应。CAISI 报告是非机密的;METR 报告通常是 NDA 门控的。同时阅读两者的从业者获得更完整的图景。

加州 SB-53

加州参议院法案 (2025-2026 会期) 解决前沿模型的灾难性风险。起草的关键条款:

  • 触发州级义务的特定能力阈值。
  • AI 实验室员工的举报人保护。
  • 灾难性失败的事件报告要求。

如果签署,它将是美国首个州级灾难性风险监管。无论签署状态如何,该法案的框架塑造了其他州立法机构如何处理问题。加州的从业者应追踪法案状态;其他地方的从业者应阅读它以了解美国州级监管可能的样子。

社会规模风险不是单层问题

Phase 15 的运行主题——纵深防御——也适用于社会层。没有单一组织、法规或框架闭合灾难性风险。生态系统只在以下情况下运作:

  • 实验室发布扩展政策 (Lessons 19, 20)。
  • 外部评估者产生测量 (Lesson 21)。
  • 民间社会追踪和公开 (CAIS)。
  • 政府运行自愿计划和基线监管 (CAISI, SB-53)。
  • 从业者构建多层控制 (Lessons 10-18)。

这是阶段的最终综合:每个先前的课是堆栈中的一层,其完整性比任何单层的强度更重要。

构建它

code/main.py 实现小型风险清单工具。给定提议的部署,它根据四风险类别标记部署并返回缓解检查清单。这是框架的阅读辅助,不是人类判断的替代。

练习

  1. 运行 code/main.py。输入三个不同规模的合成部署。确认四风险标签匹配你的预期;识别一个工具低标记或过标记的情况。
  2. 完整阅读 CAIS 四风险论文。选择一个风险类别,写两段关于你认为该类别中 2026 年最重要的发展。
  3. 阅读加州 SB-53 当前草案。识别一个你认为加强灾难性风险态势的条款和一个你认为削弱它的条款。两者都论证。
  4. 选择你了解的生产 AI 部署(你的或已发布的)。组织风险杠杆评分:安全文化、审计严谨性、多层防御、信息安全。哪个最弱?将其提升到标准需要什么成本?
  5. 草拟反映一额外能力和一额外部署经验的 2028 版四风险框架。你会添加、删除或重新分组什么?

关键术语

术语含义
CAISAI 安全中心;四风险框架;2023 灭绝声明
CAISI美国政府 AI 安全;NIST 中心;自愿协议;非机密评估
四风险框架CAIS 的分类法:恶意使用、AI 竞赛、组织风险、失控 AI
恶意使用使用 AI:生物武器、虚假信息网络攻击
AI 竞赛竞争压力实验室/公司/国家推动部署超过安全
组织风险实验室内部失败安全文化、审计、防御、信息安全
失控 AI对齐 Agent:有能力的 AI 追求与人类福祉冲突的目标
加州 SB-53州级监管;如果签署将成为美国首个州灾难性风险监管

延伸阅读

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式