前置知识: AI Agent

Agent失败模式

00:00
9 min Intermediate

MASFT(Berkeley,2025)将14个多Agent失败模式编入3个类别。Microsoft的分类法文档了现有AI失败如何在Agent设置中放大。行业领域数据趋同于五个反复出现的模式:幻觉动作、范围蔓延、级联错误、上下文丢失、工具误用。

失败模式:为什么Agent会崩溃

MASFT(Berkeley,2025)将14个多Agent失败模式编入3个类别。Microsoft的分类法文档了现有AI失败如何在Agent设置中放大。行业领域数据趋同于五个反复出现的模式:幻觉动作、范围蔓延、级联错误、上下文丢失、工具误用。

类型: 学习 + 构建 语言: Python (stdlib) 前置条件: Phase 14 · 05 (自精炼与CRITIC), Phase 14 · 24 (可观测性) 时间: ~60分钟

学习目标

  • 说出MASFT的三个失败类别以及每个中至少四个具体模式。
  • 解释为什么Agent式失败放大了现有AI失败模式(偏见、幻觉)。
  • 描述五个行业反复出现的模式及其缓解措施。
  • 实现一个用失败模式标签标记Agent追踪的stdlib检测器。

问题所在

团队发布在90%追踪上工作的Agent。10%的失败不是随机噪声——它们落入少量反复出现的类别。一旦你能命名它们,你就可以监控并修复它们。

核心概念

MASFT(Berkeley,arXiv:2503.13657)

多Agent系统失败分类法。14个失败模式聚类为3个类别。注释者间Cohen’s Kappa 0.88 — 类别是可靠可区分的。

核心声明:失败是多Agent系统中的根本设计缺陷,不是通过更好基础模型就能修复的LLM限制。

Microsoft Agent式AI系统失败模式分类法

  • 现有AI失败(偏见、幻觉、数据泄露)在Agent设置中放大。
  • 自主性产生新失败:规模上的意外动作、工具误用、任务漂移。
  • 白皮书是Agent产品的风险登记册。

Agent式AI中的故障特征化(arXiv:2603.06847)

  • 失败源于编排、内部状态演化和环境交互。
  • 不只是”坏代码”或”坏模型输出”。

LLM Agent幻觉调查(arXiv:2509.18970)

两种主要表现:

  1. 指令遵循偏差 — Agent不遵循系统提示。
  2. 长范围上下文误用 — Agent忘记或误用早期轮次的上下文。

子意图错误:遗漏(遗漏步骤)、冗余(重复步骤)、失序(步骤顺序错误)。

五个行业反复出现的模式

Arize、Galileo、NimbleBrain 2024-2026年领域分析趋同于:

  1. 幻觉动作。 Agent调用不存在的工具或编造参数。
  2. 范围蔓延。 Agent将任务扩展到用户请求之外(创建额外PR、发送额外邮件)。
  3. 级联错误。 一个错误调用触发下游效应。一个幽灵SKU幻觉触发四个API调用 — 一次多系统事件。
  4. 上下文丢失。 长时间范围任务忘记早期轮次约束。
  5. 工具误用。 用错误参数调用正确工具,或完全调用错误工具。

级联是致命的。Agent无法区分”我失败了”和”任务不可能”,经常在400错误上幻觉成功消息以关闭循环。

缓解:每步门控

在推理链的每一步进行自动验证门控,根据环境状态检查事实接地。具体地:

  • 每步安全分类器(第21课)。
  • 工具调用参数验证(第06课)。
  • 将检索内容与已知事实交叉检查(第05课,CRITIC)。
  • 通过重新探测状态检测成功幻觉(文件是否真的创建了?)。

失败监控哪里会出错

  • 只标记崩溃。 大多数Agent失败产生看起来有效的输出。需要内容级检查。
  • 无基线。 漂移检测需要最后已知良好状态;没有它你无法说”这正在变糟”。
  • 过度告警。 每个失败产生一个页面。聚类和限速。

构建它

code/main.py实现一个stdlib失败模式标记器:

  • 覆盖五种模式的合成追踪数据集。
  • 每模式的检测器函数(工具调用、输出、重复动作上的签名模式)。
  • 一个标记每条追踪并报告模式分布的标记器。

运行:

python3 code/main.py

输出:每追踪标签 + 聚合分布,Phoenix追踪聚类的廉价复现。

使用它

  • Phoenix用于生产漂移聚类(第24课)。
  • Langfuse用于会话回放 + 标注。
  • 自定义用于你的可观测性平台无法检测的领域特定签名。

发布它

outputs/skill-failure-detector.md生成针对你领域定制的失败模式检测器,连接到追踪存储。

练习

  1. 添加”成功幻觉”检测器:Agent返回成功但目标状态未改变。
  2. 标记你构建的产品的100条真实追踪。哪种模式占主导?修复它的成本是多少?
  3. 实现级联半径”指标:给定第N步的失败,它影响少下游步骤
  4. 阅读MASFT的14个失败模式。选择适用于你产品的三个。编写检测器。
  5. 将一个检测连接到CI作业:如果>=5%的追踪标记了某个模式则构建失败

关键术语

术语们常说的实际含义
MASFT”多Agent失败分类法”Berkeley 14模式分类
级联错误”涟漪失败一个早期错误传播N步
上下文丢失”忘记约束时间范围次丢弃早期轮次事实
工具误用错误工具/错误参数”有效调用,错误调用
成功幻觉”伪造完成Agent在400上声称成功;状态未改变
范围蔓延”越权”Agent做了超出要求
指令遵循偏差”不服从”忽略系统提示或用户约束
错误”计划Bug”计划中的遗漏、冗余、失序

延伸阅读

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式