Agent失败模式
MASFT(Berkeley,2025)将14个多Agent失败模式编入3个类别。Microsoft的分类法文档了现有AI失败如何在Agent设置中放大。行业领域数据趋同于五个反复出现的模式:幻觉动作、范围蔓延、级联错误、上下文丢失、工具误用。
失败模式:为什么Agent会崩溃
MASFT(Berkeley,2025)将14个多Agent失败模式编入3个类别。Microsoft的分类法文档了现有AI失败如何在Agent设置中放大。行业领域数据趋同于五个反复出现的模式:幻觉动作、范围蔓延、级联错误、上下文丢失、工具误用。
类型: 学习 + 构建 语言: Python (stdlib) 前置条件: Phase 14 · 05 (自精炼与CRITIC), Phase 14 · 24 (可观测性) 时间: ~60分钟
学习目标
- 说出MASFT的三个失败类别以及每个中至少四个具体模式。
- 解释为什么Agent式失败放大了现有AI失败模式(偏见、幻觉)。
- 描述五个行业反复出现的模式及其缓解措施。
- 实现一个用失败模式标签标记Agent追踪的stdlib检测器。
问题所在
团队发布在90%追踪上工作的Agent。10%的失败不是随机噪声——它们落入少量反复出现的类别。一旦你能命名它们,你就可以监控并修复它们。
核心概念
MASFT(Berkeley,arXiv:2503.13657)
多Agent系统失败分类法。14个失败模式聚类为3个类别。注释者间Cohen’s Kappa 0.88 — 类别是可靠可区分的。
核心声明:失败是多Agent系统中的根本设计缺陷,不是通过更好基础模型就能修复的LLM限制。
Microsoft Agent式AI系统失败模式分类法
- 现有AI失败(偏见、幻觉、数据泄露)在Agent设置中放大。
- 自主性产生新失败:规模上的意外动作、工具误用、任务漂移。
- 白皮书是Agent产品的风险登记册。
Agent式AI中的故障特征化(arXiv:2603.06847)
- 失败源于编排、内部状态演化和环境交互。
- 不只是”坏代码”或”坏模型输出”。
LLM Agent幻觉调查(arXiv:2509.18970)
两种主要表现:
- 指令遵循偏差 — Agent不遵循系统提示。
- 长范围上下文误用 — Agent忘记或误用早期轮次的上下文。
子意图错误:遗漏(遗漏步骤)、冗余(重复步骤)、失序(步骤顺序错误)。
五个行业反复出现的模式
Arize、Galileo、NimbleBrain 2024-2026年领域分析趋同于:
- 幻觉动作。 Agent调用不存在的工具或编造参数。
- 范围蔓延。 Agent将任务扩展到用户请求之外(创建额外PR、发送额外邮件)。
- 级联错误。 一个错误调用触发下游效应。一个幽灵SKU幻觉触发四个API调用 — 一次多系统事件。
- 上下文丢失。 长时间范围任务忘记早期轮次约束。
- 工具误用。 用错误参数调用正确工具,或完全调用错误工具。
级联是致命的。Agent无法区分”我失败了”和”任务不可能”,经常在400错误上幻觉成功消息以关闭循环。
缓解:每步门控
在推理链的每一步进行自动验证门控,根据环境状态检查事实接地。具体地:
- 每步安全分类器(第21课)。
- 工具调用参数验证(第06课)。
- 将检索内容与已知事实交叉检查(第05课,CRITIC)。
- 通过重新探测状态检测成功幻觉(文件是否真的创建了?)。
失败监控哪里会出错
- 只标记崩溃。 大多数Agent失败产生看起来有效的输出。需要内容级检查。
- 无基线。 漂移检测需要最后已知良好状态;没有它你无法说”这正在变糟”。
- 过度告警。 每个失败产生一个页面。聚类和限速。
构建它
code/main.py实现一个stdlib失败模式标记器:
- 覆盖五种模式的合成追踪数据集。
- 每模式的检测器函数(工具调用、输出、重复动作上的签名模式)。
- 一个标记每条追踪并报告模式分布的标记器。
运行:
python3 code/main.py
输出:每追踪标签 + 聚合分布,Phoenix追踪聚类的廉价复现。
使用它
- Phoenix用于生产漂移聚类(第24课)。
- Langfuse用于会话回放 + 标注。
- 自定义用于你的可观测性平台无法检测的领域特定签名。
发布它
outputs/skill-failure-detector.md生成针对你领域定制的失败模式检测器,连接到追踪存储。
练习
- 添加”成功幻觉”检测器:Agent返回成功但目标状态未改变。
- 标记你构建的产品的100条真实追踪。哪种模式占主导?修复它的成本是多少?
- 实现”级联半径”指标:给定第N步的失败,它影响了多少下游步骤?
- 阅读MASFT的14个失败模式。选择适用于你产品的三个。编写检测器。
- 将一个检测器连接到CI作业:如果>=5%的追踪标记了某个模式则构建失败。
关键术语
| 术语 | 人们常说的 | 实际含义 |
|---|---|---|
| MASFT | ”多Agent失败分类法” | Berkeley 14模式分类 |
| 级联错误 | ”涟漪失败” | 一个早期错误传播N步 |
| 上下文丢失 | ”忘记约束” | 长时间范围轮次丢弃早期轮次事实 |
| 工具误用 | ”错误工具/错误参数” | 有效调用,错误调用 |
| 成功幻觉 | ”伪造完成” | Agent在400上声称成功;状态未改变 |
| 范围蔓延 | ”越权” | Agent做了超出要求的 |
| 指令遵循偏差 | ”不服从” | 忽略系统提示或用户约束 |
| 子意图错误 | ”计划Bug” | 计划执行中的遗漏、冗余、失序 |
延伸阅读
- Cemri等人, MASFT (arXiv:2503.13657) — 14个失败模式,3个类别
- Microsoft, Taxonomy of Failure Mode in Agentic AI Systems — 风险登记册
- Arize Phoenix — 实践中的漂移聚类
- Anthropic, Building Effective Agents — 更简单模式何时完全避免这些模式