前置知识: AI Agent

Agent工作台为何模型失败 — 七种失败模式

00:00
8 min Intermediate

识别Agent在真实代码库中失败的七种模式,理解线束工程比模型选择更重要的实证数据

Agent工作台为何模型失败 — 七种失败模式

模型在演示中成功,在生产中失败。差距不是推理能力 — 而是线束。本课命名七种反复出现的失败模式,引用2026年数据,并建立案例:线束工程比模型选择更重要。

类型: 学习 语言: Python(标准库) 前置条件: Phase 14 · 01(Agent循环),Phase 14 · 26(失败模式) 时间: ~45分钟

学习目标

  • 命名七种反复出现的Agent失败模式。
  • 引用2026年数据:88%的企业AI Agent项目未能投产;线束变更使Terminal Bench排名从30名外跃升至第5名。
  • 解释为什么”更好的模型”是错误的修复,“更好的线束”是正确的修复。
  • 描述工作台要解决的差距。

问题所在

演示有效。生产失败。差距不是模型能力 — 而是围绕模型的工程。2026年数据:

  • 88%的企业AI Agent项目未能投产(preprints.org,2026年3月)。
  • LangChain的Anatomy of an Agent Harness:同一模型从Terminal Bench 2.0的30名外跃升至第5名,仅通过更改线束。
  • Vercel删除80%的Agent工具将成功率从80%提升到100%。
  • Harvey仅通过线束优化将法律Agent准确性翻倍,无模型变更。

核心概念

七种失败模式

  1. 范围蔓延。 任务是”修复登录bug”。diff触及登录路由、邮件助手、数据库驱动、README和发布脚本。每次触及都有当时的合理理由。合在一起,它们是一个与审查时不同的变更。

  2. 上下文丢失。 会话结束。下一个会话问”我们从哪里继续?“上一个会话的答案消失了。Agent重新发现、重新运行相同命令、重新询问人类相同问题。

  3. 幻觉验证。 Agent说”测试通过了。“没有测试实际运行的记录。Agent想象输出,或运行了命令但从未读取结果,或读取了结果并静默截断了失败行。

  4. 状态损坏。 两个Agent写入相同状态文件。一个覆盖另一个的更改。或者Agent在写入中途崩溃,留下半写入的状态文件,下一个会话将其视为权威。

  5. 规则漂移。 Agent开始遵循规则。在10步之后,上下文窗口推移了规则。Agent”忘记”它不应该触及配置文件。提示中的规则是建议;磁盘上的规则是契约。

  6. 无限循环。 Agent陷入循环:尝试A,失败,尝试B,失败,再次尝试A。轮次预算最终停止它,但token和时间已经浪费。

  7. 交接间隙。 会话结束。下一个会话没有关于已完成内容、尝试了什么、失败了什么以及下一步该做什么的结构化信息。恢复成本随每个会话复合。

为什么”更好的模型”是错误的修复

更好的模型推迟了失败,但未修复结构原因。范围蔓延发生是因为没有范围契约。上下文丢失发生是因为没有持久状态。幻觉验证发生是因为没有反馈运行器。每种失败模式都有线束修复,模型无法自行提供。

工作台提案

工作台是七种表面,每种解决一种失败模式:

失败模式工作台表面
范围蔓延范围契约(第36课)
上下文丢失仓库记忆(第34课)
幻觉验证反馈运行器(第37课)
状态损坏带验证的原子状态(第34课)
规则漂移可执行规则(第33课)
无限循环验证门(第38课)
交接间隙交接包(第40课)

实践

code/main.py用标准库模拟七种失败模式,每种带有和没有对应工作台表面的对比。运行它以查看每种失败模式以及表面如何防止它。

交付

outputs/skill-failure-mode-catalog.md为你的产品编目哪些失败模式最频繁,并映射到工作台表面。

练习

  1. 在你的生产Agent中识别你见过的三种失败模式。将每种映射到工作台表面。
  2. 测量:你的Agent在范围蔓延上浪费了token上下文丢失?幻觉验证?
  3. 阅读LangChain的Anatomy of an Agent Harness。哪种线束变更产生了最大的排名提升?
  4. 设计一个实验:同一模型,有和没有工作台,在10个真实任务上。定义指标。
  5. 向非工程解释为什么”更好的模型”是错误修复。使用Vercel或Harvey数据。

关键术语

术语们怎么说实际含义
范围蔓延”它还触及了…”文件任务范围外被更改
上下文丢失”我们从哪里继续?“没有持久状态;每个会话重新发现
幻觉验证测试通过了”无运记录的成功声明
状态损坏状态文件坏了”并发写入部分写入损坏状态
规则漂移”Agent忘记了规则上下文窗口推移规则规则变成建议
无限循环”Agent卡住了”Agent重复相同失败尝试直到次预算
交接间隙”下一个会话开始”结构会话信息

延伸阅读

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式