Agent工作台为何模型失败 — 七种失败模式
识别Agent在真实代码库中失败的七种模式,理解线束工程比模型选择更重要的实证数据
Agent工作台为何模型失败 — 七种失败模式
模型在演示中成功,在生产中失败。差距不是推理能力 — 而是线束。本课命名七种反复出现的失败模式,引用2026年数据,并建立案例:线束工程比模型选择更重要。
类型: 学习 语言: Python(标准库) 前置条件: Phase 14 · 01(Agent循环),Phase 14 · 26(失败模式) 时间: ~45分钟
学习目标
- 命名七种反复出现的Agent失败模式。
- 引用2026年数据:88%的企业AI Agent项目未能投产;线束变更使Terminal Bench排名从30名外跃升至第5名。
- 解释为什么”更好的模型”是错误的修复,“更好的线束”是正确的修复。
- 描述工作台要解决的差距。
问题所在
演示有效。生产失败。差距不是模型能力 — 而是围绕模型的工程。2026年数据:
- 88%的企业AI Agent项目未能投产(preprints.org,2026年3月)。
- LangChain的Anatomy of an Agent Harness:同一模型从Terminal Bench 2.0的30名外跃升至第5名,仅通过更改线束。
- Vercel删除80%的Agent工具将成功率从80%提升到100%。
- Harvey仅通过线束优化将法律Agent准确性翻倍,无模型变更。
核心概念
七种失败模式
-
范围蔓延。 任务是”修复登录bug”。diff触及登录路由、邮件助手、数据库驱动、README和发布脚本。每次触及都有当时的合理理由。合在一起,它们是一个与审查时不同的变更。
-
上下文丢失。 会话结束。下一个会话问”我们从哪里继续?“上一个会话的答案消失了。Agent重新发现、重新运行相同命令、重新询问人类相同问题。
-
幻觉验证。 Agent说”测试通过了。“没有测试实际运行的记录。Agent想象输出,或运行了命令但从未读取结果,或读取了结果并静默截断了失败行。
-
状态损坏。 两个Agent写入相同状态文件。一个覆盖另一个的更改。或者Agent在写入中途崩溃,留下半写入的状态文件,下一个会话将其视为权威。
-
规则漂移。 Agent开始遵循规则。在10步之后,上下文窗口推移了规则。Agent”忘记”它不应该触及配置文件。提示中的规则是建议;磁盘上的规则是契约。
-
无限循环。 Agent陷入循环:尝试A,失败,尝试B,失败,再次尝试A。轮次预算最终停止它,但token和时间已经浪费。
-
交接间隙。 会话结束。下一个会话没有关于已完成内容、尝试了什么、失败了什么以及下一步该做什么的结构化信息。恢复成本随每个会话复合。
为什么”更好的模型”是错误的修复
更好的模型推迟了失败,但未修复结构原因。范围蔓延发生是因为没有范围契约。上下文丢失发生是因为没有持久状态。幻觉验证发生是因为没有反馈运行器。每种失败模式都有线束修复,模型无法自行提供。
工作台提案
工作台是七种表面,每种解决一种失败模式:
| 失败模式 | 工作台表面 |
|---|---|
| 范围蔓延 | 范围契约(第36课) |
| 上下文丢失 | 仓库记忆(第34课) |
| 幻觉验证 | 反馈运行器(第37课) |
| 状态损坏 | 带验证的原子状态(第34课) |
| 规则漂移 | 可执行规则(第33课) |
| 无限循环 | 验证门(第38课) |
| 交接间隙 | 交接包(第40课) |
实践
code/main.py用标准库模拟七种失败模式,每种带有和没有对应工作台表面的对比。运行它以查看每种失败模式以及表面如何防止它。
交付
outputs/skill-failure-mode-catalog.md为你的产品编目哪些失败模式最频繁,并映射到工作台表面。
练习
- 在你的生产Agent中识别你见过的三种失败模式。将每种映射到工作台表面。
- 测量:你的Agent在范围蔓延上浪费了多少token?上下文丢失?幻觉验证?
- 阅读LangChain的Anatomy of an Agent Harness。哪种线束变更产生了最大的排名提升?
- 设计一个实验:同一模型,有和没有工作台,在10个真实任务上。定义指标。
- 向非工程师解释为什么”更好的模型”是错误的修复。使用Vercel或Harvey数据。
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| 范围蔓延 | ”它还触及了…” | 文件在任务范围外被更改 |
| 上下文丢失 | ”我们从哪里继续?“ | 没有持久状态;每个会话重新发现 |
| 幻觉验证 | ”测试通过了” | 无运行记录的成功声明 |
| 状态损坏 | ”状态文件坏了” | 并发写入或部分写入损坏状态 |
| 规则漂移 | ”Agent忘记了规则” | 上下文窗口推移规则;规则变成建议 |
| 无限循环 | ”Agent卡住了” | Agent重复相同失败尝试直到轮次预算 |
| 交接间隙 | ”下一个会话从头开始” | 无结构化会话间信息 |
延伸阅读
- LangChain, The Anatomy of an Agent Harness — Terminal Bench Top-30到Top-5
- MongoDB, The Agent Harness — Vercel + Harvey数据
- preprints.org, Harness Engineering for Language Agents — 88%企业失败率
- Anthropic, Building Effective Agents — Agent vs工作流