AI Agent
智能体架构与应用
- 001 进阶 A2A协议 — Agent间通信 掌握Google A2A协议的Agent Card、Task生命周期和认证模型,实现跨框架Agent互操作
- 002 中级 A2A协议深入 Google 于 2025 年 4 月宣布 A2A;到 2026 年 4 月,规范位于 https://a2a-protocol.org/latest/specification/,150+ 组织支持它。A2A 是 MCP (Lesson 13) 的水平补充:MCP 是垂直的(Agent ↔ ...
- 003 中级 AI-Scientist-v2自主研究 Sakana 的 AI Scientist v2 (Yamada 等人, arXiv:2504.08066) 运行完整研究循环:假设、代码、实验、图表、论文、提交。它是第一个有生成论文通过 ICLR 2025 workshop 同行评审的系统。独立评估 (Beel 等人) 发现 42% 的实验...
- 004 中级 Agent可观测性平台 三个开源Agent可观测性平台主导2026年。Langfuse(MIT)— 6M+安装/月,追踪 + 提示管理 + 评估 + 会话回放。Arize Phoenix(Elastic 2.0)— 深度Agent特定评估,RAG相关性,OpenInference自动仪器化。Comet Opik(Ap...
- 005 中级 Agent失败模式 MASFT(Berkeley,2025)将14个多Agent失败模式编入3个类别。Microsoft的分类法文档了现有AI失败如何在Agent设置中放大。行业领域数据趋同于五个反复出现的模式:幻觉动作、范围蔓延、级联错误、上下文丢失、工具误用。
- 006 中级 Agent工作台为何模型失败 — 七种失败模式 识别Agent在真实代码库中失败的七种模式,理解线束工程比模型选择更重要的实证数据
- 007 中级 Agent工作台项目 — 可复用工作台包 将七种工作台表面打包为可复用的drop-in目录,实现一键安装、版本控制和跨项目复用
- 008 中级 Agent循环 — 观察、思考、行动 掌握ReAct循环的五个要素,实现标准库Agent循环,理解2026年从提示思维token到原生推理的转变
- 009 中级 Agent经济体与声誉 长时间范围自主 Agent (METR 的 1 小时到 8 小时工作曲线) 需要经济主体能力。新兴的 5 层栈 是:DePIN (物理计算) → 身份 (W3C DID + 声誉资本) → 认知 (RAG + MCP) → 结算 (账户抽象) → 治理 (Agentic DAO)。生产 Age...
- 010 中级 Agno与Mastra生产运行时 Agno(Python)和Mastra(TypeScript)是2026年的生产运行时配对。Agno瞄准微秒级Agent实例化和无状态FastAPI后端。Mastra在Vercel AI SDK基底上发布Agent、工具、工作流、统一模型路由和复合存储。
- 011 中级 AlphaEvolve进化编码 将前沿编码模型与进化循环和机器可检查评估器配对。让循环运行足够长时间。它发现了一个使用 48 次标量乘法的 4x4 复矩阵乘法程序——56 年来对 Strassen 的首次改进。它还找到了一个 Google 范围的 Borg 调度启发式,在生产中恢复了约 0.7% 的集群计算。架构故意无聊。胜...
- 012 进阶 Anthropic RSP v3.0 — 负责任扩展政策 深入解读RSP v3.0的两层缓解机制、AI R&D-4阈值、前沿安全路线图,以及SaferAI降级评分的原因
- 013 中级 Anthropic工作流模式 Schluntz和Zhang(Anthropic,2024年12月)区分了工作流(预定义路径)和Agent(动态工具使用)。五种工作流模式覆盖了大多数情况。从直接API调用开始。只在步骤无法预测时才添加Agent。
- 014 中级 AutoGen-Actor模型与Agent框架 AutoGen v0.4(Microsoft Research,2025年1月)围绕Actor模型重新设计了Agent编排。异步消息交换、事件驱动Agent、故障隔离、天然并发。该框架目前处于维护模式,Microsoft Agent Framework(2025年10月公开预览)成为继任者。
- 015 中级 CAIS-CAISI与社会规模风险 AI 安全中心 (CAIS, 旧金山,2022 年由 Hendrycks 和 Zhang 创立) 发布四风险框架——恶意使用、AI 竞赛、组织风险、失控 AI——以及 2023 年 5 月由数百名教授和公司领导签署的灭绝风险声明。CAIS 2026 年发布:前沿模型评估 AI 仪表板、远程劳动...
- 016 中级 Claude Agent SDK:子Agent与会话存储 Claude Agent SDK是Claude Code线束的库形式。内置工具、子Agent用于上下文隔离、钩子、W3C追踪传播、会话存储对等。Claude Managed Agents是长时间运行异步工作的托管替代。
- 017 中级 Claude-Code权限模式与Auto模式 Claude Code 暴露七种权限模式。plan 在每个动作前询问,default 仅对有风险的动作询问,acceptEdits 自动批准文件写入但仍确认 Shell 执行,bypassPermissions 批准一切。Auto 模式用两阶段并行安全分类器替代逐动作批准。
- 018 中级 CrewAI角色团队与流程 CrewAI是2026年基于角色的多Agent框架。四个原语:Agent、Task、Crew、Process。两种顶层形状:Crew(自主、基于角色的协作)和Flow(事件驱动、确定性)。文档直言:"对于任何生产就绪应用,从Flow开始。"
- 019 中级 Darwin-Godel自修改Agent Schmidhuber 2003 年的 Godel Machine 要求在接受任何自修改之前有正式证明其有益。那个证明在实践中不可能。Darwin Godel Machine (Zhang 等人, 2025) 放弃证明保留档案:Agent 提议对其自身 Python 源代码的编辑,每个变体在 ...
- 020 中级 FIPA-ACL遗产 在 MCP 之前,在 A2A 之前,有 FIPA-ACL。2000 年,IEEE 智能物理代理基金会批准了一种代理通信语言,包含二十个施事行为、两种内容语言和一组交互协议——合同网、订阅/通知、请求-当。它从行业中消退,因为本体开销对 Web 来说太重了,但 LLM 复兴的多 Agent 系统...
- 021 中级 HTN规划与进化搜索 符号规划处理计划可证明正确的情况。进化代码搜索处理适应度函数可机器检查的情况。ChatHTN(2025)和AlphaEvolve(2025)展示了与LLM配对时各自解锁了什么。
- 022 中级 LLM路由层 — 模型选择、回退、成本优化 构建LLM路由层,实现基于任务的路由、回退链、成本感知选择和A/B测试
- 023 中级 LangGraph状态图与持久执行 LangGraph是2026年低层有状态编排的参考。Agent是状态机;节点是函数;边是转换;状态是不可变的并在每步后检查点。从任何失败处精确恢复。
- 024 中级 LlamaGuard与输入输出分类 掌握Llama Guard 3/4分类器、NeMo Guardrails防护栏和MLCommons危害分类法,理解分类器层的优势与局限
- 025 中级 多Agent强化学习MADDPG-QMIX-MAPPO 多 Agent 协调的强化学习遗产,在 2026 年仍然指导 LLM Agent 系统。MADDPG (Lowe 等人, NeurIPS 2017, arXiv:1706.02275) 引入了集中训练分散执行 (CTDE):每个评论家在训练期间看到所有 Agent 的状态和动作;测试时只有局部...
- 026 中级 MCP基础 — 原语、生命周期、JSON-RPC基础 掌握MCP的六个原语、三阶段生命周期和JSON-RPC 2.0线路格式,理解能力协商机制
- 027 中级 MCP传输 — stdio vs Streamable HTTP vs SSE迁移 理解stdio与Streamable HTTP传输的选择、Origin验证、DNS重绑定防护和SSE迁移策略
- 028 进阶 MCP安全II — OAuth 2.1、资源指示器、增量作用域 实现MCP的OAuth 2.1认证配置,掌握PKCE、RFC 8707资源指示器、RFC 9728受保护资源元数据和SEP-835步进授权
- 029 进阶 MCP安全I — 工具投毒、地毯拉扯、跨服务器影子 掌握MCP七种攻击类别,构建工具投毒检测器和哈希固定存储,理解深度防御策略
- 030 进阶 MCP应用 — 通过ui://的交互式UI资源 掌握MCP Apps扩展,使用ui://资源方案和iframe沙箱postMessage协议实现交互式HTML界面
- 031 进阶 MCP异步任务 — 即时调用、稍后获取 掌握SEP-1686异步任务原语,实现长时间运行工具的异步执行、状态轮询和崩溃恢复
- 032 中级 MCP根目录与诱导 — 作用域与飞行中用户输入 掌握roots作用域限制和elicitation中途用户输入机制,解决路径假设和参数歧义问题
- 033 进阶 MCP生产认证 — 注册、JWKS刷新、受众固定Token 掌握生产MCP认证的完整表面:客户端注册(CIMD/DCR)、JWKS缓存刷新、受众固定token验证和IdP能力矩阵
- 034 进阶 MCP网关与注册表 — 企业控制平面 掌握MCP网关的五大职责和官方注册表体系,理解企业级MCP部署的集中化策略
- 035 进阶 MCP采样 — 服务器请求的LLM补全与Agent循环 掌握sampling机制使服务器能通过客户端LLM进行推理,实现无需API密钥的服务器端Agent循环
- 036 中级 MCP资源与提示 — 超越工具的上下文暴露 掌握工具、资源、提示三种原语的选择决策,实现资源订阅和提示模板
- 037 中级 METR时间范围与外部能力评估 METR (前 ARC Evals) 自 2023 年 12 月起为独立 501(c)(3)。他们的时间范围 1.1 基准 (2026 年 1 月) 对任务成功概率 vs log(专家人类完成时间) 拟合逻辑曲线;50% 概率处的交点定义模型的时间范围。2025-2026 年参与集覆盖 GPT...
- 038 中级 OpenAI准备性与DeepMind前沿安全框架 OpenAI 准备性框架 v2 (2025 年 4 月) 引入研究类别——长时间范围自主性、沙袋行为、自主复制与适应、破坏保障措施——与追踪类别不同。追踪类别触发能力报告加保障措施报告,由安全咨询组审查。DeepMind 的 FSF v3 (2025 年 9 月,2026 年 4 月 17 日...
- 039 中级 OpenTelemetry-GenAI语义约定 OpenTelemetry的GenAI SIG(2024年4月启动)定义了Agent遥测的标准Schema。Span名称、属性和内容捕获规则跨供应商趋同,使Agent追踪在Datadog、Grafana、Jaeger和Honeycomb中含义相同。
- 040 中级 OpenAI Agents SDK:交接、护栏、追踪 OpenAI Agents SDK是构建在Responses API上的轻量级多Agent框架。五个原语:Agent、Handoff、Guardrail、Session、Tracing。交接是名为transfer_to_<agent>的工具。护栏在输入或输出时触发。追踪默认开启。
- 041 中级 OpenTelemetry GenAI — Agent可观测性语义约定 掌握OpenTelemetry GenAI语义约定,实现LLM调用的分布式追踪、token计量和成本归因
- 042 中级 ReWOO与计划执行 ReAct在一个流中交替思考和行动。ReWOO将它们分离:先做一个完整计划,然后执行。Token消耗减少5倍,HotpotQA准确率提升4%,而且你可以将规划器蒸馏到7B模型中。Plan-and-Execute将其泛化;Plan-and-Act将其扩展到Web导航。
- 043 中级 Reflexion语言强化学习 基于梯度的RL需要数千次试验和GPU集群来修复一个失败模式。Reflexion(Shinn等人,NeurIPS 2023)用自然语言做到这一点:每次失败的试验后,Agent写一段反思,存储在情景记忆中,并在下一次试验中以此记忆为条件。这是Letta的睡眠时间计算、Claude Code的CLA...
- 044 中级 STaR自教推理 最小的可能自改进循环存在于推理依据中。模型生成思维链,保留那些得到正确答案的,并在其上微调。这就是 STaR。V-STaR 添加验证者以改善推理时选择。Quiet-STaR 将推理依据推到每个 token。三者都有效。没有一个是魔法——循环保留了碰巧达到正确答案的任何捷径。
- 045 中级 为何多Agent 一个 Agent 遇到瓶颈时,明智之举不是更大的 Agent,而是更多的 Agent。
- 046 中级 交接与例程 OpenAI 的 Swarm (2024 年 10 月) 将多 Agent 编排提炼为两个原语:例程(指令 + 工具作为系统提示)和交接(返回另一个 Agent 的工具)。没有状态机,没有分支 DSL——LLM 通过调用正确的交接工具来路由。OpenAI Agents SDK (2025 年 ...
- 047 中级 仓库记忆与持久状态 构建Schema优先的状态管理器,实现原子写入、验证拒绝和迁移支持,使Agent状态跨会话持久化
- 048 中级 作用域契约与任务边界 构建作用域契约,定义允许文件、禁止文件、验收标准和回滚计划,实现范围蔓延的自动检测和审查
- 049 中级 先提议后提交模式 先提议后提交是自主 Agent 中人机交互的基本模式。Agent 提议一个动作;人类审查并批准或修改;Agent 执行批准的版本。这是 plan 权限模式 (Lesson 10) 的泛化。它适用于文件编辑、Shell 命令、网络请求和任何有副作用的操作。关键设计选择:提议和提交之间的边界在哪里...
- 050 中级 共享记忆与黑板模式 2026 年多 Agent 系统中共存两种方法:消息池(每个人看到每个人的消息,如 AutoGen GroupChat 或 MetaGPT)和带订阅的黑板(Agent 订阅相关事件,如 Context-Aware MCP 或 Matrix 框架)。两者都是多 Agent 系统中唯一有状态的部分...
- 051 中级 共识与拜占庭容错 经典分布式系统 BFT 遇上随机 LLM。2025-2026 年出现三个研究方向:CP-WBFT (arXiv:2511.10400) 通过置信度探针加权每票;DecentLLMs (arXiv:2507.14928) 采用无领导模式,并行工作者提议和几何中位数聚合;WBFT (arXiv:2...
- 052 中级 函数调用深入 — OpenAI、Anthropic、Gemini 对比三大前沿提供商的函数调用格式差异,构建统一翻译器实现跨提供商移植
- 053 中级 初始化脚本 — 一次性支付启动税 构建确定性初始化脚本,探测运行时、依赖、路径和健康状态,将启动税从每次会话支付变为一次性支付
- 054 中级 协商与讨价还价 Agent 协商资源、价格、任务分配和条款。2026 年基准集很明确:NegotiationArena (arXiv:2402.05863) 显示 LLM 可以通过人格操纵("绝望")改善收益约 20%;"Measuring Bargaining Abilities" (arXiv:2402....
- 055 中级 基准测试SWE-bench与GAIA 三个基准锚定2026年Agent评估。SWE-bench测试代码补丁。GAIA测试通用工具使用。AgentBench测试多环境推理。了解它们的组成、污染故事以及它们不测量的内容。
- 056 中级 基准测试WebArena与OSWorld WebArena跨四个自托管应用测试Web Agent能力。OSWorld跨Ubuntu、Windows、macOS测试桌面Agent能力。在发布时(2023-2024)两者都显示了最佳Agent和人类之间的巨大差距。差距在缩小;失败模式没有改变。
- 057 中级 多Agent原语模型 — 四维设计空间 掌握Agent、Handoff、共享状态、编排器四个原语,将所有2026年多Agent框架映射到同一坐标系
- 058 中级 多Agent辩论与协作 Du等人(ICML 2024,"Society of Minds")运行N个模型实例独立提出答案,然后在R轮中迭代批评彼此以收敛。改善事实性、规则遵循、推理。稀疏拓扑在token成本上击败全网格。
- 059 中级 多会话交接 — 会话结束,工作继续 构建七字段交接包,从工作台工件自动生成,使下一个会话在第一分钟就高效
- 060 中级 失败模式MAST与群体思维 2026 年的参考分类法是 MAST (Cemri 等人, NeurIPS 2025, arXiv:2503.13657),源自 7 个最先进开源 MAS 的 1642 条执行轨迹,显示 41-86.7% 失败率。三个根类别:规格问题 (41.77%) — 角色模糊、任务定义不清;协调失败 (...
- 061 中级 审查Agent — 分离构建者与标记者 构建独立审查Agent,使用五维度评分标准对构建者产出进行定性评审,实现角色分离和偏差缓解
- 062 中级 宪法AI与价值观对齐 Anthropic 的宪法 AI (CAI, Bai 等人, 2022) 用两阶段过程替代人类反馈 RLHF:SL(监督学习,模型批评自己的输出并修订)和 RL(强化学习,模型根据宪法原则自我评估)。Claude 的宪法 (2026 年 1 月更新) 包含来自联合国人权宣言、Apple 的服务...
- 063 中级 层级架构及其失败模式 掌握层级架构的三种失败模式:任务分配错误、输出误读、共识循环,理解何时顺序优于层级
- 064 中级 工具Schema设计 — 命名、描述、参数约束 掌握工具命名规则、描述模式和参数设计,提升工具选择准确率10-20个百分点
- 065 中级 工具使用与函数调用 Toolformer(Schick等人,2023)开始了自监督工具标注。Berkeley Function Calling Leaderboard V4(Patil等人,2025)设定了2026年的标准:40% Agent式、30%多轮、10%实时、10%非实时、10%幻觉。单轮已解决。记忆、...
- 066 中级 工具接口 — Agent为何需要结构化I/O 理解Agent工具调用的四步循环:描述、决策、执行、观察,以及纯工具与后果工具的安全区分
- 067 进阶 工具生态项目 — 发布完整MCP+A2A+路由+可观测性栈 整合Phase 13所有原语,构建端到端工具生态系统,包含MCP服务器、A2A委托、路由层和可观测性
- 068 中级 并行群体网络架构 与监督者对比:没有中央决策者。Agent 读取共享事件总线,异步获取工作,写回结果。LangGraph 明确支持"群体架构"用于去中心化、动态环境。Matrix (arXiv:2511.21686) 将控制流和数据流都表示为通过分布式队列传递的序列化消息,以消除编排者瓶颈。权衡是明确的:用确定...
- 069 中级 心智理论与涌现协调 Li 等人 (arXiv:2310.10701) 显示合作文本游戏中的 LLM Agent 展现了涌现高阶心智理论 (ToM)——推理另一个 Agent 对第三个 Agent 信念的信念——但由于上下文管理和幻觉在长期规划上失败。Riedl (arXiv:2510.05174) 测量了群体中的...
- 070 中级 并行与流式工具调用 掌握并行工具调用的扇出执行和流式参数重组,理解id关联陷阱和依赖调度
- 071 中级 心智社会与多Agent辩论 Minsky 1986 年的前提——智能是专家的社会——每十年被重新发现一次。2023 年 Du 等人将其转化为具体算法:多个 LLM 实例提出答案、阅读彼此的答案、批评并更新。经过 N 轮,它们收敛于一个共识,在六个推理和事实性任务上击败零样本 CoT 和反思。两个发现很重要:多个 Agen...
- 072 中级 思维树与LATS 单条思维链轨迹没有回溯的空间。ToT(Yao等人,2023)将推理变成带有每个节点自评估的树。LATS(Zhou等人,2024)在蒙特卡洛树搜索下统一了ToT、ReAct和Reflexion。Game of 24从4%(CoT)提升到74%(ToT);LATS在HumanEval上达到92.7...
- 073 中级 成本治理器与预算终止 每个自主 Agent 都需要三个预算:max_turns(迭代次数)、max_budget_usd(美元上限)和 max_wallclock_s(挂钟秒数)。Claude Code 在每次运行时强制执行所有三个。LangGraph 的运行时在每个超步检查预算。没有这些,长时间范围 Agent ...
- 074 中级 技能与Agent SDK — 可复用Agent能力打包 掌握技能打包规范和主流Agent SDK的技能模型,实现跨框架的Agent能力复用
- 075 中级 技能库与终身学习 Voyager(Wang等人,TMLR 2024)将可执行代码视为技能。技能是命名的、可检索的、可组合的,并由环境反馈精炼。这是Claude Agent SDK技能、skillkit和2026年技能库模式的参考架构。
- 076 中级 投票辩论拓扑 最便宜的聚合:采样 N 个独立 Agent,多数投票。Wang 等人 2022 年的自一致性用一个模型采样 N 次做到了。多 Agent 用异构 Agent 扩展它以逃离单一文化——不同模型、不同提示、不同温度、不同上下文。超越多数投票,辩论拓扑很重要:MultiAgentBench (arX...
- 077 中级 指令作为可执行约束 — 规则即代码 将Agent规则从提示建议升级为磁盘上的可执行约束,实现启动检查、行动前检查和违规报告
- 078 进阶 提示注入防御 — PVE模式 掌握间接提示注入的五种攻击类别和六项防御原则,实现Prompt-Validator-Executor防御模式
- 079 中级 最小Agent工作台 — 三个文件 构建最小可行Agent工作台:agent-rules.md、agent_state.json、task_board.json,实现规则即代码和状态持久化
- 080 中级 有界自改进设计 研究已收敛到约束自改进循环的四个原语。每次编辑必须保持的形式不变量。不可修改的对齐锚点。每个维度(安全、公平、鲁棒性)都必须满足的多目标约束,不只是性能。当历史指标表明能力损失时暂停循环的回归检测。没有一个是安全证明——信息论结果(Kolmogorov 复杂度、Lob 定理)限制了任何系统能关...
- 081 进阶 构建MCP客户端 — 发现、调用、会话管理 构建多服务器MCP客户端,实现进程生成、能力协商、工具列表合并、命名空间冲突处理和路由
- 082 中级 构建MCP服务器 — Python + TypeScript SDK 从零构建完整的MCP服务器,实现tools、resources、prompts三个原语,掌握调度循环和注解机制
- 083 中级 案例研究与2026年SOTA 三个生产级参考端到端研究,每个说明多 Agent 工程的不同切片。Anthropic 研究系统(编排者-工作者,15 倍 token,相对单 Agent Opus 4 +90.2%,彩虹部署)是规范监督者案例。MetaGPT / ChatDev(SOP 编码的角色专业化用于软件工程;ChatD...
- 084 中级 检查点与回滚 检查点保存状态;回滚恢复到先前状态。两者是持久执行 (Lesson 12) 的基础。检查点让 Agent 在崩溃后恢复。回滚让 Agent 在犯错后撤销。关键设计选择:检查点频率(每次迭代 vs 每个重要步骤)、回滚粒度(完整状态 vs 单个文件)和回滚触发器(人工 vs 自动)。
- 085 中级 浏览器Agent与间接注入 ChatGPT agent(2025 年 7 月)将 Operator 和深度研究合并为一个浏览器/终端 Agent,BrowseComp SOTA 达 68.9%。OpenAI 于 2025 年 8 月 31 日关闭 Operator——产品层整合。Anthropic 的 Vercept 收...
- 086 中级 混合记忆向量图与KV Mem0(Chhikara等人,2025)将记忆视为三个并行存储——向量用于语义相似性,KV用于快速事实查找,图用于实体关系推理。一个评分层在检索时融合三者。这是2026年外部记忆的生产标准。
- 087 中级 生产扩展队列与检查点 将多 Agent 系统扩展到数千个并发运行需要持久执行。LangGraph 的运行时在每个超步后写入检查点,以 thread_id 为键(默认 Postgres);工作者崩溃释放租约,另一个工作者恢复。Agent 可以无限期睡眠等待人工输入。MegaAgent (arXiv:2408.0995...
- 088 中级 生产运行时 — 队列、事件、定时 掌握六种生产运行时形状,理解持久执行的重要性,以及可观测性作为承重组件的必要性
- 089 中级 生成式Agent与涌现模拟 Park 等人 2023 (UIST '23, arXiv:2304.03442) 用三部分架构填充了 Smallville,一个 25 Agent 沙箱:记忆流(自然语言日志)、反思(Agent 关于自己流生成的更高层次综合)和计划(日级行为,然后子计划)。标志性结果是情人节派对涌现:一个 ...
- 090 中级 监督者/编排者-工作者模式 构建监督者模式,理解Anthropic研究系统+90.2%的机制,掌握token主导、彩虹部署和综合冲突处理
- 091 中级 真实仓库工作台 — 前后对比报告 在真实代码库上对比仅提示vs工作台引导的Agent运行,用数据证明工作台工程的价值
- 092 中级 终止开关与金丝雀令牌 终止开关是停止运行的硬机制。金丝雀令牌是检测运行何时行为不当的软机制。两者都需要。终止开关是"拔插头"——它停止执行但不告诉你为什么需要停止。金丝雀令牌是"矿井中的金丝雀"——它们在事情出错时发出信号,但它们不停止运行。组合:金丝雀检测 → 人类审查 → 终止开关执行。
- 093 中级 结构化输出 — JSON Schema、Pydantic、Zod、约束解码 掌握约束解码保证JSON Schema合规的机制,处理拒绝、解析错误和模式违反三种失败模式
- 094 中级 编排模式 — 监督者、群集、层级 掌握四种编排拓扑模式,理解Anthropic的"构建正确系统"原则,根据需求选择合适的编排模式
- 095 中级 群体优化PSO与ACO 生物启发优化正在 LLM 领域回归。LMPSO (arXiv:2504.09247) 使用 PSO,其中每个粒子的速度是一个提示,LLM 生成下一个候选;在结构化序列输出(数学表达式、程序)上效果良好。Model Swarms (arXiv:2410.11163) 将每个 LLM 专家视为模型...
- 096 中级 群聊与发言者选择 AutoGen GroupChat 和 AG2 GroupChat 在 N 个 Agent 之间共享一个对话;选择器函数(LLM、轮询或自定义)选择下一个发言者。这是涌现式多 Agent 对话的原型——Agent 不知道自己在静态图中的角色,它们只是对共享池做出反应。AutoGen v0.2 ...
- 097 中级 自主编码Agent格局 SWE-bench Verified 在不到三年内从 4% 升至 80.9%。相同的 Claude Sonnet 4.5 在 SWE-agent v1 上得分 43.2%,在 Cline autonomous 上得分 59.8%——模型周围的脚手架现在与模型本身一样重要。OpenHands(前...
- 098 中级 自动化对齐研究AAR Anthropic 在独立沙箱中运行了并行的 Claude Opus 4.6 自主对齐研究员团队,通过共享论坛协调,其日志存储在任何沙箱之外(因此 Agent 不能删除自己的记录)。在弱到强训练问题上,AAR 超越了人类研究员。Anthropic 自己的总结指出,规定性工作流经常约束 AAR ...
- 099 中级 自精炼与CRITIC Self-Refine(Madaan等人,2023)用一个LLM扮演三个角色——生成、反馈、精炼——循环执行。7个任务平均提升20个绝对百分点。CRITIC(Gou等人,2023)通过将验证路由到外部工具来强化反馈步骤。在2026年,这个模式在每个框架中都以"评估器-优化器"(Anthropi...
- 100 中级 角色专业化 2026 年最常见的多 Agent 分解:一个 Agent 规划,一个执行,一个批评或验证。MetaGPT (arXiv:2308.00352) 将此形式化为编码到角色提示中的 SOP——产品经理、架构师、项目经理、工程师、QA 工程师——遵循 Code = SOP(Team)。ChatDev...
- 101 中级 计算机使用Agent 2026年三个生产计算机使用模型。三者都是基于视觉的。三者都将截图、DOM文本和工具输出视为不可信输入。只有直接用户指令算作许可。每步安全服务是常态。
- 102 中级 记忆块与睡眠时间计算 MemGPT在2024年成为Letta。2026年的演进添加了两个想法:模型可直接编辑的离散功能记忆块,以及在主Agent空闲时异步整合记忆的睡眠时间Agent。这是你将记忆扩展到单次对话之外的方式。
- 103 中级 记忆虚拟上下文与MemGPT 上下文窗口是有限的。对话、文档和工具轨迹不是。MemGPT(Packer等人,2023)将其框架为操作系统虚拟内存——主上下文是RAM,外部存储是磁盘,Agent在它们之间换页。这是每个2026年记忆系统继承的模式。
- 104 中级 评估与协调基准 五个 2025-2026 年基准覆盖多 Agent 评估空间。MultiAgentBench / MARBLE (ACL 2025, arXiv:2503.01935) 评估星形/链式/树形/图式拓扑与里程碑 KPI;图式最适合研究,认知规划增加约 3% 里程碑成就。COMMA 评估多模态不对...
- 105 中级 评估驱动Agent开发 掌握三层评估体系、评估器-优化器紧密循环,将评估作为驱动Agent开发每个选择的外循环
- 106 中级 语音Agent-Pipecat与LiveKit 语音Agent是2026年的一等生产类别。Pipecat给你一个Python基于帧的管道(VAD → STT → LLM → TTS → 传输)。LiveKit Agents通过WebRTC将AI模型桥接到用户。高级栈的生产延迟目标落在450-600ms端到端。
- 107 中级 递归自改进与对齐竞赛 递归自改进 (RSI) 不再是推测。ICLR 2026 RSI Workshop 在里约 (4 月 23-27 日) 将其框架为具有具体工具的工程问题。Demis Hassabis 在 WEF 2026 公开询问循环是否可以在没有人类参与的情况下闭合。Miles Brundage 和 Jare...
- 108 中级 运行时反馈循环 — 事实而非预测 构建反馈运行器,捕获命令输出为结构化记录,使Agent基于事实而非预测做出反应
- 109 中级 通信协议 不能说同一种语言的 Agent 不是团队。它们是向虚空呐喊的陌生人。
- 110 中级 长时间范围Agent METR 的 2024-2025 测量显示,Agent 在 1 小时任务上得分 50%,但在 8 小时任务上仅得分 10%。差距不是线性的——它是超线性的。每个额外小时的人类等价工作需要不成比例更多的 Agent 步骤,因为错误累积、上下文衰减和工具失败复合。当前 Agent 在约 30 分钟...
- 111 中级 长时间运行Agent持久执行 生产长时间范围 Agent 不在 while True 中运行。每个 LLM 调用成为带检查点、重试和重放的活动。Temporal 的 OpenAI Agents SDK 集成于 2026 年 3 月 GA。Claude Code Routines (Anthropic) 运行调度的 Clau...
- 112 中级 验证门 — Agent不能自己打分 构建确定性验证门,组合规则报告、范围报告、反馈记录和diff,产出任务完成裁决
- 113 入门 AI Agent 概述与架构 AI Agent 概念、发展历程、与 LLM 的关系、Agent 架构模式及应用场景。
- 114 入门 LLM 基础 大语言模型原理、Transformer 架构、Tokenization、Prompt Engineering 及模型选择。
- 115 中级 Agent 框架 LangChain/LangGraph、CrewAI、AutoGen、Dify 等主流 Agent 框架对比与选型。
- 116 中级 工具使用与 Function Calling Function Calling 原理、工具定义、MCP 协议、RAG 检索增强生成与知识库构建。
- 117 中级 记忆与规划 短期/长期记忆、对话管理、向量记忆、知识图谱记忆、任务规划与反思机制。
- 118 进阶 多 Agent 系统 Multi-Agent 协作模式、角色分配、通信机制、层级式/扁平式架构与实战。
- 119 进阶 Agent 评估与安全 Agent 评估指标、基准测试、安全风险、对齐与可控性、红队测试与可解释性。
- 120 进阶 实战项目 编程助手、数据分析、客服、自动化工作流 Agent 及 RAG 聊天机器人实战。
- 121 进阶 Agent 核心模块详解 感知、规划、行动、反思四大核心模块深度解析,以及 ReAct 模式的原理与实现。
- 122 进阶 MCP 与 A2A 协议 MCP 协议标准化 Agent 与工具交互、A2A 协议实现 Agent 间通信、上下文工程与工具调用格式。
- 123 进阶 Agent 安全与沙盒 托管沙盒隔离执行、响应式 API 流式返回、多智能体协作模式与具身智能。
- 124 中级 ReAct模式 ReAct 模式:Reasoning + Acting 交错推理与行动的智能体范式。
- 125 中级 思维链与思维树 思维链(Chain of Thought)与思维树(Tree of Thoughts):推理增强技术。
- 126 中级 工具调用机制 工具调用机制:Function Calling、Toolformer 与工具选择策略。
- 127 中级 记忆模块设计 智能体记忆模块设计:短期上下文、长期向量数据库与记忆检索。
- 128 中级 规划算法 智能体规划算法:Plan-and-Solve、A* 搜索与任务分解。
- 129 中级 多智能体协作 多智能体协作:CrewAI、AutoGen 框架与协作模式。
- 130 中级 主流框架对比 AI Agent 主流框架对比:LangChain、LangGraph、Semantic Kernel、AutoGPT、BabyAGI。
- 131 中级 提示工程 提示工程:系统提示、少样本、思维链提示与提示优化。
- 132 中级 智能体评估 智能体评估:WebArena、AgentBench 与评估指标体系。
- 133 中级 RAG与Agent结合 RAG 与 Agent 结合:检索增强生成、Agent-RAG 融合架构。
- 134 中级 智能体安全 智能体安全:沙箱隔离、输入过滤、权限限制与提示注入防御。