前置知识: AI Agent

评估与协调基准

00:00
15 min Intermediate

五个 2025-2026 年基准覆盖多 Agent 评估空间。MultiAgentBench / MARBLE (ACL 2025, arXiv:2503.01935) 评估星形/链式/树形/图式拓扑与里程碑 KPI;图式最适合研究,认知规划增加约 3% 里程碑成就。COMMA 评估多模态不对...

评估与协调基准

五个 2025-2026 年基准覆盖多 Agent 评估空间。MultiAgentBench / MARBLE (ACL 2025, arXiv:2503.01935) 评估星形/链式/树形/图式拓扑与里程碑 KPI;图式最适合研究,认知规划增加约 3% 里程碑成就。COMMA 评估多模态不对称信息协调;包括 GPT-4o 在内的最先进模型难以击败随机基线。MedAgentBoard (arXiv:2505.12371) 覆盖四个医疗任务类别,经常发现多 Agent 不主导单 LLM。AgentArch (arXiv:2509.10769) 基准测试结合工具使用 + 记忆 + 编排的企业 Agent 架构。SWE-bench Pro (arXiv:2509.16941) 有 41 个仓库的 1865 个问题,跨越商业应用、B2B 服务和开发者工具;前沿模型在 Pro 上得分约 23% vs Verified 上的 70%+——对污染的现实检查。Claude Opus 4.7 (2026 年 4 月) 在 Pro 上报告 64.3%,使用显式 Agent 团队协调(尚无 Anthropic 主要来源发布——视为初步);Verdent (Agent 脚手架) 在 Verified 上达到 76.1% pass@1 (Verdent 技术报告)。AAAI 2026 Bridge Program WMAC (https://multiagents.org/2026/) 是 2026 年社区焦点。本课程基于 MARBLE 的指标,运行拓扑 vs 指标扫描,并固定”仅通过 SWE-bench Verified 不是泛化证据”规则。

类型: 学习 语言: Python (stdlib) 前置条件: Phase 16 · 15 (投票辩论拓扑), Phase 16 · 23 (失败模式) 时间: ~75 分钟

问题

当一篇论文声称”我们的多 Agent 系统更好”时,问题是:比什么更好,在什么上,如何测量?2023-2024 年的多 Agent 评估时代是混乱的——每个人都选择自己的指标、自己的基线和自己的任务集。2025-2026 年的基准施加了结构。

没有共享基准,你无法有意义地比较两个多 Agent 系统。更糟的是,没有保留基准,前沿模型可能被污染。SWE-bench Verified 在 2025 年中之前部分污染了训练语料;前沿分数膨胀;Pro 被设计为未污染的现实检查。

本课程枚举五个规范 2026 年基准,命名每个测量什么,并教你持怀疑态度阅读基准声明。

概念

MultiAgentBench (MARBLE) — ACL 2025

arXiv:2503.01935。在研究、编码和规划任务上评估四种协调拓扑(星形、链式、树形、图式)。基于里程碑的 KPI 追踪部分进展而非仅最终成功。

测量结果:

  • 图式拓扑最适合研究场景;支持任意对任意批评。
  • 链式最适合逐步精炼编码。
  • 星形最适合快速事实整合。
  • 协调税在图式上约 4 个 Agent 后出现。
  • 认知规划在所有拓扑上增加约 3% 里程碑成就。

使用场景:当你想苹果对苹果比较协调拓扑时。MARBLE 仓库 (https://github.com/ulab-uiuc/MARBLE) 提供评估器。

COMMA — 多模态不对称信息

覆盖 Agent 有不同观察模态且必须在没有完整信息共享的情况下协调的任务。报告结果令人不安:包括 GPT-4o 在内的前沿模型在 COMMA 的 Agent-Agent 协作上难以击败随机基线。信号是多 Agent 模态训练不足且评估不足——LLM 合理处理单模态合作;多模态协调崩溃。

使用场景:你的系统有多模态或不对称信息协调。COMMA 的零结果是测量前先声明的警告。

MedAgentBoard — 领域压力测试

arXiv:2505.12371。四个医疗任务类别:诊断、治疗规划、报告生成、患者沟通。比较多 Agent vs 单 LLM vs 传统基于规则的系统。

发现:多 Agent 在大多数类别上主导单 LLM。多 Agent 优势很窄——任务分解在子任务清晰可分时(诊断 + 治疗)有帮助;在协调开销超过专业化增益时(报告生成)有害。

使用场景:你的领域有明确的单 LLM 基线。如果 MedAgentBoard 的教训泛化,许多提议的多 Agent 系统是过度工程。

AgentArch — 企业架构

arXiv:2509.10769。企业设置,工具使用、记忆和编排分层在一起。基准隔离每层的贡献:添加工具有多少帮助?添加记忆?添加多 Agent 编排?

使用场景:你在设计企业 Agent 栈并需要证明每层的价值。AgentArch 帮助避免购买你无法测量价值的功能。

SWE-bench Pro — 现实检查

arXiv:2509.16941。41 个仓库的 1865 个问题,跨越商业应用、B2B 服务和开发者工具。设计为未污染,具有更晚的训练截止日期。前沿模型在 Pro 上得分约 23% vs Verified 上的 70%+。差距是污染信号。

2026 年 4 月分数:

  • Claude Opus 4.7 在 Pro 上:64.3%(报告使用显式 Agent 团队协调;尚无 Anthropic 主要来源发布——视为初步)。
  • Verdent (Agent 脚手架) 在 Verified 上:76.1% pass@1 (技术报告)。
  • 前沿原始分数在 Pro 上无 Agent 脚手架:约 23-35% (SWE-bench Pro 论文)。

要点:“我们击败了 SWE-bench Verified”不再是能力的证据。Pro 是当前的门控测试。Agent 团队脚手架在 Pro 上产生可测量的增益(约 30-40 点差异),这是 2026 年多 Agent 协调最强的经验论证之一。

AAAI 2026 WMAC

AAAI 2026 Bridge Program — 多 Agent 协调研讨会 (https://multiagents.org/2026/)。2026 年多 Agent AI 研究的社区焦点。接受的论文和研讨会论文集是评估新方法的规范场所;对于生产决策,优先考虑 WMAC 接受的声明而非 arXiv 预印本。

持怀疑态度阅读基准声明 — 2026 年检查清单

当有人声称多 Agent 结果时:

  1. 哪个基准,哪个分割? SWE-bench Verified vs Pro 很重要。在错误分割上报告的数字是无价值的。
  2. 污染检查。 基准是否在模型训练截止日期之后发布?如果不是,谨慎对待。
  3. 基线比较。 vs 单 LLM 基线、vs 随机、vs 先前多 Agent 工作。不是”vs 相同系统的未调优版本。”
  4. 统计显著性。 N 次试验、p 值、置信区间。前沿模型高方差;单次运行误导。
  5. 任务多样性。 一个任务还是多个?泛化对生产很重要。
  6. 成本披露。 每任务 token、挂钟时间。20 倍成本的 90% 解决方案是商业决策,不是能力声明。

没有基准测量好的方面

  • 长时间范围协调。 数天的挂钟交互。所有当前基准运行很短。
  • 对抗性韧性。 当一个 Agent 恶意或被入侵时会发生什么?
  • 部署下的漂移。 基准是静态的;生产分布偏移。
  • 成本标准化性能。 大多数基准报告原始准确性,不是每美元准确性。

为你实际关心的轴构建自己的内部基准通常是正确的举措。

构建它

code/main.py 是非交互式演练:

  • 在玩具任务上模拟 3 个多 Agent 系统。
  • 为每个计算 MARBLE 风格的里程碑指标。
  • 通过从”训练”集中保留任务运行污染检查。
  • 显式与随机基线比较。
  • 打印基准声明记分卡。

运行:

python3 code/main.py

预期输出:系统记分卡,包含原始准确性、里程碑成就、每任务成本、vs 随机基线增量和污染检查注释。

使用它

outputs/skill-benchmark-reader.md 阅读任何多 Agent 基准声明并应用审查检查清单。输出:等级和注意事项。

发布它

生产评估纪律:

  • 构建内部基准,反映你的实际生产分布。公共基准提供信息但不替代。
  • 在每个比较中包含随机基线。 如果你在协调任务上不能大幅击败随机,任务可能定义不当。
  • 同时报告成本和准确性。 Token 成本和挂钟时间。运维团队需要两者。
  • 每季度重建基准。 生产分布偏移;陈旧基准误导。
  • 避免已发布基准过拟合。 如果你的团队专门为 SWE-bench Pro 数字优化,你会在生产上退化。

练习

  1. 运行 code/main.py。识别三个模拟系统中哪个有最佳每里程碑成本。它是否匹配最高原始准确性系统?
  2. 阅读 MultiAgentBench (arXiv:2503.01935)。对于你自己的任务领域,决定 MARBLE 会推荐四种拓扑中的哪种。从论文结果论证。
  3. 阅读 SWE-bench Pro 论文。什么具体使它抗污染?相同技术可以应用于你关心的其他基准吗?
  4. 阅读 COMMA 关于多模态协调的发现。设计一个你可以添加到内部基准的简单多模态协调任务。什么算作有用信号?
  5. 将基准声明检查清应用于最近一篇 Agent 论文的结果。你会给声明什么等级

关键术语

术语们怎么说实际含义
MARBLE”MultiAgentBench”ACL 2025;带里程碑 KPI 的星形/链式/形/拓扑
COMMA多模态基准”多模态对称信息协调;前沿模型难以击败随机
MedAgentBoard领域压力测试四个医疗类别;经常发现多 Agent 不主导 LLM。
AgentArch企业基准”工具 + 记忆 + 编排分层。
SWE-bench Pro”抗污染”1865 个问题,41 个仓库;约 23% vs Verified 上的 70%+(污染信号)。
里程碑成就部分信用”奖励进展而非仅最终成功的基准。
污染”基准泄露到训练中”发布后,基准漂移到训练语料;分数膨胀。
WMAC”AAAI 2026 Bridge Program Agent 协调研讨会;社区焦

延伸阅读

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式