评估与协调基准
五个 2025-2026 年基准覆盖多 Agent 评估空间。MultiAgentBench / MARBLE (ACL 2025, arXiv:2503.01935) 评估星形/链式/树形/图式拓扑与里程碑 KPI;图式最适合研究,认知规划增加约 3% 里程碑成就。COMMA 评估多模态不对...
评估与协调基准
五个 2025-2026 年基准覆盖多 Agent 评估空间。MultiAgentBench / MARBLE (ACL 2025, arXiv:2503.01935) 评估星形/链式/树形/图式拓扑与里程碑 KPI;图式最适合研究,认知规划增加约 3% 里程碑成就。COMMA 评估多模态不对称信息协调;包括 GPT-4o 在内的最先进模型难以击败随机基线。MedAgentBoard (arXiv:2505.12371) 覆盖四个医疗任务类别,经常发现多 Agent 不主导单 LLM。AgentArch (arXiv:2509.10769) 基准测试结合工具使用 + 记忆 + 编排的企业 Agent 架构。SWE-bench Pro (arXiv:2509.16941) 有 41 个仓库的 1865 个问题,跨越商业应用、B2B 服务和开发者工具;前沿模型在 Pro 上得分约 23% vs Verified 上的 70%+——对污染的现实检查。Claude Opus 4.7 (2026 年 4 月) 在 Pro 上报告 64.3%,使用显式 Agent 团队协调(尚无 Anthropic 主要来源发布——视为初步);Verdent (Agent 脚手架) 在 Verified 上达到 76.1% pass@1 (Verdent 技术报告)。AAAI 2026 Bridge Program WMAC (https://multiagents.org/2026/) 是 2026 年社区焦点。本课程基于 MARBLE 的指标,运行拓扑 vs 指标扫描,并固定”仅通过 SWE-bench Verified 不是泛化证据”规则。
类型: 学习 语言: Python (stdlib) 前置条件: Phase 16 · 15 (投票辩论拓扑), Phase 16 · 23 (失败模式) 时间: ~75 分钟
问题
当一篇论文声称”我们的多 Agent 系统更好”时,问题是:比什么更好,在什么上,如何测量?2023-2024 年的多 Agent 评估时代是混乱的——每个人都选择自己的指标、自己的基线和自己的任务集。2025-2026 年的基准施加了结构。
没有共享基准,你无法有意义地比较两个多 Agent 系统。更糟的是,没有保留基准,前沿模型可能被污染。SWE-bench Verified 在 2025 年中之前部分污染了训练语料;前沿分数膨胀;Pro 被设计为未污染的现实检查。
本课程枚举五个规范 2026 年基准,命名每个测量什么,并教你持怀疑态度阅读基准声明。
概念
MultiAgentBench (MARBLE) — ACL 2025
arXiv:2503.01935。在研究、编码和规划任务上评估四种协调拓扑(星形、链式、树形、图式)。基于里程碑的 KPI 追踪部分进展而非仅最终成功。
测量结果:
- 图式拓扑最适合研究场景;支持任意对任意批评。
- 链式最适合逐步精炼编码。
- 星形最适合快速事实整合。
- 协调税在图式上约 4 个 Agent 后出现。
- 认知规划在所有拓扑上增加约 3% 里程碑成就。
使用场景:当你想苹果对苹果比较协调拓扑时。MARBLE 仓库 (https://github.com/ulab-uiuc/MARBLE) 提供评估器。
COMMA — 多模态不对称信息
覆盖 Agent 有不同观察模态且必须在没有完整信息共享的情况下协调的任务。报告结果令人不安:包括 GPT-4o 在内的前沿模型在 COMMA 的 Agent-Agent 协作上难以击败随机基线。信号是多 Agent 模态训练不足且评估不足——LLM 合理处理单模态合作;多模态协调崩溃。
使用场景:你的系统有多模态或不对称信息协调。COMMA 的零结果是测量前先声明的警告。
MedAgentBoard — 领域压力测试
arXiv:2505.12371。四个医疗任务类别:诊断、治疗规划、报告生成、患者沟通。比较多 Agent vs 单 LLM vs 传统基于规则的系统。
发现:多 Agent 在大多数类别上不主导单 LLM。多 Agent 优势很窄——任务分解在子任务清晰可分时(诊断 + 治疗)有帮助;在协调开销超过专业化增益时(报告生成)有害。
使用场景:你的领域有明确的单 LLM 基线。如果 MedAgentBoard 的教训泛化,许多提议的多 Agent 系统是过度工程。
AgentArch — 企业架构
arXiv:2509.10769。企业设置,工具使用、记忆和编排分层在一起。基准隔离每层的贡献:添加工具有多少帮助?添加记忆?添加多 Agent 编排?
使用场景:你在设计企业 Agent 栈并需要证明每层的价值。AgentArch 帮助避免购买你无法测量价值的功能。
SWE-bench Pro — 现实检查
arXiv:2509.16941。41 个仓库的 1865 个问题,跨越商业应用、B2B 服务和开发者工具。设计为未污染,具有更晚的训练截止日期。前沿模型在 Pro 上得分约 23% vs Verified 上的 70%+。差距是污染信号。
2026 年 4 月分数:
- Claude Opus 4.7 在 Pro 上:64.3%(报告使用显式 Agent 团队协调;尚无 Anthropic 主要来源发布——视为初步)。
- Verdent (Agent 脚手架) 在 Verified 上:76.1% pass@1 (技术报告)。
- 前沿原始分数在 Pro 上无 Agent 脚手架:约 23-35% (SWE-bench Pro 论文)。
要点:“我们击败了 SWE-bench Verified”不再是能力的证据。Pro 是当前的门控测试。Agent 团队脚手架在 Pro 上产生可测量的增益(约 30-40 点差异),这是 2026 年多 Agent 协调最强的经验论证之一。
AAAI 2026 WMAC
AAAI 2026 Bridge Program — 多 Agent 协调研讨会 (https://multiagents.org/2026/)。2026 年多 Agent AI 研究的社区焦点。接受的论文和研讨会论文集是评估新方法的规范场所;对于生产决策,优先考虑 WMAC 接受的声明而非 arXiv 预印本。
持怀疑态度阅读基准声明 — 2026 年检查清单
当有人声称多 Agent 结果时:
- 哪个基准,哪个分割? SWE-bench Verified vs Pro 很重要。在错误分割上报告的数字是无价值的。
- 污染检查。 基准是否在模型训练截止日期之后发布?如果不是,谨慎对待。
- 基线比较。 vs 单 LLM 基线、vs 随机、vs 先前多 Agent 工作。不是”vs 相同系统的未调优版本。”
- 统计显著性。 N 次试验、p 值、置信区间。前沿模型高方差;单次运行误导。
- 任务多样性。 一个任务还是多个?泛化对生产很重要。
- 成本披露。 每任务 token、挂钟时间。20 倍成本的 90% 解决方案是商业决策,不是能力声明。
没有基准测量好的方面
- 长时间范围协调。 数天的挂钟交互。所有当前基准运行很短。
- 对抗性韧性。 当一个 Agent 恶意或被入侵时会发生什么?
- 部署下的漂移。 基准是静态的;生产分布偏移。
- 成本标准化性能。 大多数基准报告原始准确性,不是每美元准确性。
为你实际关心的轴构建自己的内部基准通常是正确的举措。
构建它
code/main.py 是非交互式演练:
- 在玩具任务上模拟 3 个多 Agent 系统。
- 为每个计算 MARBLE 风格的里程碑指标。
- 通过从”训练”集中保留任务运行污染检查。
- 显式与随机基线比较。
- 打印基准声明记分卡。
运行:
python3 code/main.py
预期输出:系统记分卡,包含原始准确性、里程碑成就、每任务成本、vs 随机基线增量和污染检查注释。
使用它
outputs/skill-benchmark-reader.md 阅读任何多 Agent 基准声明并应用审查检查清单。输出:等级和注意事项。
发布它
生产评估纪律:
- 构建内部基准,反映你的实际生产分布。公共基准提供信息但不替代。
- 在每个比较中包含随机基线。 如果你在协调任务上不能大幅击败随机,任务可能定义不当。
- 同时报告成本和准确性。 Token 成本和挂钟时间。运维团队需要两者。
- 每季度重建基准。 生产分布偏移;陈旧基准误导。
- 避免已发布基准过拟合。 如果你的团队专门为 SWE-bench Pro 数字优化,你会在生产上退化。
练习
- 运行
code/main.py。识别三个模拟系统中哪个有最佳每里程碑成本。它是否匹配最高原始准确性系统? - 阅读 MultiAgentBench (arXiv:2503.01935)。对于你自己的任务领域,决定 MARBLE 会推荐四种拓扑中的哪种。从论文结果论证。
- 阅读 SWE-bench Pro 论文。什么具体使它抗污染?相同技术可以应用于你关心的其他基准吗?
- 阅读 COMMA 关于多模态协调的发现。设计一个你可以添加到内部基准的简单多模态协调任务。什么算作有用信号?
- 将基准声明检查清单应用于最近一篇多 Agent 论文的头条结果。你会给声明什么等级?
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| MARBLE | ”MultiAgentBench” | ACL 2025;带里程碑 KPI 的星形/链式/树形/图式拓扑。 |
| COMMA | ”多模态基准” | 多模态不对称信息协调;前沿模型难以击败随机。 |
| MedAgentBoard | ”领域压力测试” | 四个医疗类别;经常发现多 Agent 不主导单 LLM。 |
| AgentArch | ”企业基准” | 工具 + 记忆 + 编排分层。 |
| SWE-bench Pro | ”抗污染” | 1865 个问题,41 个仓库;约 23% vs Verified 上的 70%+(污染信号)。 |
| 里程碑成就 | ”部分信用” | 奖励进展而非仅最终成功的基准。 |
| 污染 | ”基准泄露到训练中” | 发布后,基准漂移到训练语料;分数膨胀。 |
| WMAC | ”AAAI 2026 Bridge Program” | 多 Agent 协调研讨会;社区焦点。 |
延伸阅读
- MultiAgentBench / MARBLE — 带里程碑 KPI 的拓扑基准
- MARBLE repository — 参考实现
- MedAgentBoard — 领域压力测试;多 Agent 通常不主导
- AgentArch — 企业 Agent 架构
- SWE-bench leaderboards — 前沿模型的 Verified 和 Pro 分数
- AAAI 2026 WMAC — 2026 年社区焦点