前置知识: AI Agent

共识与拜占庭容错

14 minIntermediate

经典分布式系统 BFT 遇上随机 LLM。2025-2026 年出现三个研究方向:CP-WBFT (arXiv:2511.10400) 通过置信度探针加权每票;DecentLLMs (arXiv:2507.14928) 采用无领导模式,并行工作者提议和几何中位数聚合;WBFT (arXiv:2...

共识与 Agent 拜占庭容错

经典分布式系统 BFT 遇上随机 LLM。2025-2026 年出现三个研究方向:CP-WBFT (arXiv:2511.10400) 通过置信度探针加权每票;DecentLLMs (arXiv:2507.14928) 采用无领导模式,并行工作者提议和几何中位数聚合;WBFT (arXiv:2505.05103) 结合加权投票与层次结构聚,拆分核心和边缘节点。“Can AI Agents Agree?” (arXiv:2603.01213) 的诚实实证结果是,即使是标量协议在今天也是脆弱的——一个欺骗性 Agent 就可以危害 Mixture-of-Agents。BFT 是必要但不充分的。本课程构建最小 BFT 协议,注入三种 Agent 特定攻击(拜占庭谎言、谄媚从众、相关错误单一文化),并测量每种共识变体如何应对。

类型: 学习 + 构建 语言: Python (stdlib) 前置条件: Phase 16 · 07 (心智社会与辩论), Phase 16 · 13 (共享记忆) 时间: ~75 分钟

问题

你有 N 个 LLM Agent 各自产生答案。它们不一致。多数投票选错了,因为两个 Agent 是相关的(相同基础模型、相同训练数据、相同失败模式)。第三个 Agent 碰巧以新颖的方式出错——所以多数是虚假多数。

现在添加一个欺骗性 Agent:它故意撒谎。或者一个谄媚的 Agent:它同意最后说话的人。在经典 BFT 中,假设拜占庭节点是 f < n/3 的分数并任意行为。2026 年的现实是 LLM 节点即使诚实也是随机的、跨模型相关的、受彼此输出影响的。你不能将它们视为独立的伯努利投票者。

经典 BFT (PBFT, 1999) 不是错的——它是不完整的。它处理任意位翻转。它不处理”三个诚实 Agent 共享幻觉因为它们共享训练数据。“本课程从 PBFT 基础构建,并叠加三个 2025-2026 适配。

概念

经典 BFT 给了你什么

实用拜占庭容错 (Castro & Liskov, OSDI 1999) 容忍 f < n/3 拜占庭节点。协议有三个阶段(预准备、准备、提交)和两个原语(签名消息、法定证书)。在 n >= 3f + 1 个诚实或恶意节点中就单个值达成协议。

保证很强但假设:

  1. 独立故障。 拜占庭节点不协调。
  2. 诚实节点真正诚实。 诚实输出的正确性不是问题;协议只对齐分歧。
  3. 问题有真实答案。 对错误事实的共识仍然是共识。

LLM Agent 违反了全部三个。运行相同基础模型的两个 Agent 共享故障。“诚实”的 LLM 仍然会幻觉。在模糊问题上,“真相”是 Agent 们决定的——没有外部预言机。

三种 LLM 特定攻击

拜占庭谎言。 一个 Agent 输出故意错误的答案。如果 f < n/3,经典 BFT 处理这个。

谄媚从众。 一个 Agent 在投票前读取其他 Agent 的答案,并与最后说话的人对齐。不是恶意的,但与最大声的声音相关。经典 BFT 不阻止这个,因为 Agent 通过每个签名检查。

相关错误单一文化。 三个 Agent 共享基础模型。它们幻觉相同的错误答案。多数是错的。经典 BFT 不帮助,因为三个都”诚实地”同意。

2025-2026 的回应

CP-WBFT (arXiv:2511.10400) — 置信度探针加权 BFT。每个投票者附置信度探针到其答案(自报告概率,或单独校准模型的预测)。投票权重随置信度缩放。报告在完全上 +85.71% BFT 改进。缓解:谄媚从众(从众 Agent 倾向于对其自愿立场低置信度)。

DecentLLMs (arXiv:2507.14928) — 无领导。工作者 Agent 并行提议,评估者 Agent 评分提议,最终答案是评分位置的几何中位数。当 f < n/2 时鲁棒。缓解:拜占庭谎言和相关错误(几何中位数对异常值鲁棒,拉向密集簇,不是模型偏向的平均)。

WBFT (arXiv:2505.05103) — 带层次结构聚的加权 BFT。投票权重由响应质量加从历史学习的信任分数分配。将 Agent 聚为核心和边缘;核心 Agent 必须先达成共识,边缘 Agent 跟随。缓解:可扩展性(核心共识小且快)和部分缓解单一文化(核心可以选择多样性)。

实证:“Can AI Agents Agree?” (arXiv:2603.01213)

论文测量了跨多个前沿模型的标量协议(LLM Agent 就单个数值达成一致)。发现令人不安:

  • 即使没有对手,LLM Agent 在许多基准上以 30% 以上的比率在标量问题上不一致。
  • 采用欺骗性人格的单一 Agent 可以将 Mixture-of-Agents 共识拉离诚实基线 40+ 个百分点。
  • 不一致率与模型多样性相关——异构集成比同构更不一致(好:不相关错误)但漂移更慢(坏:更长的达成协议时间)。

要点:BFT 给你对齐输出的机制,但不告诉你对齐的输出是否正确。结合验证 (Phase 16 · 08 角色专业化)、多样性 (Phase 16 · 15 辩论变体) 和评估者 Agent (Phase 16 · 24 基准)。

核心协议,精简版

LLM Agent 的最小 BFT 轮次:

1. 任务到达;每个 Agent i 产生答案 a_i
2. 每个 Agent 附置信度探针 c_i 在 [0, 1]
3. 聚合器从所有 n 个 Agent 收集 (a_i, c_i)
4. 聚合器按语义簇分组(等价答案)
5. 聚合器为每个簇 C 计算权重:
     w(C) = sum_{i in C} c_i
6. 获胜者 = 权重最大的簇,如果 max > threshold * sum(c_i)
   否则:重试或升级
7. 少数簇带来源记录用于事后审计

语义聚步骤是 LLM 特有的转折。两个答案”研究报告 4.2%“和”4.2% 提升”是同一簇。朴素的字符串相等检查会错过这个。生产中,使用便宜的嵌入模型或显式规范化。

阈值调优

threshold 参数决定何时接受何时重试。太低:你接受弱多数。太高:你永远不接受任何东西。经验范围n=5-7 个 Agent 时 0.5-0.67,更小的 n 时更高。低于阈值时,升级到人或不同的 Agent 集成。

共识不帮助的地方

  • 模糊问题。 如果问题没有真实答案,共识是一种意见。这样称呼它。
  • 复合问题。 “写代码并解释它”——两个答案。独立投票每个。
  • 对抗性多轮。 如果 Agent 可以观察先前轮次并模仿 (Du 2023 辩论),它们开始不论真相地互相同意。限制轮次(通常 2-3)。

构建它

code/main.py 实现:

  • AgentVoter — 带有 (answer, confidence) 的脚本化策略。
  • MajorityVote — 经典多数。
  • CPWBFT — 带语义聚的置信度加权投票。
  • DecentLLMs — 评分提议上的几何中位数聚合。
  • Scenario — 在三种攻击模式下运行每个聚合器。

攻击模式:

  1. byzantine:一个 Agent 高置信度撒谎。
  2. sycophancy:一个 Agent 复制它看到的第一个答案,匹配置信度。
  3. monoculture:三个 Agent 共享错误答案(相关错误),中等置信度。

运行:

python3 code/main.py

预期输出:(攻击, 聚合器) -> 最终答案的表格,正确答案高亮。多数在单一文化案例中失败。CPWBFT 的置信度加权缓解谄媚。DecentLLMs 的几何中位数在单一文化不到一半时拉向诚实簇。

使用它

outputs/skill-consensus-designer.md 为多 Agent 集成设计共识协议:聚方法、加权、阈值和次阈值轮次的升级策略。

发布它

发布任何共识机制之前:

  • 至少用上述三种模式攻击测试。 你的协议应该可预测地失败,不是静默地。
  • 记录每个少数簇带来源。少数簇是你相关错误的早期预警系统。
  • 强制有限轮次。 没有”继续辩论直到同意”——那奖励谄媚。
  • 分离协议和正确性。 共识输出到验证者;验证者独立于集成。
  • 监控协议率。 急剧上升意味着从众偏差;急剧下降意味着模型漂移。

练习

  1. 运行 code/main.py。确认多数在单一文化攻击中失败,但 CPWBFT 在单一文化置信度低于 0.7 时部分缓解。
  2. 添加第四种攻击模式:静默弃权 — 一个 Agent 拒绝回答 (“我不知道”)。每个聚合器应该如何处理弃权?实现你的选择。
  3. 将语义聚从字符串规范化交换为嵌入相似度(使用任何开源嵌入模型)。对谄媚攻击有什么影响?
  4. 阅读 CP-WBFT (arXiv:2511.10400)。实现置信度探针校准步骤(单独的校准模型检查每个 Agent 的自报告置信度)。测量在单一文化场景上的准确性增益。
  5. 阅读 “Can AI Agents Agree?” (arXiv:2603.01213)。复现一个简化的标量协议实验:三个 Agent,一个标量问题,欺骗性人格提示。CPWBFT 或 DecentLLMs 能捕获它吗?

关键术语

术语人们怎么说实际含义
BFT”拜占庭容错”Castro-Liskov 1999 协议,容忍 f < n/3 任意故障的共识。
拜占庭”任何不良行为”可以撒谎、丢消息、静默失败——除了安全崩溃以外的任何事。
置信度探针”你有多确定?“附在投票上的自报告或校准器预测的概率。
语义聚”相同答案,不同措辞”在计票前分组等价答案。
几何中位数”鲁棒中心”最小化到样本点距离之和的点。对异常值鲁棒,不像均值。
单一文化”相同模型,相同失败”Agent 共享训练数据或基础模型时的相关错误。
谄媚从众”同意大声的声音”Agent 的投票偏向最先/最大声说话的人。
核心/边缘”层次化 BFT”WBFT 拆分:小核心先共识,边缘节点跟随。限制延迟。

延伸阅读