共识与拜占庭容错
经典分布式系统 BFT 遇上随机 LLM。2025-2026 年出现三个研究方向:CP-WBFT (arXiv:2511.10400) 通过置信度探针加权每票;DecentLLMs (arXiv:2507.14928) 采用无领导模式,并行工作者提议和几何中位数聚合;WBFT (arXiv:2...
共识与 Agent 拜占庭容错
经典分布式系统 BFT 遇上随机 LLM。2025-2026 年出现三个研究方向:CP-WBFT (arXiv:2511.10400) 通过置信度探针加权每票;DecentLLMs (arXiv:2507.14928) 采用无领导模式,并行工作者提议和几何中位数聚合;WBFT (arXiv:2505.05103) 结合加权投票与层次结构聚类,拆分核心和边缘节点。“Can AI Agents Agree?” (arXiv:2603.01213) 的诚实实证结果是,即使是标量协议在今天也是脆弱的——一个欺骗性 Agent 就可以危害 Mixture-of-Agents。BFT 是必要但不充分的。本课程构建最小 BFT 协议,注入三种 Agent 特定攻击(拜占庭谎言、谄媚从众、相关错误单一文化),并测量每种共识变体如何应对。
类型: 学习 + 构建 语言: Python (stdlib) 前置条件: Phase 16 · 07 (心智社会与辩论), Phase 16 · 13 (共享记忆) 时间: ~75 分钟
问题
你有 N 个 LLM Agent 各自产生答案。它们不一致。多数投票选错了,因为两个 Agent 是相关的(相同基础模型、相同训练数据、相同失败模式)。第三个 Agent 碰巧以新颖的方式出错——所以多数是虚假多数。
现在添加一个欺骗性 Agent:它故意撒谎。或者一个谄媚的 Agent:它同意最后说话的人。在经典 BFT 中,假设拜占庭节点是 f < n/3 的分数并任意行为。2026 年的现实是 LLM 节点即使诚实也是随机的、跨模型相关的、受彼此输出影响的。你不能将它们视为独立的伯努利投票者。
经典 BFT (PBFT, 1999) 不是错的——它是不完整的。它处理任意位翻转。它不处理”三个诚实 Agent 共享幻觉因为它们共享训练数据。“本课程从 PBFT 基础构建,并叠加三个 2025-2026 适配。
概念
经典 BFT 给了你什么
实用拜占庭容错 (Castro & Liskov, OSDI 1999) 容忍 f < n/3 拜占庭节点。协议有三个阶段(预准备、准备、提交)和两个原语(签名消息、法定证书)。在 n >= 3f + 1 个诚实或恶意节点中就单个值达成协议。
保证很强但假设:
- 独立故障。 拜占庭节点不协调。
- 诚实节点真正诚实。 诚实输出的正确性不是问题;协议只对齐分歧。
- 问题有真实答案。 对错误事实的共识仍然是共识。
LLM Agent 违反了全部三个。运行相同基础模型的两个 Agent 共享故障。“诚实”的 LLM 仍然会幻觉。在模糊问题上,“真相”是 Agent 们决定的——没有外部预言机。
三种 LLM 特定攻击
拜占庭谎言。 一个 Agent 输出故意错误的答案。如果 f < n/3,经典 BFT 处理这个。
谄媚从众。 一个 Agent 在投票前读取其他 Agent 的答案,并与最后说话的人对齐。不是恶意的,但与最大声的声音相关。经典 BFT 不阻止这个,因为 Agent 通过每个签名检查。
相关错误单一文化。 三个 Agent 共享基础模型。它们幻觉相同的错误答案。多数是错的。经典 BFT 不帮助,因为三个都”诚实地”同意。
2025-2026 的回应
CP-WBFT (arXiv:2511.10400) — 置信度探针加权 BFT。每个投票者附置信度探针到其答案(自报告概率,或单独校准模型的预测)。投票权重随置信度缩放。报告在完全图上 +85.71% BFT 改进。缓解:谄媚从众(从众 Agent 倾向于对其自愿立场低置信度)。
DecentLLMs (arXiv:2507.14928) — 无领导。工作者 Agent 并行提议,评估者 Agent 评分提议,最终答案是评分位置的几何中位数。当 f < n/2 时鲁棒。缓解:拜占庭谎言和相关错误(几何中位数对异常值鲁棒,拉向密集簇,不是模型偏向的平均)。
WBFT (arXiv:2505.05103) — 带层次结构聚类的加权 BFT。投票权重由响应质量加从历史学习的信任分数分配。将 Agent 聚类为核心和边缘;核心 Agent 必须先达成共识,边缘 Agent 跟随。缓解:可扩展性(核心共识小且快)和部分缓解单一文化(核心可以选择多样性)。
实证:“Can AI Agents Agree?” (arXiv:2603.01213)
论文测量了跨多个前沿模型的标量协议(LLM Agent 就单个数值达成一致)。发现令人不安:
- 即使没有对手,LLM Agent 在许多基准上以 30% 以上的比率在标量问题上不一致。
- 采用欺骗性人格的单一 Agent 可以将 Mixture-of-Agents 共识拉离诚实基线 40+ 个百分点。
- 不一致率与模型多样性相关——异构集成比同构更不一致(好:不相关错误)但漂移更慢(坏:更长的达成协议时间)。
要点:BFT 给你对齐输出的机制,但不告诉你对齐的输出是否正确。结合验证 (Phase 16 · 08 角色专业化)、多样性 (Phase 16 · 15 辩论变体) 和评估者 Agent (Phase 16 · 24 基准)。
核心协议,精简版
LLM Agent 的最小 BFT 轮次:
1. 任务到达;每个 Agent i 产生答案 a_i
2. 每个 Agent 附置信度探针 c_i 在 [0, 1]
3. 聚合器从所有 n 个 Agent 收集 (a_i, c_i)
4. 聚合器按语义簇分组(等价答案)
5. 聚合器为每个簇 C 计算权重:
w(C) = sum_{i in C} c_i
6. 获胜者 = 权重最大的簇,如果 max > threshold * sum(c_i)
否则:重试或升级
7. 少数簇带来源记录用于事后审计
语义聚类步骤是 LLM 特有的转折。两个答案”研究报告 4.2%“和”4.2% 提升”是同一簇。朴素的字符串相等检查会错过这个。生产中,使用便宜的嵌入模型或显式规范化。
阈值调优
threshold 参数决定何时接受何时重试。太低:你接受弱多数。太高:你永远不接受任何东西。经验范围:n=5-7 个 Agent 时 0.5-0.67,更小的 n 时更高。低于阈值时,升级到人类或不同的 Agent 集成。
共识不帮助的地方
- 模糊问题。 如果问题没有真实答案,共识是一种意见。这样称呼它。
- 复合问题。 “写代码并解释它”——两个答案。独立投票每个。
- 对抗性多轮。 如果 Agent 可以观察先前轮次并模仿 (Du 2023 辩论),它们开始不论真相地互相同意。限制轮次(通常 2-3)。
构建它
code/main.py 实现:
AgentVoter— 带有 (answer, confidence) 的脚本化策略。MajorityVote— 经典多数。CPWBFT— 带语义聚类的置信度加权投票。DecentLLMs— 评分提议上的几何中位数聚合。Scenario— 在三种攻击模式下运行每个聚合器。
攻击模式:
byzantine:一个 Agent 高置信度撒谎。sycophancy:一个 Agent 复制它看到的第一个答案,匹配置信度。monoculture:三个 Agent 共享错误答案(相关错误),中等置信度。
运行:
python3 code/main.py
预期输出:(攻击, 聚合器) -> 最终答案的表格,正确答案高亮。多数在单一文化案例中失败。CPWBFT 的置信度加权缓解谄媚。DecentLLMs 的几何中位数在单一文化不到一半时拉向诚实簇。
使用它
outputs/skill-consensus-designer.md 为多 Agent 集成设计共识协议:聚类方法、加权、阈值和次阈值轮次的升级策略。
发布它
发布任何共识机制之前:
- 至少用上述三种模式攻击测试。 你的协议应该可预测地失败,不是静默地。
- 记录每个少数簇带来源。少数簇是你相关错误的早期预警系统。
- 强制有限轮次。 没有”继续辩论直到同意”——那奖励谄媚。
- 分离协议和正确性。 共识输出到验证者;验证者独立于集成。
- 监控协议率。 急剧上升意味着从众偏差;急剧下降意味着模型漂移。
练习
- 运行
code/main.py。确认多数在单一文化攻击中失败,但 CPWBFT 在单一文化置信度低于 0.7 时部分缓解。 - 添加第四种攻击模式:静默弃权 — 一个 Agent 拒绝回答 (“我不知道”)。每个聚合器应该如何处理弃权?实现你的选择。
- 将语义聚类从字符串规范化交换为嵌入相似度(使用任何开源嵌入模型)。对谄媚攻击有什么影响?
- 阅读 CP-WBFT (arXiv:2511.10400)。实现置信度探针校准步骤(单独的校准模型检查每个 Agent 的自报告置信度)。测量在单一文化场景上的准确性增益。
- 阅读 “Can AI Agents Agree?” (arXiv:2603.01213)。复现一个简化的标量协议实验:三个 Agent,一个标量问题,欺骗性人格提示。CPWBFT 或 DecentLLMs 能捕获它吗?
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| BFT | ”拜占庭容错” | Castro-Liskov 1999 协议,容忍 f < n/3 任意故障的共识。 |
| 拜占庭 | ”任何不良行为” | 可以撒谎、丢消息、静默失败——除了安全崩溃以外的任何事。 |
| 置信度探针 | ”你有多确定?“ | 附在投票上的自报告或校准器预测的概率。 |
| 语义聚类 | ”相同答案,不同措辞” | 在计票前分组等价答案。 |
| 几何中位数 | ”鲁棒中心” | 最小化到样本点距离之和的点。对异常值鲁棒,不像均值。 |
| 单一文化 | ”相同模型,相同失败” | Agent 共享训练数据或基础模型时的相关错误。 |
| 谄媚从众 | ”同意大声的声音” | Agent 的投票偏向最先/最大声说话的人。 |
| 核心/边缘 | ”层次化 BFT” | WBFT 拆分:小核心先共识,边缘节点跟随。限制延迟。 |
延伸阅读
- Castro & Liskov — Practical Byzantine Fault Tolerance (OSDI 1999) — 基础
- CP-WBFT — Confidence-Probe Weighted BFT — 按置信度加权投票
- DecentLLMs — leaderless multi-agent consensus — 几何中位数聚合
- WBFT — Weighted BFT with Hierarchical Structure Clustering — 核心/边缘拆分以限制延迟
- Can AI Agents Agree? — 标量协议脆弱性和欺骗性人格攻击