前置知识: AI Agent

STaR自教推理

00:00
11 min Intermediate

最小的可能自改进循环存在于推理依据中。模型生成思维链,保留那些得到正确答案的,并在其上微调。这就是 STaR。V-STaR 添加验证者以改善推理时选择。Quiet-STaR 将推理依据推到每个 token。三者都有效。没有一个是魔法——循环保留了碰巧达到正确答案的任何捷径。

STaR, V-STaR, Quiet-STaR — 自教推理

最小的可能自改进循环存在于推理依据中。模型生成思维链,保留那些得到正确答案的,并在其上微调。这就是 STaR。V-STaR 添加验证者以改善推理时选择。Quiet-STaR 将推理依据推到每个 token。三者都有效。没有一个是魔法——循环保留了碰巧达到正确答案的任何捷径。

类型: 学习 语言: Python (stdlib, 自举循环模拟器) 前置条件: Phase 13 · 01-03 (推理与CoT), Phase 15 · 01 (长时间范围框架) 时间: ~60 分钟

问题

教模型推理的直接方法是收集人工编写的推理轨迹。这昂贵、缓慢,且受限于人类愿意编写多少高质量思维链。

STaR (Self-Taught Reasoner, Zelikman 等人, 2022) 问:如果模型自己编写推理依据并对照已知答案评分呢?循环是:

  1. 采样推理轨迹加答案。
  2. 如果最终答案正确,保留轨迹。
  3. 在保留的轨迹上微调。
  4. 重复。

它有效。GSM8K 和 CommonsenseQA 都在没有新人工标注的情况下改善了。但循环有内置偏差:任何产生正确答案的推理依据都被保留,无论推理本身是否合理。V-STaR (Hosseini 等人, 2024) 用学习验证者修补了这一点;Quiet-STaR (Zelikman 等人, 2024) 将想法推广到每 token 内部推理依据。

概念

STaR:在有效的上面自举

从有弱推理能力的基础模型开始。在每个训练问题上,采样推理依据加答案。如果答案匹配标签,保留 (问题, 推理依据, 答案) 三元组。在保留集上微调模型。重复。

一个转折很重要。如果模型永远无法做对一个问题,循环无法从中学习。STaR 添加合理化:对于模型失败的问题,注入正确答案作为提示,重新提示模型产生导向它的推理依据。合理化的推理依据被添加到训练集。

原始论文结果 (Zelikman 等人, 2022):GPT-J 基础模型通过重复 STaR 轮次加合理化从 5.8% 提升到 10.7%——约 5 个百分点绝对值。在 CommonsenseQA 上,STaR 训练的 GPT-J 6B 达到 72.5%,可比较于微调的 GPT-3 175B (~73%)——一个约 30 倍更大的模型在人工标注推理依据上训练。

V-STaR:用 DPO 训练验证者

STaR 丢弃不正确的推理依据。Hosseini 等人 (2024) 观察到那些也是数据:每对 (推理依据, “这是否正确”) 可以训练验证者。他们使用直接偏好优化在正确和不正确解决方案上构建排名器。在推理时,采样 N 个推理依据并选择验证者的首选。

报告增量:在 GSM8K 和 MATH 上相对先前自改进基线 +4 到 +17 个百分点,大部分增益来自使用验证者进行推理时选择而非额外生成器微调。

Quiet-STaR:每 token 内部推理依据

Zelikman 等人 (2024) 问:如果模型学会在每个 token 位置生成短内部推理依据,而不仅仅是在问题和答案之间呢?Quiet-STaR 训练模型在每个预测 token 前发出隐藏”想法”,然后通过学习权重将感知想法的预测与基线预测混合。

结果:Mistral 7B 在 GSM8K 上从 5.9% 到 10.9%,CommonsenseQA 上从 36.3% 到 47.2% 获得绝对零样本改善,无需任务特定微调。模型学会了”何时思考”——困难 token 获得更长的内部推理依据;简单的几乎不获得。

为什么三者共享安全关注

三种方法都使用最终答案作为梯度信号。通过有缺陷推理达到正确答案的推理依据——利用捷径、猜测或使用不泛化的模式——被正向强化。在分布内问题上捷径有效。在分布外问题上它静默失败。

V-STaR 的验证者通过学习排名推理依据来缓解,但验证者在相同标签集上训练。它可能学会偏好格式良好的错误推理而非诚实的确定性。更安全的设计是将 STaR 风格数据与 (a) 过程监督奖励模型(奖励中间步骤,不只是答案)和 (b) 打破简单捷径的保留 OOD 评估结合。

比较

方法训练信号推理成本数据浪费已知失败模式
STaR如果正确保留 (推理依据, 答案)1x丢弃所有不正确推理依据捷径推理依据
STaR + 合理化以上 + 正确答案提示重试1x较少合理化推理依据可能不合理
V-STaRSTaR + 两类 DPO 验证者Nx (best-of-N)最少验证者可以强化自信的错误
Quiet-STaR每 token 推理依据 + 混合权重1.5-3x最少仍然是答案条件梯度

在 2026 栈中的位置

STaR 是旧的。但模式在 2025-2026 年到处重现。可验证数学问题上的 RL (DeepSeek-R1, Kimi-k1.5, o1) 是 STaR 的答案条件梯度信号,放大了。过程奖励模型 (Lightman 等人, 2023; OpenAI 的 “Let’s verify step by step”) 是过程监督替代方案。AlphaEvolve (Lesson 3) 是代码的 STaR,用程序评估器替代标签。Darwin Godel Machine (Lesson 4) 是 Agent 脚手架本身的 STaR。

理解 STaR 让所有这些豁然开朗。它是最小可行自改进循环。

构建它

code/main.py 在玩具算术任务上运行模拟 STaR 循环。你可以观察:

  • 准确性如何在自举轮次上攀升。
  • 捷径如何潜入:模拟器包含一个”懒惰”推理依据类,40% 的时间得到正确答案但泛化很差。观察 STaR 是否保留它们。
  • 验证者 (V-STaR 风格) 如何在推理时帮助但无法完全修剪训练期间引入的捷径。

使用它

outputs/skill-star-loop-reviewer.md 帮助你在训练之前审计提议的自教推理流水线。

练习

  1. 运行模拟器。将捷径频率设为零,然后设为 0.4。两次运行之间的最终准确性差异有多大,即使两者在训练分布上都达到 >90%?

  2. 向模拟器添加保留 OOD 测试。从不同分布抽取问题,在分布内和 OOD 集上评估自举模型。量化差距。

  3. 阅读 Quiet-STaR 论文 (arXiv:2403.09629) 第 3 节。用三句话解释”思考结束” token 和混合权重头。

  4. 比较 STaR 的”正确则保留”过滤器与独立奖励每个推理依据步骤的过程监督替代方案。识别标注成本差异和合理的质量差异。

  5. 设计一个能在部署模型中捕获捷径推理依据的评估。它不需要完美——它只需要打破 STaR 循环会强化的最简单捷径。

关键术语

术语人们怎么说实际含义
STaR”自教推理者”在模型生成的、得到正确答案的推理依据上微调;重复
合理化”提示重试”注入正确答案,基础模型失败问题重新提示推理依据
V-STaR验证者 STaR”在正确和不正确推理依据上 DPO 训练验证者,用于推理选择
Quiet-STaR”每 token 推理依据”在每个 token 位置生成隐藏想法;与基线预测混合
答案条件”基于结果信号训练奖励最终答案,不是推理步骤
过程奖励模型步骤验证者”在每步正确性上训练的奖励模型,不是结果——与 STaR
捷径推理依据”正确答案,错误推理”通过泛化模式达到标签推理依据;STaR 保留这些

延伸阅读

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式