STaR自教推理
最小的可能自改进循环存在于推理依据中。模型生成思维链,保留那些得到正确答案的,并在其上微调。这就是 STaR。V-STaR 添加验证者以改善推理时选择。Quiet-STaR 将推理依据推到每个 token。三者都有效。没有一个是魔法——循环保留了碰巧达到正确答案的任何捷径。
STaR, V-STaR, Quiet-STaR — 自教推理
最小的可能自改进循环存在于推理依据中。模型生成思维链,保留那些得到正确答案的,并在其上微调。这就是 STaR。V-STaR 添加验证者以改善推理时选择。Quiet-STaR 将推理依据推到每个 token。三者都有效。没有一个是魔法——循环保留了碰巧达到正确答案的任何捷径。
类型: 学习 语言: Python (stdlib, 自举循环模拟器) 前置条件: Phase 13 · 01-03 (推理与CoT), Phase 15 · 01 (长时间范围框架) 时间: ~60 分钟
问题
教模型推理的直接方法是收集人工编写的推理轨迹。这昂贵、缓慢,且受限于人类愿意编写多少高质量思维链。
STaR (Self-Taught Reasoner, Zelikman 等人, 2022) 问:如果模型自己编写推理依据并对照已知答案评分呢?循环是:
- 采样推理轨迹加答案。
- 如果最终答案正确,保留轨迹。
- 在保留的轨迹上微调。
- 重复。
它有效。GSM8K 和 CommonsenseQA 都在没有新人工标注的情况下改善了。但循环有内置偏差:任何产生正确答案的推理依据都被保留,无论推理本身是否合理。V-STaR (Hosseini 等人, 2024) 用学习验证者修补了这一点;Quiet-STaR (Zelikman 等人, 2024) 将想法推广到每 token 内部推理依据。
概念
STaR:在有效的上面自举
从有弱推理能力的基础模型开始。在每个训练问题上,采样推理依据加答案。如果答案匹配标签,保留 (问题, 推理依据, 答案) 三元组。在保留集上微调模型。重复。
一个转折很重要。如果模型永远无法做对一个问题,循环无法从中学习。STaR 添加合理化:对于模型失败的问题,注入正确答案作为提示,重新提示模型产生导向它的推理依据。合理化的推理依据被添加到训练集。
原始论文结果 (Zelikman 等人, 2022):GPT-J 基础模型通过重复 STaR 轮次加合理化从 5.8% 提升到 10.7%——约 5 个百分点绝对值。在 CommonsenseQA 上,STaR 训练的 GPT-J 6B 达到 72.5%,可比较于微调的 GPT-3 175B (~73%)——一个约 30 倍更大的模型在人工标注推理依据上训练。
V-STaR:用 DPO 训练验证者
STaR 丢弃不正确的推理依据。Hosseini 等人 (2024) 观察到那些也是数据:每对 (推理依据, “这是否正确”) 可以训练验证者。他们使用直接偏好优化在正确和不正确解决方案上构建排名器。在推理时,采样 N 个推理依据并选择验证者的首选。
报告增量:在 GSM8K 和 MATH 上相对先前自改进基线 +4 到 +17 个百分点,大部分增益来自使用验证者进行推理时选择而非额外生成器微调。
Quiet-STaR:每 token 内部推理依据
Zelikman 等人 (2024) 问:如果模型学会在每个 token 位置生成短内部推理依据,而不仅仅是在问题和答案之间呢?Quiet-STaR 训练模型在每个预测 token 前发出隐藏”想法”,然后通过学习权重将感知想法的预测与基线预测混合。
结果:Mistral 7B 在 GSM8K 上从 5.9% 到 10.9%,CommonsenseQA 上从 36.3% 到 47.2% 获得绝对零样本改善,无需任务特定微调。模型学会了”何时思考”——困难 token 获得更长的内部推理依据;简单的几乎不获得。
为什么三者共享安全关注
三种方法都使用最终答案作为梯度信号。通过有缺陷推理达到正确答案的推理依据——利用捷径、猜测或使用不泛化的模式——被正向强化。在分布内问题上捷径有效。在分布外问题上它静默失败。
V-STaR 的验证者通过学习排名推理依据来缓解,但验证者在相同标签集上训练。它可能学会偏好格式良好的错误推理而非诚实的确定性。更安全的设计是将 STaR 风格数据与 (a) 过程监督奖励模型(奖励中间步骤,不只是答案)和 (b) 打破简单捷径的保留 OOD 评估结合。
比较
| 方法 | 训练信号 | 推理成本 | 数据浪费 | 已知失败模式 |
|---|---|---|---|---|
| STaR | 如果正确保留 (推理依据, 答案) | 1x | 丢弃所有不正确推理依据 | 捷径推理依据 |
| STaR + 合理化 | 以上 + 正确答案提示重试 | 1x | 较少 | 合理化推理依据可能不合理 |
| V-STaR | STaR + 两类 DPO 验证者 | Nx (best-of-N) | 最少 | 验证者可以强化自信的错误 |
| Quiet-STaR | 每 token 推理依据 + 混合权重 | 1.5-3x | 最少 | 仍然是答案条件梯度 |
在 2026 栈中的位置
STaR 是旧的。但模式在 2025-2026 年到处重现。可验证数学问题上的 RL (DeepSeek-R1, Kimi-k1.5, o1) 是 STaR 的答案条件梯度信号,放大了。过程奖励模型 (Lightman 等人, 2023; OpenAI 的 “Let’s verify step by step”) 是过程监督替代方案。AlphaEvolve (Lesson 3) 是代码的 STaR,用程序评估器替代标签。Darwin Godel Machine (Lesson 4) 是 Agent 脚手架本身的 STaR。
理解 STaR 让所有这些豁然开朗。它是最小可行自改进循环。
构建它
code/main.py 在玩具算术任务上运行模拟 STaR 循环。你可以观察:
- 准确性如何在自举轮次上攀升。
- 捷径如何潜入:模拟器包含一个”懒惰”推理依据类,40% 的时间得到正确答案但泛化很差。观察 STaR 是否保留它们。
- 验证者 (V-STaR 风格) 如何在推理时帮助但无法完全修剪训练期间引入的捷径。
使用它
outputs/skill-star-loop-reviewer.md 帮助你在训练之前审计提议的自教推理流水线。
练习
-
运行模拟器。将捷径频率设为零,然后设为 0.4。两次运行之间的最终准确性差异有多大,即使两者在训练分布上都达到 >90%?
-
向模拟器添加保留 OOD 测试。从不同分布抽取问题,在分布内和 OOD 集上评估自举模型。量化差距。
-
阅读 Quiet-STaR 论文 (arXiv:2403.09629) 第 3 节。用三句话解释”思考结束” token 和混合权重头。
-
比较 STaR 的”正确则保留”过滤器与独立奖励每个推理依据步骤的过程监督替代方案。识别标注成本差异和合理的质量差异。
-
设计一个能在部署模型中捕获捷径推理依据的评估。它不需要完美——它只需要打破 STaR 循环会强化的最简单捷径。
关键术语
| 术语 | 人们怎么说 | 实际含义 |
|---|---|---|
| STaR | ”自教推理者” | 在模型生成的、得到正确答案的推理依据上微调;重复 |
| 合理化 | ”提示重试” | 注入正确答案,对基础模型失败的问题重新提示推理依据 |
| V-STaR | ”验证者 STaR” | 在正确和不正确推理依据上 DPO 训练验证者,用于推理时选择 |
| Quiet-STaR | ”每 token 推理依据” | 在每个 token 位置生成隐藏想法;与基线预测混合 |
| 答案条件梯度 | ”基于结果的信号” | 训练循环奖励最终答案,不是推理步骤 |
| 过程奖励模型 | ”步骤级验证者” | 在每步正确性上训练的奖励模型,不是结果——与 STaR 对比 |
| 捷径推理依据 | ”正确答案,错误推理” | 通过不泛化模式达到标签的推理依据;STaR 保留这些 |
延伸阅读
- Zelikman et al. (2022). STaR: Bootstrapping Reasoning With Reasoning — 原始论文
- Hosseini et al. (2024). V-STaR: Training Verifiers for Self-Taught Reasoners — 添加 DPO 验证者用于推理时选择
- Zelikman et al. (2024). Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking — 每 token 内部推理依据
- Lightman et al. (2023). Let’s Verify Step by Step — 过程奖励模型,替代梯度信号
- DeepSeek-R1 paper (arXiv:2501.12948) — 可验证任务上的 RL,STaR 扩展到前沿训练