指令遵循作为对齐信号
理解InstructGPT定义的三阶段RLHF参考架构及其为何仍是2026年前沿标准
指令遵循作为对齐信号
后来对RLHF的每个批评都在反对这个管道。在你研究优化压力如何扭曲代理之前,你必须先看到代理。InstructGPT (Ouyang等人, 2022)定义了参考架构:在指令-响应对上的监督微调,在成对偏好排名上训练的奖励模型,以及带KL惩罚到SFT策略的PPO。1.3B InstructGPT优于175B GPT-3。那单一结果是2026年每个前沿实验室仍然发布RLHF形状后训练管道的原因。
类型: 学习 语言: Python (stdlib, toy三阶段管道) 前置知识: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO) 时间: ~45分钟
学习目标
- 画出InstructGPT三阶段管道:SFT → 奖励模型 → PPO。
- 解释为什么1.3B InstructGPT优于175B GPT-3。
- 说出KL惩罚的目的:防止策略偏离SFT策略太远。
- 描述为什么2026年每个前沿实验室仍使用RLHF形状管道。
问题
预训练LLM是下一token预测器。它们不遵循指令——它们补全模式。问”法国首都是什么?“可能得到”法国首都是什么?这是一个常见问题…”而非”巴黎”。对齐是让模型做你想要的,而非它统计上预测的。
概念
三阶段管道
-
SFT(监督微调):在人工编写的指令-响应对上训练。教会模型遵循指令格式。
-
奖励模型:在成对偏好排名上训练(人类标注者选择哪个响应更好)。学习偏好函数。
-
PPO(近端策略优化):对奖励模型优化策略,带KL惩罚到SFT策略。防止奖励黑客。
为什么1.3B优于175B
对齐使小模型在人类偏好上优于大未对齐模型。1.3B InstructGPT在人类评估中优于175B GPT-3。对齐是乘数,不是成本。
KL惩罚
PPO优化奖励模型分数但惩罚偏离SFT策略。没有KL惩罚,策略会找到奖励模型的漏洞(奖励黑客)。KL惩罚保持输出分布接近SFT基线。
2026年仍相关
每个前沿实验室仍使用RLHF形状管道因为:
- 奖励模型提供可扩展的偏好信号。
- PPO提供强优化。
- 替代(DPO家族)不逃出Goodhart,只是移动咬的位置。
实践
code/main.py模拟三阶段管道:SFT → 奖励模型训练 → PPO优化。
输出
本课程产生outputs/skill-rlhf-pipeline-reader.md。给定RLHF管道描述,识别每个阶段及其目的。
练习
- 画出InstructGPT三阶段管道并标注每个阶段的输入/输出。
- 为什么KL惩罚是必要的?没有它会怎样?
- 1.3B InstructGPT优于175B GPT-3意味着什么关于对齐vs规模?
- 阅读InstructGPT论文第2节。描述标注者人口和偏好数据收集。
- 比较PPO和DPO在管道复杂性上。为什么PPO仍是前沿默认?
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| SFT | ”监督微调” | 在指令-响应对上训练;教会格式 |
| 奖励模型 | ”偏好模型” | 从成对排名学习偏好函数 |
| PPO | ”策略优化” | 对奖励模型优化带KL惩罚 |
| KL惩罚 | ”偏离惩罚” | 防止策略偏离SFT基线太远 |
| 对齐 | ”做你想要的” | 让模型遵循人类意图 |