前置知识: AI伦理与安全

指令遵循作为对齐信号

5 minIntermediate

理解InstructGPT定义的三阶段RLHF参考架构及其为何仍是2026年前沿标准

指令遵循作为对齐信号

后来对RLHF的每个批评都在反对这个管道。在你研究优化压力如何扭曲代理之前,你必须先看到代理。InstructGPT (Ouyang等人, 2022)定义了参考架构:在指令-响应对上的监督微调,在成对偏好排名上训练的奖励模型,以及带KL惩罚到SFT策略的PPO。1.3B InstructGPT优于175B GPT-3。那单一结果是2026年每个前沿实验室仍然发布RLHF形状后训练管道的原因。

类型: 学习 语言: Python (stdlib, toy三阶段管道) 前置知识: Phase 10 · 06 (SFT), Phase 10 · 07 (RLHF), Phase 10 · 08 (DPO) 时间: ~45分钟

学习目标

  • 画出InstructGPT三阶段管道:SFT → 奖励模型 → PPO。
  • 解释为什么1.3B InstructGPT优于175B GPT-3。
  • 说出KL惩罚的目的:防止策略偏离SFT策略太远。
  • 描述为什么2026年每个前沿实验室仍使用RLHF形状管道。

问题

预训练LLM是下一token预测器。它们不遵循指令——它们补全模式。问”法国首都是什么?“可能得到”法国首都是什么?这是一个常见问题…”而非”巴黎”。对齐是让模型做你想要的,而非它统计上预测的。

概念

三阶段管道

  1. SFT(监督微调):在人工编写的指令-响应对上训练。教会模型遵循指令格式。

  2. 奖励模型:在成对偏好排名上训练(人标注者选择哪个响应更好)。学习偏好函数。

  3. PPO(近端策略优化):对奖励模型优化策略,带KL惩罚到SFT策略。防止奖励黑客。

为什么1.3B优于175B

对齐使小模型在人偏好上优于大未对齐模型。1.3B InstructGPT在人评估中优于175B GPT-3。对齐是乘数,不是成本。

KL惩罚

PPO优化奖励模型分数但惩罚偏离SFT策略。没有KL惩罚,策略会找到奖励模型的漏洞(奖励黑客)。KL惩罚保持输出分布接近SFT基线。

2026年仍相关

每个前沿实验室仍使用RLHF形状管道因为:

  • 奖励模型提供可扩展的偏好信号。
  • PPO提供强优化。
  • 替代(DPO家族)不逃出Goodhart,只是移动咬的位置。

实践

code/main.py模拟三阶段管道:SFT → 奖励模型训练 → PPO优化。

输出

本课程产生outputs/skill-rlhf-pipeline-reader.md。给定RLHF管道描述,识别每个阶段及其目的。

练习

  1. 画出InstructGPT三阶段管道并标注每个阶段的输入/输出。
  2. 为什么KL惩罚是必要的?没有它会怎样?
  3. 1.3B InstructGPT优于175B GPT-3意味着什么关于对齐vs规模?
  4. 阅读InstructGPT论文第2节。描述标注者人口和偏好数据收集。
  5. 比较PPO和DPO在管道复杂性上。为什么PPO仍是前沿默认?

关键术语

术语常见说法实际含义
SFT”监督微调”在指令-响应对上训练;教会格式
奖励模型”偏好模型”从成对排名学习偏好函数
PPO”策略优化”对奖励模型优化带KL惩罚
KL惩罚”偏离惩罚”防止策略偏离SFT基线太远
对齐”做你想要的”让模型遵循人

延伸阅读