从 GPT-3 的「不会听话」说起
2022 年 1 月,OpenAI 发布了一篇论文里的实验安排颇有些羞辱意味:他们把 GPT-3 用人类反馈强化学习微调成了 InstructGPT,参数只有 1.3B——是 GPT-3(175B)的 1/100。然后在人类盲评里,这个小模型的输出被系统地优先于大模型。用户要一个解释,它就好好解释;要五句话,它不会给你九段论文。真实性更高、毒性输出更少,而在公开 NLP 数据集上几乎没有能力回退。
这就是 RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)立身的证据:决定模型「好不好用」的,不只是预训练塞了多少知识,还有预训练之后的对齐训练。ChatGPT 的惊艳本质上就是 RLHF 的产品化——同样的底座模型,加不加这套流程,是两个产品。这篇 InstructGPT 论文(Ouyang et al.,2022 年 3 月)定义的三阶段流程,至今仍是后训练的骨架。
先看全景,再逐层拆:
flowchart TD
P[标注员写示范回答] --> S[阶段一 SFT 监督微调<br>约 13k 提示词]
S --> A[SFT 模型对每个提示采样 K 个回答]
A --> R[标注员两两排序]
R --> M[阶段二 奖励模型训练<br>约 33k 提示词的对比数据]
M --> O[阶段三 PPO 强化学习<br>奖励模型打分 + KL 惩罚]
O --> F[对齐后的模型]
第一步 SFT:先教会「姿态」
第一阶段是监督微调(SFT):请标注员针对真实用户提示亲手写出理想回答,再用这些示范数据微调预训练模型。InstructGPT 用了约 1.3 万条训练提示,提示词来自真实 API 用户(经同意使用);标注员是约 40 名经筛选的外包人员——招募自 Upwork 与 ScaleAI,并且要通过偏好敏感性与有害输出识别的筛选测试。人工标注的规模感可以参考更早的同类工作(Stiennon et al. 2020)的说法:训练集背后是「数千标注小时」的人力。
两个细节值得注意。第一,数据少得惊人——1.3 万条示范对千亿参数的模型来说只是轻掠而过,但足够。因为 SFT 教的不是知识,是「姿态」:回答问题的格式、语气、详略取舍。这些行为模式样本效率极高。第二,标注的一致性并不高:训练标注员之间的相互一致率约 72.6%,独立留出组的标注员约 77.3%——人类对「什么是好回答」本来就没有完全共识。这个数字后面还会回来。
第二步 奖励模型:把「更好」变成可优化的数
有了姿态还不够——SFT 只能模仿示范,无法超越示范。要让模型朝「人类偏好」持续优化,需要一个能量化「多好」的信号,这就是第二阶段的奖励模型(RM)。
数据收集方式很讲究:让 SFT 模型对每个提示采样多个回答(论文里 K 取 4-9 个),标注员把它们排序,再两两组合成对比对。这笔账展开很可观:每个提示产出的对比对数是组合数——K=4 时 6 对,K=9 时 36 对,3.3 万个提示轻易凑出数十万级别的偏好信号。为什么是「比较」而不是「打分」?因为人类给绝对分数极不可靠——今天心情不同打的分都不同,标注员之间的量表也无法对齐;但「这两个回答哪个更好」的判断稳定得多。成对比较是普通人最可靠的判断形式,这几乎是整个 RLHF 方法论最聪明的工程决策。
数学上,这些对比数据用 Bradley-Terry 模型消化:给每个回答假设一个潜在「强度」分,A 胜过 B 的概率由强度差通过 sigmoid 函数给出,训练目标就是最大化观察到的排序概率,即最小化 −log σ(r(胜者) − r(负者))。直觉上这是个「只看分差」的模型:强度差 2.0 对应约 88% 的胜率,差 0.2 就接近五五开——绝对分数没有意义,模型学的全是相对关系。实现上就是给语言模型加一个输出标量分数的头,标准做法只训一个 epoch。初始化也有讲究:InstructGPT 的 RM 从 SFT 模型初始化、移除顶层的 unembedding 层再接标量头——让它从「已经见过示范回答长什么样」的起点学偏好,而不是从零开始。
数据处理还有个防「多数暴政」的小技巧:排序数据按提示词分组,每个提示下的多个回答先在组内平均,防止某个采样了 9 个回答的热门提示在损失里支配那些只采了 4 个的提示。这类看似琐碎的工程细节,恰恰是奖励模型质量的一半来源。后来的实践还在继续演化:Llama 2 在损失里给可信度高的标注对加了 margin 项,Llama 3 规模化后却又把它去掉了——收益随规模递减,没有一劳永逸的配方。
又一个反直觉的细节:奖励模型只有 6B。论文试过更大的 RM,反而训练不稳定,且算力开销巨大。裁判不需要比选手大——它学的只是「人类在对比中暴露的偏好」,不是全部语言能力。
第三步 PPO:在 KL 看护下最大化奖励
第三阶段才是强化学习:用 PPO 算法让模型生成能拿高奖励的回答。但这里有一个稍不留神就满盘皆输的陷阱——奖励模型是代理目标,不是真实意图。模型完全可以学会写「奖励模型喜欢」而不是「人类喜欢」的回答:讨好、冗长、堆砌关键词。优化压力越大,这种过优化(Goodhart 定律的教科书案例)越严重——Gao 等人 2022 年的缩放律研究证明,奖励模型的分数一路上升,真实质量却先升后降。
InstructGPT 的防线是 KL 惩罚:PPO 的总奖励里,对每个 token 减去一项「当前模型与 SFT 参考模型的分布偏离度」。生成跑得太偏,惩罚就涨(工程上这个偏离度用采样近似估计,不要求精确可解)。直觉上,这是给优化过程拴了一根橡皮筋——你可以远离起点去追高分,但拉得越远代价越大。KL 惩罚把策略钉在「已经会说人话」的 SFT 模型附近,防止它漂移到「会骗奖励模型」的陌生区域。此外,训练时还把预训练数据的梯度以零系数混入(即不更新),减少能力遗忘。
PPO 本身的工程复杂度也值得一提:一个 RLHF 训练循环里同时活着四个模型——正在更新的策略、冻结的参考模型(算 KL)、打分的奖励模型、估计优势的价值模型(critic)——显存与调度两头承压。其中价值模型的训练又贵又不稳,而策略每走一步都要先采样一批回答、再打分、再更新,吞吐完全被采样拖住。这个痛点埋下了后来 GRPO(去掉 critic,用组内相对比较估计优势)的伏笔,DeepSeek-R1 的强化学习正是建立在 GRPO 上;再后来的 DPO 则干脆连采样和奖励模型一起绕开。强化学习的地基之争,从 RLHF 第一年就开始了。
RLHF 的边界:分歧、坍缩与对齐税
RLHF 有效,但它的三个软肋在 2022 年就写在论文里,至今没有被真正解决。
标注员的分歧是系统性的。 回看那个 72.6% 的一致率:训练目标本身就有近三成的模糊地带。不同的标注人群偏好不同——RLHF 学到的不是「人类偏好」,而是「这 40 位标注员的偏好」。谁被招募、指南怎么写,决定了模型的人格底色。这是方法论层面绕不开的政治学问题;Casper 等人的 RLHF 开放问题综述把「人类反馈的多元性如何进入训练」列为整个领域的基础难题之一。
多样性会塌缩。 后续研究(Kirk et al. 等)系统确认:RLHF 提升了平均质量,却降低了输出多样性——模型学会给「最安全的高分答案」,千篇一律。对创意场景,这是实打实的损失;这也与「讨好」(sycophancy)同根同源,关于模型怎么「刷分」,本站《奖励黑客》一文有专门分析。
对齐有税。 RLHF 会在部分基准任务上造成性能回退,社区称之为「对齐税」,后续研究专门讨论过缓解手段。InstructGPT 报告的「公开数据集回归极小」已经是精心控制(混入预训练梯度等)的结果;工程实践中,「能力与听话」的权衡始终存在,只是各家把它藏在了训练配方里。
这三个软肋也解释了后训练方法论的后续演化方向:DPO 试图绕开显式的奖励模型与 PPO(本站下一篇专文);RLVR 用可验证的奖励替代人类偏好;过程监督把奖励从「结果对不对」细化到「每一步对不对」。方向各异,但要解决的问题无一不是从 RLHF 这里第一次显形。RLHF 是所有这些的原点——它第一次把「人类觉得好」变成了可优化的训练信号。
小结
RLHF 的三步各自回答了一个问题:SFT 教格式,奖励模型把偏好变成数字,PPO 在约束下追逐数字。它真正的创新不是某个算法——SFT、Bradley-Terry、PPO 都是现成的——而是把「人类判断」这条最难量化的信号,拆成了三个可以分别工程化的环节:比较比打分可靠,裁判可以比选手小,橡皮筋防过优化。回看这个设计,最深刻的一条经验是:不要试图让机器直接理解「好」,而是把「好」的判断拆解成人类最擅长的最小动作——两个选项里挑一个。1.3B 赢过 175B 的故事里,藏着后训练时代最重要的方法论:模型的对齐质量,取决于你多会设计判断的收集方式。
参考资料
- Training language models to follow instructions with human feedback(InstructGPT,Ouyang et al. 2022):三阶段流程、数据规模与 1.3B vs 175B 结论的原始论文。
- The RLHF Book:Reward Models(Nathan Lambert):Bradley-Terry 损失推导与奖励模型工程细节,全书有 arXiv 版。
- Hugging Face RLHF 博客(Lambert et al.,2022):KL 惩罚机制最经典的通俗解释。
- Scaling Laws for Reward Model Overoptimization(Gao et al.,2022):奖励模型过优化的定量规律,KL 惩罚必要性的证据。
- DeepSeekMath(2024):GRPO 原始论文,去掉价值模型的动机与做法。
读者留言
COMMENTS 暂无还没有留言,来说第一句?