第 5 章:对齐——从补全机器到对话助手
上一章:预训练 | 回到 学习主页 | 下一章:番外:现代 LLM 的工程魔法
预训练产出的基础模型像一位读遍了图书馆却从没学过「如何与人相处」的天才。对齐(Alignment)的目标:让模型的输出符合人的意图和偏好——听得懂指令、拒绝有害请求、回答有用。现代对齐流水线有三道主要工序。
第一道:SFT——指令微调(Supervised Fine-Tuning)
最直接的办法:教。人工收集数万到数十万条高质量的「指令-回答」对(instruction-response pairs):
指令:「把这段英文翻译成中文:The cat sat on the mat.」
理想回答:「猫坐在垫子上。」
把基础模型在这些数据上继续训练(微调,fine-tuning)。因为数据量相对预训练小得多(数万 vs 数万亿),只需几天、成本很低。效果立竿见影:模型学会了「问答」这个格式,突然能听懂指令了。这就像让那位图书馆天才做几万道有标准答案的例题,学会考试。
Note
SFT 学的是格式与行为,不是新知识。模型的知识几乎全部来自预训练;SFT 只是把它「唤醒」成对话形式。
SFT 的局限:高质量人工标注贵;而且「模仿」只能让模型接近标注者的水平,无法超越;对于「哪种回答更好」这类没有标准答案的偏好问题,SFT 束手无策。
第二道:RLHF——用人类反馈做强化学习
2022 年 OpenAI 的 InstructGPT 论文把 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)推向主流。思路是:让人类当裁判而不是老师。分三步:
- 训练奖励模型(Reward Model):让模型对同一个问题生成多个回答,人类对回答排序(或打分)。用这些偏好数据训练一个「奖励模型」——它学着给「人类会喜欢的回答」打高分。这一步把人类偏好压缩成了一个可以大规模调用的打分函数。
- 强化学习优化:用PPO(Proximal Policy Optimization)等强化学习算法,让模型生成回答 → 奖励模型打分 → 按分数调整参数,引导模型输出高分回答。
- 反复迭代:收集新输出、继续标注、继续优化。
RLHF 解决了「偏好」问题:模型学会的不只是「正确的答案」,而是「人类觉得好的答案」——更有帮助、更无害、更符合表达习惯。ChatGPT 的爆火,RLHF 功不可没。
代价也很明显:人类标注昂贵、流程复杂、PPO 训练不稳定且对超参数敏感。
第三道:DPO——跳过奖励模型的简化方案
2023 年斯坦福团队提出的 DPO(Direct Preference Optimization,直接偏好优化)发现:奖励模型这一步可以整个省掉。数学上,RLHF 的目标可以改写成一种特殊形式的损失函数,直接在偏好数据对(好回答 vs 坏回答)上优化模型本身:
输入:「写一句关于秋天的诗」
赢家回答(人类更喜欢):「落叶把秋天铺成了一条金色的河。」
输家回答:「秋天是一个季节。」
训练时只有一个目标:让模型给「赢家回答」的概率升高、「输家回答」的概率降低。不需要单独训练奖励模型,不需要 PPO,训练稳定得多。如今 DPO 及其变体(如 IPO、KTO)是开源社区对齐的事实标准,RLHF 主要用于追求极限效果的前沿模型。
对齐的成果与边界
经过 SFT + 偏好对齐,模型从「接话器」变成了能遵循指令、拒绝有害请求、回答风格讨喜的助手。但要注意:
- 对齐不增加知识,只改变行为——幻觉问题(第 1 章)依然存在,因为模型的本质还是概率续写;
- 对齐可能「训掉」一些创造力——过度对齐(对齐税,alignment tax)会让回答变得平庸、千篇一律;
- 对齐是一个持续的过程,部署后的用户反馈(红队测试、RLVR 等)会继续改进模型行为——这是 2025 年之后「推理模型」和「后训练」研究的热点。
一句话总结
对齐把基础模型变成助手:SFT 用数万条指令-回答对教会「问答格式」;RLHF 训练奖励模型 + PPO 优化让输出符合人类偏好;DPO 跳过奖励模型直接在偏好对上优化,成为开源社区主流。对齐改变行为而非知识,幻觉依然存在。
来源
- RLHF 三步流程(SFT → 奖励模型 → PPO):已核实(OpenAI 论文 Training language models to follow instructions with human feedback,InstructGPT,2022)
- DPO 由斯坦福团队 Rafailov 等人于 2023 年提出,直接优化偏好对:已核实(论文 Direct Preference Optimization: Your Language Model is Secretly a Reward Model)
- 「对齐税」(alignment tax)概念:出自 InstructGPT 论文,指对齐过程可能造成部分基准能力下降
相关笔记
- RLHF — wiki 版笔记:奖励模型与 PPO 的细节
- DPO — wiki 版笔记:直接偏好优化的数学思路
- Pre-training — 对齐之前的基础模型
- LLM — 全生命周期概览