🟣 PPO / DPO / GRPO:RLHF 后的三代对齐算法
🟣 PPO / DPO / GRPO:RLHF 后的三代对齐算法
让 LLM “听话 + 安全 + 会推理”的关键技术叫对齐。 过去 3 年它走过三代: PPO → DPO → GRPO。 每一代都把”复杂、贵、不稳”砍掉一些。
🟣 AI 深度派专栏 · 第 S2-04 期 📅 2026年9月22日 ✍️ 小敏说 AI
💡 本文要点:本文一次性讲清三代对齐算法的演进——PPO 的稳定但复杂、DPO 的优雅简化、GRPO 让推理模型成为可能。配最少的公式 + 最直观的对比。
🎯 本文导读
- 🔹 为什么需要对齐
- 🔹 PPO:第一代王者
- 🔹 DPO:把 RL 干掉
- 🔹 GRPO:推理模型的引擎
- 🔹 三者对比一张表
一、🎯 为什么需要对齐
预训练只让模型”会预测下一个 Token”,但不知道应该说什么。
预训练后:模型可以接出黄色 / 错误 / 危险内容
对齐后:模型知道该 / 不该说什么、怎么说
💬 关键观点:RLHF(基于人类反馈的强化学习)= “教 AI 礼貌 + 安全 + 有用”。
二、🔧 第一代:PPO
流程
1. 人类标 "A 答案 vs B 答案 哪个更好" 大量对
2. 训一个"奖励模型 (RM)" 学会给答案打分
3. 用 PPO 算法让 LLM 学会"得高分"
- 每生成一个答案,RM 打分
- LLM 朝高分方向调整
- 同时不能离原模型太远(KL 散度约束)
优点
- 通用、效果好
- ChatGPT、Claude 早期都靠这个
缺点
| 缺点 | 描述 | |—|—| | 复杂 | 同时跑 4 个模型(Actor / Critic / Reward / Reference) | | 贵 | 显存爆炸 | | 不稳 | 调参玄学 |
三、🪄 第二代:DPO(Direct Preference Optimization)
斯坦福 2023 年的神来之笔:
🎯 核心洞察:根本不需要奖励模型,也不需要 RL。直接用偏好数据”反向推”出对齐后模型。
流程
1. 人类标 "更好 vs 更差" 答案对
2. 直接最小化一个数学等价的 loss
loss = -log σ(β · (π_θ(better) - π_θ(worse)))
3. 训完即对齐
优点
- 简单 —— 没有 RM、没有 PPO
- 稳 —— 像普通监督学习
- 省 —— 只需 1 个模型 + 1 个参考模型
局限
- 偏”模仿”,学不会”探索 / 反思”
- 对推理任务不够给力
💬 关键观点:DPO 让”对齐”从”科研工程” 变成 “工程师都能跑”。
四、🚀 第三代:GRPO(Group Relative Policy Optimization)
DeepSeek 在 R1 上用爆的算法。
核心思想
不用奖励模型 + 不用价值模型,靠”同一题多次采样 + 组内相对优势”:
1. 对同一道题,让模型生成 N 个答案(如 N=16)
2. 用一个**可验证的规则**(如数学答案对不对)给每个答案打分
3. 计算组内的相对优势:高于均值 = 正向,低于 = 反向
4. 用这个优势更新策略
优点
| 优点 | 描述 | |—|—| | 无 RM | 数学题答案是金标准,不需要学打分 | | 省 GPU | 砍掉了 Critic 模型 | | 天然支持长推理 | 一次思考链算一个样本 | | 能涌现”反思” | R1-Zero 自发学会 aha moment |
🎯 一句话总结:GRPO = “用可验证奖励 + 组内对比” 让推理模型成为可能。
五、📊 三者对比一张表
| 维度 | PPO | DPO | GRPO |
|---|---|---|---|
| 是否需要 RM | ✅ | ❌ | ❌ |
| 是否需要 Critic | ✅ | ❌ | ❌ |
| 训练复杂度 | 高 | 低 | 中 |
| 数据形式 | 偏好对 | 偏好对 | 可验证奖励 |
| 长推理 | 一般 | 弱 | 强 |
| 代表应用 | ChatGPT | Llama 3 微调 | DeepSeek R1 |
六、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ DPO 完全取代 PPO | ✅ 各有适用,PPO 仍在 |
| ❌ GRPO 只能做数学 | ✅ 任何”可验证奖励”任务都行 |
| ❌ 对齐 = 让 AI 听话 | ✅ 也包括”能力提升” |
| ❌ 不对齐的模型无用 | ✅ 基座模型仍是基础 |
七、🔮 后续演进方向
| 方向 | 描述 |
|---|---|
| 过程奖励(PRM) | 不只奖励最终答案,奖励中间步骤 |
| 自我对弈(Self-play) | 模型自己出题自己答 |
| 多目标对齐 | 同时优化安全 / 有用 / 简洁 |
| 可解释对齐 | 让对齐过程”可审计” |
📮 今日话题:你认为”AI 对齐”最难的是教它”安全”,还是教它”有用”?
🔮 下一篇预告:s2ep05《KV Cache:让 LLM 推理快 10 倍的小秘密》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-04 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。