🟣 PPO / DPO / GRPO:RLHF 后的三代对齐算法

让 LLM “听话 + 安全 + 会推理”的关键技术叫对齐。 过去 3 年它走过三代: PPO → DPO → GRPO。 每一代都把”复杂、贵、不稳”砍掉一些。

🟣 AI 深度派专栏 · 第 S2-04 期 📅 2026年9月22日 ✍️ 小敏说 AI

💡 本文要点:本文一次性讲清三代对齐算法的演进——PPO 的稳定但复杂、DPO 的优雅简化、GRPO 让推理模型成为可能。配最少的公式 + 最直观的对比。


🎯 本文导读

  • 🔹 为什么需要对齐
  • 🔹 PPO:第一代王者
  • 🔹 DPO:把 RL 干掉
  • 🔹 GRPO:推理模型的引擎
  • 🔹 三者对比一张表

一、🎯 为什么需要对齐

预训练只让模型”会预测下一个 Token”,但不知道应该说什么。

预训练后:模型可以接出黄色 / 错误 / 危险内容
对齐后:模型知道该 / 不该说什么、怎么说

💬 关键观点:RLHF(基于人类反馈的强化学习)= “教 AI 礼貌 + 安全 + 有用”。


二、🔧 第一代:PPO

流程

1. 人类标 "A 答案 vs B 答案 哪个更好" 大量对
2. 训一个"奖励模型 (RM)" 学会给答案打分
3. 用 PPO 算法让 LLM 学会"得高分"
   - 每生成一个答案,RM 打分
   - LLM 朝高分方向调整
   - 同时不能离原模型太远(KL 散度约束)

优点

  • 通用、效果好
  • ChatGPT、Claude 早期都靠这个

缺点

| 缺点 | 描述 | |—|—| | 复杂 | 同时跑 4 个模型(Actor / Critic / Reward / Reference) | | 贵 | 显存爆炸 | | 不稳 | 调参玄学 |


三、🪄 第二代:DPO(Direct Preference Optimization)

斯坦福 2023 年的神来之笔:

🎯 核心洞察:根本不需要奖励模型,也不需要 RL。直接用偏好数据”反向推”出对齐后模型。

流程

1. 人类标 "更好 vs 更差" 答案对
2. 直接最小化一个数学等价的 loss
   loss = -log σ(β · (π_θ(better) - π_θ(worse)))
3. 训完即对齐

优点

  • 简单 —— 没有 RM、没有 PPO
  • 稳 —— 像普通监督学习
  • 省 —— 只需 1 个模型 + 1 个参考模型

局限

  • 偏”模仿”,学不会”探索 / 反思”
  • 对推理任务不够给力

💬 关键观点:DPO 让”对齐”从”科研工程” 变成 “工程师都能跑”。


四、🚀 第三代:GRPO(Group Relative Policy Optimization)

DeepSeek 在 R1 上用爆的算法。

核心思想

不用奖励模型 + 不用价值模型,靠”同一题多次采样 + 组内相对优势”:

1. 对同一道题,让模型生成 N 个答案(如 N=16)
2. 用一个**可验证的规则**(如数学答案对不对)给每个答案打分
3. 计算组内的相对优势:高于均值 = 正向,低于 = 反向
4. 用这个优势更新策略

优点

| 优点 | 描述 | |—|—| | 无 RM | 数学题答案是金标准,不需要学打分 | | 省 GPU | 砍掉了 Critic 模型 | | 天然支持长推理 | 一次思考链算一个样本 | | 能涌现”反思” | R1-Zero 自发学会 aha moment |

🎯 一句话总结:GRPO = “用可验证奖励 + 组内对比” 让推理模型成为可能。


五、📊 三者对比一张表

维度 PPO DPO GRPO
是否需要 RM ✅ ❌ ❌
是否需要 Critic ✅ ❌ ❌
训练复杂度 高 低 中
数据形式 偏好对 偏好对 可验证奖励
长推理 一般 弱 强
代表应用 ChatGPT Llama 3 微调 DeepSeek R1

六、❌ 常见误区

误区 真相
❌ DPO 完全取代 PPO ✅ 各有适用,PPO 仍在
❌ GRPO 只能做数学 ✅ 任何”可验证奖励”任务都行
❌ 对齐 = 让 AI 听话 ✅ 也包括”能力提升”
❌ 不对齐的模型无用 ✅ 基座模型仍是基础

七、🔮 后续演进方向

方向 描述
过程奖励(PRM) 不只奖励最终答案,奖励中间步骤
自我对弈(Self-play) 模型自己出题自己答
多目标对齐 同时优化安全 / 有用 / 简洁
可解释对齐 让对齐过程”可审计”

📮 今日话题:你认为”AI 对齐”最难的是教它”安全”,还是教它”有用”?

🔮 下一篇预告:s2ep05《KV Cache:让 LLM 推理快 10 倍的小秘密》


🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-04 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。