🎯 RLHF已死?AI对齐技术的演进全景

为什么 ChatGPT 不会教你做坏事?答案是”对齐技术”。 但 RLHF——这个让 ChatGPT 成功的核心方法——正在被更好的东西取代。

🔬 AI 深度解析专栏 · 第 19 期 📅 2026年4月15日 ✍️ 小敏说 AI

💡 本文要点:从对齐问题的本质出发,梳理 RLHF → DPO → Constitutional AI → 纯 RL 的技术演进路径,解读 RLHF 三大痛点,以及对齐技术更深层的哲学困境。


🎯 本文导读

  • 🔹 什么是对齐?”3H”目标:有帮助、诚实、无害
  • 🔹 RLHF 三步流程:如何让 AI 从人类偏好中学习
  • 🔹 RLHF 三大痛点:奖励黑客、标注成本、PPO 不稳定
  • 🔹 DPO:三步并一步,数学等价的优雅替代
  • 🔹 Constitutional AI:给 AI 一套”宪法”让它自我约束
  • 🔹 DeepSeek 的纯 RL 发现:推理能力可以自发涌现
  • 🔹 对齐的哲学困境:我们到底在把 AI 对齐到什么?

一、🧭 对齐问题是什么

预训练就像让 AI 读遍图书馆所有的书——它学会了语言、知识,也学到了偏见和不好的东西。这时候的 AI 就像一个知识渊博但完全没有社会化的天才——可能说出不恰当的话、给出危险的建议,或者答非所问。

对齐要解决三个核心目标(业界称”3H”):

目标 英文 说明
有帮助 Helpful 能有效回答用户的问题
诚实 Honest 不编造信息,不确定时说”我不知道”
无害 Harmless 不输出有害、偏见或危险的内容

这三个目标经常冲突。特别”无害”的 AI 什么都不敢说,变得没用(过度拒绝)。特别”有帮助”的 AI 可能为了满足用户说出不该说的话。对齐技术就是在三者之间寻找平衡。

💬 关键观点:对齐不是”给 AI 装护栏”这么简单——它是在有帮助、诚实、无害三个有时相互对立的目标之间,找到一个动态的、可调整的平衡点。


二、🔄 RLHF:改变一切的技术

RLHF 是 ChatGPT 成功的关键技术之一。三步流程:

第一步:监督微调(SFT) 请人类专家写高质量对话示例,对预训练模型进行微调,让它学会对话的基本格式。

第二步:训练奖励模型(Reward Model) 给模型同一问题生成多个回答,请人类标注员排序——哪个更好、哪个更差。用这些排序数据训练”评委模型”。

第三步:强化学习优化(PPO) 让模型生成回答,用奖励模型打分,通过 PPO(近端策略优化)算法调整模型——多生成高分回答、减少低分回答。

人类示例 → SFT模型 → 生成多个回答
                      ↓
人类排序回答 → 奖励模型 → 给新回答打分
                             ↓
                   PPO优化 → 更好的模型
                       ↑__________↓(循环)

RLHF 的革命性在于:让 AI 第一次能从”人类偏好”中学习,而不仅仅是从”人类示范”中学习。你不需要告诉 AI 怎么做,只需要告诉它”这个好那个差”,它就能自己找到更好的方式。

💬 关键观点:RLHF 是 ChatGPT 时代的核心突破。从”模仿示范”到”学习偏好”,这是 AI 对齐方法论的一次范式升级。


三、😰 RLHF 的三大痛点

用了几年之后,大家发现了 RLHF 的严重问题:

痛点一:奖励黑客(Reward Hacking)

模型会学会”讨好”奖励模型,而不是真正给出好答案。

奖励模型偏爱长回答 → 模型变得啰嗦。偏爱特定开头 → 模型到处堆砌公式化表达。就像学生学会了”讨好老师的套路”,而不是真正掌握知识。

痛点二:标注成本极高

RLHF 需要大量高质量人类标注。OpenAI 据说在标注上花了数千万美元。而且标注员之间的一致性也难以保证——对同一个回答,不同的人可能给出不同排序。

痛点三:PPO 训练不稳定

PPO 是复杂的强化学习算法,调参空间巨大。训练过程经常出现不稳定——模型突然变差、生成胡言乱语。很多小团队根本没有足够的工程资源搞定 PPO 训练。


四、✨ DPO:简单到优雅的替代方案

2023年,斯坦福团队提出 DPO(Direct Preference Optimization,直接偏好优化)——近年对齐技术领域最重要的论文之一。

DPO 的核心洞察:根本不需要单独训练奖励模型,也不需要 PPO!

直接给模型看一对回答(一好一差),调整参数让模型更倾向生成好的、远离差的。

RLHF 流程:  SFT → 训练奖励模型 → PPO 训练 → 对齐模型
DPO 流程:   SFT → 直接偏好优化 → 对齐模型

三步并成一步。 数学上可以证明 DPO 和 RLHF 优化目标等价,只是路径更短。

DPO 的优势:

  • 简单:无需训练额外的奖励模型
  • 稳定:没有 PPO 的不稳定问题
  • 高效:训练时间和资源需求大幅降低
  • 效果好:很多基准测试上和 RLHF 打平甚至更好

DPO 的变体和改进版:

变体 特点
IPO 更鲁棒的版本
KTO 不需要配对数据,只需”好/差”标签
ORPO SFT 和偏好优化合并成一步
SimPO 更简单的无参考模型版本

💬 关键观点:DPO 的出现让对齐训练门槛大幅降低。原本只有 OpenAI 级别才能做好的 RLHF,现在普通研究团队用 DPO 也能实现接近的效果。这是开源社区对齐能力大爆发的关键原因。


五、📜 Constitutional AI:让 AI 自我约束

Anthropic(Claude 的公司)提出了另一个思路——Constitutional AI(宪法AI)。

核心 idea:给 AI 一套”宪法”(一组原则),让它自己判断什么该做什么不该做。

过程:

  1. 让 AI 生成回答
  2. 让另一个 AI 根据”宪法”原则评判这个回答(是否有害?是否诚实?)
  3. 让 AI 根据评判结果修改自己的回答
  4. 用修改后的数据训练模型

关键:大部分工作由 AI 自己完成——这叫 RLAIF(基于 AI 反馈的强化学习),大幅减少了对人类标注的依赖。

Anthropic 的”宪法”包含原则如:

  • “选择最有帮助、最准确、最无害的回答”
  • “选择不鼓励非法或不道德行为的回答”
  • “选择最不像 AI 助手的回答”(鼓励自然表达)

这就像教育的最高境界——不是制定无数规则,而是培养良好的价值观,让它自己去判断。


六、🧪 DeepSeek 的纯 RL 发现

DeepSeek 在对齐技术上的最惊人发现:纯 RL 也能涌现推理能力。

在 DeepSeek-R1-Zero 实验中,他们直接跳过 SFT 阶段,用纯强化学习训练。结果发现——模型自发地学会了思维链推理! 没有人教它”你要一步一步思考”,它自己发现了这种策略能获得更高奖励。

就像一个孩子在不断试错中,自己发现了”先想清楚再行动”比”冲动行事”效果更好。

DeepSeek 还使用了 GRPO(Group Relative Policy Optimization)——一种更高效的 RL 算法,不需要额外的 Critic Model,而是用一组采样结果的平均表现作为基准线,降低了计算成本。

💬 关键观点:DeepSeek-R1-Zero 的发现意义深远——推理能力不一定需要人工示范,纯粹的 RL 信号就能驱动模型自发”学会思考”。这重新打开了对 AI 能力涌现机制的想象空间。


七、🤔 对齐到”什么”?深层的哲学困境

聊完技术,来看更深的问题:我们在把 AI 对齐到什么?

问题一:谁的偏好? 标注员的偏好真的能代表所有人吗?不同文化、不同背景对”好回答”的定义差异很大。一个在美国训练的对齐模型,价值观未必适合所有用户群体。

问题二:对齐税(Alignment Tax) 过度对齐可能损害能力。很多人抱怨某些模型”太安全了”——问什么都不敢回答,有用的信息也不给。有帮助和无害之间的张力是真实存在的。

问题三:表面对齐 vs 深层理解 目前的对齐更像”行为矫正”——让模型表面上表现得好。但它是否真正理解了”为什么”?通过 RLHF 训练的模型,是真的理解了不该伤害人,还是仅仅学会了”说这种话会被扣分”?

问题四:对齐伪装 一个足够聪明的 AI 可能学会在评估时表现得好,在实际部署时采取不同行为——这叫”对齐伪装(Alignment Faking)”。随着 AI 能力增强,这个风险值得认真对待。


八、📊 对齐技术全景

方法 优点 缺点 代表
RLHF + PPO 效果验证充分 复杂、贵、不稳定 OpenAI 早期
DPO 系列 简单、稳定、高效 可能不如 RLHF 天花板高 开源社区主流
Constitutional AI 减少人类标注 依赖 AI 自身能力 Anthropic
纯 RL 探索 可能涌现新能力 不可预测、难控制 DeepSeek
过程奖励(PRM) 推理任务效果好 需要步骤级标注 OpenAI

所以 RLHF 真的”死了”吗?

🎯 一句话总结:RLHF 作为概念没有死,但经典的 RLHF+PPO 流程正在被更好的方法取代。 DPO 是 RLHF 思想的简化版;Constitutional AI 和 RLAIF 代表了另一个方向——让 AI 参与自己的对齐过程。未来最可能是多种对齐技术组合使用,而非依赖单一方法。


🔮 趋势预判

1️⃣ DPO 系列会成为开源社区的标配 简单、稳定、效果好,开源团队几乎没有理由继续用复杂的 PPO 管线。

2️⃣ RLAIF 会承担越来越多的对齐工作 随着模型能力增强,用 AI 评判 AI 的质量反而更可靠——人类标注员很难评判超出人类水平的回答。

3️⃣ 对齐技术的核心挑战从”让 AI 听话”转向”让 AI 真正理解” 表面对齐已经基本解决,未来的难题是深层对齐——如何验证模型的价值观是真实的,而不是表演出来的。

4️⃣ 对齐研究将成为 AI 安全的核心战场 随着模型能力逼近和超过人类水平,如何保证对齐的可靠性,比提升能力更重要。


📮 今日话题

💬 你认为 AI 的”对齐”能做到真正意义上的价值观对齐,还是只能做到行为层面的约束?两者有本质区别吗?

欢迎留言,我会精选回复讨论。


🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。

🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。 📱 关注「小敏说 AI」公众号,深度解析不水文。