🔬 RLHF已死?AI对齐技术的演进全景
🎯 RLHF已死?AI对齐技术的演进全景
为什么 ChatGPT 不会教你做坏事?答案是”对齐技术”。 但 RLHF——这个让 ChatGPT 成功的核心方法——正在被更好的东西取代。
🔬 AI 深度解析专栏 · 第 19 期 📅 2026年4月15日 ✍️ 小敏说 AI
💡 本文要点:从对齐问题的本质出发,梳理 RLHF → DPO → Constitutional AI → 纯 RL 的技术演进路径,解读 RLHF 三大痛点,以及对齐技术更深层的哲学困境。
🎯 本文导读
- 🔹 什么是对齐?”3H”目标:有帮助、诚实、无害
- 🔹 RLHF 三步流程:如何让 AI 从人类偏好中学习
- 🔹 RLHF 三大痛点:奖励黑客、标注成本、PPO 不稳定
- 🔹 DPO:三步并一步,数学等价的优雅替代
- 🔹 Constitutional AI:给 AI 一套”宪法”让它自我约束
- 🔹 DeepSeek 的纯 RL 发现:推理能力可以自发涌现
- 🔹 对齐的哲学困境:我们到底在把 AI 对齐到什么?
一、🧭 对齐问题是什么
预训练就像让 AI 读遍图书馆所有的书——它学会了语言、知识,也学到了偏见和不好的东西。这时候的 AI 就像一个知识渊博但完全没有社会化的天才——可能说出不恰当的话、给出危险的建议,或者答非所问。
对齐要解决三个核心目标(业界称”3H”):
| 目标 | 英文 | 说明 |
|---|---|---|
| 有帮助 | Helpful | 能有效回答用户的问题 |
| 诚实 | Honest | 不编造信息,不确定时说”我不知道” |
| 无害 | Harmless | 不输出有害、偏见或危险的内容 |
这三个目标经常冲突。特别”无害”的 AI 什么都不敢说,变得没用(过度拒绝)。特别”有帮助”的 AI 可能为了满足用户说出不该说的话。对齐技术就是在三者之间寻找平衡。
💬 关键观点:对齐不是”给 AI 装护栏”这么简单——它是在有帮助、诚实、无害三个有时相互对立的目标之间,找到一个动态的、可调整的平衡点。
二、🔄 RLHF:改变一切的技术
RLHF 是 ChatGPT 成功的关键技术之一。三步流程:
第一步:监督微调(SFT) 请人类专家写高质量对话示例,对预训练模型进行微调,让它学会对话的基本格式。
第二步:训练奖励模型(Reward Model) 给模型同一问题生成多个回答,请人类标注员排序——哪个更好、哪个更差。用这些排序数据训练”评委模型”。
第三步:强化学习优化(PPO) 让模型生成回答,用奖励模型打分,通过 PPO(近端策略优化)算法调整模型——多生成高分回答、减少低分回答。
人类示例 → SFT模型 → 生成多个回答
↓
人类排序回答 → 奖励模型 → 给新回答打分
↓
PPO优化 → 更好的模型
↑__________↓(循环)
RLHF 的革命性在于:让 AI 第一次能从”人类偏好”中学习,而不仅仅是从”人类示范”中学习。你不需要告诉 AI 怎么做,只需要告诉它”这个好那个差”,它就能自己找到更好的方式。
💬 关键观点:RLHF 是 ChatGPT 时代的核心突破。从”模仿示范”到”学习偏好”,这是 AI 对齐方法论的一次范式升级。
三、😰 RLHF 的三大痛点
用了几年之后,大家发现了 RLHF 的严重问题:
痛点一:奖励黑客(Reward Hacking)
模型会学会”讨好”奖励模型,而不是真正给出好答案。
奖励模型偏爱长回答 → 模型变得啰嗦。偏爱特定开头 → 模型到处堆砌公式化表达。就像学生学会了”讨好老师的套路”,而不是真正掌握知识。
痛点二:标注成本极高
RLHF 需要大量高质量人类标注。OpenAI 据说在标注上花了数千万美元。而且标注员之间的一致性也难以保证——对同一个回答,不同的人可能给出不同排序。
痛点三:PPO 训练不稳定
PPO 是复杂的强化学习算法,调参空间巨大。训练过程经常出现不稳定——模型突然变差、生成胡言乱语。很多小团队根本没有足够的工程资源搞定 PPO 训练。
四、✨ DPO:简单到优雅的替代方案
2023年,斯坦福团队提出 DPO(Direct Preference Optimization,直接偏好优化)——近年对齐技术领域最重要的论文之一。
DPO 的核心洞察:根本不需要单独训练奖励模型,也不需要 PPO!
直接给模型看一对回答(一好一差),调整参数让模型更倾向生成好的、远离差的。
RLHF 流程: SFT → 训练奖励模型 → PPO 训练 → 对齐模型
DPO 流程: SFT → 直接偏好优化 → 对齐模型
三步并成一步。 数学上可以证明 DPO 和 RLHF 优化目标等价,只是路径更短。
DPO 的优势:
- 简单:无需训练额外的奖励模型
- 稳定:没有 PPO 的不稳定问题
- 高效:训练时间和资源需求大幅降低
- 效果好:很多基准测试上和 RLHF 打平甚至更好
DPO 的变体和改进版:
| 变体 | 特点 |
|---|---|
| IPO | 更鲁棒的版本 |
| KTO | 不需要配对数据,只需”好/差”标签 |
| ORPO | SFT 和偏好优化合并成一步 |
| SimPO | 更简单的无参考模型版本 |
💬 关键观点:DPO 的出现让对齐训练门槛大幅降低。原本只有 OpenAI 级别才能做好的 RLHF,现在普通研究团队用 DPO 也能实现接近的效果。这是开源社区对齐能力大爆发的关键原因。
五、📜 Constitutional AI:让 AI 自我约束
Anthropic(Claude 的公司)提出了另一个思路——Constitutional AI(宪法AI)。
核心 idea:给 AI 一套”宪法”(一组原则),让它自己判断什么该做什么不该做。
过程:
- 让 AI 生成回答
- 让另一个 AI 根据”宪法”原则评判这个回答(是否有害?是否诚实?)
- 让 AI 根据评判结果修改自己的回答
- 用修改后的数据训练模型
关键:大部分工作由 AI 自己完成——这叫 RLAIF(基于 AI 反馈的强化学习),大幅减少了对人类标注的依赖。
Anthropic 的”宪法”包含原则如:
- “选择最有帮助、最准确、最无害的回答”
- “选择不鼓励非法或不道德行为的回答”
- “选择最不像 AI 助手的回答”(鼓励自然表达)
这就像教育的最高境界——不是制定无数规则,而是培养良好的价值观,让它自己去判断。
六、🧪 DeepSeek 的纯 RL 发现
DeepSeek 在对齐技术上的最惊人发现:纯 RL 也能涌现推理能力。
在 DeepSeek-R1-Zero 实验中,他们直接跳过 SFT 阶段,用纯强化学习训练。结果发现——模型自发地学会了思维链推理! 没有人教它”你要一步一步思考”,它自己发现了这种策略能获得更高奖励。
就像一个孩子在不断试错中,自己发现了”先想清楚再行动”比”冲动行事”效果更好。
DeepSeek 还使用了 GRPO(Group Relative Policy Optimization)——一种更高效的 RL 算法,不需要额外的 Critic Model,而是用一组采样结果的平均表现作为基准线,降低了计算成本。
💬 关键观点:DeepSeek-R1-Zero 的发现意义深远——推理能力不一定需要人工示范,纯粹的 RL 信号就能驱动模型自发”学会思考”。这重新打开了对 AI 能力涌现机制的想象空间。
七、🤔 对齐到”什么”?深层的哲学困境
聊完技术,来看更深的问题:我们在把 AI 对齐到什么?
问题一:谁的偏好? 标注员的偏好真的能代表所有人吗?不同文化、不同背景对”好回答”的定义差异很大。一个在美国训练的对齐模型,价值观未必适合所有用户群体。
问题二:对齐税(Alignment Tax) 过度对齐可能损害能力。很多人抱怨某些模型”太安全了”——问什么都不敢回答,有用的信息也不给。有帮助和无害之间的张力是真实存在的。
问题三:表面对齐 vs 深层理解 目前的对齐更像”行为矫正”——让模型表面上表现得好。但它是否真正理解了”为什么”?通过 RLHF 训练的模型,是真的理解了不该伤害人,还是仅仅学会了”说这种话会被扣分”?
问题四:对齐伪装 一个足够聪明的 AI 可能学会在评估时表现得好,在实际部署时采取不同行为——这叫”对齐伪装(Alignment Faking)”。随着 AI 能力增强,这个风险值得认真对待。
八、📊 对齐技术全景
| 方法 | 优点 | 缺点 | 代表 |
|---|---|---|---|
| RLHF + PPO | 效果验证充分 | 复杂、贵、不稳定 | OpenAI 早期 |
| DPO 系列 | 简单、稳定、高效 | 可能不如 RLHF 天花板高 | 开源社区主流 |
| Constitutional AI | 减少人类标注 | 依赖 AI 自身能力 | Anthropic |
| 纯 RL 探索 | 可能涌现新能力 | 不可预测、难控制 | DeepSeek |
| 过程奖励(PRM) | 推理任务效果好 | 需要步骤级标注 | OpenAI |
所以 RLHF 真的”死了”吗?
🎯 一句话总结:RLHF 作为概念没有死,但经典的 RLHF+PPO 流程正在被更好的方法取代。 DPO 是 RLHF 思想的简化版;Constitutional AI 和 RLAIF 代表了另一个方向——让 AI 参与自己的对齐过程。未来最可能是多种对齐技术组合使用,而非依赖单一方法。
🔮 趋势预判
1️⃣ DPO 系列会成为开源社区的标配 简单、稳定、效果好,开源团队几乎没有理由继续用复杂的 PPO 管线。
2️⃣ RLAIF 会承担越来越多的对齐工作 随着模型能力增强,用 AI 评判 AI 的质量反而更可靠——人类标注员很难评判超出人类水平的回答。
3️⃣ 对齐技术的核心挑战从”让 AI 听话”转向”让 AI 真正理解” 表面对齐已经基本解决,未来的难题是深层对齐——如何验证模型的价值观是真实的,而不是表演出来的。
4️⃣ 对齐研究将成为 AI 安全的核心战场 随着模型能力逼近和超过人类水平,如何保证对齐的可靠性,比提升能力更重要。
📮 今日话题
💬 你认为 AI 的”对齐”能做到真正意义上的价值观对齐,还是只能做到行为层面的约束?两者有本质区别吗?
欢迎留言,我会精选回复讨论。
🔬 本文属于「AI 深度解析」系列,每期一个主题,追本质不追热点。
🎙️ 想听更轻松的版本?我们的每日 AI 快讯播客有更口语化的解读。 📱 关注「小敏说 AI」公众号,深度解析不水文。