🟡 预训练 / 微调 / RLHF——一个大模型是怎么炼成的
🟡 预训练 / 微调 / RLHF——一个大模型是怎么炼成的
从一坨网络垃圾,到能优雅回答你问题的 ChatGPT。 中间经历了三道工序。
🟡 AI 通识专栏 · 第 12 期 📅 2026年6月25日 ✍️ 小敏说 AI
💡 本文要点:一个大模型不是”训练一次就完事”——它要经过预训练、监督微调、RLHF 三个阶段,每个阶段解决一个完全不同的问题。本文用”养孩子”的类比把这三步讲透,并说清为什么”开源底座 + 自家微调”是当前企业级 AI 的主流路线。
🎯 本文导读
- 🔹 三个阶段对应”孩子”的三个成长期
- 🔹 预训练:把全网知识灌进脑子
- 🔹 SFT 微调:教会”听话回答”
- 🔹 RLHF:让回答符合人类偏好
- 🔹 为什么企业都在做”自家微调”
一、👶 先看结论:训练大模型 = 养一个孩子
| 阶段 | 学名 | 类比 | 目标 |
|---|---|---|---|
| 1️⃣ 预训练 | Pretraining | 让孩子从 0 到 18 岁博览群书 | 学会”什么是语言、世界、知识” |
| 2️⃣ 监督微调 | SFT(Supervised Fine-Tuning) | 培训”接电话礼仪” | 学会”如何回答问题” |
| 3️⃣ 对齐 | RLHF(Reinforcement Learning from Human Feedback) | 教”做事要让人舒服” | 学会”什么样的回答好” |
🎯 一句话总结:预训练给”知识”,微调给”格式”,RLHF 给”价值观”。三道工序缺一不可。
二、📚 预训练:把全网知识灌进脑子
预训练(Pretraining) 是最贵、最耗时、最关键的一步。
| 维度 | 数字 |
|---|---|
| 数据量 | 几 TB 到几十 TB 的文本(整个互联网精华) |
| 算力 | 数千张顶级 GPU |
| 时间 | 几周到几个月 |
| 成本 | 几千万到几亿美元 |
| 目标 | 一个非常简单的任务:预测下一个 token |
就这么简单吗? 就这么简单。
模型反复做下面这件事几千亿次:
输入:"今天天气真"
预测:"好"
对比:"好"(真实答案)
计算损失 → 调整参数
⚠️ 重要提醒:预训练之后的模型,叫 Base Model(基础模型)——它知识渊博,但不会”听话”。你问它”如何写邮件”,它可能回你”如何写邮件 的几个常见误区是……”——它在续写,不在回答。
三、🎓 SFT:教会模型”听话”
SFT(监督微调,Supervised Fine-Tuning) 用人类写的”高质量问答对”训练模型。
| 训练数据样例 |
|---|
| 输入:”写一首关于春天的诗” |
| 输出:”春风又绿江南岸,明月何时照我还……” |
| 输入:”Python 怎么读 CSV 文件?” |
输出:”使用 pandas:df = pd.read_csv('xxx.csv'),参数包括 ……” |
OpenAI 雇了大量标注员(甚至 PhD)写了几万到几十万条这样的高质量对话,让模型从”续写引擎”变成”回答引擎”。
| 维度 | 数字 |
|---|---|
| 数据量 | 几万到几十万条 |
| 算力 | 几十张 GPU 几天 |
| 成本 | 几十万到几百万美元 |
💬 关键观点:SFT 之后的模型,叫 Chat Model / Instruct Model。能回答问题,但还不够”善解人意”——它会照着字面意思回答,没有判断”什么样的答案更好”。
四、👍 RLHF:让回答符合人类偏好
RLHF(人类反馈强化学习) 是 ChatGPT 真正变得”惊艳”的关键一步。
核心思路:
| 步骤 | 在做什么 |
|---|---|
| 1️⃣ | 模型对同一个问题生成 4 个不同回答 |
| 2️⃣ | 人类对 4 个回答排序(A > C > B > D) |
| 3️⃣ | 用这些排序数据训练一个”奖励模型”(Reward Model) |
| 4️⃣ | 用奖励模型当裁判,让原模型用强化学习继续训练 |
| 5️⃣ | 模型学会”什么样的回答能得高分” |
RLHF 解决了什么具体问题?
| 问题 | RLHF 之前 | RLHF 之后 |
|---|---|---|
| 回答简洁度 | 啰嗦、套话多 | 直接、有重点 |
| 回答态度 | 生硬 / 不耐烦 | 礼貌、友善 |
| 拒绝危险请求 | 几乎不拒绝 | 学会拒绝越狱 |
| 承认不知道 | 经常硬编 | 会说”我不确定” |
🎯 一句话总结:RLHF 是把”答得对”升级到”答得让人舒服”。这是 ChatGPT 当年震惊世界的根本原因。
五、🔄 完整流程图:从一坨数据到 ChatGPT
| 阶段 | 输入 | 输出 | 谁来做 |
|---|---|---|---|
| 数据收集 | 互联网爬虫 | TB 级原始文本 | 工程团队 |
| 预训练 | 清洗后的文本 | Base Model | 算法 + 千卡集群 |
| SFT | 几万条人写问答对 | Chat Model | 算法 + 标注团队 |
| Reward Model | 人类对回答的排序 | Reward Model | 算法 + 标注团队 |
| RLHF | Chat Model + Reward Model | 最终模型 | 算法 |
| 部署 | 最终模型 | API / 产品 | 工程团队 |
⚠️ 重要提醒:整条管线下来,真正的”算法创新”占比可能只有 20%,剩下 80% 是数据、工程、标注。这就是 OpenAI / Anthropic 难被复制的原因。
六、🏢 为什么企业都在做”自家微调”
预训练一个基础模型要几亿美元,普通企业玩不起。但 微调便宜得多——
| 路线 | 成本 | 适合谁 |
|---|---|---|
| 从头预训练 | \(\) | 只有大厂 |
| 全参数微调 | $$$ | 中大型企业 |
| LoRA 微调 | $ | 大多数企业 |
| Prompt 工程 | 几乎免费 | 个人 + 小团队 |
典型企业路线:
开源底座(Llama / DeepSeek)
↓ 用自家行业数据
SFT 微调
↓ 加上业务规则
内部 RLHF / DPO
↓
企业专属模型
💬 关键观点:2026 年的企业 AI 主流路线 = “开源大模型 + 自家行业微调”。既享受巨头烧的钱(基础模型免费),又有差异化壁垒(自家数据)。
七、🆕 RLHF 之后还有什么:DPO / RLAIF / Constitutional AI
最新的演进方向:
| 方法 | 全称 | 改进点 |
|---|---|---|
| DPO | Direct Preference Optimization | 不需要训练奖励模型,直接用偏好数据 |
| RLAIF | RL from AI Feedback | 用 AI 代替人来打分,降低标注成本 |
| Constitutional AI | Anthropic 的方法 | 给模型一套”宪法原则”,自我对齐 |
🎯 RLHF 是 2022 年的工艺,它的接班人正在路上。
八、❌ 三个常见误区
| 误区 | 真相 |
|---|---|
| ❌ “我每天问 ChatGPT,它会越来越懂我” | 不会。你只是在用 system message / 历史对话辅助,模型参数没变 |
| ❌ “训练就是预训练” | 训练是个多阶段过程,预训练只是第一步 |
| ✅ “Base Model + SFT + RLHF 是当前标配三段式” | 对,所有主流 LLM 都走这条路 |
📮 今日话题
💬 如果你们公司要做一个行业 AI 助手,你会选”用 GPT-4 API”还是”开源模型自部署+微调”?
评论区聊聊你的决策维度——预算、数据安全、定制需求……
🔮 下一篇预告
🟡 AI 通识 · 第 13 期:涌现能力——为什么大到一定程度,模型就”开窍”了
模型参数从 100 亿涨到 1000 亿,会发生什么神奇的事?
🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。
📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。