🟡 预训练 / 微调 / RLHF——一个大模型是怎么炼成的

从一坨网络垃圾,到能优雅回答你问题的 ChatGPT。 中间经历了三道工序。

🟡 AI 通识专栏 · 第 12 期 📅 2026年6月25日 ✍️ 小敏说 AI

💡 本文要点:一个大模型不是”训练一次就完事”——它要经过预训练、监督微调、RLHF 三个阶段,每个阶段解决一个完全不同的问题。本文用”养孩子”的类比把这三步讲透,并说清为什么”开源底座 + 自家微调”是当前企业级 AI 的主流路线。


🎯 本文导读

  • 🔹 三个阶段对应”孩子”的三个成长期
  • 🔹 预训练:把全网知识灌进脑子
  • 🔹 SFT 微调:教会”听话回答”
  • 🔹 RLHF:让回答符合人类偏好
  • 🔹 为什么企业都在做”自家微调”

一、👶 先看结论:训练大模型 = 养一个孩子

阶段 学名 类比 目标
1️⃣ 预训练 Pretraining 让孩子从 0 到 18 岁博览群书 学会”什么是语言、世界、知识”
2️⃣ 监督微调 SFT(Supervised Fine-Tuning) 培训”接电话礼仪” 学会”如何回答问题”
3️⃣ 对齐 RLHF(Reinforcement Learning from Human Feedback) 教”做事要让人舒服” 学会”什么样的回答好”

🎯 一句话总结:预训练给”知识”,微调给”格式”,RLHF 给”价值观”。三道工序缺一不可。


二、📚 预训练:把全网知识灌进脑子

预训练(Pretraining) 是最贵、最耗时、最关键的一步。

维度 数字
数据量 几 TB 到几十 TB 的文本(整个互联网精华)
算力 数千张顶级 GPU
时间 几周到几个月
成本 几千万到几亿美元
目标 一个非常简单的任务:预测下一个 token

就这么简单吗? 就这么简单。

模型反复做下面这件事几千亿次:

输入:"今天天气真"
预测:"好"
对比:"好"(真实答案)
计算损失 → 调整参数

⚠️ 重要提醒:预训练之后的模型,叫 Base Model(基础模型)——它知识渊博,但不会”听话”。你问它”如何写邮件”,它可能回你”如何写邮件 的几个常见误区是……”——它在续写,不在回答。


三、🎓 SFT:教会模型”听话”

SFT(监督微调,Supervised Fine-Tuning) 用人类写的”高质量问答对”训练模型。

训练数据样例
输入:”写一首关于春天的诗”
输出:”春风又绿江南岸,明月何时照我还……”
输入:”Python 怎么读 CSV 文件?”
输出:”使用 pandas:df = pd.read_csv('xxx.csv'),参数包括 ……”

OpenAI 雇了大量标注员(甚至 PhD)写了几万到几十万条这样的高质量对话,让模型从”续写引擎”变成”回答引擎”。

维度 数字
数据量 几万到几十万条
算力 几十张 GPU 几天
成本 几十万到几百万美元

💬 关键观点:SFT 之后的模型,叫 Chat Model / Instruct Model。能回答问题,但还不够”善解人意”——它会照着字面意思回答,没有判断”什么样的答案更好”。


四、👍 RLHF:让回答符合人类偏好

RLHF(人类反馈强化学习) 是 ChatGPT 真正变得”惊艳”的关键一步。

核心思路:

步骤 在做什么
1️⃣ 模型对同一个问题生成 4 个不同回答
2️⃣ 人类对 4 个回答排序(A > C > B > D)
3️⃣ 用这些排序数据训练一个”奖励模型”(Reward Model)
4️⃣ 用奖励模型当裁判,让原模型用强化学习继续训练
5️⃣ 模型学会”什么样的回答能得高分”

RLHF 解决了什么具体问题?

问题 RLHF 之前 RLHF 之后
回答简洁度 啰嗦、套话多 直接、有重点
回答态度 生硬 / 不耐烦 礼貌、友善
拒绝危险请求 几乎不拒绝 学会拒绝越狱
承认不知道 经常硬编 会说”我不确定”

🎯 一句话总结:RLHF 是把”答得对”升级到”答得让人舒服”。这是 ChatGPT 当年震惊世界的根本原因。


五、🔄 完整流程图:从一坨数据到 ChatGPT

阶段 输入 输出 谁来做
数据收集 互联网爬虫 TB 级原始文本 工程团队
预训练 清洗后的文本 Base Model 算法 + 千卡集群
SFT 几万条人写问答对 Chat Model 算法 + 标注团队
Reward Model 人类对回答的排序 Reward Model 算法 + 标注团队
RLHF Chat Model + Reward Model 最终模型 算法
部署 最终模型 API / 产品 工程团队

⚠️ 重要提醒:整条管线下来,真正的”算法创新”占比可能只有 20%,剩下 80% 是数据、工程、标注。这就是 OpenAI / Anthropic 难被复制的原因。


六、🏢 为什么企业都在做”自家微调”

预训练一个基础模型要几亿美元,普通企业玩不起。但 微调便宜得多——

路线 成本 适合谁
从头预训练 \(\) 只有大厂
全参数微调 $$$ 中大型企业
LoRA 微调 $ 大多数企业
Prompt 工程 几乎免费 个人 + 小团队

典型企业路线:

开源底座(Llama / DeepSeek)
  ↓ 用自家行业数据
SFT 微调
  ↓ 加上业务规则
内部 RLHF / DPO
  ↓
企业专属模型

💬 关键观点:2026 年的企业 AI 主流路线 = “开源大模型 + 自家行业微调”。既享受巨头烧的钱(基础模型免费),又有差异化壁垒(自家数据)。


七、🆕 RLHF 之后还有什么:DPO / RLAIF / Constitutional AI

最新的演进方向:

方法 全称 改进点
DPO Direct Preference Optimization 不需要训练奖励模型,直接用偏好数据
RLAIF RL from AI Feedback 用 AI 代替人来打分,降低标注成本
Constitutional AI Anthropic 的方法 给模型一套”宪法原则”,自我对齐

🎯 RLHF 是 2022 年的工艺,它的接班人正在路上。


八、❌ 三个常见误区

误区 真相
❌ “我每天问 ChatGPT,它会越来越懂我” 不会。你只是在用 system message / 历史对话辅助,模型参数没变
❌ “训练就是预训练” 训练是个多阶段过程,预训练只是第一步
✅ “Base Model + SFT + RLHF 是当前标配三段式” 对,所有主流 LLM 都走这条路

📮 今日话题

💬 如果你们公司要做一个行业 AI 助手,你会选”用 GPT-4 API”还是”开源模型自部署+微调”?

评论区聊聊你的决策维度——预算、数据安全、定制需求……


🔮 下一篇预告

🟡 AI 通识 · 第 13 期:涌现能力——为什么大到一定程度,模型就”开窍”了

模型参数从 100 亿涨到 1000 亿,会发生什么神奇的事?


🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。

📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。