🟣 推理模型:o1 / R1 / 思考链是什么新物种
🟣 推理模型:o1 / R1 / 思考链是什么新物种
2024 年 OpenAI 放出 o1, 不是更大的 GPT-4, 而是一个“会先思考很久再回答”的新物种。 半年后 DeepSeek R1 把它平价化、开源化。 整个 LLM 范式被改写了一次。
🟣 AI 深度派专栏 · 第 S2-03 期 📅 2026年9月19日 ✍️ 小敏说 AI
💡 本文要点:本文讲清推理模型(Reasoning Models)和普通 LLM 的本质区别、”测试时算力(Test-Time Compute)”为什么是新维度、o1 / R1 各自的训练秘密、推理模型适用 vs 不适用场景。
🎯 本文导读
- 🔹 推理模型 vs 普通 LLM
- 🔹 Test-Time Compute:新维度
- 🔹 o1 的两个秘密
- 🔹 R1 的开源逆袭
- 🔹 何时不该用推理模型
一、🤔 推理模型 vs 普通 LLM
| 维度 | 普通 LLM(GPT-4o) | 推理模型(o1 / R1) |
|---|---|---|
| 思考方式 | 快回答 | 先想很久 |
| 输出长度 | 几百 Token | 可能几万 Token(含思考) |
| 数学 / 编程 | 中等 | 顶尖 |
| 创意 / 闲聊 | 自然 | 偶尔过度思考 |
| 延迟 | 秒级 | 十秒到分钟级 |
| 成本 | 低 | 高 5-30 倍 |
💬 关键观点:推理模型不是”更大”,是”用更多算力换更准答案”。
二、⏱ Test-Time Compute:新维度
大模型过去靠两个维度 scale:
- 模型参数量(训练)
- 训练数据量
o1 引入了第三个维度:
🎯 Test-Time Compute(推理时算力):让模型在回答前”先想几秒、几分钟、几小时”。
实验显示:
- 让 o1 “思考”更久 → 数学题准确率持续上升
- 思考时间从 1 秒 → 100 秒 → 1 小时,没有饱和
⚠️ 重要提醒:这是一条新的 Scaling Law——把算力花在推理而不只是训练。
三、🧠 o1 的两个秘密(公开部分)
秘密 1:长 Chain-of-Thought
o1 内部生成的”思考链”可能上万 Token。这些对用户大部分隐藏。
秘密 2:用 RL 训练”如何思考”
不是教它”答案”,是教它”思考过程”——通过 RL(强化学习)奖励正确的思考路径。
传统:教答案
o1:教过程(探索 → 反思 → 修正 → 再尝试)
四、💥 R1 的开源逆袭
2025 年 1 月 DeepSeek 放出 R1,引爆全网:
| 突破 | 描述 |
|---|---|
| R1-Zero | 完全靠 RL 训练(无监督微调),自发学会”反思 / aha moment” |
| R1 | 加少量冷启动 SFT,效果对标 o1 |
| 开源 | 全套权重 + 论文 + 蒸馏版 |
关键技术:GRPO
(Group Relative Policy Optimization)—— 一种比 PPO 更省的 RL 算法,s2ep04 详讲。
💬 关键观点:R1 证明了”推理能力”是可以靠 RL 自发涌现的。
五、✅ 推理模型擅长 vs 不擅长
✅ 擅长
- 数学 / 物理 / 化学
- 编程算法题
- 复杂多步推理
- 科研类长任务
❌ 不擅长 / 不该用
| 场景 | 原因 | |—|—| | 写公众号 / 文案 | 过度思考反而僵硬 | | 闲聊 / 陪伴 | 慢 + 贵 | | 简单事实问答 | 杀鸡用牛刀 | | 实时对话 | 延迟太高 |
🎯 一句话总结:思考型任务用推理模型,写作 / 对话用普通 LLM。
六、🌐 主流推理模型一览
| 模型 | 出品 | 备注 |
|---|---|---|
| OpenAI o1 / o3 | OpenAI | 开创者 |
| DeepSeek R1 / R2 | DeepSeek | 开源标杆 |
| Claude 3.7 / 4 Thinking | Anthropic | 思考长度可调 |
| Gemini 2.5 Thinking | 多模态推理 | |
| Qwen QwQ / QwR | 阿里 | 国内开源 |
七、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 推理模型永远更准 | ✅ 简单题反而易”想偏” |
| ❌ 思考过程都是真的 | ✅ 思考链本身也可能幻觉 |
| ❌ 思考越长越好 | ✅ 边际递减 |
| ❌ o1 是 GPT-5 | ✅ 是平行物种 |
八、🔮 推理模型的未来
| 趋势 | 描述 |
|---|---|
| 思考时间可调 | 用户决定”想 5 秒还是 5 分钟” |
| 混合架构 | 简单题快、复杂题慢,自动切换 |
| 多模态推理 | 看图 + 看视频 + 推理 |
| Agent 必备 | 长任务规划离不开推理模型 |
📮 今日话题:你试过”让 AI 多想 1 分钟”再回答吗?体感怎么样?
🔮 下一篇预告:s2ep04《PPO / DPO / GRPO:RLHF 后的三代对齐算法》
🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-03 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。