🟣 推理模型:o1 / R1 / 思考链是什么新物种

2024 年 OpenAI 放出 o1, 不是更大的 GPT-4, 而是一个“会先思考很久再回答”的新物种。 半年后 DeepSeek R1 把它平价化、开源化。 整个 LLM 范式被改写了一次。

🟣 AI 深度派专栏 · 第 S2-03 期 📅 2026年9月19日 ✍️ 小敏说 AI

💡 本文要点:本文讲清推理模型(Reasoning Models)和普通 LLM 的本质区别、”测试时算力(Test-Time Compute)”为什么是新维度、o1 / R1 各自的训练秘密、推理模型适用 vs 不适用场景。


🎯 本文导读

  • 🔹 推理模型 vs 普通 LLM
  • 🔹 Test-Time Compute:新维度
  • 🔹 o1 的两个秘密
  • 🔹 R1 的开源逆袭
  • 🔹 何时不该用推理模型

一、🤔 推理模型 vs 普通 LLM

维度 普通 LLM(GPT-4o) 推理模型(o1 / R1)
思考方式 快回答 先想很久
输出长度 几百 Token 可能几万 Token(含思考)
数学 / 编程 中等 顶尖
创意 / 闲聊 自然 偶尔过度思考
延迟 秒级 十秒到分钟级
成本 低 高 5-30 倍

💬 关键观点:推理模型不是”更大”,是”用更多算力换更准答案”。


二、⏱ Test-Time Compute:新维度

大模型过去靠两个维度 scale:

  1. 模型参数量(训练)
  2. 训练数据量

o1 引入了第三个维度:

🎯 Test-Time Compute(推理时算力):让模型在回答前”先想几秒、几分钟、几小时”。

实验显示:

  • 让 o1 “思考”更久 → 数学题准确率持续上升
  • 思考时间从 1 秒 → 100 秒 → 1 小时,没有饱和

⚠️ 重要提醒:这是一条新的 Scaling Law——把算力花在推理而不只是训练。


三、🧠 o1 的两个秘密(公开部分)

秘密 1:长 Chain-of-Thought

o1 内部生成的”思考链”可能上万 Token。这些对用户大部分隐藏。

秘密 2:用 RL 训练”如何思考”

不是教它”答案”,是教它”思考过程”——通过 RL(强化学习)奖励正确的思考路径。

传统:教答案
o1:教过程(探索 → 反思 → 修正 → 再尝试)

四、💥 R1 的开源逆袭

2025 年 1 月 DeepSeek 放出 R1,引爆全网:

突破 描述
R1-Zero 完全靠 RL 训练(无监督微调),自发学会”反思 / aha moment”
R1 加少量冷启动 SFT,效果对标 o1
开源 全套权重 + 论文 + 蒸馏版

关键技术:GRPO

(Group Relative Policy Optimization)—— 一种比 PPO 更省的 RL 算法,s2ep04 详讲。

💬 关键观点:R1 证明了”推理能力”是可以靠 RL 自发涌现的。


五、✅ 推理模型擅长 vs 不擅长

✅ 擅长

  • 数学 / 物理 / 化学
  • 编程算法题
  • 复杂多步推理
  • 科研类长任务

❌ 不擅长 / 不该用

| 场景 | 原因 | |—|—| | 写公众号 / 文案 | 过度思考反而僵硬 | | 闲聊 / 陪伴 | 慢 + 贵 | | 简单事实问答 | 杀鸡用牛刀 | | 实时对话 | 延迟太高 |

🎯 一句话总结:思考型任务用推理模型,写作 / 对话用普通 LLM。


六、🌐 主流推理模型一览

模型 出品 备注
OpenAI o1 / o3 OpenAI 开创者
DeepSeek R1 / R2 DeepSeek 开源标杆
Claude 3.7 / 4 Thinking Anthropic 思考长度可调
Gemini 2.5 Thinking Google 多模态推理
Qwen QwQ / QwR 阿里 国内开源

七、❌ 常见误区

误区 真相
❌ 推理模型永远更准 ✅ 简单题反而易”想偏”
❌ 思考过程都是真的 ✅ 思考链本身也可能幻觉
❌ 思考越长越好 ✅ 边际递减
❌ o1 是 GPT-5 ✅ 是平行物种

八、🔮 推理模型的未来

趋势 描述
思考时间可调 用户决定”想 5 秒还是 5 分钟”
混合架构 简单题快、复杂题慢,自动切换
多模态推理 看图 + 看视频 + 推理
Agent 必备 长任务规划离不开推理模型

📮 今日话题:你试过”让 AI 多想 1 分钟”再回答吗?体感怎么样?

🔮 下一篇预告:s2ep04《PPO / DPO / GRPO:RLHF 后的三代对齐算法》


🟣 本系列是「小敏说 AI · AI 深度派专栏」第 S2-03 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。