🟡 涌现能力——为什么大到一定程度,模型就"开窍"了
🟡 涌现能力——为什么大到一定程度,模型就”开窍”了
100 亿参数时,模型只会复读。 1000 亿参数时,它突然会推理了。 这就是”涌现”,AI 圈最迷人的现象之一。
🟡 AI 通识专栏 · 第 13 期 📅 2026年6月27日 ✍️ 小敏说 AI
💡 本文要点:涌现(Emergence)指的是——某些能力在模型规模到达临界点前几乎为零,越过临界点后突然出现。本文讲清三件事:涌现到底是真现象还是测量错觉、Scaling Law 为什么让所有大厂疯狂烧钱、为什么 ChatGPT 看起来”会思考”但不等于真的思考。
🎯 本文导读
- 🔹 一张图看懂”涌现”
- 🔹 涌现的真实案例:三类能力
- 🔹 Scaling Law:可预测的”力大砖飞”
- 🔹 涌现是真现象还是测量错觉
- 🔹 涌现 ≠ 理解:保持清醒的判断
一、📈 先看结论:能力曲线不是平滑的
正常曲线长这样:
能力 ▲
│ ╱
│ ╱
│ ╱
│ ╱
│ ╱
└─────────────► 参数量
但 LLM 的能力曲线长这样:
能力 ▲
│ ╱──────
│ │ 涌现点
│ │
│ │
│_____________│
└─────────────► 参数量
(10B以下几乎为 0,到了 100B 突然能做了)
🎯 一句话总结:涌现 = 量变到质变。某些能力在小模型上完全做不了,大模型突然就会了,而且没有中间态。
二、🎬 涌现的真实案例:三类能力
Google 2022 年的论文《Emergent Abilities of Large Language Models》记录了137 种涌现能力。挑三个最直观的:
1️⃣ 多步推理(Chain-of-Thought)
- 小模型:直接给答案,常常错
- 大模型:用”让我们一步步思考”prompt → 准确率暴涨
2️⃣ 上下文学习(In-Context Learning)
- 小模型:你给几个例子也没用,按训练数据回答
- 大模型:你给 3 个例子,它就地学会新模式
3️⃣ 跟随指令(Instruction Following)
- 小模型:照字面续写
- 大模型:理解你的”意图”,做出合适回应
| 能力 | 涌现临界点 | 典型模型 |
|---|---|---|
| 简单算术 | ~10B 参数 | GPT-2 大版本 |
| 多步推理 | ~62B 参数 | PaLM 62B |
| 跟随复杂指令 | ~100B 参数 | GPT-3、PaLM |
| 工具使用 | ~175B 参数 | GPT-3.5+ |
💬 关键观点:涌现现象没法事先预测——你不知道下一个能力是 200B 还是 500B 才出现。这就是大厂疯狂堆参数的根本动机:不堆,永远不知道自己错过了什么。
三、📊 Scaling Law:可预测的”力大砖飞”
虽然具体能力的涌现不可预测,但整体损失(Loss)的下降是可预测的。
2020 年 OpenAI 发表的 Scaling Law 论文揭示:
模型损失 ∝ 1 / (参数量^a × 数据量^b × 算力^c)
翻译成大白话:
| 增加 | 模型性能 |
|---|---|
| 参数 × 10 | 损失下降一个固定幅度 |
| 数据 × 10 | 损失下降一个固定幅度 |
| 算力 × 10 | 损失下降一个固定幅度 |
🎯 这条规律可怕在哪? 它告诉行业:你只要敢花钱堆参数,模型就一定会变强。这是 OpenAI、Anthropic 一轮轮融资几百亿美元的”理论靠山”。
四、🤔 涌现是真现象还是测量错觉?
2023 年斯坦福一篇论文《Are Emergent Abilities of Large Language Models a Mirage?》提出反对意见:
“涌现可能是评估指标造成的错觉。”
举例:
- 用 “完全正确才得 1 分” 这种指标 → 看起来是突然涌现
- 用 “部分正确给部分分” 这种指标 → 看起来是平滑提升
真实情况:
| 评估方式 | 看到的曲线 |
|---|---|
| 严格 0/1 评分 | 突然涌现 |
| 软评分(Token 概率) | 平滑提升 |
⚠️ 重要提醒:涌现部分是真的(确实存在能力上的质变),部分是测量的伪影(曲线看起来突然)。真相在两者之间。
五、🚫 涌现 ≠ 理解:保持清醒的判断
涌现能力让模型看起来”会思考”,但本质上:
| 看起来像 | 实际上是 |
|---|---|
| 推理 | 模仿训练数据里的推理过程 |
| 创造 | 重组训练数据里的元素 |
| 理解 | 统计意义上的”高概率响应” |
| 反思 | 被 prompt 引导的额外生成 |
💬 关键观点:涌现的是能力表现,不是意识 / 理解 / 智能本身。模型还是那个”超级模仿器”,只是模仿得更长链、更连贯、更接近人。
真正的”理解”需要什么?
- 因果推理(不只是相关性)
- 持续学习(不只是冻结参数)
- 世界模型(不只是文本模型)
- 主体性(不只是反应式回答)
这些目前都还不在 LLM 的能力包里。
六、💰 涌现的商业含义:所有人都在赌下一个临界点
| 公司 | 赌的是什么 |
|---|---|
| OpenAI | GPT-5/6 在某个规模会涌现”自主科学发现” |
| Anthropic | Claude 在更大规模会涌现”安全性自我约束” |
| Gemini 在多模态规模会涌现”跨模态推理” | |
| Meta | Llama 在开源规模放大会涌现”工程通用性” |
🎯 本质上:整个 AI 行业都在赌 Scaling Law 还没失效。一旦失效(也叫”撞墙”),整个估值体系会崩塌。
目前的迹象:
- 2024-2025 年开始有”Scaling Law 撞墙”的讨论
- GPT-4 → GPT-5 的提升幅度,远不如 GPT-3 → GPT-4
- 业界开始转向”测试时计算“(让模型回答时思考更久)作为新增长方向
七、❌ 三个常见误区
| 误区 | 真相 |
|---|---|
| ❌ “涌现 = 模型开始有意识” | 涌现是能力表现,不是意识 |
| ❌ “Scaling Law 会一直成立” | 已有撞墙迹象,业界在找新路径 |
| ✅ “大模型 + 涌现 + Scaling Law 是 2020s AI 浪潮的三大基石” | 对,理解这三个就理解了 OpenAI 的赌注 |
八、🎁 一段能让你”理性看待 AI 进展”的话术
下次有人说”GPT-X 已经有意识了”,你可以这样回应:
“目前我们看到的’惊艳能力’确实是真的——这叫涌现。但涌现的是能力表现,不等于真正的理解、意识或目标。
模型本质上还是在做’下一个 token 预测’,只是规模到了,模仿得足够长、足够连贯,让人感觉它在思考。
真正的判断标准是:它能不能解决训练数据里完全没见过的、需要新颖因果推理的问题。 目前的答案是:还差得远。”
💬 关键观点:既不神化、也不否定——这是技术圈最稀缺的判断力。
📮 今日话题
💬 你认为 Scaling Law 会在什么时候彻底”撞墙”?
是参数到几万亿、是能源跟不上、是数据耗尽,还是其他原因?评论区聊聊。
🔮 下一篇预告
🟡 AI 通识 · 第 14 期:幻觉是怎么来的?AI 为什么一本正经胡说八道
涌现的另一面,就是幻觉。它不是 bug,是大模型架构的副作用。
🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。
📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。