🟡 涌现能力——为什么大到一定程度,模型就”开窍”了

100 亿参数时,模型只会复读。 1000 亿参数时,它突然会推理了。 这就是”涌现”,AI 圈最迷人的现象之一。

🟡 AI 通识专栏 · 第 13 期 📅 2026年6月27日 ✍️ 小敏说 AI

💡 本文要点:涌现(Emergence)指的是——某些能力在模型规模到达临界点前几乎为零,越过临界点后突然出现。本文讲清三件事:涌现到底是真现象还是测量错觉、Scaling Law 为什么让所有大厂疯狂烧钱、为什么 ChatGPT 看起来”会思考”但不等于真的思考。


🎯 本文导读

  • 🔹 一张图看懂”涌现”
  • 🔹 涌现的真实案例:三类能力
  • 🔹 Scaling Law:可预测的”力大砖飞”
  • 🔹 涌现是真现象还是测量错觉
  • 🔹 涌现 ≠ 理解:保持清醒的判断

一、📈 先看结论:能力曲线不是平滑的

正常曲线长这样:

能力 ▲
     │              ╱
     │           ╱
     │        ╱
     │     ╱
     │  ╱
     └─────────────► 参数量

但 LLM 的能力曲线长这样:

能力 ▲
     │              ╱──────
     │             │  涌现点
     │             │
     │             │
     │_____________│
     └─────────────► 参数量
       (10B以下几乎为 0,到了 100B 突然能做了)

🎯 一句话总结:涌现 = 量变到质变。某些能力在小模型上完全做不了,大模型突然就会了,而且没有中间态。


二、🎬 涌现的真实案例:三类能力

Google 2022 年的论文《Emergent Abilities of Large Language Models》记录了137 种涌现能力。挑三个最直观的:

1️⃣ 多步推理(Chain-of-Thought)

  • 小模型:直接给答案,常常错
  • 大模型:用”让我们一步步思考”prompt → 准确率暴涨

2️⃣ 上下文学习(In-Context Learning)

  • 小模型:你给几个例子也没用,按训练数据回答
  • 大模型:你给 3 个例子,它就地学会新模式

3️⃣ 跟随指令(Instruction Following)

  • 小模型:照字面续写
  • 大模型:理解你的”意图”,做出合适回应
能力 涌现临界点 典型模型
简单算术 ~10B 参数 GPT-2 大版本
多步推理 ~62B 参数 PaLM 62B
跟随复杂指令 ~100B 参数 GPT-3、PaLM
工具使用 ~175B 参数 GPT-3.5+

💬 关键观点:涌现现象没法事先预测——你不知道下一个能力是 200B 还是 500B 才出现。这就是大厂疯狂堆参数的根本动机:不堆,永远不知道自己错过了什么。


三、📊 Scaling Law:可预测的”力大砖飞”

虽然具体能力的涌现不可预测,但整体损失(Loss)的下降是可预测的。

2020 年 OpenAI 发表的 Scaling Law 论文揭示:

模型损失 ∝ 1 / (参数量^a × 数据量^b × 算力^c)

翻译成大白话:

增加 模型性能
参数 × 10 损失下降一个固定幅度
数据 × 10 损失下降一个固定幅度
算力 × 10 损失下降一个固定幅度

🎯 这条规律可怕在哪? 它告诉行业:你只要敢花钱堆参数,模型就一定会变强。这是 OpenAI、Anthropic 一轮轮融资几百亿美元的”理论靠山”。


四、🤔 涌现是真现象还是测量错觉?

2023 年斯坦福一篇论文《Are Emergent Abilities of Large Language Models a Mirage?》提出反对意见:

“涌现可能是评估指标造成的错觉。”

举例:

  • 用 “完全正确才得 1 分” 这种指标 → 看起来是突然涌现
  • 用 “部分正确给部分分” 这种指标 → 看起来是平滑提升

真实情况:

评估方式 看到的曲线
严格 0/1 评分 突然涌现
软评分(Token 概率) 平滑提升

⚠️ 重要提醒:涌现部分是真的(确实存在能力上的质变),部分是测量的伪影(曲线看起来突然)。真相在两者之间。


五、🚫 涌现 ≠ 理解:保持清醒的判断

涌现能力让模型看起来”会思考”,但本质上:

看起来像 实际上是
推理 模仿训练数据里的推理过程
创造 重组训练数据里的元素
理解 统计意义上的”高概率响应”
反思 被 prompt 引导的额外生成

💬 关键观点:涌现的是能力表现,不是意识 / 理解 / 智能本身。模型还是那个”超级模仿器”,只是模仿得更长链、更连贯、更接近人。

真正的”理解”需要什么?

  • 因果推理(不只是相关性)
  • 持续学习(不只是冻结参数)
  • 世界模型(不只是文本模型)
  • 主体性(不只是反应式回答)

这些目前都还不在 LLM 的能力包里。


六、💰 涌现的商业含义:所有人都在赌下一个临界点

公司 赌的是什么
OpenAI GPT-5/6 在某个规模会涌现”自主科学发现”
Anthropic Claude 在更大规模会涌现”安全性自我约束”
Google Gemini 在多模态规模会涌现”跨模态推理”
Meta Llama 在开源规模放大会涌现”工程通用性”

🎯 本质上:整个 AI 行业都在赌 Scaling Law 还没失效。一旦失效(也叫”撞墙”),整个估值体系会崩塌。

目前的迹象:

  • 2024-2025 年开始有”Scaling Law 撞墙”的讨论
  • GPT-4 → GPT-5 的提升幅度,远不如 GPT-3 → GPT-4
  • 业界开始转向”测试时计算“(让模型回答时思考更久)作为新增长方向

七、❌ 三个常见误区

误区 真相
❌ “涌现 = 模型开始有意识” 涌现是能力表现,不是意识
❌ “Scaling Law 会一直成立” 已有撞墙迹象,业界在找新路径
✅ “大模型 + 涌现 + Scaling Law 是 2020s AI 浪潮的三大基石” 对,理解这三个就理解了 OpenAI 的赌注

八、🎁 一段能让你”理性看待 AI 进展”的话术

下次有人说”GPT-X 已经有意识了”,你可以这样回应:

“目前我们看到的’惊艳能力’确实是真的——这叫涌现。但涌现的是能力表现,不等于真正的理解、意识或目标。

模型本质上还是在做’下一个 token 预测’,只是规模到了,模仿得足够长、足够连贯,让人感觉它在思考。

真正的判断标准是:它能不能解决训练数据里完全没见过的、需要新颖因果推理的问题。 目前的答案是:还差得远。”

💬 关键观点:既不神化、也不否定——这是技术圈最稀缺的判断力。


📮 今日话题

💬 你认为 Scaling Law 会在什么时候彻底”撞墙”?

是参数到几万亿、是能源跟不上、是数据耗尽,还是其他原因?评论区聊聊。


🔮 下一篇预告

🟡 AI 通识 · 第 14 期:幻觉是怎么来的?AI 为什么一本正经胡说八道

涌现的另一面,就是幻觉。它不是 bug,是大模型架构的副作用。


🟡 本文属于「AI 通识 · 阶段二:大模型怎么思考」。

📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。