🟢 模型、参数、训练、推理——4 个被混用最严重的 AI 术语

这四个词在朋友圈被滥用程度,仅次于”赋能”和”闭环”。 5 分钟,今天一次性讲清。

🟢 AI 通识专栏 · 第 05 期 📅 2026年6月9日 ✍️ 小敏说 AI

💡 本文要点:模型、参数、训练、推理——这四个词几乎出现在所有 AI 文章里,但绝大多数人说不清它们的精确区别。本文用一个”做菜”的统一类比,把四者关系一次性讲透,并附一张”看懂技术新闻”的速查表。


🎯 本文导读

  • 🔹 一道菜讲完四个词
  • 🔹 模型:一个”菜谱”还是一个”厨师”?
  • 🔹 参数:那 1750 亿个旋钮长什么样
  • 🔹 训练 vs 推理:成本差几千倍的两件事
  • 🔹 看懂科技新闻的速查表

一、🍜 先看结论:四个词 = 一道菜的四个层次

概念 做菜类比 通俗解释
模型(Model) 厨师本人 一个能做事的”系统”
参数(Parameters) 厨师脑子里的火候经验 模型里”可调的旋钮”
训练(Training) 学徒期反复练习 调整参数让模型变厉害
推理(Inference) 厨师出师后做菜 用训练好的模型回答问题

🎯 一句话总结:训练是”教厨师”,推理是”让厨师做菜”;模型是”厨师”,参数是”厨师脑子里的经验”。


二、🧑‍🍳 模型:不是文件,是一个”能做事的系统”

很多人以为”模型”就是一个 .bin 文件——这是误解。

模型(Model) 严格来说包含三部分:

组成 是什么 做菜类比
架构(Architecture) 网络结构图(Transformer、CNN…) 菜谱的步骤框架
参数(Weights) 几亿个具体数字 每一步的火候、调料量
配置(Config) 上下文长度、tokenizer 等 厨房规则
模型 = 架构 + 参数 + 配置

你下载的 “GPT-4“、”Llama-3-70B“,本质上是同一种架构(Transformer)配上不同的参数。

⚠️ 重要提醒:架构相同 ≠ 模型相同。真正决定 ChatGPT 和 Llama 谁更聪明的,是参数——这是几千万美元训练费砸进去得到的”经验值”。


三、🎚️ 参数:那 1750 亿个旋钮长什么样

你听过的”GPT-3 有 1750 亿参数”——这 1750 亿到底是什么?

参数 ≈ 神经网络里每根连线上的权重。

输入 ──(w1)── 神经元A ──(w2)── 神经元B ── 输出
              ↑                ↑
              w1, w2 就是参数

每个 w 都是一个浮点数(比如 0.3271),训练就是不断微调这些数字。

参数量决定了什么?

参数量级 代表模型 能力定位
百万级 早期 NLP 模型 单一任务(情感分类)
亿级 BERT (3.4亿)、GPT-2 (15亿) 通用语言理解
千亿级 GPT-3 (1750亿)、GPT-4 (~万亿) 涌现能力出现
万亿级稀疏 GPT-4 MoE、DeepSeek-V3 顶级推理

💬 关键观点:参数越多 ≈ 模型脑容量越大,但不是越多越好——参数多的模型,训练和推理都更贵、更慢。


四、🏋️ 训练 vs 推理:成本差几千倍

这是最容易混的两个词,先看对比:

维度 训练(Training) 推理(Inference)
做什么 调整参数让模型学会 用学好的模型回答
何时发生 模型上线前(一次性) 用户每次提问(持续)
算力需求 极高(数千张 GPU) 中等(一两张 GPU 够用)
耗时 几周到几个月 几毫秒到几秒
成本 GPT-4 训练费 ≈ 1 亿美元 一次回答 ≈ 几分钱
类比 厨师学艺 10 年 厨师做一道菜 5 分钟

🎯 一句话总结:训练是贵且慢的一次性投入,推理是便宜但累加的持续支出。

这就是为什么——

  • OpenAI 烧的是训练费:GPT-5 训练费传闻几亿美元
  • 你付的是推理费:每月 20 美元订阅、每百万 token 几美元的 API 费

⚠️ 重要提醒:当新闻说”DeepSeek 训练只花了 600 万美元”,指的是训练成本。当你用 API 觉得贵,看的是推理成本。两个指标天差地别,不要混。


五、🔄 完整流程:四个词怎么串起来

一个 AI 产品的全生命周期:

阶段 主角 在做什么
1️⃣ 设计 架构师 选 Transformer 还是 Mamba
2️⃣ 训练 算法工程师 投喂数据、调整参数
3️⃣ 评测 测试团队 跑 benchmark 验证
4️⃣ 部署 工程团队 把模型搬上服务器
5️⃣ 推理 用户 每次提问触发一次

💬 关键观点:你每次和 ChatGPT 聊天,触发的都是”推理”,不会让模型变聪明。要让模型变聪明,必须重新”训练”或”微调”。


六、❌ 四个高频误用

错误说法 正确理解
❌ “我把数据喂给 ChatGPT 训练它” 你只是在提示词里加了上下文,没改任何参数
❌ “GPT-4 参数比 GPT-3.5 多 10 倍所以贵 10 倍” 推理成本和参数量有关,但还看架构、量化、并发优化
❌ “模型 = 模型文件” 模型 = 架构 + 参数 + 配置
✅ “训练一次,推理无数次” 对,AI 产品的核心成本结构

七、🎁 看懂科技新闻的术语速查表

下次看到这些表述,你能秒懂:

新闻原文 真实含义
“DeepSeek 训练成本 600 万美元” 预训练一次的算力费用
“模型蒸馏到 70 亿参数” 用大模型当老师训练一个小模型
“推理速度提升 3 倍” 同一个模型,输出每个 token 更快
“MoE 架构有效参数 370 亿” 总参数大,但每次推理只激活一部分
“微调一个 LoRA” 在原模型基础上只训练少量额外参数

🎯 掌握这五条,你看 AI 新闻的理解力立刻上一个台阶。


📮 今日话题

💬 你听过最离谱的”AI 训练”误用是什么?

比如有人说”我训练了一下 ChatGPT,它现在更懂我了”——评论区分享,我帮你纠正。


🔮 下一篇预告

🟢 AI 通识 · 第 06 期:为什么 GPU 比 CPU 更适合 AI?

一个本来用来打游戏的芯片,怎么就把 AI 推上了万亿美元市值的赛道?


🟢 本文属于「AI 通识」专栏,由浅入深、由零到一。

📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。