🟢 模型、参数、训练、推理——4 个被混用最严重的 AI 术语
🟢 模型、参数、训练、推理——4 个被混用最严重的 AI 术语
这四个词在朋友圈被滥用程度,仅次于”赋能”和”闭环”。 5 分钟,今天一次性讲清。
🟢 AI 通识专栏 · 第 05 期 📅 2026年6月9日 ✍️ 小敏说 AI
💡 本文要点:模型、参数、训练、推理——这四个词几乎出现在所有 AI 文章里,但绝大多数人说不清它们的精确区别。本文用一个”做菜”的统一类比,把四者关系一次性讲透,并附一张”看懂技术新闻”的速查表。
🎯 本文导读
- 🔹 一道菜讲完四个词
- 🔹 模型:一个”菜谱”还是一个”厨师”?
- 🔹 参数:那 1750 亿个旋钮长什么样
- 🔹 训练 vs 推理:成本差几千倍的两件事
- 🔹 看懂科技新闻的速查表
一、🍜 先看结论:四个词 = 一道菜的四个层次
| 概念 | 做菜类比 | 通俗解释 |
|---|---|---|
| 模型(Model) | 厨师本人 | 一个能做事的”系统” |
| 参数(Parameters) | 厨师脑子里的火候经验 | 模型里”可调的旋钮” |
| 训练(Training) | 学徒期反复练习 | 调整参数让模型变厉害 |
| 推理(Inference) | 厨师出师后做菜 | 用训练好的模型回答问题 |
🎯 一句话总结:训练是”教厨师”,推理是”让厨师做菜”;模型是”厨师”,参数是”厨师脑子里的经验”。
二、🧑🍳 模型:不是文件,是一个”能做事的系统”
很多人以为”模型”就是一个 .bin 文件——这是误解。
模型(Model) 严格来说包含三部分:
| 组成 | 是什么 | 做菜类比 |
|---|---|---|
| 架构(Architecture) | 网络结构图(Transformer、CNN…) | 菜谱的步骤框架 |
| 参数(Weights) | 几亿个具体数字 | 每一步的火候、调料量 |
| 配置(Config) | 上下文长度、tokenizer 等 | 厨房规则 |
模型 = 架构 + 参数 + 配置
你下载的 “GPT-4“、”Llama-3-70B“,本质上是同一种架构(Transformer)配上不同的参数。
⚠️ 重要提醒:架构相同 ≠ 模型相同。真正决定 ChatGPT 和 Llama 谁更聪明的,是参数——这是几千万美元训练费砸进去得到的”经验值”。
三、🎚️ 参数:那 1750 亿个旋钮长什么样
你听过的”GPT-3 有 1750 亿参数”——这 1750 亿到底是什么?
参数 ≈ 神经网络里每根连线上的权重。
输入 ──(w1)── 神经元A ──(w2)── 神经元B ── 输出
↑ ↑
w1, w2 就是参数
每个 w 都是一个浮点数(比如 0.3271),训练就是不断微调这些数字。
参数量决定了什么?
| 参数量级 | 代表模型 | 能力定位 |
|---|---|---|
| 百万级 | 早期 NLP 模型 | 单一任务(情感分类) |
| 亿级 | BERT (3.4亿)、GPT-2 (15亿) | 通用语言理解 |
| 千亿级 | GPT-3 (1750亿)、GPT-4 (~万亿) | 涌现能力出现 |
| 万亿级稀疏 | GPT-4 MoE、DeepSeek-V3 | 顶级推理 |
💬 关键观点:参数越多 ≈ 模型脑容量越大,但不是越多越好——参数多的模型,训练和推理都更贵、更慢。
四、🏋️ 训练 vs 推理:成本差几千倍
这是最容易混的两个词,先看对比:
| 维度 | 训练(Training) | 推理(Inference) |
|---|---|---|
| 做什么 | 调整参数让模型学会 | 用学好的模型回答 |
| 何时发生 | 模型上线前(一次性) | 用户每次提问(持续) |
| 算力需求 | 极高(数千张 GPU) | 中等(一两张 GPU 够用) |
| 耗时 | 几周到几个月 | 几毫秒到几秒 |
| 成本 | GPT-4 训练费 ≈ 1 亿美元 | 一次回答 ≈ 几分钱 |
| 类比 | 厨师学艺 10 年 | 厨师做一道菜 5 分钟 |
🎯 一句话总结:训练是贵且慢的一次性投入,推理是便宜但累加的持续支出。
这就是为什么——
- OpenAI 烧的是训练费:GPT-5 训练费传闻几亿美元
- 你付的是推理费:每月 20 美元订阅、每百万 token 几美元的 API 费
⚠️ 重要提醒:当新闻说”DeepSeek 训练只花了 600 万美元”,指的是训练成本。当你用 API 觉得贵,看的是推理成本。两个指标天差地别,不要混。
五、🔄 完整流程:四个词怎么串起来
一个 AI 产品的全生命周期:
| 阶段 | 主角 | 在做什么 |
|---|---|---|
| 1️⃣ 设计 | 架构师 | 选 Transformer 还是 Mamba |
| 2️⃣ 训练 | 算法工程师 | 投喂数据、调整参数 |
| 3️⃣ 评测 | 测试团队 | 跑 benchmark 验证 |
| 4️⃣ 部署 | 工程团队 | 把模型搬上服务器 |
| 5️⃣ 推理 | 用户 | 每次提问触发一次 |
💬 关键观点:你每次和 ChatGPT 聊天,触发的都是”推理”,不会让模型变聪明。要让模型变聪明,必须重新”训练”或”微调”。
六、❌ 四个高频误用
| 错误说法 | 正确理解 |
|---|---|
| ❌ “我把数据喂给 ChatGPT 训练它” | 你只是在提示词里加了上下文,没改任何参数 |
| ❌ “GPT-4 参数比 GPT-3.5 多 10 倍所以贵 10 倍” | 推理成本和参数量有关,但还看架构、量化、并发优化 |
| ❌ “模型 = 模型文件” | 模型 = 架构 + 参数 + 配置 |
| ✅ “训练一次,推理无数次” | 对,AI 产品的核心成本结构 |
七、🎁 看懂科技新闻的术语速查表
下次看到这些表述,你能秒懂:
| 新闻原文 | 真实含义 |
|---|---|
| “DeepSeek 训练成本 600 万美元” | 预训练一次的算力费用 |
| “模型蒸馏到 70 亿参数” | 用大模型当老师训练一个小模型 |
| “推理速度提升 3 倍” | 同一个模型,输出每个 token 更快 |
| “MoE 架构有效参数 370 亿” | 总参数大,但每次推理只激活一部分 |
| “微调一个 LoRA” | 在原模型基础上只训练少量额外参数 |
🎯 掌握这五条,你看 AI 新闻的理解力立刻上一个台阶。
📮 今日话题
💬 你听过最离谱的”AI 训练”误用是什么?
比如有人说”我训练了一下 ChatGPT,它现在更懂我了”——评论区分享,我帮你纠正。
🔮 下一篇预告
🟢 AI 通识 · 第 06 期:为什么 GPU 比 CPU 更适合 AI?
一个本来用来打游戏的芯片,怎么就把 AI 推上了万亿美元市值的赛道?
🟢 本文属于「AI 通识」专栏,由浅入深、由零到一。
📱 关注「小敏说 AI」,回复 「AI 入门」 领取《打工人 AI 自救工具箱》。