⚙️ 训练一个 GPT-5 要多少卡、多少电、多少钱

这是一道让人睡不着觉的题。 不是因为难算, 而是因为算完之后你会震惊。

⚙️ AI 深度派专栏 · 第 S2-21 期 📅 2026年10月31日 ✍️ 小敏说 AI

💡 本文要点:本文用真实参数估算训一次 GPT-5 级模型的 GPU 数、训练时长、电力消耗、电费、租赁价、总成本——并对比 GPT-3、GPT-4、Llama 3、DeepSeek V3。


🎯 本文导读

  • 🔹 训练算力的”基本公式”
  • 🔹 GPT-3 → GPT-4 → GPT-5 估算
  • 🔹 电、水、土地、人力
  • 🔹 国产模型为什么这么便宜
  • 🔹 训练成本天花板会在哪

一、📐 基本公式

训练总算力(FLOPs)≈ 6 × 参数量 × Token 数

这是 Chinchilla 论文里的经典公式。

举例:

  • GPT-3:175B × 300B token = 3.14e23 FLOPs
  • GPT-4:~1.8T × 13T = ~2.1e25 FLOPs
  • GPT-5(猜):~5T × 30T = ~9e26 FLOPs

二、💵 GPT-3 训练账本

  • 算力需求:3.14e23 FLOPs
  • A100 实际算力:~150 TFLOPs(BF16,含通信折扣)
  • 总卡时:~24 万 GPU·小时
  • 时间:1024 张 A100,约 1 个月
  • 电力(每张卡约 0.4 kW):~100 MWh
  • 训练直接成本(云上 $2/小时):~$0.5M

三、💸 GPT-4 训练账本

  • 算力需求:2.1e25 FLOPs(≈ 67 倍 GPT-3)
  • H100 实际算力:~600 TFLOPs(FP8)
  • 卡时:~1000-2000 万 GPU·小时
  • 时间:约 25000 张 H100,跑 3-6 个月
  • 电力:~50-80 GWh
  • 训练直接成本:$50-100M

💬 关键观点:GPT-4 真实成本(含数据 / 实验 / 失败次数)业内估计在 $200-500M。


四、🚀 GPT-5 估算账本(推测)

按外界估计 GPT-5 训练算力大约 10-30× GPT-4:

项 GPT-5 估算
算力 2-5e26 FLOPs
GPU 10 万张 H100 或 5 万张 B200
训练时间 4-9 个月
电力 300-700 GWh
直接训练 $500M-$1B
总投入(含失败 / 实验 / 数据 / 团队) $2-5B

🎯 300 GWh ≈ 一个 30 万人小城市一年的居民用电。


五、🔋 电、水、土地

电力

  • 一张 H100 满载约 700W,加 PUE 约 1.1-1.2 → ~840W
  • 10 万张 = 84 MW 持续负载
  • 6 个月 = ~360 GWh

水

液冷或风冷数据中心耗水约 1.8 L/kWh:

  • 360 GWh = ~65 万吨水

土地

10 万张 H100 + 配套设备 ≈ 3-5 万平米

⚠️ 重要提醒:所以现在头部 AI 数据中心都在水电充足的地方(华盛顿州、得州、内蒙古、宁夏)。


六、🇨🇳 国产模型为什么这么便宜

DeepSeek V3 训练只花了 $5.5M(自报)。

奥秘:

  1. 算力高效利用:FP8 + Multi-Latent Attention + 高利用率
  2. 数据高质量:合成 + 精筛,少 Token 也强
  3. 没有 OpenAI 那种”无限实验” :路径已被打通
  4. MoE 架构:激活参数少
  5. 算力价格:国内租 GPU 比海外便宜

💬 关键观点:“训练成本”不再线性增长——工程红利仍很大。


七、📊 对比表

模型 参数 Token 算力 卡 × 时间 直接成本
GPT-3 175B 300B 3e23 1k A100 × 1月 $0.5M
GPT-4 ~1.8T MoE ~13T 2e25 25k H100 × 3月 $50-100M
Llama 3.1-405B 405B 15.6T 4e25 16k H100 × 54天 $80M
DeepSeek V3 671B MoE(37B 激活) 14.8T 2.7e24 2k H800 × 2月 $5.5M
GPT-5(估) 5T+ 30T+ 2-5e26 10万 H100 × 6月 $500M-1B

八、🚧 训练成本会无限增长吗

不会。3 大杠杆在压:

  1. 硬件迭代(H100 → B200 → R200)每代 2-3 倍
  2. 算法进步(MoE / FP8 / GRPO / 合成数据)每年 1.5-2 倍
  3. 工程红利(DeepSeek 路线)3-5 倍

🎯 一句话总结:1B 美元单次训练是天花板附近。再往上要拼算法 + 数据而非纯堆卡。


九、❌ 常见误区

误区 真相
❌ 训练越贵越强 ✅ 算法红利仍大
❌ DeepSeek $5M 把 OpenAI 干没 ✅ 路径不一样,成本计算口径也不同
❌ 训练成本就是全部 ✅ 推理成本未来更大
❌ 模型越大越省电 ✅ 推理时算力随用户 × 长度增

十、🎁 给非工程读者的”训练账本心法”

🔑 训练成本 = 算力 × 数据 × 时间
🔑 1B 美元 ≈ 当前训练天花板
🔑 真正烧钱在"训练 + 推理 + 失败实验"三件套
🔑 国产路径 = 工程 + 算法红利
🔑 5 年内训练成本可能再降 10×(同等智能)

📮 今日话题:你愿意为一次 GPT-5 级别的”私人模型”训练付多少钱?

🔮 下一篇预告:s2ep22《AI 数据中心:电、冷、网怎么造》


⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-21 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。