⚙️ 训练一个 GPT-5 要多少卡、多少电、多少钱
⚙️ 训练一个 GPT-5 要多少卡、多少电、多少钱
这是一道让人睡不着觉的题。 不是因为难算, 而是因为算完之后你会震惊。
⚙️ AI 深度派专栏 · 第 S2-21 期 📅 2026年10月31日 ✍️ 小敏说 AI
💡 本文要点:本文用真实参数估算训一次 GPT-5 级模型的 GPU 数、训练时长、电力消耗、电费、租赁价、总成本——并对比 GPT-3、GPT-4、Llama 3、DeepSeek V3。
🎯 本文导读
- 🔹 训练算力的”基本公式”
- 🔹 GPT-3 → GPT-4 → GPT-5 估算
- 🔹 电、水、土地、人力
- 🔹 国产模型为什么这么便宜
- 🔹 训练成本天花板会在哪
一、📐 基本公式
训练总算力(FLOPs)≈ 6 × 参数量 × Token 数
这是 Chinchilla 论文里的经典公式。
举例:
- GPT-3:175B × 300B token = 3.14e23 FLOPs
- GPT-4:~1.8T × 13T = ~2.1e25 FLOPs
- GPT-5(猜):~5T × 30T = ~9e26 FLOPs
二、💵 GPT-3 训练账本
- 算力需求:3.14e23 FLOPs
- A100 实际算力:~150 TFLOPs(BF16,含通信折扣)
- 总卡时:~24 万 GPU·小时
- 时间:1024 张 A100,约 1 个月
- 电力(每张卡约 0.4 kW):~100 MWh
- 训练直接成本(云上 $2/小时):~$0.5M
三、💸 GPT-4 训练账本
- 算力需求:2.1e25 FLOPs(≈ 67 倍 GPT-3)
- H100 实际算力:~600 TFLOPs(FP8)
- 卡时:~1000-2000 万 GPU·小时
- 时间:约 25000 张 H100,跑 3-6 个月
- 电力:~50-80 GWh
- 训练直接成本:$50-100M
💬 关键观点:GPT-4 真实成本(含数据 / 实验 / 失败次数)业内估计在 $200-500M。
四、🚀 GPT-5 估算账本(推测)
按外界估计 GPT-5 训练算力大约 10-30× GPT-4:
| 项 | GPT-5 估算 |
|---|---|
| 算力 | 2-5e26 FLOPs |
| GPU | 10 万张 H100 或 5 万张 B200 |
| 训练时间 | 4-9 个月 |
| 电力 | 300-700 GWh |
| 直接训练 | $500M-$1B |
| 总投入(含失败 / 实验 / 数据 / 团队) | $2-5B |
🎯 300 GWh ≈ 一个 30 万人小城市一年的居民用电。
五、🔋 电、水、土地
电力
- 一张 H100 满载约 700W,加 PUE 约 1.1-1.2 → ~840W
- 10 万张 = 84 MW 持续负载
- 6 个月 = ~360 GWh
水
液冷或风冷数据中心耗水约 1.8 L/kWh:
- 360 GWh = ~65 万吨水
土地
10 万张 H100 + 配套设备 ≈ 3-5 万平米
⚠️ 重要提醒:所以现在头部 AI 数据中心都在水电充足的地方(华盛顿州、得州、内蒙古、宁夏)。
六、🇨🇳 国产模型为什么这么便宜
DeepSeek V3 训练只花了 $5.5M(自报)。
奥秘:
- 算力高效利用:FP8 + Multi-Latent Attention + 高利用率
- 数据高质量:合成 + 精筛,少 Token 也强
- 没有 OpenAI 那种”无限实验” :路径已被打通
- MoE 架构:激活参数少
- 算力价格:国内租 GPU 比海外便宜
💬 关键观点:“训练成本”不再线性增长——工程红利仍很大。
七、📊 对比表
| 模型 | 参数 | Token | 算力 | 卡 × 时间 | 直接成本 |
|---|---|---|---|---|---|
| GPT-3 | 175B | 300B | 3e23 | 1k A100 × 1月 | $0.5M |
| GPT-4 | ~1.8T MoE | ~13T | 2e25 | 25k H100 × 3月 | $50-100M |
| Llama 3.1-405B | 405B | 15.6T | 4e25 | 16k H100 × 54天 | $80M |
| DeepSeek V3 | 671B MoE(37B 激活) | 14.8T | 2.7e24 | 2k H800 × 2月 | $5.5M |
| GPT-5(估) | 5T+ | 30T+ | 2-5e26 | 10万 H100 × 6月 | $500M-1B |
八、🚧 训练成本会无限增长吗
不会。3 大杠杆在压:
- 硬件迭代(H100 → B200 → R200)每代 2-3 倍
- 算法进步(MoE / FP8 / GRPO / 合成数据)每年 1.5-2 倍
- 工程红利(DeepSeek 路线)3-5 倍
🎯 一句话总结:1B 美元单次训练是天花板附近。再往上要拼算法 + 数据而非纯堆卡。
九、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ 训练越贵越强 | ✅ 算法红利仍大 |
| ❌ DeepSeek $5M 把 OpenAI 干没 | ✅ 路径不一样,成本计算口径也不同 |
| ❌ 训练成本就是全部 | ✅ 推理成本未来更大 |
| ❌ 模型越大越省电 | ✅ 推理时算力随用户 × 长度增 |
十、🎁 给非工程读者的”训练账本心法”
🔑 训练成本 = 算力 × 数据 × 时间
🔑 1B 美元 ≈ 当前训练天花板
🔑 真正烧钱在"训练 + 推理 + 失败实验"三件套
🔑 国产路径 = 工程 + 算法红利
🔑 5 年内训练成本可能再降 10×(同等智能)
📮 今日话题:你愿意为一次 GPT-5 级别的”私人模型”训练付多少钱?
🔮 下一篇预告:s2ep22《AI 数据中心:电、冷、网怎么造》
⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-21 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。