⚙️ GPU 内部架构:Tensor Core / SM / 显存层级
⚙️ GPU 内部架构:Tensor Core / SM / 显存层级
大家都在抢 H100、B200。 但你真的知道 GPU 里面长什么样吗? 一张卡 = 几万个小核 + 一栋楼一样的内存层级 + 一组专门算矩阵的”魔法核心”。 阶段七,从这里开始。
⚙️ AI 深度派专栏 · 第 S2-16 期(阶段七 · 基础设施开篇) 📅 2026年10月20日 ✍️ 小敏说 AI
💡 本文要点:本文从普通工程师视角讲清现代 NVIDIA GPU 的内部结构——SM、CUDA Core、Tensor Core、显存层级(HBM/L2/L1/Register),以及为什么 AI 训练对 GPU 是”绝配”。
🎯 本文导读
- 🔹 GPU vs CPU 的本质区别
- 🔹 SM = GPU 里的”小工厂”
- 🔹 Tensor Core:AI 的真正主角
- 🔹 显存层级:从 HBM 到寄存器
- 🔹 看懂 H100 / B200 spec 表
一、🔄 GPU vs CPU 的本质区别
| 维度 | CPU | GPU |
|---|---|---|
| 核数 | 几十 | 几万 ALU |
| 单核能力 | 强 | 弱 |
| 擅长 | 逻辑、分支 | 大规模并行算数 |
| 缓存 | 大 | 小(但带宽极高) |
| 设计哲学 | 让一件事飞快 | 让一万件事一起做 |
💬 关键观点:AI 训练 = 几万亿次矩阵乘加 → 天生适合 GPU。
二、🏭 SM:GPU 里的”小工厂”
SM(Streaming Multiprocessor) 是 GPU 的基本计算单元。
H100 一共 132 个 SM。每个 SM 包含:
- ~128 CUDA Core(做通用 FP32 / INT 计算)
- 4 个 Tensor Core(做矩阵)
- 寄存器文件(256KB)
- 共享内存 / L1(228KB)
- Warp Scheduler(线程调度)
GPU = 数十~上百个 SM
SM = CUDA Core + Tensor Core + 缓存
三、🧮 Tensor Core:AI 的真正主角
普通 CUDA Core 一次算 1 个乘加。 Tensor Core 一次算 64-256 个乘加(一个矩阵块)。
| 代际 | 代表卡 | 主要精度 |
|---|---|---|
| V100 | Volta | FP16 |
| A100 | Ampere | FP16 + BF16 + TF32 |
| H100 | Hopper | + FP8 |
| B100/B200 | Blackwell | + FP4 |
🎯 一句话总结:Tensor Core 把 AI 算力提升了 10-30 倍——是 AI 时代真正的”特种部队”。
为什么精度越来越低
- 训练 FP32 → BF16 → FP8 → FP4
- 精度低 = 算更快 + 占内存更少
- AI 任务”容错”高,低精度足够
四、🏢 显存层级:从 HBM 到寄存器
GPU 内存像一栋楼,越上越快越小:
🏢 寄存器(Register) | < 1 KB / thread | 0 cycle
↓
🏢 L1 / 共享内存(per SM) | 228 KB | ~30 cycles
↓
🏢 L2(全卡共享) | 50 MB(H100) | ~200 cycles
↓
🏢 HBM(高带宽显存) | 80-192 GB | ~500 cycles
↓
🏢 主机 RAM(通过 PCIe / NVLink)| TB 级 | ~10000+
关键带宽(H100)
- HBM3:3 TB/s
- L2:~12 TB/s
- 共享内存:~33 TB/s/SM
⚠️ 重要提醒:AI 性能瓶颈常在”带宽”,不在算力。这就是 Flash Attention 这类工作的意义。
五、🔗 NVLink:把多卡”焊在一起”
- PCIe 5.0:~128 GB/s
- NVLink 4.0:900 GB/s(H100 单卡)
- NVLink 5.0(B200):1.8 TB/s
NVLink 让多卡之间”像一张大卡”。 NVSwitch 让数十张卡互连。 NVL72(GB200):72 张 GPU 一个机柜,130 TB/s 内部带宽。
六、📊 看懂 H100 / B200 spec 表
挑几个最重要的:
| 指标 | H100 | B200 |
|---|---|---|
| Tensor 算力 FP8 | 3958 TFLOPS | ~10000 |
| HBM | 80 GB HBM3 | 192 GB HBM3e |
| 显存带宽 | 3 TB/s | 8 TB/s |
| NVLink | 900 GB/s | 1.8 TB/s |
| 功耗 | 700W | 1000W |
怎么读
- 看 算力——决定单卡训练 / 推理速度
- 看 显存大小——决定能不能装下大模型
- 看 带宽——决定真实利用率
- 看 互连——决定能不能多卡协作
七、💡 这对你意味着什么
| 角色 | 关心点 |
|---|---|
| 创业者 | 租得起 / 买得到比 spec 重要 |
| 工程师 | 显存够不够装模型 |
| 研究者 | FP8 / FP4 精度训练支持 |
| 看客 | 看懂”显存焦虑”的根源 |
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ TFLOPS 高就快 | ✅ 带宽和软件栈同等重要 |
| ❌ 多卡 = 算力线性叠加 | ✅ 通信效率打折 |
| ❌ 消费级显卡也能训大模型 | ✅ 显存不够装 |
| ❌ 国产卡只是慢一点 | ✅ 还差软件生态 |
九、🎁 给非工程读者的”GPU 心法”
🔑 GPU = SM 工厂 + Tensor Core 矩阵专员
🔑 现代 AI 训练痛点 = 显存 + 带宽
🔑 NVLink / NVSwitch 决定多卡天花板
🔑 看 spec 不只看算力——看带宽、显存、互连
📮 今日话题:如果给你一张 H100,你想用它做什么?
🔮 下一篇预告:s2ep17《CUDA 的真正护城河:为什么 10 年了还没人撼动 NVIDIA》
⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-16 期(阶段七 · AI 基础设施开篇)。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。