⚙️ GPU 内部架构:Tensor Core / SM / 显存层级

大家都在抢 H100、B200。 但你真的知道 GPU 里面长什么样吗? 一张卡 = 几万个小核 + 一栋楼一样的内存层级 + 一组专门算矩阵的”魔法核心”。 阶段七,从这里开始。

⚙️ AI 深度派专栏 · 第 S2-16 期(阶段七 · 基础设施开篇) 📅 2026年10月20日 ✍️ 小敏说 AI

💡 本文要点:本文从普通工程师视角讲清现代 NVIDIA GPU 的内部结构——SM、CUDA Core、Tensor Core、显存层级(HBM/L2/L1/Register),以及为什么 AI 训练对 GPU 是”绝配”。


🎯 本文导读

  • 🔹 GPU vs CPU 的本质区别
  • 🔹 SM = GPU 里的”小工厂”
  • 🔹 Tensor Core:AI 的真正主角
  • 🔹 显存层级:从 HBM 到寄存器
  • 🔹 看懂 H100 / B200 spec 表

一、🔄 GPU vs CPU 的本质区别

维度 CPU GPU
核数 几十 几万 ALU
单核能力 强 弱
擅长 逻辑、分支 大规模并行算数
缓存 大 小(但带宽极高)
设计哲学 让一件事飞快 让一万件事一起做

💬 关键观点:AI 训练 = 几万亿次矩阵乘加 → 天生适合 GPU。


二、🏭 SM:GPU 里的”小工厂”

SM(Streaming Multiprocessor) 是 GPU 的基本计算单元。

H100 一共 132 个 SM。每个 SM 包含:

  • ~128 CUDA Core(做通用 FP32 / INT 计算)
  • 4 个 Tensor Core(做矩阵)
  • 寄存器文件(256KB)
  • 共享内存 / L1(228KB)
  • Warp Scheduler(线程调度)
GPU = 数十~上百个 SM
SM  = CUDA Core + Tensor Core + 缓存

三、🧮 Tensor Core:AI 的真正主角

普通 CUDA Core 一次算 1 个乘加。 Tensor Core 一次算 64-256 个乘加(一个矩阵块)。

代际 代表卡 主要精度
V100 Volta FP16
A100 Ampere FP16 + BF16 + TF32
H100 Hopper + FP8
B100/B200 Blackwell + FP4

🎯 一句话总结:Tensor Core 把 AI 算力提升了 10-30 倍——是 AI 时代真正的”特种部队”。

为什么精度越来越低

  • 训练 FP32 → BF16 → FP8 → FP4
  • 精度低 = 算更快 + 占内存更少
  • AI 任务”容错”高,低精度足够

四、🏢 显存层级:从 HBM 到寄存器

GPU 内存像一栋楼,越上越快越小:

🏢 寄存器(Register)         | < 1 KB / thread | 0 cycle
   ↓
🏢 L1 / 共享内存(per SM)    | 228 KB         | ~30 cycles
   ↓
🏢 L2(全卡共享)             | 50 MB(H100)  | ~200 cycles
   ↓
🏢 HBM(高带宽显存)          | 80-192 GB     | ~500 cycles
   ↓
🏢 主机 RAM(通过 PCIe / NVLink)| TB 级       | ~10000+

关键带宽(H100)

  • HBM3:3 TB/s
  • L2:~12 TB/s
  • 共享内存:~33 TB/s/SM

⚠️ 重要提醒:AI 性能瓶颈常在”带宽”,不在算力。这就是 Flash Attention 这类工作的意义。


五、🔗 NVLink:把多卡”焊在一起”

  • PCIe 5.0:~128 GB/s
  • NVLink 4.0:900 GB/s(H100 单卡)
  • NVLink 5.0(B200):1.8 TB/s

NVLink 让多卡之间”像一张大卡”。 NVSwitch 让数十张卡互连。 NVL72(GB200):72 张 GPU 一个机柜,130 TB/s 内部带宽。


六、📊 看懂 H100 / B200 spec 表

挑几个最重要的:

指标 H100 B200
Tensor 算力 FP8 3958 TFLOPS ~10000
HBM 80 GB HBM3 192 GB HBM3e
显存带宽 3 TB/s 8 TB/s
NVLink 900 GB/s 1.8 TB/s
功耗 700W 1000W

怎么读

  1. 看 算力——决定单卡训练 / 推理速度
  2. 看 显存大小——决定能不能装下大模型
  3. 看 带宽——决定真实利用率
  4. 看 互连——决定能不能多卡协作

七、💡 这对你意味着什么

角色 关心点
创业者 租得起 / 买得到比 spec 重要
工程师 显存够不够装模型
研究者 FP8 / FP4 精度训练支持
看客 看懂”显存焦虑”的根源

八、❌ 常见误区

误区 真相
❌ TFLOPS 高就快 ✅ 带宽和软件栈同等重要
❌ 多卡 = 算力线性叠加 ✅ 通信效率打折
❌ 消费级显卡也能训大模型 ✅ 显存不够装
❌ 国产卡只是慢一点 ✅ 还差软件生态

九、🎁 给非工程读者的”GPU 心法”

🔑 GPU = SM 工厂 + Tensor Core 矩阵专员
🔑 现代 AI 训练痛点 = 显存 + 带宽
🔑 NVLink / NVSwitch 决定多卡天花板
🔑 看 spec 不只看算力——看带宽、显存、互连

📮 今日话题:如果给你一张 H100,你想用它做什么?

🔮 下一篇预告:s2ep17《CUDA 的真正护城河:为什么 10 年了还没人撼动 NVIDIA》


⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-16 期(阶段七 · AI 基础设施开篇)。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。