⚙️ AI 网络:InfiniBand vs RoCE 的世纪对决
⚙️ AI 网络:InfiniBand vs RoCE 的世纪对决
训练 GPT-5 一万张卡—— 每秒钟它们之间要交换 几 TB 数据。 网络如果掉链子,GPU 就是一堆昂贵的暖气。 所以 AI 集群的”血管”特别讲究。
⚙️ AI 深度派专栏 · 第 S2-24 期 📅 2026年11月7日 ✍️ 小敏说 AI
💡 本文要点:本文讲清 AI 集群对网络的特殊需求、InfiniBand 的来历与统治力、RoCE 的反击之路、以太网联盟 UALink / UEC 是怎么回事。
🎯 本文导读
- 🔹 AI 集群为什么需要专网
- 🔹 InfiniBand 为什么赢了
- 🔹 RoCE:以太网的反扑
- 🔹 NVLink / NVSwitch 是什么
- 🔹 未来:UEC、CPO、光互联
一、🩺 AI 集群对网络的特殊需求
普通网络应用:
- 偶发突发流量
- 一点丢包能容忍
- 延迟 1-10 ms 够用
AI 训练: | 维度 | 需求 | |—|—| | 带宽 | 400-1600 Gbps/口 | | 延迟 | μs 级 | | 丢包 | 0(一丢就回退、性能跳水) | | 同步性 | 强一致(AllReduce) | | 模式 | 东西向为主,不是南北向 |
💬 关键观点:AI 集群网络的特征是”高带宽 + 低延迟 + 零丢包 + 全互连”。
二、👑 InfiniBand 为什么赢
InfiniBand(IB)是 1999 年提出的协议,原本是想替代 PCIe,结果在 HPC 圈活下来。
三大优势
- 原生 RDMA——CPU 不参与,远端内存直接读写
- 硬件级零丢包(credit-based flow control)
- 极低延迟:1-3 μs
NVIDIA 2020 年收购 Mellanox(IB 鼻祖),从此 IB = NVIDIA 的”网络武器”。
现状
- 几乎所有顶级 AI 集群用 IB
- 800 Gbps(NDR)已普及,1600 Gbps(XDR)开始铺
- NVL72 + IB → 万卡级集群标配
✅ 性能无可争议 ❌ 价格非常贵;生态闭
三、⚔️ RoCE:以太网的反扑
RoCE = RDMA over Converged Ethernet
思路:让以太网也能做 RDMA。
| 版本 | 描述 |
|---|---|
| RoCE v1 | 基于以太网链路层 |
| RoCE v2 | 基于 UDP/IP,可路由 |
为什么大家想要 RoCE
- 以太网更便宜
- 生态广(开放标准)
- 运维熟悉
挑战
- 以太网默认会丢包
- 必须配 PFC(优先级流控)+ ECN
- 调优极难——稍不对就爆头一片
用户
- Meta、Microsoft、字节都在大规模部署
- 国产数据中心普遍偏好(成本 + 国产化)
🎯 一句话总结:RoCE 便宜但难调;IB 贵但稳。
四、🔗 NVLink / NVSwitch:节点内”超级总线”
注意它们 不是网络,是节点内互连。
| 维度 | NVLink | InfiniBand |
|---|---|---|
| 范围 | 节点内 / 机架内 | 节点间 / 整集群 |
| 带宽 | 900-1800 GB/s | 400-800 Gbps |
| 协议 | 私有 | 标准 |
NVL72(GB200)
- 72 张 GPU 通过 NVSwitch 组成一个”超级 GPU”
- 内部带宽 130 TB/s
- 整柜液冷
- 价格:单柜 $3-5M+
💬 关键观点:未来 AI 集群 = 节点内 NVLink + 节点间 IB / RoCE。
五、🛡 协议背后的”联盟战”
NVIDIA 阵营
- InfiniBand(XDR / GDR)
- NVLink / NVSwitch / NVL-72
- 全栈私有 + 高性能
反 NVIDIA 阵营
- UEC(Ultra Ethernet Consortium):AMD、Intel、Meta、Cisco……做”AI 优化以太网”
- UALink:节点内 NVLink 替代品(开放标准)
时间线
- 2024 UEC 1.0 草案
- 2025-2026 量产
- 2027+ 大规模部署
⚠️ 重要提醒:UEC + UALink 联盟若成功,将是 NVIDIA 网络霸权最大威胁。
六、🔮 未来:光互联与 CPO
铜线 800 Gbps 已接近物理极限。光将取代铜:
| 技术 | 描述 |
|---|---|
| 可插拔光模块 | 现有标准 |
| CPO(Co-Packaged Optics) | 光器件直接封装在芯片旁 |
| 硅光(Silicon Photonics) | 用 CMOS 做光器件 |
CPO 优势:
- 功耗 ↓ 30-50%
- 带宽 ↑↑↑
- 延迟 ↓
NVIDIA Blackwell 已开始集成 CPO 技术。
七、📊 对比表
| 维度 | InfiniBand | RoCE v2 | NVLink |
|---|---|---|---|
| 范围 | 集群 | 集群 | 节点内 |
| 带宽 | 400-1600 Gbps | 100-800 Gbps | 1800 GB/s |
| 延迟 | 1-3 μs | 3-10 μs | < 1 μs |
| 丢包 | 0 | 需调优 | 0 |
| 成本 | 高 | 低 | 极高(私有) |
| 难度 | 中 | 高(调优) | 一体化 |
| 厂商 | NVIDIA | 多家 | NVIDIA |
八、❌ 常见误区
| 误区 | 真相 |
|---|---|
| ❌ AI 集群随便用以太网 | ✅ 必须 RDMA |
| ❌ 带宽够就行 | ✅ 延迟 + 零丢包同样关键 |
| ❌ NVLink 能跨机架 | ✅ 仅节点内 / NVL72 内 |
| ❌ RoCE = IB | ✅ 接近但差距仍在 |
九、🎁 给非工程读者的”AI 网络心法”
🔑 AI 训练的隐形瓶颈在"网络"
🔑 IB 贵但稳;RoCE 便宜但难调
🔑 NVLink 是节点内"超级总线"
🔑 未来:光互联 + CPO 是必然
🔑 国产 / 开源阵营在追,但仍有差距
📮 今日话题:如果你是字节 / 阿里,你会选 IB 还是 RoCE?为什么?
🔮 下一篇预告:s2ep25《边缘 AI 与端侧芯片:手机里跑大模型》
⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-24 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。