⚙️ AI 网络:InfiniBand vs RoCE 的世纪对决

训练 GPT-5 一万张卡—— 每秒钟它们之间要交换 几 TB 数据。 网络如果掉链子,GPU 就是一堆昂贵的暖气。 所以 AI 集群的”血管”特别讲究。

⚙️ AI 深度派专栏 · 第 S2-24 期 📅 2026年11月7日 ✍️ 小敏说 AI

💡 本文要点:本文讲清 AI 集群对网络的特殊需求、InfiniBand 的来历与统治力、RoCE 的反击之路、以太网联盟 UALink / UEC 是怎么回事。


🎯 本文导读

  • 🔹 AI 集群为什么需要专网
  • 🔹 InfiniBand 为什么赢了
  • 🔹 RoCE:以太网的反扑
  • 🔹 NVLink / NVSwitch 是什么
  • 🔹 未来:UEC、CPO、光互联

一、🩺 AI 集群对网络的特殊需求

普通网络应用:

  • 偶发突发流量
  • 一点丢包能容忍
  • 延迟 1-10 ms 够用

AI 训练: | 维度 | 需求 | |—|—| | 带宽 | 400-1600 Gbps/口 | | 延迟 | μs 级 | | 丢包 | 0(一丢就回退、性能跳水) | | 同步性 | 强一致(AllReduce) | | 模式 | 东西向为主,不是南北向 |

💬 关键观点:AI 集群网络的特征是”高带宽 + 低延迟 + 零丢包 + 全互连”。


二、👑 InfiniBand 为什么赢

InfiniBand(IB)是 1999 年提出的协议,原本是想替代 PCIe,结果在 HPC 圈活下来。

三大优势

  1. 原生 RDMA——CPU 不参与,远端内存直接读写
  2. 硬件级零丢包(credit-based flow control)
  3. 极低延迟:1-3 μs

NVIDIA 2020 年收购 Mellanox(IB 鼻祖),从此 IB = NVIDIA 的”网络武器”。

现状

  • 几乎所有顶级 AI 集群用 IB
  • 800 Gbps(NDR)已普及,1600 Gbps(XDR)开始铺
  • NVL72 + IB → 万卡级集群标配

✅ 性能无可争议 ❌ 价格非常贵;生态闭


三、⚔️ RoCE:以太网的反扑

RoCE = RDMA over Converged Ethernet

思路:让以太网也能做 RDMA。

版本 描述
RoCE v1 基于以太网链路层
RoCE v2 基于 UDP/IP,可路由

为什么大家想要 RoCE

  • 以太网更便宜
  • 生态广(开放标准)
  • 运维熟悉

挑战

  • 以太网默认会丢包
  • 必须配 PFC(优先级流控)+ ECN
  • 调优极难——稍不对就爆头一片

用户

  • Meta、Microsoft、字节都在大规模部署
  • 国产数据中心普遍偏好(成本 + 国产化)

🎯 一句话总结:RoCE 便宜但难调;IB 贵但稳。


注意它们 不是网络,是节点内互连。

维度 NVLink InfiniBand
范围 节点内 / 机架内 节点间 / 整集群
带宽 900-1800 GB/s 400-800 Gbps
协议 私有 标准

NVL72(GB200)

  • 72 张 GPU 通过 NVSwitch 组成一个”超级 GPU”
  • 内部带宽 130 TB/s
  • 整柜液冷
  • 价格:单柜 $3-5M+

💬 关键观点:未来 AI 集群 = 节点内 NVLink + 节点间 IB / RoCE。


五、🛡 协议背后的”联盟战”

NVIDIA 阵营

  • InfiniBand(XDR / GDR)
  • NVLink / NVSwitch / NVL-72
  • 全栈私有 + 高性能

反 NVIDIA 阵营

  • UEC(Ultra Ethernet Consortium):AMD、Intel、Meta、Cisco……做”AI 优化以太网”
  • UALink:节点内 NVLink 替代品(开放标准)

时间线

  • 2024 UEC 1.0 草案
  • 2025-2026 量产
  • 2027+ 大规模部署

⚠️ 重要提醒:UEC + UALink 联盟若成功,将是 NVIDIA 网络霸权最大威胁。


六、🔮 未来:光互联与 CPO

铜线 800 Gbps 已接近物理极限。光将取代铜:

技术 描述
可插拔光模块 现有标准
CPO(Co-Packaged Optics) 光器件直接封装在芯片旁
硅光(Silicon Photonics) 用 CMOS 做光器件

CPO 优势:

  • 功耗 ↓ 30-50%
  • 带宽 ↑↑↑
  • 延迟 ↓

NVIDIA Blackwell 已开始集成 CPO 技术。


七、📊 对比表

维度 InfiniBand RoCE v2 NVLink
范围 集群 集群 节点内
带宽 400-1600 Gbps 100-800 Gbps 1800 GB/s
延迟 1-3 μs 3-10 μs < 1 μs
丢包 0 需调优 0
成本 高 低 极高(私有)
难度 中 高(调优) 一体化
厂商 NVIDIA 多家 NVIDIA

八、❌ 常见误区

误区 真相
❌ AI 集群随便用以太网 ✅ 必须 RDMA
❌ 带宽够就行 ✅ 延迟 + 零丢包同样关键
❌ NVLink 能跨机架 ✅ 仅节点内 / NVL72 内
❌ RoCE = IB ✅ 接近但差距仍在

九、🎁 给非工程读者的”AI 网络心法”

🔑 AI 训练的隐形瓶颈在"网络"
🔑 IB 贵但稳;RoCE 便宜但难调
🔑 NVLink 是节点内"超级总线"
🔑 未来:光互联 + CPO 是必然
🔑 国产 / 开源阵营在追,但仍有差距

📮 今日话题:如果你是字节 / 阿里,你会选 IB 还是 RoCE?为什么?

🔮 下一篇预告:s2ep25《边缘 AI 与端侧芯片:手机里跑大模型》


⚙️ 本系列是「小敏说 AI · AI 深度派专栏」第 S2-24 期。 关注公众号 小敏说 AI,回复「深度派」领取第二季合集。