🔀 Crossbar Fabric · NVLink Switch · Rack-Scale Interconnect

什么是 NVIDIA NVSwitch(GPU 交换机芯片)?

把几十上百张显卡无缝熔接为单一超算的心脏中枢!看懂 NVLink 与 NVSwitch 的本质区别、为什么两两直连走不通,以及 72 颗 GPU 全双工全互联的工程奇迹

无交换芯片: 朴素点对点直连 (Point-to-Point)
🕸️🐌 杂乱缠绕且无法扩展的私拉电线

如果显卡之间只靠 NVLink 导线直接两两对插,连接 8 张显卡需要 28 根线;连接 72 张显卡则需要 2,556 根复杂的网状连线!GPU 身上根本没有那么多物理接口,而且无法做到任意两卡满血直达,节点稍大通信就会严重受阻

❌ 连线复杂度随卡数指数级暴增 N(N-1)/2 ❌ GPU 物理端口数严重受限 ❌ 无法跨机架形成统一大显存池
VS
NVSwitch: 专用 Crossbar 超级交换中枢
🚄🔀 高铁中央交通总站·全员全速直达

英伟达专为 GPU 集群研发的硬件交换芯片! 每张 GPU 只需把自己的 NVLink 通道接入 NVSwitch。NVSwitch 内部是一个超高带宽的 Crossbar 交叉矩阵,提供全双工、任意两张 GPU 之间完全对等、零拥塞的全速数据交换,顺手完成 SHARP 网内求和!

✅ 任意卡之间全速无阻塞 (Non-blocking) ✅ 支持扩展至 72 卡 NVL72 铜缆集群 ⭐ 硬件 SHARP 网内计算规约加速
💡

5岁核心顿悟:有了 NVLink(线),为什么非要造 NVSwitch(交换机芯片)?

NVLink 是‘光速马路’,而 NVSwitch 是‘智能立体大立交枢纽’ 🛣️➡️🔀
• 如果两栋房子来往,修一条 NVLink 直通公路很简单;
• 但如果有 8 栋、甚至 72 栋房子(72 颗 GPU),如果每两栋楼之间都修一条专属公路,整个城市会被几千条公路彻底塞死,地基根本放不下!
NVSwitch 解决了这个物理死结 🏢✨
• 每栋房子只修一条超宽公路通向城市的中心大转盘(NVSwitch);
• NVSwitch 芯片内部拥有惊人的数据吞吐力(Blackwell 时代单片交换吞吐高达 28.8 Tbps / 3.6 TB/s),它能瞬间将 GPU 1 的数据精准投递给 GPU 72,所有卡随时以光速互相读写显存!

NVSwitch 统治 AI 集群网络的三大必杀技

从 Crossbar 无阻塞拓扑、硬件网内计算到底层缓存一致性

🔀

1. 真正的任意对任意全互联 (Any-to-Any)

内部采用全交叉开关(Crossbar Fabric),所有连接到交换机上的 GPU 享有完全相同的最低延迟和对称极速带宽,消灭了任何层级瓶颈。

🧮

2. SHARP 硬件网内计算 (In-Network Computing)

大模型训练最耗时的分布式求和(All-Reduce),数据在流经 NVSwitch 芯片的瞬间,交换机内部算力单元顺手就把加法算完了,GPU 算力利用率翻倍!

🧱

3. 机架级铜缆物理背板 (NVL72 Spine)

在 GB200 NVL72 机柜中,9 个独立的 NVSwitch 托盘通过 5,000 根双轴高精度铜缆直接贯穿整个机架,功耗极低且零光模块故障率。

📊 历代 NVSwitch 芯片规格飞跃

从单机 8 卡到机架级 72 卡巨型芯片的进化:

NVSwitch 1 (Volta)
960 GB/s
首次实现 DGX-2 16卡全互联
NVSwitch 3 (Hopper)
3.2 TB/s
64 端口 · 4nm 制程 · SHARP v3
NVSwitch 4 (Blackwell)
7.2 TB/s
双向 14.4 TB/s · 支持 NVL72
GB200 NVL72 总带宽
130 TB/s
9 台 NVSwitch 协同全机架全互联

🎮 交互模拟器:推演 NVSwitch 在集群内部调度数据的高速流水

点击查看大模型张量通信与多卡数据交换在 NVSwitch 调度下的实战表现: