NVLink vs Ethernet 有什么区别?Scale-up 与 Scale-out 网络比较

作者 Klaro 编辑部 ·发布于 2026年8月24日

NVLink 机内 GPU scale-up 与 Ethernet 集群 scale-out 的拓扑比较
网络层级根据 NVIDIA、Ethernet Alliance、UALink 与 SEC 文件截至 2026 年 8 月 24 日整理。
目录

NVLink 主要连接同一伺服器或机架级系统内的 GPU/CPU,建立高带宽、低延迟的 scale-up 加速器域;Ethernet 主要把更多伺服器、存储与数据中心连成 scale-out 网络。 两者通常同时存在:节点内用 NVLink/NVSwitch,节点间用 Ethernet 或 InfiniBand。[1] [2]

Klaro Research 核心结论: NVLink 解决「少量至机架级加速器像一台更大机器共同工作」;Ethernet 解决「更多独立节点如何可靠扩展和互通」。前者强调 accelerator coherence、collective 和拓扑整合,后者强调开放网络、路由、供应商与数据中心规模。比较标称 Tb/s 而不固定端点、方向和聚合,没有决策价值。

本文资料截至 2026 年 8 月 24 日。UALink 1.0 显示业界亦在建立开放 scale-up 加速器互连;NVIDIA 年报证明 NVLink、InfiniBand、Ethernet 和系统平台共同构成商业产品,不是互相排他的单一芯片。[3] [4]

NVLink 机内 GPU scale-up 与 Ethernet 集群 scale-out 拓扑比较

NVLink 机内 GPU scale-up 与 Ethernet 集群 scale-out 拓扑比较

NVLink 与 Ethernet 比较框架手机版

NVLink 与 Ethernet 比较框架手机版

维度 NVLink/NVSwitch Ethernet
主要层级 scale-up:节点/机架内加速器域 scale-out:伺服器、机架、园区与数据中心
端点 GPU、CPU、NVSwitch NIC、DPU、交换机、路由器、存储
语义 加速器间高带宽存取与 collective 封包网络、IP/RDMA、路由与广泛互通
拓扑 高度受系统平台定义 leaf-spine、Clos、多层数据中心网络
生态 NVIDIA 平台集中;UALink 提供开放相邻路线 多供应商、IEEE/UEC/IP 生态
主要瓶颈 GPU 域大小、封装、交换、功耗与线缆/光学 拥塞、尾延迟、路由、NIC/交换机和运维

Scale-up 和 Scale-out 有什么不同?

Scale-up 把加速器连成更大的共享运算域,让模型并行和细粒度 collective 更快;scale-out 把多台已具本地运算能力的伺服器组成更大集群。前者追求极低延迟与高带宽,后者要兼顾容错、路由、租户、存储和大量节点。

Google TPU 也使用 ICI 建立 slice,再用数据中心网络连接多 slice,说明「内部专用互连 + 外部 scale-out」是广泛系统模式,不只 NVIDIA。

NVSwitch 做什么?

NVSwitch 在多 GPU 系统内交换 NVLink 流量,让 GPU 不只点对点连接。系统拓扑决定可用总带宽与 collective 路径;把单一 NVLink 速率乘端口数,不能直接当应用可用带宽。

NVIDIA 将 NVLink 定位 scale-up,Quantum InfiniBand/Spectrum-X Ethernet 定位 scale-out。这是官方系统层级,而不是本文章任意分类。[1]

一般不在同一层直接取代。Ethernet 可向机架内更短距离和更低延迟演进,NVLink/UALink 也可扩大加速器域;边界会重叠,但 Ethernet 仍承担开放 scale-out,专用互连承担更紧耦合 scale-up。

UALink 的目的正是建立开放高带宽 scale-up accelerator interconnect,说明竞争不只「NVLink vs Ethernet」,还包括专用/开放 scale-up 生态。[3]

光互连为何会进入 scale-up?

GPU 域扩大后,铜的距离、密度和功耗成为限制,CPO/LPO/光 scale-up 可能把光学带到机架内或机架间。这会提高 SerDes、光引擎、雷射、封装和纤维管理的重要性,详见 CPO vs LPO光模块产业链

如何做公平性能比较?

固定 GPU 数、模型、精度、拓扑、collective、软件和容错,再比较 job completion time、goodput、功耗、故障恢复与总成本。NVLink 单链路带宽和 Ethernet 交换机总容量使用不同分母,不能直接相除。

常见问题

NVLink 是网络吗? 它是 NVIDIA 的高速处理器互连,可在 GPU/CPU 和 NVSwitch 间传输;功能比一般数据中心 Ethernet 更接近 scale-up fabric。

NVLink 和 InfiniBand 有什么不同? NVLink 多用于节点/机架内 GPU 域;InfiniBand 多用于节点间 scale-out HPC/AI fabric。两者可同时使用。

Ethernet 能否用于 GPU 训练? 可以,通常配合高速 NIC、RoCE/UEC、拥塞控制和 collective 优化;普通企业配置不等于已准备好大型 AI。

UALink 是 Ethernet 吗? 不是。UALink 是开放的 scale-up accelerator interconnect 规格,与 Ethernet 的 scale-out 生态相邻但层级不同。

投资者应追踪哪一层? 先分 GPU/switch scale-up、NIC/交换机 scale-out、光模块/CPO 物理层,再看各公司在该层的收入、毛利和客户份额。

Klaro Research

资料来源与更新依据

资料截止:2026年8月24日

  1. [1] NVIDIA NVIDIA AI networking architecture

    第一方 · 原始资料 · 查阅:2026年8月24日

  2. [2] Ethernet Alliance 2026 Ethernet Roadmap

    权威资料 · 方法文件 · 查阅:2026年8月24日

  3. [4] NVIDIA/美国证券交易委员会 NVIDIA FY2026 Form 10-K

    第一方 · 监管申报 · FY2026 · 查阅:2026年8月24日

研究限制

  • NVLink 与 Ethernet 服务不同拓扑层级,速率单位、聚合方式与系统边界不同;本文不把标称带宽直接排名。
  • 产品代际、NVSwitch、NIC、交换机、CPO、软件和拓扑快速演进,具体系统须按当代官方规格核对。

需要重新检查的事件

  • NVLink、UALink、Ethernet/UEC 新代际形成量产系统和互通资料时,更新 scale-up/scale-out 边界。
  • 机架级系统、CPO 或光 scale-up 改变 GPU 域大小、功耗和成本时,重做拓扑比较。

本文仅供参考,不构成投资建议。