ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Scale-up互连之争:NVLink、UALink与以太网的技术路线与选型解析

Scale-up互连之争:NVLink、UALink与以太网的技术路线与选型解析 一个做基础设施选型的朋友把三家方案同时甩到我桌上NVLink的封闭全家桶、UALink的开放路线图、还有直接用以太网硬顶Scale-up的激进派。他问我不都是把GPU连起来吗凭什么价格差一倍、布线方式完全不一样这个问题值一篇长文。Scale-up之争本质是在争数据中心里最值钱的那条路——GPU与GPU之间的高速互连通道——由谁来修、怎么修、修完之后归谁说了算。这背后是技术选择更是生态话语权的争夺。1. 为什么Scale-up突然成了AI基建的关键词1.1 大模型把算力短缺从芯片层推到了互连层训练一个万亿参数模型能不能跑得快已经不只看单卡算力更看GPU之间交换梯度的管道够不够粗。过去大家比的是FLOPS、显存容量这几年比的是互连带宽、通信时延、NFSo4K这类训练框架能扛住多大的张量并行。模型并行切得越细通信占比越高。8路张量并行下每个Transformer层的前向和反向都要做All-Gather、Reduce-Scatter。模型规模一上来单卡能力再强如果跨卡通信管道太细整个集群就是一颗强大的脑子配了一根细气管跑两下就喘不上气。所以大模型社区率先拥抱了Scale-up机器不是把一堆服务器用网络拼起来而是让所有GPU待在同一台逻辑机器的内部共享一个高速互连域。这个域里的通信不走标准网络协议而是走专门为GPU设计的私有通道或开放标准。谁能把这条通道修得又宽又稳谁就能决定下一代AI集群的性能上限。1.2 算力涨得快网络追得苦过去十年单张GPU的算力增长了上千倍PCIe代际带宽大约每三年翻一倍网络端口速率从10G到100G、400G每代提升虽有四倍但对比算力的增长速度完全不是一个量级。把这个账算到训练上就很直观同样一批数据单卡计算时间每代砍半可通信时间没有跟上那通信占比就会逐年侵蚀硬件红利。业界应对的办法很朴素——在GPU旁边修一条近程高速通道把最重的通信留在机柜内部甚至板卡之间不让它们去挤通用的PCIe或者以太网。NVLink是这条路的天花板UALink想走同一条路但换一个开放姿势以太网则是想用改造通用协议的方式闯进这个领域。1.3 从Scale-out到Scale-up当万卡集群变成一台巨型单机传统互联网服务是Scale-out的典型逻辑无数台独立服务器通过网络协同每一台坏了不影响整体天然适合无状态扩展。AI训练更像Scale-up的逻辑。你可以类比成两种团队协作方式Scale-out是一群人在不同城市远程开会灵活、松散、有网络延迟和沟通成本Scale-up是把所有人塞进同一间面对面办公室沟通几乎零延迟但这间办公室必须造得极其精良——墙体隔音、空气流通、桌椅布局都要定制代价高但沟通效率无与伦比。这解释了为什么NVLink系统越来越像一个整体也解释了为什么UALink联盟想把这些办公室扩到上千人规模以及为什么以太网阵营想抢着给这间办公室装一套公共广播系统。过去大家讨论万卡集群想的是怎么用网络把机器堆起来现在的思路反过来了——先把几十上百张卡焊进同一个互连域再把多个互连域用网络拼成大集群。Scale-up从少数派的HPC玩法变成了主流AI基建的前置条件。2. 三把尺子带宽、延迟、扩展域决定互连方案的一切2.1 带宽每秒能倒多少水比较互连技术第一眼永远是带宽。但带宽要看清楚单位口径双向还是单向峰值还是可持续。NVLink 4.0的每GPU带宽900GB/s是双向合计NVLink 5.0做到1.8TB/s双向PCIe 6.0 x16的单向带宽约128GB/s400G以太网端口满双工状态换算下来大约是100GB/s级别。这些数字放在一起差距是数量级的。带宽就像输水管的直径AI训练里的张量并行、专家并行、流水线并行对管径的渴求没有止境。模型越做越大每次梯度同步的数据量也在涨。只有管径足够粗通信开销才能压到步进时间的个位数百分比。否则算力堆得再高通信瓶颈一卡整卡利用率断崖式下跌。2.2 延迟喊一嗓子到对方听到要多久带宽决定能倒多少水延迟决定打开水龙头到水流出来要多久。在GPU互连里延迟往往比带宽更致命。原因在于GPU通信中有大量同步点A卡算完一步B卡得拿到结果才能继续。每一轮同步延迟就是纯纯的等待时间。NVLink域内的GPU间时延大约在亚微秒到数微秒量级UALink设计目标也在微秒级以下以太网即便用上RDMA单跳转发也通常在数微秒到十几微秒跨多层交换机后更高。看起来几微秒没多少但训练迭代一次也就几十到几百毫秒单次迭代里通信同步次数特别频繁时几次微秒的延迟就会累积成可感知的时间损失。2.3 扩展域这套互连能管多大的摊子互连方案还有一个容易被忽略但极其重要的维度——扩展域就是多少设备能待在同一套互连体系里、像一台机器一样协调工作。NVLink Switch系统可以把256张GPU放进一个NVLink域GB200 NVL72则在一个机柜里用NVLink把72张GPU做成一个逻辑整体。UALink的公开目标是从上千个加速器起步往后往数千扩展。以太网更特殊它的二层域理论上能覆盖几千台设备但能连上和能高速无拥塞地通信是两回事。当以太网要用作Scale-up语义时扩展性直接受制于拥塞控制和时延抖动规模一大性能损耗指数级上升。维度NVLinkUALink以太网Scale-up方向定位私有加速器互连开放加速器互连标准通用网络协议向Scale-up延伸代表带宽量级900GB/s至1.8TB/s双向单链路从PCIe 6.0口径起步域内聚合看实现单端口400G/800G聚合取决于拓扑时延量级亚微秒到数微秒目标微秒级以下单跳数微秒端到端更高域内规模数百GPU量级规划上千至数千理论可大实际受拥塞限制生态完全私有开放联盟治理开放事实标准成熟度量产多年最成熟规范早期产品落地中设备成熟Scale-up语义仍在演进这三把尺子一旦并排摆出来结论就很明显NVLink是私人高速路UAlink是开放高速路联盟以太网是把公共马路改造成高速路的工程。三者比的不是单一指标而是谁能在带宽、时延、扩展域的综合战场上满足AI训练的真实需求。3. NVLinkNVIDIA私有的高速路为什么让所有人又爱又恨3.1 从GPU直连到NVLink Switch一场拓扑革命第一代NVLink只是把两张GPU用高速线做点对点直连解决双卡通信。那时的思想还停留在把一根线加粗。真正的转折是NVLink Switch。它的引入把互连从点对点变成了星形交换一颗NVSwitch芯片提供几十个端口任意GPU和任意GPU之间都能以接近全速通信。直连GPU像给每对朋友拉一条热线设备一多就成线缆地狱NVSwitch像建了一座超大型立交桥所有车流都汇聚到桥面上但桥上不堵车。没有它H100时代的8卡、甚至DGX系统不可能把每张卡都跑到900GB/s。NVLink的演进曲线也从侧面说明问题P100时代约160GB/sV100约300GB/sA100约600GB/sH100达到900GB/s到了B200平台直接翻倍到1.8TB/s。这个速度已经远远甩开了PCIe和以太网任何一个跑过大规模训练的人都会对这份数据心服口服。3.2 第五代NVLink为什么非要做到1.8TB/s很多人问GB200 NVL72里的NVLink 5.0做到每GPU 1.8TB/s双向是不是性能过剩不是。张量并行是当前大模型训练最核心的并行策略之一而张量并行恰恰是通信量最大的模式。你可以想象一群人同时砌一堵墙每个人砌一块砖就得看旁边人砌的进度理论上最理想的通信是零延迟交换所有现场观察。现实里做不到但NVLink 5.0的方向就是把这个交换成本压到极低。一个训练案例做8路张量并行时每步迭代每个GPU和其他GPU交换的数据量常常是几百MB级只有TB/s级互连才能让这一步通信开销降到总时间的好几个百分点以内。这个量级以太网无能为力UALink的1.0规范也还要追赶。3.3 生态锁定的另一面全栈固然甜绑定你要看清NVLink从来不单卖它绑在NVIDIA的整个系统里GPU硬件、NVSwitch、网卡、CUDA、通信库、集群管理工具。买NVLink系统本质上是买了一整套NVIDIA定义的AI基础设施。好处很明显性能确定性极高NVIDIA已经帮你把所有软硬件调过一遍开箱即用。坏处也很明显价格高、供应链受制于一家厂商、失去选择权。行业内所有人都知道这层绑定所以反制力量才会出现。UALink、UEC、以太网阵营的每一次动作本质上都是围绕NVLink太强但它姓NVIDIA这件事展开的。3.4 从业者视角NVLink是好技术但标准不能只有一家如果只论技术完成度NVLink今天的地位没有争议它是唯一的量产级Scale-up互连性能、稳定性、生态配合度都无可挑剔。但把它当成事实标准来拥护对行业不是好事。标准这个词的本意是大家共同遵守的规则而NVLink的规则只由NVIDIA一家制定。它今天开放给所有人用不代表明天还会这样做它今天定的价格也没有任何协商机制。任何一个想长期做AI基础设施的团队都应该在拥抱NVLink的同时认真关注开放路线的进展。这不是唱反调这是给自己留后路。4. UALink开放阵营的标准答案实验4.1 UALink联盟一堆行业巨头攒的局UALink全称Ultra Accelerator Link由AMD、Broadcom、Cisco、Google、HPE、Intel、Meta、Microsoft等公司组成的联盟主导。这些名字放在一起潜台词非常明确不能让NVIDIA一家定义AI加速器怎么互连。联盟想做的事是定义一套开放的、多厂商支持的加速器互连规范让GPU、AI加速器、DPU、交换机都能按同一套标准互联。回到话题本身就是NVLink能做到的UALink也想做到只不过它是大家的。这个联盟的产业基础并不弱。AMD有Instinct系列MI300/MI350Google有TPUMeta有自研MTIA加上Intel的Gaudi和可能的外部队列这批非NVIDIA加速器合起来是一个庞大的潜在市场。它们需要一个公共的、高效的Scale-up互连否则每家的加速器都各搞一套封闭方案生态碎片化程度会彻底劝退客户。4.2 技术路线借PCIe/CXL的杯子倒自己的酒UALink的一大特点是复用PCIe物理层生态。消费者不用重新发明SerDes不必从零设计线缆和连接器而是站在PCIe/CXL的既有物理基础上把协议层做成面向AI加速器的专用形态。按联盟公开信息UALink 1.0规范已经推出目标是构建支持上千加速器规模的互连域链路能力参考PCIe 6.0口径向上走UALink 2.0在规划中继续扩展节点规模。UALink的开放也不是嘴上说说而是把规范和验证机制交给联盟治理任何厂商都能基于它做产品用户也能在不同厂商之间做选择。我对标NVLink做判断UALink在协议设计思路上更灵活它不用背负NVLink的历史兼容包袱可以直接面向当前AI负载做精简时延目标甚至可以压得更低。4.3 落地难点标准从来只是第一步做出一套规范和拿出能量产、稳定、有好用的软件栈支持的设备中间隔着一条鸿沟。回看历史InfiniBand当初也是开放标准技术性能在当时压制以太网但最终规模化落地还是靠后来与CUDA生态深度绑定才真正起飞。UALink面前有一个同样的课题规范和芯片可以有但跑在上面的通信库、调试工具、运维实践是否也能跟上如果不能光有标准很难打动工程团队。还有一个现实问题NVIDIA加速器依然占据AI市场的绝对大头UALink眼下能够服务的对象主要是AMD、自研芯片和少量新入局者。这部分市场在快速增长但要撼动NVLink的存量地位还要时间。我对UALink的态度是审慎乐观。它不会让NVLink一夜消失但它给了非NVIDIA方案一个活下来的理由。对使用者来说多一个选择本身就是好事哪怕只是用它作为和NVIDIA谈判的筹码。5. 以太网从机房外围杀向机箱内部的野心5.1 传统以太网的角色Scale-out的代名词在很长一段时间里以太网是Scale-out的代名词。服务器与服务器之间、机柜与机柜之间靠以太网互联配合TCP/IP或RoCE跑分布式训练。今天绝大多数AI集群的域间网络依然是Spine-Leaf架构的以太网或InfiniBand。在这个定位里以太网负责把多个Scale-up域拼成一个更大的训练集群。比如一个机柜里的8张或72张GPU通过NVLink组成了一个域几十个这样的域再靠400G以太网连起来。域内通信享受超低时延和超高带宽域间通信依靠以太网的大规模覆盖能力。这套混合架构目前是行业主流但以太网阵营显然不满意只做外围它们想往更核心的位置挤。5.2 UEC超以太网把尽力而为改造成倒逼无损UECUltra Ethernet Consortium是另一大联盟AMD、Broadcom、Cisco、Intel、Meta、Microsoft等巨头都在里面。UEC的思路不是另起炉灶而是对以太网做外科手术级改造让它能满足AI训练的低时延、低抖动、无损要求。核心改进集中在几个方向分组喷洒packet spraying取代单一链路负载均衡提升多路径利用率更精准的拥塞控制替代传统ECNPFC的粗放组合更细粒度的时戳和流控减少网络中的微突发拥塞。目标是让以太网的性能和可靠性逼近InfiniBand同时保留以太网的开放性和成本优势。更进一步以太网阵营也想在Scale-up层扎根用高密度交换芯片、线性直连铜缆和背板互连把多张GPU/加速器直接挂在一个超低时延以太网交换域里。这个设想一旦走通用户可以在Scale-up域就用标准以太网设备采购和运维逻辑都会发生巨大变化。5.3 以太网做Scale-up的先天难题理想很丰满现实有很多坑。以太网从诞生起就是尽力而为的协议它默认丢包、默认重传、默认时延抖动。为了变成AI训练需要的无损低时延网络历史上加了很多补丁PFC、ECN、DCQCN、RoCEv2。补丁越多系统越复杂故障模式也越难排查。我自己在测试环境里跑过不少RoCE的训练集群。小规模时体验很好几条命令配完性能非常亮眼一旦扩大到几百卡拥塞控制参数、PFC阈值、流表配置之间的隐性冲突就开始冒头。论文里出现的那种网络性能雪崩我在真实集群里见过不止一次。这不是说以太网不行而是说它做Scale-up这件事工程难度比NVLink、UALink都大。专用互连可以精简协议、砍掉历史包袱以太网却必须背着一大堆兼容性负担往前跑。好处是成本低、供应链广、工程师技能储备足一个组织大概很难拒绝这种诱惑。如果UEC能把拥塞管理做到足够好以太网确实有可能在Scale-up域撕开一道口子。6. 落到现实不同规模、不同预算应该怎么选6.1 先看懂自己的规模再谈技术路线技术讨论到最后都要落到一个问题上我该买什么。互连方案的选择首先取决于你到底要在一个互连域里放多少加速器。集群规模互连策略说明单机4至8卡板载PCIe或NVLink大多数训练、微调场景够用优先控制成本单机柜16至72卡NVLink域或UALink首批产品张量并行收益明显通信瓶颈变小中等规模32至256卡多机柜组Scale-up域域间走以太网混合架构兼顾性能与灵活性大型集群256卡以上NVLink/UALink做域内以太网或IB做域间重点在于域间调度、网络容量与故障域设计如果只是跑微调或者推理老老实实买几张卡走PCIe完全没毛病。但如果你要训练千亿甚至万亿参数模型那就别在互连上省钱Scale-up域的性能决定了整个集群的上限。6.2 兼容性、成本、风险的综合考量做选型时大部分人先看单价却容易忽略后面的隐性成本。NVLink系统贵但省心软硬件都是通的出了问题NVIDIA生态里的工具链能快速定位开放系统便宜但你自己得当胶水把加速器、交换芯片、通信库、调度平台拼在一起团队里必须有人懂网络又懂系统。以一个做垂直行业大模型的中型公司为例三十多人的算法团队两三个负责平台的工程师。如果选NVLink整体方案平台工程师可以省出一半精力去调模型如果选开放方案都必须有人花大量时间在互连调试上。所以我的建议很直白预算充足、想快速出成果、不希望团队被基础设施细节拖住就选NVLink体系有多厂商设备、自研芯片、或者长期掌控基础设施的需求就开始认真评估UALink生态。但无论走哪条路团队里至少要有一个能把互连这三个字讲清楚的人这个角色在未来AI基础设施团队里的价值会越来越高。6.3 未来18个月的一个判断NVLink不会停步NVIDIA必然会继续提升带宽、扩大域规模继续保持它的市场优势。UALink会在2025到2026年拿出可用的产品但成熟度不可能一步到位大概率还要经历一两代迭代。以太网这边的UEC规范会逐步落地在Scale-out层面带来更多实测收益而在Scale-up层面会继续艰难试探。如果你已经在规划明年的AI集群我的建议是关注两点一是UALink产品的实际互操作测试看它是不是真的能像宣传里那样跨厂商工作二是NVIDIA对开放生态的态度有没有松动。这两个信号比任何单卡性能跑分都更能预测未来两年的格局。最后再分享一个私人观察互连技术的学习曲线虽然陡但它不是玄学。把本文提到的三把尺子——带宽、时延、扩展域——装进脑子里再看任何互连方案都会清晰很多。别被厂商的PPT数字牵着走先想清楚自己到底要把多少设备变成一个整体再反推该用哪套方案。这个思考顺序能帮你避开大部分选型陷阱。
返回列表