ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AI供应链牛鞭效应:从MetaRoCE开源到GPU过剩的传导路径

AI供应链牛鞭效应:从MetaRoCE开源到GPU过剩的传导路径 1. AI 供应链最近到底发生了什么为什么值得你停下来读AI 供应链最近出现了一次教科书级别的连锁反应MetaRoCE 开源、ChatGPT Work 采用断层、牛鞭效应在硬件层被反复放大这三件事本质上是一个故事的三段剧情。我在基础设施圈待了这么多年第一次觉得供给和需求之间那根弦被拉到这么紧——上游厂商拼命扩产中游云厂商一边抢卡一边退单下游企业用户却在 POC 里打转。这篇文章我就把自己观察到的整条传导路径拆开讲顺便给同样在震荡期里做技术选型和预算规划的同学一些可落地的参考。先说我为什么会对这两件看上去不相干的事产生警觉。Meta 开源 RoCE 网络相关的成果这属于基础设施层的技术事件很多人只把它当成又一个开源项目上架ChatGPT Work 在企业端采用遇冷又常被归为产品落地难的老话题。但如果你把 AI 行业放回供应链框架里看会发现它们分别是供给侧新增了一个替代变量和需求侧出现了一段失真信号。当这两个变量同时叠加上下游的订单预测和行为决策就会开始互相踩踏这就是我在标题里点名的牛鞭效应。这篇文章适合三类人一类是负责算力采购、集群规划、网络选型的基础设施工程师一类是在企业里推进 AI 工具落地的技术管理者和产品负责人还有一类是关注 AI 行业投资与创业节奏的从业者。我尽量不堆术语但涉及 RoCE、RDMA、InfiniBand 这些网络基础概念时会展开解释保证没接触过数据中心网络的读者也能跟上。2. 从用户敲下回车到芯片厂排产AI 供应链中间隔着多少层2.1 一条被所有人低估的长链条大多数人理解 AI 行业看到的是最上游的模型发布和最下游的对话框打字。但一条完整的 AI 供应链其实长这样终端用户和应用场景排在最前端往下是调用这些能力的软件产品再往下是大模型训练与推理服务紧接着是承载这些服务的算力集群——服务器、GPU、网络设备再往深处走是芯片设计、先进封装、存储颗粒最底层是代工产能和上游材料。每一层都有自己的下单节奏、库存逻辑和度量方式。终端用户按天产生请求量云厂商按季度评估扩容GPU 采购合同的周期往往以年计算而芯片代工从投片到出货要经历数月甚至更长的周期。层与层之间的时间尺度越拉越大需求信号在传递过程中的失真程度就越严重。这里有个特别容易被忽视的点AI 供应链不是一个单线结构而是一张网。算力可以来自自建集群、云上租用、裸金属托管、甚至二手卡市场需求可以从多个入口分流。这张网的出口越多每一层对真实需求的判断就越困难。2.2 为什么网络层才是整条链的心跳我在跟不少做 AI 训练的同学聊的时候发现大家普遍盯着 GPU 的算力指标却很少关注 GPU 之间的通信效率。分布式训练的本质是让几千张卡协同完成同一个任务训练过程中频繁发生集合通信——梯度聚合、参数同步、模型分片交换。网络质量直接决定 GPU 有多少时间在真正计算、有多少时间在空等数据。业内有个词叫通信占比如果一次迭代 10 秒其中 3 秒花在等网络数据那通信占比就是 30%等于三成算力在闲置。高性能网络的价值就在这里——把通信占比压下去GPU 利用率才能提上来。网络层之所以是整条供应链的心跳不只是因为它决定性能还因为它决定了算力集群的采购组合选 InfiniBand 还是选以太网加 RoCE交换机品牌和端口速率怎么配网卡是否支持 RDMA这些决定直接影响了硬件成本结构、交付周期和运维复杂度。网络层的每个技术路线变化都会沿着供应链向上游传导——这就是 MetaRoCE 开源这件事值得单独拿出来聊的原因。3. MetaRoCE 开源网络层突然多了一个改写采购逻辑的变量3.1 先补课RoCE 到底是干什么的RoCE 全称是 RDMA over Converged Ethernet翻译过来就是在融合以太网上跑 RDMA。RDMA 是一种允许网卡直接把数据从一个服务器的内存搬到另一个服务器内存的技术绕过操作系统内核和 CPU 参与实现极低的延迟和极高的吞吐。传统 TCP 协议走内核协议栈每次收发都有开销在大规模分布式训练里根本扛不住频繁的集合通信。RDMA 把数据通路从 CPU 手里解放出来让网络传输变得像本地内存访问一样快。RoCE 最大的特点在于它跑在以太网上而 RDMA 最初的载体实际上是 InfiniBand。InfiniBand 是专门为高性能计算设计的网络架构性能确实强但设备生态相对封闭价格也更贵。RoCE 让 RDMA 能力可以在标准以太网基础设施上实现理论上能用更低的成本获得接近 InfiniBand 的性能。代价是工程复杂度上来了以太网本身是尽力而为的网络丢包、拥塞、乱序都是常态而 RDMA 对丢包极其敏感一个报文丢失可能拖垮整条链路的重传效率。于是 RoCE 网络里最核心的难题变成了拥塞控制——什么时候降速、该让谁降速、怎么让整个集群的流量像水流一样平稳分布。Meta 开源的 MetaRoCE按标题消息的指向看就是把他们大规模 AI 集群中运行 RoCE 网络积累的相关成果——拥塞控制算法、网络调优配置、运维工具链这一类的东西——以开源形式放出来。对这种项目我的判断是它不只是代码层面的一次贡献更是对整个 AI 网络生态的一次姿态调整。3.2 开源带来的连锁反应比代码本身更重要先说采购层面的变化。AI 训练集群选型时网络方案通常只有两个选项InfiniBand 或者 RoCE。InfiniBand 生态成熟、性能稳定但成本高且被单一厂商主导RoCE 开放、兼容现有以太网设施但对工程师的调优能力要求极高。过去很多团队不敢选 RoCE就是因为拥塞控制这类核心技术掌握在少数设备厂商手里出了问题只能提工单等回复。MetaRoCE 这类开源成果相当于把大型互联网公司千卡、万卡集群上验证过的网络运营经验公开出来等于告诉所有人RoCE 这条路不仅走得通而且已经被跑大规模生产系统的人验证过了。这会直接影响三个层面的决策。第一交换机采购不再是非 InfiniBand 不可基于标准以太网配合 RoCE 的方案在成本上的优势会被重新评估第二网卡和驱动层面的竞争会加剧开源协议栈降低了新硬件进入生态的门槛第三云厂商可以用更低的网络成本提供裸金属训练集群把省下来的成本投射到租金上反过来倒逼上一轮囤积 InfiniBand 设备的数据中心重新算账。我在这一节想强调的关键点是供应链上的技术选型从来不只是性能对比而是替代弹性的博弈。当某个关键环节只有一种成熟方案时它的定价权、交付周期、升级节奏都掌握在供应商手里而一旦开源方案提供了一个可信的替代项整个采购谈判的天平就会移动。MetaRoCE 开源的真正意义是让 AI 训练网络的供给曲线从单一通道变成了双通道替代弹性上来了上游的议价空间和下游的成本结构都会跟着变。4. ChatGPT Work 的采用断层需求信号正在被虚火污染4.1 断层比大多数人想象的更真实MetaRoCE 开源解决的是供给端怎么更便宜地造算力的问题而 ChatGPT Work 在企业端的采用情况直接关系到终端到底有多少真实需求。我这里的 ChatGPT Work 泛指以 ChatGPT 为代表的一批生成式 AI 工作工具在实际企业环境中的部署应用状态。断层这个词是我有意选的因为它比推进缓慢更准确。实际情况是个体热情很高组织落地停滞。员工自己注册账号用得不亦乐乎但公司层面的采购流程、权限管控、预算归属全都没跟上POC 项目做了不少真正进入生产环境、跑在核心业务流里的极少。典型的症状包括安全合规评审卡在第一轮数据权属问题无人拍板IT 部门不清楚该把 AI 工具的预算划在哪个科目下业务部门又担心用错工具导致责任事故。这种断层的本质是个人生产力提升和组织流程再造之间没有搭桥。AI 工具帮助个体写周报、生成代码片段、整理会议纪要这类价值是即时且清晰的但企业级的价值需要系统集成、权限架构、审计追踪、知识库治理这些配套工程才能兑现。后者是重活、慢活没人愿意为它买单断层就产生了。4.2 断层如何污染上游的需求信号关键是这个断层对供应链意味着什么。供应链每一层做决策时依赖的都是层与层之间的订单信号而订单信号的起点是终端用量。当企业端采用处于断层时终端用量呈现出的形态非常具有迷惑性总注册数和总调用量可能很高但付费深度很浅稳定留存很少。这会造成两类相反的误判。一类误判是高估——看到用户增长曲线陡峭认定需求还会继续爆发于是云厂商下单购买 GPU 训练容量的节奏明显快于实际推理负载的增长另一类是低估——当业界开始普遍讨论采用断层的新闻后投资人收紧预算云厂商缩减扩容计划终端需求其实还在缓慢爬坡但采购决策已经踩了刹车。这两类误判的交替出现正是牛鞭效应最典型的触发条件。终端信号的失真不会停留在终端它会顺着订单一层一层往上传递每一层都在用自己的偏差放大前一层的信息。ChatGPT Work 采用断层看起来是个应用层的话题但它实际上就是整个 AI 供应链需求侧的第一个失真节点。5. 牛鞭效应为什么 GPU 从抢不到货到传言过剩中间只隔了几个月5.1 先讲清楚牛鞭效应的四个诱因AI 供应链上全都齐了牛鞭效应是供应链管理里一个经典现象终端需求只出现很小的波动越往上游走订单波动越大图像上画出来就像甩动的牛鞭——鞭梢小幅挥动鞭把大幅摆动。它的产生机制在学术界早有定论我在 AI 供应链上逐条对照过发现四个标准诱因全部命中。第一个诱因是需求预测放大。每一层都基于下游订单加一个安全系数来下单安全系数层层叠加订单量就层层放大。第二个诱因是批量订购。GPU 这类设备有最小起订量云厂商一次下单可能就是一个集群规模的整数倍不会跟着周级别需求精细化调整。第三个诱因是价格波动和配额分配。供应紧张时供应商按订单比例配货客户为了多拿货会虚报需求这个虚报在后续周期里变成泡沫。第四个诱因是信息不透明和长交付周期。芯片和网络设备交付周期长客户等货期间会重复下单、多处下单等到货时才发现远超真实所需于是大面积取消订单。下面这张表是我把经典诱因映射到 AI 供应链的一个速查方便你对照理解牛鞭效应诱因在经典供应链中的表现在 AI 供应链中的对照需求预测放大零售商按销量加安全库存订货云厂商按用户增长曲线加安全系数采购 GPU批量订购批发商按整车整柜下单算力集群按千卡万卡整数规模下单配额分配与虚报短缺时按比例配货客户多报需求GPU 产能紧张时客户超订再转售信息不透明与长交付期经销商一单多投试探同一批算力需求向多个云厂商重复询价5.2 从现象级增长到库存过剩完整传导路径复盘把这四个诱因串起来就能还原出 AI 供应链过去一段时间经历的完整路径。第一阶段是需求爆发。生成式 AI 产品上线用户量在极短时间内冲到现象级所有人都觉得这是历史级的机会。第二阶段是恐慌性下单。云厂商和 AI 创业公司大规模锁定 GPU 订单合同一签就是数年订单规模远超当下真实负载因为没人敢赌自己能抢到下一批产能。第三阶段是产能瓶颈暴露。以 GPU 为代表的算力芯片供给受限交付周期拉得很长这时候客户能做的只有两件事加价、加量下单。供应商面对过量订单只能按比例分配产能又倒逼客户进一步虚报需求。第四阶段就是现在正在经历的终端采用断层被媒体和行业报告大面积讨论投资人开始追问 GPU 利用率和回报率云厂商发现当初锁定的订单有一部分根本消化不掉于是推迟交付、协商取消、甚至把囤积的卡转向转售租赁市场。第五阶段是反向踩刹车。上游芯片厂看到取消订单和降价消息开始收缩产能规划原定的扩产计划延后或搁置。整个过程里最讽刺的一点是终端需求从现象级暴涨到增速回落波动幅度其实没有那么大真正被放大的是产业链每一层基于悲观预期做出的收缩动作。牛鞭效应最伤人的地方从来不是需求本身的变化而是需求变化被层层放大的过程。5.3 MetaRoCE 和采用断层如何联手改变了传导路径现在把第三和第四节的线索合并看这场连锁反应的全貌就清晰了。MetaRoCE 开源解决的是供给端的结构性问题——它降低了 RoCE 网络的采用门槛让算力供给多了一条更便宜的通道硬件采购的选择权更多供应瓶颈被部分打破。这相当于给整条链条加了一个泄压阀当 InfiniBand 生态产能紧张时RoCE 方案可以承接溢出的需求。而 ChatGPT Work 采用断层则处在需求端它让终端信号失真成为整条链条上最不稳定的输入源。一旦市场情绪从风口论切换到断层论上游订单修正的力度会被放大形成剧烈的库存调整周期。泄压阀能缓解供给紧张却不能纠正需求信号的失真开源项目能降低建设成本却不能代替企业把 AI 工具真正嵌进业务流程。两个变量一叠加就会看到一种奇特局面网络层技术在进步、算力成本在下降但上游设备商的排产计划依然在周期底部徘徊因为下游的采购意愿被采用断层和需求修正死死压制着。6. 震荡周期里的生存策略我在实际操作中总结的几条做法6.1 基础设施侧按弹性规划而不是按峰值规划如果你现在负责公司的算力集群规划我的第一条建议是把预算报告的叙事从满足峰值需求改成满足弹性扩展。按峰值规划基建本质上是把自己的决策权交给最乐观的预测者按弹性规划则是把风险分散到云上按需扩容、短期租用、混合调度这些路径上。我见过太多团队在 GPU 紧缺时咬牙囤货结果等货到了模型推理负载已经被更轻量的部署方案消化掉了几百张卡在机房里吃灰。具体执行层面的做法是先把训练和推理的负载拆开训练负载优先跑在自建集群上推理负载用云上按需实例兜底扩容时按周粒度观察真实利用率连续两周超过既定阈值才触发下一批采购。网络侧同样值得上心如果你在新建 AI 集群别默认选 InfiniBand把 RoCE 方案纳入评估用实际业务负载做几分钟的基准压测而不是看厂商的宣传材料。MetaRoCE 这类开源项目落地后RoCE 方案的技术风险正在快速下降值得认真测试。运维团队可以提前准备网络层面的可观测性工具比如用ethtool -S查看网卡丢包和重传计数用ibstat查看 InfiniBand 链路状态或者重点监控 RoCE 网络里的 PFC 暂停帧计数这些数字比任何仪表盘上的健康度都诚实。6.2 应用侧把 AI 能力做成可插拔模块别做全家桶改造在采用断层期里企业应用侧最容易犯的错是把 AI 工具当成一个整体项目去推动动辄就要重构业务流程和系统架构。以我的经验这种做法大概率会在断层期里卡死组织没有做好配套准备重构带来的风险又让决策者迟迟不敢签字项目就从推进中慢慢变成悬停中。更务实的路线是把 AI 能力抽象成可插拔的模块。比如把大模型调用包一层中间层模型 API 的切换不影响上层业务代码对单个场景做价值验证而不是等全套基础设施就绪后才开始试点成本核算跟真实调用量挂钩按每千次请求的实际成本做展示而不是按并发峰值去买授权和算力。断层的本质是组织消化新工具的能力跟不上工具本身的能力而可插拔架构能让你以最小的组织改动先吃下最容易产生价值的部分。6.3 个人与团队的信号识别训练最后说点偏认知层面的建议我觉得这也是震荡期里最值钱的东西。第一看数据别看头条。行业头条在短缺期一定会渲染紧缺在过剩期一定会渲染饱和而真实信号藏在云厂商的价格调整、二手市场的报价变动、开源社区的技术讨论密度这些容易被忽略的地方。第二区分用户增长和付费深度。用户增长是前置信号付费深度才是可持续需求判断供应链走势时多盯后者。第三把开源生态投入当作长期对冲。MetaRoCE 这类开源项目带来的不只是技术选项更是一种供应链上的冗余能力——当某个环节收紧时开源生态的存在本身就是谈判筹码和逃生通道。回过头看这轮 AI 供应链的连锁反应并不神秘它只是把供应链管理教科书里的经典剧本用新行业重新演了一遍。Meta 在网络上开源是给供给侧松松绑ChatGPT Work 在需求侧的断层则是给产业链打了一针清醒剂。两股力量较劲的时候最不该做的就是跟着情绪追涨杀跌。基础设施往弹性方向走应用架构往模块化方向走认知判断往真实数据方向走这三点全做到哪怕后面再来一轮牛鞭效应的反向甩动你也能站稳。
返回列表