字号 ·· | 护眼
theregister

AI网络初创公司竞相取代英伟达的NVLink

随着英伟达通过其NVLink Fusion技术扩大影响力,竞争对手网络供应商正争相将替代性互连和交换机推向市场。在本周的AI Infra峰会上,Delos Data和Cornelis Networks正式加入了scale up网络竞赛。像NVLink这样的scale-up fabric,正是让英伟达得以将8块、72块乃至如今576块GPU当作一个巨型AI加速器来运行的关键。为了追赶,AMD等竞争对手已拥抱Ultra Accelerator Link等新兴协议。如今,这些协议很大程度上是通过标准以太网交换机进行隧道传输。例如,AMD正在使用博通基于102.4 Tbps Tomahawk 6的交换机,连接到MI455X上的定制I/O裸片。专用UALink交换机和物理互连仍然难以实现,但如果Cornelis和Delos如愿以偿,这种情况不会持续太久。

这两家公司正从几个不同角度应对这一挑战,包括标准化、软件优化和物理硬件。为“永不用英伟达”的网络设定标准周一,在AI Infra大会上,以高性能计算为核心业务的网络供应商Cornelis推出了Active Compute Fabric(ACF),试图为纵向扩展和横向扩展网络建立一种开放架构,将可编程计算集成到网络结构中。这一标准标志着Cornelis进入纵向扩展网络领域。Cornelis的Omni-Path技术于2020年从英特尔分拆出来,最初是作为面向高性能计算应用(包括Trinity和Lynx等超级计算机)的横向扩展互连技术而设计的。

随着公司即将推出支持800 Gbps的CN6000系列交换机和网卡,公司的目标不仅是通过开放的Ultra Ethernet协议将其技术带给更广泛的受众,还着眼于纵向扩展网络。ACF扩展了UALink和Ethernet for Scale-Up Networking等技术的使命,后者是另一种纵向扩展网络协议,旨在为广泛的硬件(而不仅仅是Cornelis自家的CN系列部件)设定网络内计算能力的基准。Nvidia的NVSwitch ASIC背后的关键技术之一是支持SHARP,它允许将网络内集合通信等任务卸载到交换机ASIC,从而释放GPU计算资源并减少通信开销。集合通信加速并非新鲜事物,从博通到思科等主要网络供应商都已以某种形式实现了它。

作为一种开放架构,ACF似乎设定了一个最低共同标准,以便部署这些系统的客户能够确切了解他们将获得什么。然而,它的作用远不止于此。Cornelis看到了加速各种其他功能的机会。我们详细介绍了几个方面:KV缓存卸载,用于跨多个会话存储和检索模型状态;MoE专家调度,以减少混合专家模型在推理和训练期间的重复传输和通信开销;面向以HPC为中心的应用程序的消息传递接口卸载;以及用于训练和其他大型工作负载期间故障恢复的架构检查点。“通信开销和同步可能导致昂贵的加速器利用不足,”该公司解释道。

这些网络内加速器“允许网络在数据流经系统时对其进行处理”。据Cornelis称,回收这些闲置算力所带来的节约潜力十分可观。“在一个拥有10万块GPU的系统中,Cornelis对公开数据的建模显示,大约一半的GPU小时都花在等待数据上,这相当于每年浪费约16.8亿美元的算力容量和500吉瓦时的电力。”一如既往,对这些说法要持保留态度。然而,回收GPU闲置时间确实会带来可观的节约。要消除所有造成这些闲置的瓶颈,说起来容易做起来难。面向AI时代的新型网卡虽然Cornelis大力推崇其ACF架构,但由前Barefoot Networks和英特尔高管创立的初创公司Delos Data则旨在通过一系列新的网络参考设计来解决物理层的问题。

该网络接口产品以Nonstop AI产品组合的名义进行营销,涵盖了从共封装互连到更传统网卡的各种连接方式。公司解释说,其理念是为客户提供一套系统级蓝图,以加速端点之间的数据移动,并支持超越单一机架的更大计算域。Delos的数据接口将提供三种形态。第一种是I/O裸片,能够提供超过30 Tbps的总带宽,或每个方向约8 TB/s。这比英伟达或AMD最新加速器的互连带宽高出一倍以上,后者的上限为3.6 TB/s。其最终竞争力将取决于Delos的I/O小芯片何时真正投入部署。

这一时间线将在很大程度上取决于集成情况,因为这些I/O芯片需要直接集成到加速器封装中,而这需要高度的协同设计。关键在于,Delos并不像Nvidia通过其NVLink Fusion I/O芯片或IP那样,试图将客户困在围墙花园中。至少截至撰写本文时,NVLink Fusion仍要求客户购买NVSwitch以实现横向扩展网络。Delos的芯粒是协议无关的。它们不在乎你使用的是ESUN、UALink还是其他什么。那些更愿意将精力和资本集中在加速器AI部分的芯片设计者——事实证明,这适用于大多数超大规模厂商——可以直接授权Delos的芯粒设计。

这种协议无关性也延伸到了Delos的近封装光学(NPO)技术,该技术将集成一个10+Tbps的数据接口——用英伟达的话说,就是2.5 TB/s的双向带宽——并搭配来自领先光学供应商的光学引擎。迄今为止,像英伟达的NVL72这样的机架级系统,由于功耗限制,在很大程度上一直依赖铜互连。随着系统从72 GPU的机架系统扩展到576个乃至最终1,152个GPU的行级集群,光学互连变得不可避免。虽然利用当今现有技术可以将光学器件直接集成到加速器中,但光学模块故障的影响范围相当大。NPO提供了一种替代方案。在机架内部使用铜互连,而机架之间则通过用户可维护的NPO模块提供光学连接。

最后,Delos正在研发一款400+Gbps的网卡,与其余数据接口产品一样,这款网卡同样不依赖特定协议。这可以说是整个产品线中最不令人意外的成员。对于大型训练集群以及前端访问和存储网络而言,横向扩展网络仍将是必需的。这些接口建立在Delos现有的计算参考设计之上——我们在Computex期间曾对此进行过了解——以及其Nonstop AI软件平台,该平台旨在简化这些交换架构或网格的配置与监控,以便在链路故障时实现流量的动态重路由。其数据接口产品所采集的遥测数据能够提供更深入的网络可见性,从而实现更快的重路由和恢复。激发竞争。投资者似乎非常渴望在纵向扩展领域看到更多竞争。

在产品发布的同时,Cornelis宣布了约2.05亿美元的融资,以将其下一代横向扩展和纵向扩展网络产品推向市场。与此同时,Delos Data周二宣布,在Matrix、Playground和Socratic Partners等风险投资公司的支持下,该公司目前已筹集超过1亿美元的资金。®