字号 ·· | 护眼
theregister

下一代AI网络可能取决于电话交换台的回归

如果你认为每个机架72个GPU已经很密集,那么Nvidia和其他公司的下一代设计将把数百甚至数千个加速器塞进一个庞大的系统中。

但要做到这一点,他们将需要大量光学技术和让人想起老式电话交换台的技术。

这一现实推动了从光子学初创公司到成熟光学设备和光纤制造领域的一连串投资。

3月,Nvidia向Coherent、Lumentum和Marvell各投资20亿美元(总计60亿美元),以推进其光学技术。其中一些投资用于支持光路交换(OCS)技术。

周三,Nvidia与Maverick Silicon和Light Street Capital一起再投入1.25亿美元,支持iPronics第二代OCS技术的开发。既然可以交换光,为什么还要交换数据包?光路交换机只是在字面意义上才是交换机。

与Broadcom Tomahawk或Marvell Teralynx ASIC不同,OCS设备无法交换数据包。这种光电设备是现代版的电话交换台。

但不再是人工操作员手动将两条电话线接在一起,而是使用由微型镜子、压电执行器、LCD或其他技术构建的高速执行器,在眨眼之间重新配置网络。

OCS在现代GPU部署中并不特别常见,但它们在AI集群中已经使用了相当长一段时间。

具体来说,Google多年来一直在其TPU集群中使用OCS。

传统上,Google的TPU pod采用2D和3D环形拓扑,加速器在一个大网格中相互通信,而不是依赖分组交换结构将它们连接在一起。网格网络的代价是可能更高的芯片间延迟和刚性。就其本身而言,它们并不是最灵活的拓扑。

如果你想添加、移除或更换一个失效的加速器,需要有人或某物重新配置网络。在Google的情况下,这个某物就是光路交换。

来自Google TPU集群的流量通过OCS设备以光方式传输,这使得这家“巧克力工厂”能够按需更改pod大小或虚拟热插拔失效加速器。

光路交换可以说是Google能够运营业内一些最大单一计算域的原因。其网络架构不受分组交换基数限制。平滑OCS的粗糙边缘 然而,现有的OCS设备并不完美。

许多使用微机电系统(MEMS)设备,通过移动微型镜子来调整哪些组件相连。这种方法有效,但算不上快。通常引用的重新配置时间约为100毫秒。

OCS设备也往往相当大,部分原因是所涉及的机制,还有所使用的连接器。

光子学初创公司iPronics旨在解决其中一些不足,它所谓的“第二代”OCS摒弃了MEMS和基于LCD的系统,采用基于硅光子学的设计,没有移动部件。

该公司声称其技术可以实现亚毫秒级重新配置时间,这通过在计算周期内隐藏延迟,为工作负载中途更改拓扑提供了可能。

iPronics表示,它还能实现比“第一代”OCS设计更高的密度。例如,iPronics One每个芯片支持32个端口。我们得知该公司正在努力将72端口和144端口芯片推向市场。由于这些芯片采用硅光子学制造,它们也可以被塞进更小的空间。

iPronics押注,通过使用多芯片和高密度连接器,它能够在一个机架单元内封装多达720对端口。

作为参考,现有的高基数OCS交换机,如Coherent的300端口设备,通常需要八个或更多机架单元。

OCS在更广泛的AI网络中的位置 即使具有亚毫秒级延迟,OCS在网络路径不经常变化的环境中效果最佳。

这与大多数现代机架系统(如Nvidia的NVL72或AMD的Helios)采用的方法截然不同,后者优先考虑单跳全对全连接和极端的路径多样性。但两者并不相互排斥。iPronics尚未准备好讨论其客户采用的具体拓扑。但有几种潜在用例,包括将网格与交换结构融合的混合环境。

你可能还记得,当Nvidia在2024年推出其首个机架级计算平台时,CEO黄仁勋将72-GPU系统描述为一个巨大的加速器。

它通过18个超快NVLink Switch芯片实现这一点,这些芯片以全对全网络连接,使任何GPU与下一个GPU之间只需一跳。

你可能认为这与OCS不太契合,但它可以通过在机架内使用铜缆交换结构,以及基于OCS的网格进行机架间通信来工作。

然而,更可能的用例是让Nvidia现在推销的大规模LPU集群保持可控。

正如我们之前讨论过的,每万亿参数,Nvidia需要八个LPX机架,总计超过2000个加速器。

由于这些芯片主要采用流水线并行,数据一次处理一个芯片,这意味着它们已经是OCS编排网格拓扑的良好候选者,并且将使Nebius等新云服务商更容易为不同模型调整集群规模。

我们将需要更密集的光纤连接 将所有系统连接在一起需要大量光纤,而恰巧另一家初创公司Mixx Technologies本周发布了一种新连接器,能够将数万根光纤端接到单个机架上。

这是通过Mixx所谓的SxC连接器实现的,该连接器包含64根光纤,而MPO通常最多只有8到24根。

使用其SxC连接器,它估计可以在一个OCP机架单元内封装384个64光纤端口,假设400 Gbps SerDes,足以提供614 TB/s的总带宽。®