在年度 Connect 大会上,华为发布了新一代人工智能加速器,其性能表现有望远超英伟达目前在中国市场所能提供的任何产品。对于习惯了从这家全球最热门的 AI 军火商那里购买“缩水版”产品的中国开发者来说,这无疑是一个利好消息。不仅如此,这款代号为“升腾 960DT”(其中 DT 显然代表解码/训练)的芯片预计将提前三个季度问世,于 2027 年第一季度正式发布。该加速器配备了高达 288 GB 的内存(推测为华为定制的 HiZQ 内存技术,这是全球通用的高带宽内存的国产替代方案),并具备高达 4 petaFLOPS 的 FP4 算力(FP8 算力减半),其性能和内存容量均达到了该公司今年早些时候推出的 950 系列产品的两倍。与美国 GPU 相比,960DT 的内存和带宽与英伟达去年推出的 B300 系列芯片相当,但 FP8 算力仅为其一半左右,FP4 算力则约为其三分之一。尽管这对这家中国芯片设计商来说是一大进步,但要追赶英伟达的 Rubin 和 AMD 最近推出的 MI455X,仍有很长的路要走,后两者承诺提供更高的算力和带宽。Rubin 拥有 35 到 50 petaFLOPS 的 FP4 算力、288 GB 的 HBM4 内存以及 22 TB/s 的带宽,处于完全不同的量级。话虽如此,由于这两款芯片均无法在中国市场销售,中国模型开发者也并没有更好的选择。英伟达目前在中国能销售的最强 GPU,其稠密浮点性能几乎相同,内存和内存带宽是其两倍,并支持更大规模的扩展域。扩展能力方面,性能差距可能并不像听起来那么致命。如今,人工智能模型大多不再仅在单个 GPU 或 NPU 上进行训练或运行。更重要的因素往往在于平台扩展的效率。
英伟达(Nvidia)和AMD的最新系统将72个GPU集成到一个机架级别的计算平台上;通过使用光通信技术,该平台还可以扩展到576个GPU,从而实现灵活的扩展(即“横向扩展”和“纵向扩展”)。对于即将推出的960系列加速器,华为(Huawei)也采用了类似的技术——通过使用“近封装光模块”(Near-Package Optics, NPO)将计算资源扩展到最多4096个芯片,这些芯片能够提供高达16艾浮点运算次数(16 exaFLOPS)的计算能力。虽然华为在计算密度方面存在不足,但它在系统规模上具有优势;这种策略我们在谷歌(Google)的TPU产品中也曾见过。考虑到高速网络技术是华为的核心竞争力,这一点其实并不令人意外。本周早些时候我们详细了解了华为的NPO技术:简而言之,该技术解决了早期华为产品设计中存在的重大扩展难题——可插拔的光模块功耗高、容易发生故障,且占用大量空间。华为表示,通过NPO技术,他们将48,000个800 Gbps带宽的光模块整合到了5,500个Hi-One NPO单元中,从而将功耗降低了550千瓦,并将故障率降低了一半;同时系统运行时间达到了99.8%。对于那些迫于压力、需要采用国产替代方案的中国设备制造商来说,这无疑是个好消息。据报道,DeepSeek在使用华为早期的NPU进行训练时遇到了问题,最终不得不重新切换回英伟达的GPU。除了高带宽的960DT芯片外,华为还在准备一款名为960PR的计算优化版本,预计将于2027年第三季度发布。从多个角度来看,960PR芯片的功能与英伟达今年早些时候被取消的Rubin CPX加速器类似。其中,“PR”(Prefill and Recommender)指的是该芯片的一些特殊功能;华为通过牺牲内存容量和带宽,大幅提升了芯片的低精度计算性能。
具体而言,PR版本将拥有高达8 petaFLOPS的FP4性能,以及我们认为属于其定制的192 GB HiBL内存,带宽可达2.4 TB/s。据我们了解,该芯片旨在与华为的DT芯片协同工作,以提升大语言模型(LLM)的推理性能。推理流水线中计算密集型的预填充(prefill)阶段(即处理提示词的阶段)将交给960PR处理,而内存密集型的解码(decode)阶段(即实际生成输出Token的阶段)则在960DT上运行。这种异构架构已被证明在提升性能方面非常有效,这与我们在今年春季GTC大会上看到的英伟达Vera Rubin和Groq LPX配置所采用的方案并无二致。主要区别在于,华为目前尚未拥有以SRAM为核心的解码加速器。
华为着眼于百万级NPU集群,追求更快的AI速度。在华为全联接大会(Connect)上,华为表达了将其计算集群扩展至50万个或更多NPU的意图。在一项概念验证中,华为宣布已成功将其基于升腾950的泰山(TaiShan)超级节点扩展至4,096个加速器。通过使用两层四平面的Clos网络拓扑结构,华为预计很快就能支持多达512,000个NPU的集群;而通过转向多轨(multi-rail)拓扑,华为认为百万级NPU的超级集群是有可能实现的。据我们所知,这目前仅是一个理论配置,并非该公司在实际应用中已经验证过的成果。
华为还预告了其升腾加速器的未来两代产品,正如你所预期的那样,这些产品承诺将带来稳定的性能提升、更大的内存以及更快的互联技术,以将所有组件连接在一起。计划于2028年推出的升腾970系列产品,预计将提供高达3.6 petaFLOPS的FP8性能或14 petaFLOPS的FP4性能——华为似乎正在将更多的芯片面积用于低精度数据类型,这一点我们在AMD和英伟达的最新一代芯片上也观察到了。
这款产品的内存容量为 288 GB,与 960 系列相比几乎没有变化;不过华为表示他们计划将内存带宽提升至 14.4 TB/s,这应该会对人工智能(AI)推理性能产生显著提升。到 2029 年,华为预计性能将再次翻倍,达到 7.2 petaFLOPS(FP8 计算精度)和 28 petaFLOPS(FP4 计算精度),同时内存容量也将增加到 384 GB,内存带宽将达到 38.4 TB/s。不过,三年时间确实相当漫长;如果在此之前华为的产品路线图出现重大变化,我们也不会感到意外。®