AMD的威尼斯至强处理器标志着自2019年罗马处理器面世以来,AMD在CPU设计上的最大架构变革。更重要的是,AMD基于Zen 6的产品栈正在形成有史以来最广泛的CPU组合,涵盖通用计算、HPC、AI,以及最终的消费平台。AMD还没有准备完全公开其第六代Zen内核的细节,但目前我们对威尼斯处理器的了解已经远多于之前。上周晚些时候,AMD发布了一份白皮书[PDF],这显然旨在反驳市场霸主英伟达关于其Vera CPU的说法。我们将在稍后详细探讨白皮书中提出的性能主张,但鉴于截至目前威尼斯相关信息的零星发布,我们认为有必要仔细分析一下这款将支撑AMD未来几年产品路线图的CPU架构。大致分类从广义上讲,AMD第六代产品线可分为四类——高性能、企业级、HPC和AI,每类都有其独特的特点。我们将首先介绍AMD性能优化的产品,因为这些是2026年实际上市的产品。其他几乎所有产品将在2027年陆续推出。
至强9006 SP7平台是AMD过去一年一直在强调的产品。它将提供高达256个核心、16条DDR5通道和128条快速的CXL 3.1兼容PCIe 6.0连接通道。但这些只是一些引人注目的规格,就像去年的都灵产品一样,威尼斯处理器实际上也有两种不同版本:密度优化版和频率优化版。正如你可能已经猜到的那样,256核版本是密度优化版。与此同时,AMD还在开发一款96核处理器,最高可提升至5GHz。拆开散热片后,我们可以看到AMD是如何实现这一点的。两种芯片都采用了一对I/O晶圆环绕八个核心复合体晶圆(CCD)的设计。
I/O(输入/输出)性能的提升是之前的两倍,但用于处理I/O任务的计算芯片面积却只有都灵(Turin)版本的一半;不过核心数量确实有所增加。不过,不同型号的芯片在硬件设计上存在显著差异。在这一代产品中,AMD将每个芯片中的计算核心数量提高了一倍(从8核增加到16核),同时将共享的L3缓存容量从每芯片32MB增加到了128MB。这意味着,当AMD的Venice系列CPU处于满负荷运行状态时,每个核心都可以使用高达1GB的L3缓存。对于那些注重频率优化(即追求更高运行速度)的型号,AMD在硬件设计上采取了更为保守的策略:核心数量和L3缓存容量仅比上一代产品提高了约50%(仍为每芯片12核、48MB的L3缓存)。虽然AMD新芯片带来的更高核心数量非常值得关注,但更值得关注的变化其实是缓存架构的改进——现在,Zen 6C核心与普通Zen核心在硬件设计上已没有任何区别(唯一的区别仅在于时钟频率)。在之前的产品世代中,AMD的ZenC系列芯片与普通Zen系列芯片共享相同的32MB L3缓存池,这导致高性能产品的每个核心可使用的L3缓存容量仅为低性能产品的半倍。但在Venice系列中,无论使用哪种类型的芯片,每个核心至少都能获得4MB的共享L3缓存。目前看来,用户只需在“核心数量”与“芯片集成密度”之间做出选择即可。需要提醒的是:AMD的这些紧凑型Zen核心与英特尔的高效核心(Intel的Efficiency cores)并不相同;英特尔的高效核心采用了完全不同的微架构,具有不同的功能集和缓存架构。AMD只是通过牺牲部分性能来换取更紧凑的芯片尺寸而已(两者的指令集(ISA)是相同的)。接下来我们来看看I/O相关组件:正如之前所提到的,现在AMD的处理器中集成了两个独立的I/O模块。如果非要猜测原因的话,应该与用于连接芯片与I/O子系统的互连技术有关。值得注意的是,这次这两个I/O模块是直接紧挨着彼此安装的;不过I/O本身的设计基本没有变化。
我们获得了128条PCIe连接通道——与过去几代Epyc处理器相同。然而,这些通道速度更快了一倍,得益于从5.0到6.0连接的提升。这些芯片还新增了对CXL 3.1连接的支持,这意味着客户现在可以利用内存“上帝盒”在它们之间汇集和共享内存。我们在此详细讨论了这项技术,如果您想了解这些网络附加内存设备的工作原理,可以参考相关内容。除了更快的I/O外,这些芯片还支持16通道的DDR5 8000 MT/s或12800 MT/s内存,使用MRDIMM。
这赋予了 Venice 处理器高达1.6 TB/s的内存带宽,几乎是 Turin 的3倍。在实际测试中,AMD表示其在STREAM Triad(一种经过时间考验的带宽评估基准测试)中可以达到约1.3 TB/s。
我们尚未掌握AMD Zen 6微架构的所有细节,但我们已经拥有其SP7系列的大部分完整列表,如下所示。AMD的Epyc X系列芯片再次回归在我们介绍AMD更主流的Epyc产品之前,我们应该再多谈谈其面向HPC的Venice-X产品。这些产品使用SP7插座,但将每个核心的L3缓存提升到了12MB,每个插座总共达到1152MB。
与以往的X系列芯片一样,AMD通过使用其3D V-Cache封装技术将SRAM叠加在CCD之上来实现这一点。这与消费级产品(如经典的5800X3D和7800X3D)中使用的技术相同。
对于Venice-X,AMD在12核CCD和封装之间夹入多达8块96MB的SRAM磁贴,每个插座总共达到144MB的L3缓存。
这种额外的缓存使这些芯片特别适合于面向HPC的工作负载,如计算流体动力学、有限元分析、电子设计自动化以及其他科学和工程工作负载。
从很多方面来看,这款芯片代表了AMD的回归——该公司在Turin一代中跳过了X变体。
尽管如此,与上一次的Epyc X芯片相比,新芯片不会提供更大的L3缓存容量或更高的核心数量。
Venice X 将提供大幅提升的时钟频率,部分归功于将 SRAM 瓦片置于 CCD 下方而非上方,其频率最高可达 5.15 GHz。企业级我们迄今为止讨论的所有内容都针对高性能和 HPC(高性能计算)应用——这并不是大多数企业最终会购买的产品。对于存储、数据库或虚拟化服务器等更为主流的使用场景,AMD 将提供精简版的 Venice Epyc 处理器,其核心数量从 8 个到 128 个不等,并配备 8 通道 DDR5 内存。虽然内存带宽是人工智能和 HPC 的主要瓶颈,但对于大多数企业应用而言,它远没有那么重要,因此在这里进行精简是合乎情理的。事实上,英特尔在其 Xeon 6 6700P 系列产品上也做出了同样的举措,该系列产品也最高支持 8 通道。
从我们看到的裸片渲染图来看,AMD 似乎在使用一个略有不同的 I/O 裸片,考虑到它不需要处理如此庞大的数据,这是合乎情理的。它们还将使用不同的 SP8 插槽,但会采用与 SP7 部件相同的 CCD。8 核型号是一个耐人寻味的决定,因为现在每个 CCD 的最低核心数是 12 个,但这并非我们第一次看到 AMD 通过屏蔽核心对硅片进行分级以提供更大的市场细分。同时,128 核型号将使用四个 32 核的 CCD 来达到其核心数目标。
正如你所料,AMD 的 9006 SP8 产品线要庞大得多,涵盖了 20 多种 SKU,时钟频率最高可达 5 GHz。因此,虽然选择这些型号可能会放弃一些内存通道,但你并不一定会牺牲计算性能。以下是详细概览:AMD 将 Vera 树为假想敌Venice 并不是 AMD 推出的唯一一款内置 Zen 6 核心的芯片。虽然其第一代 Helios 机架将使用 96 核的 Venice 芯片和标准的 DDR5 DIMM,但未来的设计将采用一款与英伟达的 Vera 更为相似的截然不同的 CPU。
代号为“Verano”的芯片将拥有高达72个核心(推测分布在六个12核芯粒上),主频可达5GHz,但它不采用DDR5,而是配备24条LPDDR5x内存通道以及更快速的112 GT/s xGMI接口。AMD表示,这有助于提升CPU与GPU之间的连接能力。供参考,Vera拥有88个核心,并可搭载高达1.5TB的LPDDR5x内存,带宽达到1.2TB/s。AMD计划于2027年下半年推出该芯片,并将其定位为GPU服务器的理想宿主机处理器。据我们了解,选择采用LPDDR5x而非DDR5 RDIMM的决定主要与功耗有关。LPDDR5x中的“LP”确实代表低功耗。AMD尚未透露芯片的I/O die细节,但我们推测真正的技术亮点或许将体现在此处。或许我们会看到一个精简版的I/O die,仅包含支持2至4个GPU所需的最基本功能?通过降低CPU的功耗,AMD可以腾出更多空间用于更快速、更耗热的GPU,从而在性价比上更加有竞争力,与Nvidia形成更强的竞争。Venice vs Vera在AMD最近的一份白皮书中,该公司针对Nvidia自己的性能声称提出了反驳。Nvidia声称Vera的Olympus核心相比于发布近两年的Turin芯片,单核性能提升了1.7至1.8倍。根据AMD的数据,在同一组SPEC 2026基准测试中,AMD的96核Venice芯片的性能比Vera高出1%至12%,而在SPECrate 2026的整数测试中,Zen 6架构芯片据称领先20%。最后在吞吐量方面,我们假设AMD的256核芯片如预期般远超88核的Vera,性能优势达到2.24倍。这一结果并不令人意外,毕竟核心数量通常决定吞吐量水平。
请对这些声称持有适度怀疑态度——供应商提供的基准测试往往容易被挑挑拣拣——但我们的结论其实非常简单,可能也不是AMD所希望看到的那样。
根据 AMD 自己的测试结果,Vera 系列中的 Olympus 核心在某些测试中的表现相当出色。AMD 每个插槽可安装更多的核心,并提供了多种不同的产品型号(SKU),从而能够满足更广泛的应用场景需求。实际上,几乎没有哪种 CPU 能在所有场景下都表现出色;因此我们毫不怀疑 Vera 系列会在某些工作负载下表现出色,而 Venice 系列则可能在其他方面更胜一筹。需要再次强调的是:在数据中心领域,从来就没有一种 CPU 能够在所有场景下都占据主导地位,未来也不会有这样的 CPU 出现。当然,Nvidia 并不是 AMD 在数据中心 CPU 领域的最大竞争对手——真正的竞争对手是 Intel。对于 AMD 来说,这次它在企业级市场(尤其是大规模应用场景)面临的竞争压力相对较小。正如我们上个月所讨论的那样,Intel 的 Diamond Rapids Xeon 7 处理器拥有高达 256 个核心以及 16 通道的 DDR5 内存接口,其性能表现与 AMD 的产品相当;不过与之前的产品不同,这些处理器完全专注于高性能计算(HPC)应用,因此并不适用于普通桌面市场。因此,尽管 Intel 可能在高端市场构成挑战,但在 2027 年之前,AMD 仍将在市场上占据优势。
现在让我们来看看 AMD 最新的 Epyc 处理器,以及它们对 Ryzen 和 Threadripper 系列产品的启示。从历史来看,AMD 的 Ryzen 桌面处理器经常会重用 Epyc 处理器中的核心设计;如果这一惯例继续下去,并且 AMD 能够在 AM5 插槽中集成两个这样的核心模块,那么桌面版处理器很可能会配备 8 到 24 个核心。当然,这还是基于 AMD 仅使用频率优化型芯片组的情况;如果 AMD 选择使用密度优化型芯片组,核心数量可能会增加到 32 个,不过我们对此持保留态度。至于处理器的主频,虽然目前尚不确定具体数值,但鉴于 Zen 5 系列的最高频率已达 5.7 GHz,因此 6 GHz 的加速频率应该不会令人意外。AMD 的 Ryzen 处理器历来都使用不同的 I/O 模块,因此我们没有理由认为其 10000 系列(或未来的产品系列)会有任何不同。
我们只能对PCIe通道和芯片组功能进行推测,但可以安全地假设DDR5 8000 MT/s应该是稳定的。话虽如此,鉴于当前内存短缺的情况,如此快速的内存可能对发烧友来说有些难以企及。再次强调,我们只是在推测。AMD在下一代Ryzen发布时可能会走向完全不同的方向,这也只是不太寻常的做法。至于Threadripper则相对容易预测一些。历史上这些产品一直都是解锁版的Epyc处理器,通常开箱即有更高的睿频时钟。AMD即将推出的下一代Threadripper肯定将提供96个Zen 6核心,时钟速度超过5 GHz,以及更多的PCIe通道,你可能永远都用不完,还有内存容量足以让人不得不再贷款买房才能承受。看来关键问题是,我们是否会首次在Threadripper上看到AMD部署Zen 6C内核。它们将首次让128个核心触手可及的桌面用户,但这也意味着需要在每个核心的性能上做出妥协,除了少数特定职业之外,实际需要在桌面上使用如此计算能力的用户数量可能相当有限。尽管如此,这一景象还是令人期待的。仍有许多问题有待解答就Epyc发布周期而言, Venice系列颇为特别。我们仍然不清楚支撑Zen 6内核或CCDs的架构变化究竟是什么,也不知道AMD为何将封装设计与之前 generations的Epyc处理器相去甚远。然而,我们已经掌握了全面的SKU列表,对芯片组成、时钟速度以及与AMD主要竞争对手相比的初步性能数据。我们期望在今年晚些时候、也就是第一批Venice CPU开始发货之时,能获得更多关于Zen 6内核的信息。