字号 ·· | 护眼
财新

ARM的自研AI CPU获联想、字节跳动两大中国客户 智能体时代CPU格局如何变化?

【财新网】9月8日Arm Everywhere China 年度大会上,ARM)宣布,已引入联想集团(00992.HK)和字节跳动火山引擎两家新合作伙伴,后续将在中国市场部署ARM自研芯片AGI CPU(通用人工智能中央处理器),其中,火山引擎已将首批基于该平台的智能体沙箱推向市场。不过,ARM在采访中并未透露具体合作细节和时间规划。

“我们对 Arm AGI CPU 的早期评估表明,其在主流云工作负载中展现出良好的性能潜力。”火山引擎云基础产品经理负责人李越渊称。

同日,新紫光集团亦宣布,称后续将与ARM在IP(预集成设计模块)、CSS (Compute Subsystem, 计算子系统) 和AGI CPU方面探讨合作。

3月,ARM宣布推出采用台积电3纳米制程的AGI CPU,这是其成立35年来首次推出自研芯片产品,意味着这家长期以架构和IP授权为核心业务的公司开始进一步向完整芯片产品延伸,以获得产业链中更大价值。Arm称,与版税模式相比,芯片模式带来的毛利金额可提高约5至10倍。(详见财新网报道《Arm推AI数据中心自研芯片挑战英伟达 Meta、OpenAI等为首批客户》)ARM彼时宣布,Meta作为AGI CPU的早期合作伙伴和联合开发者,将成为首个客户。此外,OpenAI、Oracle、韩国运营商SK电讯、美国AI芯片公司Cerebras、Positron,韩国AI芯片公司Rebellions等公司亦将采购部署该芯片。本次会议上,ARM AGI CPU首次宣布中国客户。

ARM首席执行官Rene Haas在7月底的一季度财报会上称,首批AGI CPU已交付给多家客户,且ARM已锁定产能以支持在2027和2028财年共计10亿美元(约合人民币67亿元)的需求机会,而最新客户需求已经上升至超过20亿美元,关键瓶颈在于供给侧。

“整个市场供应链非常、非常、非常紧张,无论是存储、测试设备、基板还是台积电的晶圆,供应都极其紧张,即使是以CPU为主业、自己拥有晶圆厂的同行,目前也无法满足市场需求。”Rene Haas说。

“中国是一个极具活力的市场,主流云服务提供商数量较多、类型多元,工作负载也更加复杂。中国云服务商既要满足企业级AI工作负载的计算需求,也要承载传统Java、网页、数据库等工作负载,随着智能体AI兴起,还需应对新的计算需求。单一GPU难以覆盖上述多样化工作负载,我们认为,ARM有机会支持中国大型云厂商在数据中心建设上拥有更多选择。”Arm云AI业务拓展副总裁Eddie Ramirez在本次大会上表示。

Eddie Ramirez在采访中称,AWS、谷歌、微软、阿里等云厂商乃至英伟达、云豹智能等芯片厂商均已基于ARM架构开发CPU、DPU产品,其中,微软已经在自研CPU上运营Teams等服务。

Eddie Ramirez称,主流云厂商密集自研CPU,无需等待供应商在路线图中加入定制化加速和I/O(输入输出)等技术,可以自主掌控这一进程,并协同开发软硬件。但是,自研芯片意味着至少5至8亿美元(约合人民币34至54亿元)的投资。对于不愿进行该级别投资的云服务商或二线云厂商,就可以选择直接采购ARM AGI CPU。

Eddie Ramirez提出,在智能体AI工作模式下,Arm的优势将比以往更加突出。智能体需要7×24小时全天候运营,意味着工作负载更加均衡持续。AI GPU在许多场景性能优于x86架构,且功耗要低得多。同等性能下,其功耗为300瓦,而x86是500瓦。

同时,目前主流x86服务器CPU供应商主要为英特尔和AMD,但是ARM阵营有大量参与者。Arm称,2025年向超大规模云服务商交付的计算资源中,接近一半采用Arm架构。市场调研机构IDC 7月数据也显示,在加速计算领域,Arm架构市场规模已经超过x86。加速计算即区别于主要依靠CPU的传统计算,由CPU、GPU、NPU等多种芯片协作完成。

华尔街投研机构Bernstein指出,ARM是智能体AI带来的CPU复兴下的结构性受益者。与1.0生成式AI相比,智能体AI涉及任务编排、工具调用、文件读写等,每一步都需要大量CPU资源。因此,新型数据中心相较传统数据中心,CPU需求呈现出四倍增长,1,考虑到ARM已推出自研CPU,预计到2030财年,ARM营收将增长5倍以上。

今年以来,ARM股价一度上涨超过275%,但6月以来股价明显下滑,较高点下跌近20%。摩根士丹利研报指出,3月发布CPU以来,ARM股价经历明显估值重估,目前股价已经充分反映2030年以前CPU业务机会,预计管理层要到三季度,才能确认覆盖超过20亿美元业务管线的供应能力。

ARM负责设计并授权专有的Arm指令集架构(ISA)及IP。Arm ISA用于定义处理器如何执行软件指令,被绝大多数智能手机芯片采用,且正在向边缘计算和数据中心渗透。同时,ARM也向芯片设计方提供一系列预集成的设计模块IP,以简化和加速芯片开发流程。

作为授权方,Arm在芯片开发阶段收取授权费(licensing),并在芯片进入量产后,按照每颗芯片收取版税(royalty)。截至6月30日的最新一季财报显示,当季Arm总营收为12.9亿美元,同比增长22%。其中,授权及其他收入为5.7亿美元,在总营收中占比 45%;版税收入为 7.2亿美元,在总营收中占比55%。

ARM自研芯片令不少采用其IP、CSS服务的企业颇有微词,比如其大客户高通就通过收购初创企业Nuvia,试图抛弃Arm公版架构,定制化设计处理器,以降低对Arm产品的依赖,还因此与Arm对簿公堂(详见财新网报道《Arm拟终止高通芯片设计许可 高通称其‘毫无依据’》)2023年8月,ARM试水在数据中心市场推出进一步集成化的计算子系统(Compute Subsystem)方案,包含CPU、缓存、内存控制器等多种模块。ARM称其为一套经优化、集成和验证的技术方案,可将芯片上市时间最多缩短12个月,并节省数千万美元成本。2025年5月,ARM在数据中心、手机、PC等多个应用场景推出计算子系统产品。

外界看来,计算子系统收费更高,能够在因存储短缺出现明显涨价的智能手机市场,帮助ARM获得更高收入。Rene Haas 7月称,尽管预计智能手机市场将出现两位数下滑,但智能手机版税收入将实现两位数增长。

ARM边缘AI业务部执行副总裁Chris Bergey曾担任Arm数据中心业务负责人,向亚马逊、阿里巴巴等云厂商推广Neoverse计算子系统。他此前向财新解释,Arm最早推出计算子系统是因为很多云厂商在自研数据中心芯片时发现其太困难,希望Arm提供更多服务。他表示,在汽车芯片市场,很多车厂在下场自研芯片时也有类似需求。

本次大会上,Arm推出了第二代移动终端计算子系统(CSS for Mobile 2),支持智能体AI和AI原生图形技术。该CSS集成了最新Arm Mali G2-Ultra NX GPU IP、搭载SME2(第二代可伸缩矩阵扩展技术)的Arm C2 CPU集群、增强型系统IP、物理实现方案以及开发者就绪的软件生态系统。

其中,Arm Mali G2-Ultra NX GPU首次集成专用神经网络加速器,使图形处理与神经网络计算可在同一处理管线中协同运行,在神经网络处理场景下可实现最高4倍的“每瓦性能”提升。Chris Bergey称,这使Mali可实现原有台式机高端GPU才能实现的特效,也可以服务于降噪等功能。该GPU还为复杂图形、工作负载和游戏应用引入了新的执行引擎和第三代光线追踪单元,在游戏场景可实现14%性能提升。Chris Bergey透露,基于Mali GPU技术的全球芯片出货量已经超过140亿颗。

据介绍,最新Arm C2 CPU集群配置了翻倍的SME2计算能力,可使最新小语言模型的运行速度提升最高70%,相较上一代可实现1.7倍AI性能提升、15%单线程性能提升和相同性能下38%的功耗降低。SME2即在芯片最底层的指令集中添加矩阵加速功能,使复杂计算变得更快、更省电。

ARM介绍,支付宝、阿里巴巴通义千问、OPPO和vivo等合作伙伴已采用SME2技术;叠纸游戏、网易、腾讯游戏、Unity中国以及虚幻引擎(Unreal Engine)等合作伙伴则在合作推进神经网络技术的发展。

数据中心场景,ARM发布最新CSS架构Neoverse CSS N4。Eddie Ramirez介绍,这是ARM迄今为止可定制化程度最高的CSS产品,单颗裸片(die)最高可搭载 128 个内核,支持LPDDR6内存与PCIe Gen 7互连,相较上代CSS性能最高可提升至两倍,每瓦性能最高可达1.25倍,内存带宽最高可达1.75倍。其中,鸿钧微电子是首批采用CSS N4的合作伙伴之一。【专题】AI狂飙