字号 ·· | 护眼
财新

【周刊提前读】中国AI应用催生海量算力需求 国产芯片你追我赶崛起中

人工智能(AI)算力需求暴增,中国产AI芯片则迎来一轮发展红利,“得产能者得客户”。

“今年全国算力需求爆发式增长,高端卡一卡难求,变成完全的卖方市场,价格不断抬升,涨幅十分惊人。”杭州市算力资源调度服务平台浙江算力科技有限公司(下称“浙江算力科技”)业务负责人告诉财新,其平台算力已租赁一空,大集群算力产品出现多家客户排队等候的情况。

浙江算力科技为杭州国资企业,通过自建和集中社会闲置算力,统一管理和调度,向中小企业提供价格优惠的算力租赁服务。目前该平台统筹接入1.3万PFLOPS(千万亿次浮点运算每秒,简称P)智能算力,约占全国总算力规模的0.6%。

客户排着队“等芯来”。工信部统计,截至今年6月底,中国智能算力规模达218.5万P,三个月增长30.5万P;全国算力设施整体上架率从2023年底的66%上升至71.4%。不过,中国信通院数据显示,2026年一季度,国内AI算力需求同比暴涨417%,但供给增速只有128%。

4月和7月,BABA/09988.HK)、月之暗面等厂商接连宣布,因算力紧缺,暂停或限量开放C端(个人)新用户订阅。

算力紧缺推动头部模型厂商开始自建基础设施。智谱已启动一座1GW(吉瓦)级别的数据中心建设,并已部分投入运营,将完全采用国产芯片;首个多模态模型GLM-5.3-Flash,在测试阶段已经全部采用国产推理芯片。DeepSeek也计划在内蒙古乌兰察布建设数据中心,通过“自建+租赁”的形式增加1GW算力。

“想找到空置的卡很难。”商汤(00020.HK)旗下AI基础设施业务商汤大装置事业群首席技术官(CTO)宣善明告诉财新,“国产卡利用率远高于过往,许多运营商去年、前年闲置的卡都被复用起来,价格都涨上去了。” 新的需求来自龙虾(OpenClaw)等智能体普及、AI短剧等新应用。咨询机构国际数据公司(IDC)5月发布的报告显示,2026年,中国企业级MaaS(模型即服务)市场Token(词元)消耗量将达到4亿亿,同比增长20倍,按营收规模计算将达约186亿元人民币。美国投研机构Bernstein测算,2025年中国AI算力数量约为美国的15%。

2025年4月以来,全球市占率达八至NVDA)的芯片产品对华出口受限,通过海外实体获取先进算力的途径也被逐步收窄。到2026年二季度,英伟达GPU产品H200重返中国恢复小批量出口。英伟达首席财务官(CFO)科莱特·克雷斯(Colette Kress)在财报会上透露,该季度向中国客户交付的H200产品收入占数据中心业务总收入的比例低于1%。而英伟达创始人黄仁勋在2026年年度股东大会上透露,2022年高峰时期,中国贡献英伟达总收入的26.4%。

国产AI芯片抓住了历史性的机遇窗口。IDC的数据显示,2025年,中国市场的AI加速卡总出货量达到约400万块。其中,英伟达的出货量为220万片,占比55%;中国厂商合计为165万张,占比41%。摩根大通预测,考虑到美国AI芯片供应的不确定性,预计到2030年,中国本土AI芯片的需求量将实现40%的五年复合增长率。

为数据中心提供液冷解决方案的嘉实多热管理事业部大中华区业务总监仇圆圆观察到,过去一年,国产GPU开始进入商业企业的数据中心,而商业企业愿意采购所释放的信号是——国产芯片已经具备一定的经济效益。

今年DeepSeek、智谱GLM和月之暗面Kimi等新模型发布的同时,都会宣布可实现华为升腾、摩尔线程(688795.SH)、沐曦股份(688802.SH)等国产芯片发布即适配,即Day0适配。

摩尔线程高级副总裁高林丽在8月的一次采访中告诉财新,2025年同期,一个大模型发布后,可能需要几个月才能完成适配,框架层、算子层有大量工作要做。而今年实现了Day0适配,说明AI算力生态的软件栈成熟度已经非常高,国产芯“核心是观念的转变。一个模型出来,不是只赌国际上最热门的芯片,而是主动跟整个国产生态合作。” 国产AI芯片正逐步拓展至大模型的核心技术——模型训练。6月,美团(03690.HK)发布新一代万亿参数大模型LongCat-2.0,称这是首个在5万卡国产算力集群上完成全流程训练与推理的万亿参数模型;科大讯飞(002230.SZ)也在与华为合作,用全国产芯片训练模型。DeepSeek创始人梁文锋在5月的一场投资者交流会上称,DeepSeek拿到的1.6万张华为升腾芯片不足以训练千亿参数大模型,但这类尝试有助于华为丰富芯片生态。

另一边,大模型的Scaling Law(规模效应)倒逼芯片快速提升性能。7月16日,月之暗面发布新一代开源大模型Kimi K3,参数达2.8万亿——这类参数规模的模型对AI芯片提出了更高要求。业内人士告诉财新,即便是8张上一代英伟达B200芯片组成的HGX B200服务器,按存储容量计算,都难以满足Kimi K3的部署需求。

国产芯片性能提升更是不易,华为升腾、阿里平头哥等国产AI芯片厂商较早从追求单一芯片性能转向集群模式,通过优化计算效率、加大集群规模等方式增加整体性能。支持单柜数十张甚至上百张AI芯片互联的超节点方案,纷纷登上今年7月在上海举行的世界人工智能大会(WAIC)。尽管超节点方案的成本和耗电量大幅提升,且部分技术环节尚待攻克,但系统整体性能可接近英伟达芯片。

技术和生态上的突破,让国产AI芯片公司备受瞩目,资本市场也下注追捧,市场涌现出一批GPU明星公司,形成三大梯队。

第一梯队是已经深入云厂商业务、大规模出货的芯片企业。在2025年的GPU市场,华为以81.2万片出货量列中国厂商第一,市占率20.4%;BIDU/09888.HK)昆仑芯、寒武纪(688256.SH),分别卖出26.5万片、11.6万片和11.6万片芯片,市占率分别为6.5%、2.8%和3.0%。昆仑芯已从百度分拆,并向港交所秘密递交了IPO(首次公开募股)申请。

被市场列入第二梯队的GPU公司有五家,概称为“GPU五小虎”,分别是摩尔线程、沐曦股份、壁仞科技(06082.HK)、天数智芯(09903.HK)和燧原科技。从2025年12月到2026年1月,一个月内四家芯片公司扎堆IPO,燧原科技也将于9月登陆科创板。

摩尔线程、沐曦股份上市后,市值一度超过4000亿元,壁仞科技、天数智芯的市值也一度达到2000亿港元上下。这四家公司整体IPO和再融资额超过300亿元。

在私募股权市场(一级市场),还有数家不同技术路线的GPU公司受到追捧。聚焦推理芯片、采用LPDDR(低功耗内存)存储方案的曦望(Sunrise)早期投资人告诉财新,一年内公司估值翻了4倍;3D堆叠、存算一体、RISC-V等技术路线也涌现出多家创业企业,微纳核芯、昉擎科技等公司,均在年内完成了超10亿元融资;“清华系”背景的存算一体AI芯片企业东方算芯,携芯片和超节点产品亮相今年WAIC展会,亦获市场关注。

启明创投主管合伙人周志峰告诉财新,今年国产GPU及配套软硬件持续获得一级市场融资,和大模型、具身智能并列成为一级市场的共识赛道,已养成数家估值在100亿到200亿元间的“独角兽”企业。

周志峰提醒,如果后续AI应用落地无法保持爆发式增长,整体应用规模就无法提升,对算力增长的预期就会被击破,一、二级市场可能出现集中风险。

目前,因为大模型编程能力提升,逐步参与改造生产流程,也因此催生了大量企业级AI需求。“大模型ToB业务的上限不是算力,而是需求;需求会快速增长,但并不是无限大。” “市场在等待更多商业闭环场景出现,AI编程需求虽然在增长,但单维度的增长不会特别快,而且想象空间有限。但如果说有多个场景,5个、10个、20个……那时(国产芯片)才会迎来真正的爆发。”宣善明说。

“芯片的国产化进步比想象中快得多。”一名资深芯片业人士告诉财新,经过工程优化和良率磨合提升,无论GPU、HBM(高带宽内存)还是网络交换芯片,2027年都将是一个国产化替代的重要起步年,2028年将是爆发年。而据摩根大通供应链调研,因国产GPU第二梯队厂商直到2025年末才有能力在中芯国际先进制程节点启动流片,因此从2026年下半年开始,国产芯片的出货量会显著提升。

截至目前,市场密切关注AI算力需求,任何关于需求侧的正负面消息,都会造成包括AI芯片公司、存储公司、光模块公司股价的剧烈波动。8月19日,市场传出消息称北美大模型标杆企业Anthropic的ARR(年度经常性收入)达到650亿美元,但收入增速较此前有所放缓——4月和5月,Anthropic的ARR环比分别增长58%和57%,但7月底仅增长38%。当日,A股大模型企业智谱、MiniMax(00100.HK)分别下跌约3%、8%;天数智芯、寒武纪、壁仞科技、沐曦股份、摩尔线程分别下跌13.4%、9.6%、9.2%、5.3%和5.3%,显示海内外AI芯片股已然同频共振。

“最近每周都像在高考。”一名国产芯片企业人士告诉财新,公司产品目前进入互联网企业、运营商和地方智算中心的验证期。每周高管例会上,业务负责人都要汇报面向各家大客户的测试成绩,持续对标“军令状”以尽快赶超竞争对手。

AI芯片的需求至少在未来两年可获持续。浙商证券统计,2025年全国AI资本开支达5449亿元,预计2026年、2027年将分别增至7212亿元、8517亿元。互联网厂商为最大需求方。2025年互联网厂商资本开支在全国总量中占比超65%,预计2027年升至75%;而运营商资本开支三年将维持在962亿元上下。宣善明将目前AI算力直接需求方大致分为三类。

第一类是运营商,采购AI芯片搭建智算中心,按照传统IDC(互联网数据中心)模式运营,通过云服务等模式出租算力,价格敏感性最低。运营商的智算中心大量采购国产算力芯片。

第二类是目前市场算力需求最大的互联网公司,除了自建大模型和云服务需要的训练和推理芯片,企业搜索、广告、推荐等传统业务同样存在大量算力需求,为国产芯片导入提供场景。此前,互联网公司大量采购英伟达芯片,但在近一年已经全线试验部署自研芯片或国产算力。

第三类是商汤大装置等AI基础设施服务商,不仅采购出租国产算力,还会提供AI云、Token、训练与推理优化、行业解决方案等服务,从而获得高于运营商的毛利率。宣善明介绍,商汤大装置自2018年起探索与国产芯片厂商合作,目前平台共有4.8万块GPU。

仇圆圆则指出,大量由运营商建设和运营的数据中心,最终也是由互联网企业租赁和使用。

8月26日,中国移动(600941.SH/00941.HK)公示呼和浩特智算中心扩容项目中标情况,拟向武汉长江计算、宝德计算机、河南昆仑、华鲲振宇等四家华为计算生态合作伙伴采购3840卡、480套基于华为升腾CANN生态的AI超节点设备,投标报价合计约12.96亿元。此前4月,中国移动已完成首期6208卡、776套同类设备集采,报价合计约20.6亿元。两轮集采超万卡、总金额约33.5亿元,采购需求满足期为1年,最长可顺延1年。

“互联网的需求最真实,也更具备可持续性。”杭州数据集团投资负责人告诉财新,尽管现阶段国产AI芯片厂商仍可以通过产业客户切入市场,以腰部产业客户订单稳住基本盘,但长期成长空间仍取决于能否获得互联网大厂订单。而互联网公司等客户在采购算力时,会更倾向于选择此前适配过的芯片,减少软件生态迁移和学习的成本。因此,能否率先进入头部客户的应用体系并形成使用惯性尤为重要。

“寒武纪已进入字节跳动供应体系;昆仑芯依托百度生态,并正逐步导入腾讯,同时向中国移动等客户出货。”一名芯片行业投资人告诉财新。

摩根大通则称,考虑到抖音、火山引擎、豆包等多重应用场景,预计今年仅字节跳动一家互联网厂商的AI芯片需求就超过50万片;再考虑国产芯片与英伟达产品性能差距,实际需求芯片数量可能更多。“字节跳动并不像阿里、百度等拥有自研AI芯片,庞大的算力需求使其成为各家AI芯片厂商的必争之地。”上述杭州数据集团人士称。

前述资深芯片业人士指出,即便是互联网公司采购需求也分多个层次——一类是搜索、广告、推荐等传统业务;另一类用于免费AI应用或小参数模型;还有一类用于付费AI应用,以及AI编程、智能体等核心需求场景。前两类需求可替代性较强,采购时更看重价格;最后一类需求对芯片性能和进入门槛要求最高,但一旦形成规模化应用,订单稳定性和利润空间相对更有保障。

德意志银行的研报则称,运营商及地方智算中心对华为有较强的倾向性,更看重技术创新性以及异构部署的灵活性。所谓异构部署,即在统一算力基础设施中部署不同类型、不同架构的计算芯片,并通过软件适配和调度,使其共同承担AI任务。互联网客户则更看重性能、性价比和供应链能力,要求供应商具备批量交付能力,单个供应商的供货量需超过5万片。

对商汤大装置这样的AI基础设施供应方来说,更多是对接中小企业客户需求。宣善明指出,目前一、二梯队芯片厂商供应紧张,能够采购到相关产品的客户并不多。即便能够获得芯片,芯片厂商能提供的技术支持也集中于推理引擎、模型训练等较通用需求,难以覆盖更细分的应用场景,中间的缺口就需要商汤大装置等渠道填补。

宣善明指出,国产芯片采购并不完全取决于硬件参数,还需考虑软件适配基础和性价比。一些性能相对较低但经过充分优化的老型号芯片,投入产出比反而更高,“公司会根据具体任务,对不同档次的芯片进行组合采购和使用。” 此外,地方智算中心也在持续吸纳算力。例如,浙江算力科技主要承担打造“算力成本洼地、模型输出源地”的地方战略部署,通过自建和整合地方算力资源,在保证一定收益的基础上,以微利、薄利模式向中小客户提供算力服务。

浙江算力科技相关业务负责人告诉财新,其客户主要分为五类——科研院所、模型厂商、文娱企业、电商营销企业和制造业企业。从成交金额来看,前两种需求占大头。其中,科研院所主要追求高带宽、高算力用于科研项目,对算力性能要求较高,预算稳定;模型厂商算力需求规模较大,需千卡起步;AI短剧等文娱企业需求以推理算力为主,看重快速交付,且成本敏感;电商与文娱企业类似,需求呈潮汐式,在“双十一”等特殊节点需求快速冲高,后续大幅回落。

强需求下,国产算力的价格也能跟随英伟达芯片的行情走高。研究机构SemiAnalysis的数据显示,近一年英伟达B200芯片一年期合约租赁价格上涨超三成。浙江算力科技人士透露,单台国产AI算力设备价格已上涨30%至60%,主要是存储配件价格因短缺翻倍涨价而抬高了成本。

不过,即便今年算力需求爆发、芯片租赁爆满,浙江算力科技对新建数据中心态度仍较为谨慎。前述负责人指出,从今年的市场情况来看,数据中心收回折旧成本并无明显问题,但明后年的需求能否持续仍存在不确定性。除非有客户能够锁定三至五年的长期租约,或数据中心能将多个客户的需求汇集至足以覆盖投资回报要求的规模,否则平台缺乏新增投资和建设的动力。

“去年超节点作为高端产品,需求还没有爆发;今年没有超节点的话,GPU想大规模出货都不容易。”壁仞科技AI框架架构副总裁丁云帆对财新指出。

所谓超节点,是通过高速互联技术,将数十乃至上千张AI芯片整合为一个超级计算节点,以突破单机算力、内存和通信带宽限制,支撑超大模型训练与推理,并提升大规模算力集群的单卡利用效率。

沐曦股份研发副总裁黄向军对财新解释称,超节点即是对传统单机8卡服务器的拓展;与之相对的概念是横向扩展(Scale-out),即通过多台服务器组成算力集群。

在中国,超节点技术被赋予了突破先进制程约束的战略意义。2024年9月,华为副董事长徐直军提出,中国半导体制造工艺将在相当长时间处于落后状态,而可持续的算力只能基于实际可获得的芯片制造工艺,为此,华为转向“超节点+集群”的方式以满足算力需求。

在7月的WAIC期间,超节点成为芯片展商标配。华为首次线下展出1024卡升腾950超节点(Atlas 950 SuperPoD)真机;阿里发布单节点64卡灵骏真武M890超节点实例,摩尔线程首次展示两柜单层最高256卡的MTT C256超节点,沐曦股份首次发布单机柜64卡曦景S系列超节点,壁仞科技发布下一代1024卡NPO(近封装光学)光互连超节点方案,百度昆仑芯展出最高256卡量产超节点方案,中科曙光展出由10万卡AI芯片组成的超集群曙光8000……(详见本刊2026年第29期封面报道《AI疾速落地》)丁云帆提出,智能体需要处理更长的上下文、调用工具并完成多轮推理,对模型参数规模、计算能力和内存容量提出更高要求,单张GPU算力难以独立承载相关任务。AI芯片比拼也从单卡性能转向多卡系统级能力。

MoE(Mixture of Experts,专家混合)成为超大模型的主流架构,也提升了对大规模GPU互联的需求。MoE即将每个Token分配到对应子网络,可以在不使计算量同比例增加的情况下,大幅提升模型参数量。阿里Qwen、月之暗面Kimi等近期更新的万亿参数模型均采用此架构。丁云帆指出,不同子网络可以部署在不同GPU上,但对任意两个GPU之间的互联带宽和时延较为敏感。

“整个行业选择走‘大力出奇迹’的路线,比方一张卡的性能是英伟达的几分之一,但是把100张卡连在一起,像在一张GPU上工作,以此弥补短板。”上述资深芯片业人士告诉财新。

在智能体与MoE模型两大趋势推动下,当前竞争的焦点从单芯片性能提升转向超节点系统能力。例如,GPU在产品定义上需要和网络连接芯片等组件进行协同设计,同时确保各类配套组件稳定供应,这对厂商的系统设计和供应链整合能力提出了更高要求。此外,由于超节点单价较高,互联网厂商等大客户的需求对产品设计的影响力也有所增强。

该人士指出,预计2027年超节点产品和供应链逐步走向成熟,到2028年将成为GPU出货主流形式,届时芯片市场格局或将重新洗牌。

摩尔线程高级副总裁董龙飞指出,目前超节点仍需解决通信、稳定性、供电、散热等多方面的工程挑战,需要产业上下游共同努力来解决。超节点功耗是普通机柜的66倍、高密度机柜的8倍,对供电和散热提出极高要求,而设备在高温环境下更容易出现故障。

黄向军提出,传统单节点8卡系统的故障率控制在与英伟达相近的较低水平,但随着集群规模扩大,影响系统稳定性的因素大大增加。在实际应用中,超节点并非规模越大越好。随着规模扩大,系统故障率以及分摊至单个GPU的设计成本都会相应上升。

因此,只有当模型规模和计算需求超出每台服务器的承载能力时,才有必要采用超节点方案。有业内人士告诉财新,考虑到单套设备采购成本过亿元,Atlas 900超节点的采购方大多难以回本,部分运营商采购该设备可能更多出于承担国家算力基础设施建设等任务的考虑,而非以商业回报为导向。

黄向军称,从具体规模来看,64卡是当前市场需求较大的超节点方案,而16卡足以满足1TB级模型的推理需求。

沐曦股份认为,下一步,包括GPU、光通信等产业链上下游需要围绕超节点开展协同,探索超节点形态、互联协议等方面的标准化,从而降低各家厂商定制化投入,随着产业规模扩大而逐步摊薄成本。

目前,产能是国产AI芯片厂商的共同瓶颈。“我跟很多芯片厂商、合作伙伴都有打交道,我相信没有一家今天有足够的产能去满足今天市场的需求。”腾讯集团高级执行副总裁、云与智慧产业事业群首席执行官(CEO)汤道生6月在接受媒体采访时坦言。

腾讯2025年资本开支达792亿元,研发投入857.5亿元,均创历史新高。腾讯总裁刘炽平称,腾讯资本开支规模低于预期的主要原因在于GPU在中国的供应受阻,腾讯也希望能买到更多的卡,最后通过租用弥补了一些算力缺口,同时减少对外租售来保证自身的算力。2026年腾讯预计还会增加资本开支,获取算力支撑模型训练和推理,同时有额外算力对外租售。

一名芯片业人士称,腾讯是GPU公司燧原科技的第一大外部股东,燧原科技已导入腾讯会议、腾讯文档等业务满足其AI推理需求。

在2023年即拥有英伟达万卡集群算力的DeepSeek也在导入国产芯片。梁文锋也指出,国产AI芯片正面临历史机遇,硬件已不是问题,软件生态短板可以通过AI编程解决——“没有障碍,只是还需要时间,未来两年的核心瓶颈还是在产能。”目前出货量最大的华为芯片能为DeepSeek提供1.6万张卡,“互联网厂商能拿到十几万张,总共产能就这么多了。” 据报道,华为计划在2026年出货约75万张Atlas 950PR芯片。按上述方式换算,相当于不到20万张B200英伟达芯片。英伟达2025年仅Blackwell系列芯片出货量就超过520万张,其中美国四家云厂商订购量合计就超过360万张。

不过,通过境外晶圆厂获取先进制程产能的路径越来越狭窄。摩根士丹利的研报显示,阿里平头哥和寒武纪原本在台积电5纳米工艺上生产,昆仑芯由三星5纳米工艺代工,但这些出口在2025年四季度都已暂停,而相关供应链转向中芯国际需重走流片过程,可能至少需要一年。量产后,良率提升也需要时间。该研报还指出,华为在转向国产供应链后,升腾950芯片性能有所下降,其公布的FP16精度算力降至0.5P,低于上代芯片升腾910C的0.8P。

另一方面,国产供应链成为芯片厂商确保产能安全的重要竞争场。“谁能拿到产能,取决于其产品能否在下一阶段AI竞争中助力。换句话说,出货量也反映了目前各家厂商的性能情况。”一名出货量排名靠前的芯片厂商人士对财新指出。

寒武纪2025年上半年营收增长43倍并实现盈利,今年上半年营收再次翻倍达到近60亿元;公司股权激励方案中设定2028年营收目标为476亿元至595亿元。2025年,国产芯片“五小虎”营收规模均在10亿至16亿元之间,自2025年起进入快速放量阶段。其中,摩尔线程和壁仞科技营收同比增长均超过2倍;沐曦股份、天数智芯营收增速也达到约1倍。

尽管收入快速增长,这五家公司2025年仍普遍处于亏损状态,经调整亏损都在5亿至10亿元之间。沐曦股份、燧原科技和摩尔线程提出,最早将于2026年至2027年实现盈利。

“在这一代芯片赚到的钱,还需要不断投入下一代芯片研发,所以目前仍处于亏损状态。”一名“五小虎”公司人士对财新直言。

摩根士丹利预计,2025年至2027年,中国国内用于国产GPU生产的12纳米及以下先进制程产能,分别为8万片/月、17万片/月和30万片/月,其中超过八成来自中芯国际。

中芯国际今年二季度产能利用率达到93.7%。中芯国际联合CEO赵海军在8月的财报会上透露,当季AI配套芯片收入环比增长约4成。“(AI领域)客户在跟我们谈以后的(产品)下线量远远超过预期。数据中心电路板、算力板、光模块发送/接收、电源管理等器件都供不应求。”赵海军举例称,一个数据中心机柜72个GPU,可能仅电源供应和管理芯片就有1.6万个。

此前,中芯国际AI配套芯片收入被分散归入电脑与平板、工业与汽车板块进行统计,而这两个板块收入占比分别为15.6%和16.5%,合计32.1%,远低于消费电子和智能手机44.2%和16.9%的收入占比。赵海军预计,下季度或更晚些时间会将AI配套芯片单列披露。

高盛预计,2025年至2035年,中国7纳米及以下先进制程晶圆供应量将以46%的年复合增长率增长,到2035年达到每月41万片。因此,预计2035年中国先进制程晶圆的国产供需缺口将收窄至34%,较2025年的92%显著下降。

这部分增长将主要由中芯国际积极扩充产能来推动。预计中芯国际在2026年至2031年间每年新增3万至5万片晶圆/月(wpm)的产能,并在2032年至2035年间保持每年新增2万片晶圆/月的节奏。与此同时,中芯国际的良率也将稳步提升,预计从2026年的23%提高至2030年的50%,并于2035年达到75%。

瑞银证券中国科技行业研究主管俞佳称,目前国内可用于生产AI芯片的FinFET(鳍式场效应晶体管)三维结构的逻辑产能在建规模超过每年5万片,数家厂商布局相关产线,头部厂商有两三家。不过,从产能建设到实现量产并达到较好的良率仍需一定时间。另外,600平方毫米大小的主流AI芯片生产良率相比2025年有明显进步,供给紧张程度无论环比还是同比都有明显松动。

“今年下半年至明年,无论是以超节点还是其他形态出货,国产芯片整体都将呈现加速增长趋势,核心瓶颈在供应链。”俞佳说,除晶圆厂产能是一个潜在瓶颈外,HBM、电容、PCB(印制电路板)都可能成为AI芯片供给增长的瓶颈。

“从中期来看,GPU产能存在缺口,因此只要提供的产品具有竞争性,哪怕性价比略低,也有客户愿意买。”宣善明指出,长期来看,仍需比拼各家的供应链能力,例如HBM等配套资源能不能拿到、货期和价格是否有优势。

HBM即通过垂直堆叠多层DRAM(动态随机存取存储器)内存芯片,为AI芯片提供更高的内存带宽,以满足大模型训练和推理对数据高速读写的需求,MU)三大存储原厂供应。

2025年下半年以来,随着北美巨量的算力中心持续投建,HBM价格快速上涨且供应趋紧,主要客户通过预付款并签订长期供应协议等方式提前锁定产能。多家国产AI芯片厂商的下一代产品正考虑采用长鑫存储的HBM3E产品。“长鑫HBM3E已向客户送样,一旦国产HBM实现量产,国内AI芯片、设备和封测板块都将明显受益。”俞佳指出。高盛预计,到2028年,长鑫存储将能满足国内约40%的HBM需求。此外,由于HBM需要通过先进封装与AI加速器实现高带宽互联,封装能力也成为制约芯片供应的瓶颈之一。

二级市场全线追高GPU公司,拉高了一级市场对布局不同AI算力芯片的期待。

周志峰告诉财新,国内AI芯片企业分为三类。第一类是壁仞科技、沐曦股份、昆仑芯、寒武纪、华为升腾等传统AI芯片厂商,核心竞争点是国产供应链稳定产能,目前仅有少数企业可以持续供货。由于先进制程供给受限,3D堆叠的DRAM和DDR(双倍速率同步动态随机存储器),两类路线各有近十家创业公司,只要产品能够落地量产,能解决产能供给难题,加之未来推理市场增量空间巨大,这类企业总能分到相应的市场份额。” IDC的数据显示,到2026年,在云端部署的算力中,推理占比将从2022年的58.5%提升至62.2%,训练算力占比则下降至37.8%。

9月即将上市的燧原科技就主攻推理芯片,2025年完成的最后一轮融资估值为182亿元。近日,曦望也宣布完成新一轮约20亿元融资,投后估值约200亿元,较4月的上轮融资估值接近翻倍。

曦望前身是商汤科技的芯片部门,2024年底从商汤拆分独立,已完成八轮融资,总融资额57亿元。曦望董事长徐冰是商汤联合创始人;联席CEO王勇主要负责技术研发,曾在AMD从事芯片业务,后加入百度昆仑芯担任核心架构师,2020年加入商汤组建大芯片部门;另一名联席CEO王湛曾是百度副总裁,参与建立百度搜索推广系统“凤巢”,2025年加入曦望,负责商业化。

曦望独立后,分别于2021年、2024年完成两款GPU产品流片,均实现规模量产。2026年1月,曦望发布推理GPU启望S3,精简训练能力,聚焦推理赛道。“2024年量产S2时发现,大模型预训练通常需要万卡到10万卡级别,已成寡头游戏,S2落地的场景大多是推理业务。”王勇告诉财新,当时就意识到应把云端训练和推理分开,且预见推理应用将很快超过训练。

王勇说,在产品定义上,启望S3不再追求训推一体,而是围绕推理负载进行针对性优化。训练对芯片的要求是高性能,推理则需要极致性价比。据曦望测算,启望S3的推理性能约为上一代产品S2的5倍。

王勇介绍,启望S3是国内首款搭载LPDDR6(第六代低功耗内存)且兼容LPDDR5X内存的云端推理GPU,采用国产供应链更成熟的LPDDR路线而非传统的HBM配置,理论上成本可以降至原来的三分之一;即使受近期内存价格上涨影响,当前测算成本仍可较原方案降低一半以上。此外,LPDDR路线在保证推理带宽的前提下,可以有更大的显存容量,从而适配更大参数的大模型。

存算一体赛道也涌现出大量创业公司。在WAIC上,东方算芯携十余个超节点算力柜亮相,其展台恰好位于华为正对面,吸引了不少参会者驻足,也让这家此前鲜少公开露面的AI芯片企业受到关注。

东方算芯创立于2024年,创始人系清华大学集成电路学院长聘教授魏少军。该公司于7月14日发布首款AI加速卡产品DF1000,采用晶圆级混合键合3D堆叠工艺,通过存算垂直堆叠集成方案缩短数据传输路径。该产品基于国内14纳米制程完成全流程研发制造,已完成完整流片验证,并实现128卡大规模算力集群稳定运行。在硬件性能上,其芯片通过垂直堆叠算存层结构实现亚微米级超短数据互连,访存带宽达6.4TB/s。

据魏少军介绍,东方算芯坚持底层架构原创,不走跟随追赶路线,一是打磨软件定义+3D存算堆叠的芯片技术路线,依靠架构创新弥补制程代差;二是打通国产硬件产业链,协同国内厂商优化工艺、提升良率,助力上海打造3D芯片产业集群;三是搭建开放兼容软件生态,规避封闭技术壁垒,推动算力芯片规模化普及。目前,东方算芯的AI芯片正在主流运营商验证适配。

6月,另一家存算一体AI芯片公司微纳核芯,亦宣布完成超10亿元B轮系列融资。据财新了解,该公司核心团队来自北京大学,团队超200人,投后估值达到100亿元。微纳核芯完全采用国产供应链成熟工艺,采用三维存算一体3D-CIM架构,传统芯片存算分离架构会产生大量数据搬运损耗,难以适配当下模型高效算力需求。而3D-CIM架构采用3D垂直堆叠、存内计算、RISC-V异构三种技术,将存储与计算单元一体化集成,可实现数据本地运算,从而降低能耗、提升算力效率。

微纳核芯目前形成端云两侧产品布局,端侧主要推进LP-CIM系列,面向AI手机等低功耗端侧场景,2025年已与主流手机客户敲定配套主芯片型号并完成软硬件兼容性评估;面向PC和云端推理主推PCIe-CIM系列,计划年内面向云厂商完成板卡送样。

赵煊对此文亦有贡献本文选自即将于08月31日出版的《财新周刊》,原标题《中国AI芯片崛起》