Arm最新的智能手机平台针对在移动设备上运行AI代理进行了优化,并引入了神经图形技术,声称能在智能手机的功耗限制内实现桌面级游戏体验。
今天在上海举行的Arm Everywhere China活动中发布的面向移动设备的计算子系统(CSS)2代,接替了去年的Lumex CSS,反映了Arm将AI作为未来增长战略的拥抱。
Arm认为自己是这一转变的核心,指出AI工作负载目前主要在云端运行,但将越来越多地转移到网络边缘的设备上。
Arm边缘AI执行副总裁Chris Bergey表示:“当每次交互都必须往返于数据中心时,就会对延迟、连接性以及大规模提供这些服务的成本产生影响,因此我们看到它正变得更加分布式,而且我认为现在很少有人怀疑,基本上所有能推到边缘的东西你都会推过去。”
Bergey称,AI已从语音识别和图像处理等后台能力演变为人们积极使用的工具,包括生成式助手。
代理式AI更进一步,通过解释目标、协调应用程序和模型以及执行一系列操作来实现。
“因此你会看到重复推理、应用程序逻辑、系统编排、多个工作负载并发运行,这意味着你不仅需要更高的CPU性能。
你需要多个高性能CPU并行工作,以保持所有这些不同工作负载的运行,”Bergey解释道。
考虑到这一点,C2 CPU集群采用了新的顶级C2-Ultra核心,Arm声称其单线程性能比去年的C1-Ultra高出15%。
C2-Ultra核心拥有更大的执行引擎,以保持更多指令在飞行中,Arm声称其分支预测更准确,获取和目标预测更好,以保持指令流水线饱满。
Arm的芯片制造商客户可以像往常一样混合搭配组件以满足需求,但该公司主打一个旗舰集群,包含两个C2-Ultra核心、六个注重效率的C2-Pro核心和两个SME2单元(可扩展矩阵扩展),而去年平台只有一个SME2单元。
据Arm称,SME2能力翻倍可在最新的小型语言模型上实现高达70%的加速,而集群拓扑支持单个CPU上的私有缓存以及大型共享L3缓存。所有这些都由DSU(DynamIQ共享单元)连接在一起。
Arm表示,该集群已针对降低延迟和保持并发代理工作负载的响应性进行了优化。
CSS for Mobile 2还在Mali G2-Ultra NX中引入了专用的神经加速图形处理,Arm称这是其首款AI原生Mali GPU。Arm去年预览了这项神经技术,让开发人员有时间准备硬件。
该GPU引入了全新的执行引擎、神经加速器硬件和第三代光线追踪单元,专为全场景光照和阴影而设计。
该硬件支持神经超级采样(NSS),可将游戏图形从540p升级到1080p,以及神经帧率提升(NFRU),可生成中间帧以提高帧率。
使用这两种技术意味着GPU渲染最终显示帧序列中所含像素的八分之一,其余部分由神经硬件重建。Arm声称这使得在1瓦功耗预算内实现桌面级图形成为可能。
GPU产品经理Deyan Lazarov表示:“G2-Ultra NX GPU能够在具有非常丰富和复杂光线追踪场景的内容上维持每秒30帧的游戏会话。
这实际上得益于整体光线追踪工作负载减少了70%,进而转化为30%的性能提升。”Arm还演示了其他以每秒60帧运行的游戏。
与CPU核心一样,Arm提供Mali G2 GPU的Premium和Pro版本,允许其芯片制造商客户在性能与成本之间进行权衡。
为了鼓励采用,Arm已在GitHub上发布了其神经图形SDK和示例代码,并支持跨平台Vulkan图形接口。
与之前的Arm智能手机平台一样,芯片制造商现在必须将设计转化为可工作的硅片,然后智能手机供应商才能将设备推向市场,可能最早在明年。®