字号 ·· | 护眼
彭博社

Meta 宣传其最新自研人工智能芯片的成本效益

明年,新款处理器将在数据中心投入使用,另一款型号将于2027年底推出。Meta Platforms Inc. 计划在明年上半年开始在其数据中心部署自主研发的人工智能芯片,此举旨在节省运行人工智能模型时的成本和能源。

该公司于2023年首次宣布开发本土人工智能芯片的计划,目前正在测试其第三代芯片,名为MTIA 450,或称Arke。下一代芯片——代号为500,或称Astrid——将在大约一个月内完成设计工作,并于2027年底投入数据中心使用。Meta预计将更广泛地使用这款芯片。

Meta工程副总裁Yee Jiun Song在接受采访时表示:“每一代芯片在技术上都承担着稍多一些的风险,并为我们带来更好的性能。”他补充说,这包括每瓦能源和每美元支出的性能提升。

Meta(Facebook、Instagram 和 WhatsApp 的母公司)正在开发自己的芯片,这是其大力发展人工智能基础设施的一部分。该公司正与博通公司(Broadcom Inc.)合作进行设计,并与台积电(Taiwan Semiconductor Manufacturing Co.)合作进行制造——此举旨在减少对英伟达公司(Nvidia Corp.)行业领先处理器的依赖。

就能源消耗而言——这是数据中心行业的一个关键基准——该公司在 12 个月内已承诺采购价值超过 1 吉瓦的芯片。宋(Song)表示,在此之后,“我们预计将会加速”。他负责 Meta 的定制芯片项目。他说,这一预测是基于人工智能市场或需求不会出现崩溃的情况。

Meta 的人工智能部门 Meta Superintelligence Labs 通过提供对即将推出的 AI 模型及其运行要求的见解,帮助微调芯片,这一阶段被称为推理。Song 表示,最终结果是,在运行 AI 模型时,这些芯片的性能比“英伟达目前出货的任何产品”都要高效,“仅仅因为我们自己做了大量的工程工作。”9 月 1 日,12 块新模型芯片从台积电运抵 Meta,其性能与公司模拟预测的相差在 2% 或 3% 以内。第一天,该团队就能够使用这些处理器来运行 Meta 模型,以及来自 DeepSeek 和阿里巴巴集团控股有限公司的模型。

测试表明,半导体在设计上没有出现任何问题。但仍有大量测试和调整工作要做——需要几个月的时间——同时工厂的生产也在逐步提升。这四代芯片在很大程度上都依赖于高带宽内存,并且并非针对超快推理市场——该市场是指人工智能模型预计能做出极快响应的类别。“这些是我们用于通用推理的‘主力芯片’,”宋说。Meta 准备部署四款自研芯片以处理人工智能该公司此前曾计划打造一款代号为“奥林匹斯”(Olympus)的芯片,该芯片旨在同时用于人工智能模型的训练和推理阶段。该芯片原定于 2028 年或 2029 年推出,但 Meta 取消了该项目,转而专注于推理——Song 表示,部分原因是成本考虑。“当你开始建立兆瓦级的产能时,你真的会关心成本,”他说。Song 表示,如果同时处理训练和推理的芯片成本可能增加 30%,那么这“完全不可接受”。

在完成“阿斯特丽德”(Astrid)项目后,Meta 将专注于通过未来的型号提高速度和吞吐量——即处理的人工智能工作量。光纤技术也应该能让芯片团队提高性能。

“我们有一个非常扎实的路线图,”宋说。“在未来几年,我们预计将继续制造在性能上能与供应商为我们制造的芯片相媲美的芯片。”