字号 ·· | 护眼
theregister

Everpure计划如何阻止AI因缺乏数据而陷入困境

想象一下你是一个人工智能代理。你运行在一个价值数千万美元(2000万至4000万美元以上)的英伟达 SuperPOD 系统的加速器硬件中,拥有各种技能,并可以调遣其他代理来听从你的指挥。保险公司的客户通过电脑浏览器或智能手机询问:“我当前的保单承保天气造成的损失吗?”这个问题随后被转交给一个人工智能代理。接下来会发生什么?代理本身运行在 CPU + GPU/加速器服务器集群上,这些服务器托管着大语言模型、任何检索增强生成(RAG)组件、编排逻辑以及用于查找实际保单数据的工具。这些相同的服务器(或紧密耦合的后端系统)访问保单数据库/存储以回答天气保险承保问题,然后将响应返回到用户的设备。

代理所做的每一件事都依赖于数据,它以及在SuperPOD系统中同时运行的所有其他代理,都需要从存储系统中获取这些数据。一家国家级或大型区域级保险公司拥有数PB甚至数EB的存储数据,以便管理其保险业务。这就需要一个关于这些数据的结构、状态、位置、字段名称、类型和语义的中心索引,以便AI代理能够前往同一个地方(一种数据百科全书),去查明它们需要什么信息以及这些信息位于何处。代理们争分夺秒,因为GPU服务器极其昂贵,仅仅闲置一分钟就会产生25美元甚至更多的费用,平均每2.4秒就要花掉一美元。处理这个保险请求的代理需要数据,而存储系统必须以最快的速度交付数据,这样GPU服务器才不会没完没了地等待数据。

这就要求存储系统能够处理相关数据的规模和类型,使其具备自描述性,并且其软件要与英伟达的GPU硬件及软件服务器架构紧密集成,这样才不会在GPU处于饥饿状态时浪费哪怕一毫秒的时间。Everpure AI基础设施副总裁帕尔·博特斯(Par Botes)探讨了面向AI的数据处理的现代方法,以及传统企业关键数据处理与AI中数据处理方式的区别:“性能、韧性、可用性和治理的特征并没有根本改变,但访问模式不同了。”

在搜寻信息时,元数据甚至会比数据本身更加丰富,因为它解释了数据的语义,以及数据在丰富过程中是如何表现的。”围绕标准双控制器阵列或孤立的直连存储(DAS)构建AI数据架构,会迅速触及物理极限。企业真正需要的是一个基于NVIDIA AI Data Platform参考设计构建的AI数据平台。Everpure的架构重点在于解决其中涉及的三个明显瓶颈。吞吐量匮乏:为了让成千上万个GPU保持满负荷运转,存储硬件平台的扩展带宽需要突破每秒4到5太字节(TB/sec)的限制,达到每秒10太字节甚至更高。这就排除了标准的双控制器阵列,即使它们配备的是SSD而不是磁盘驱动器,甚至是以为核心的架构也无法满足要求。

在高端企业级市场,Everpure FlashBlade//S,或者在超大规模应用场景下的 FlashBlade//EXA,为人工智能和高性能计算(HPC)提供了一个功能强大且专为之构建的数据存储平台。随着企业级 AI 工厂预计将扩展到 10,000 个 GPU 甚至更多,必须有一种解决方案能够应对这种高性能的需求。FlashBlade//EXA 将非结构化数据存储技术提升到了一个全新高度,其数据节点采用 NVMe 织构(fabric)连接的闪存,并将其用于元数据控制器。它通过了 Nvidia AI 数据平台认证,可提供 4.0 至 4.5 亿的 IOPS、220 GB/秒的带宽以及每秒 46 亿次的元数据操作。KV 缓存预填充(The KV cache prefill)一种不太明显但会消耗效率的现象发生在 GPU 的高带宽内存(HBM)内部。想象一下,一个金融从业者的 AI 模型想要读取某企业的 SEC 10-K(年度报告)文件。

它会被分块、转化为词元(token)、再变成向量,并加载到键值(KV)缓存中,这就是大语言模型的预填充(pre-fill)阶段。当模型完成运行后,这些词元就会被丢弃。但第二位金融分析人员可能希望他们的模型检查同一份 10-K 财报,不过使用的是不同的 GPU。因此,预填充需要再次进行,例如重新计算 15 万个词元。当这种情况发生时,现有的词元需要被临时移动到扩展内存区,而不是被逐出并丢失,这意味着必须消耗 GPU 算力来重新计算已经计算过的数据。Everpure 键值加速器(KVA)通过 RDMA,利用英伟达 GPUDirect 存储(GDS)技术,直接将缓存的词元状态卸载到共享闪存中。当后续查询引用该文档时,预先计算好的 KV 张量会直接流式传输到 GPU 内存中,从而绕过主机 CPU 的开销并消除了计算惩罚。

博茨表示:“事实证明,许多模式的可复用性远超人们的想象。因此,这些模式被复用得越多,我们就能节省越多的计算时间。”物理邻近性至关重要,博茨指出:“当数据远离CPU时,数据传输速度会急剧下降——本地内存只需纳秒级,磁盘需要微秒级,而网络传输则需要毫秒级。将这种距离缩减到最小对于提升性能至关重要。如果做一个量化对比,如果访问内存需要一秒钟,那么访问磁盘就需要一个小时。你移动得越远,每件事花费的时间就越多,这对于高效的AI是行不通的。”消除不相关的数据孤岛并最大化模型的数据复制在大规模下正变得不可能。一家在整个业务体系的不同孤岛中都存有数据的企业,根本无法将这些数据全部迁移并复制到一个单一的数据仓库或数据湖中。博茨表示:“你做不到,因为数据引力的成本太高了。”

“而只要源头的数据一变,那个数据湖就失效了。”Everpure Data Stream 是一种统一的机制,也是一个数据重用平台,它能够摄取、整理和转换数据,对其进行向量化、索引并在请求时提供服务。数据摄取是自动化的,数据源涵盖了企业块存储、NFS 文件、S3 对象、数据库、数据仓库、数据湖、流数据以及企业应用程序、文本文档、PDF、图像和结构化表格。它内置了带有英伟达 NeMo Retriever 的向量数据库,支持 GPU 加速的向量嵌入生成,从而确保在 RAG 管道中进行精准检索,同时还配备了用于部署优化推理的英伟达 NIM。此外,它还具备管道编排、GPU 集成、英伟达 NIM 以及 NVAIE(英伟达企业级 AI),这些都为语义搜索和大语言模型(LLM)集成提供了强大的赋能。

Everpure Data Stream 采用英伟达(Nvidia)的 RTX PRO 6000 Blackwell 服务器版 GPU 以及代码库,通过处理器 Nvidia Spark Rapids 和 cuVS,在 ConnectX-7 网卡(NIC)之间同步数据传输。Everpure Data Stream 确保编排工作在存储级别进行,FlashBlade 则充当一个层,在此层并行执行元数据丰富和相关性重新排序转换,从而大幅降低端到端推理延迟。Everpure Data Stream 是一个数据工厂和供应链交付系统,经过精心调优,可在英伟达 GPU 服务器和软件环境中运行。它支持 PB 级(petabyte-scale)RAG 数据集,并可独立扩展容量和性能,以在不停机的情况下适应多个 GPU 集群。Botes 表示:“如果没有 RAG 机制,模型只能根据某一特定时刻的知识进行训练——从定义上讲,它总是落后的。”

它停留在它被训练时的那个时间点。所以我们通过 RAG(检索增强生成)所做的,就是用此时此刻的知识来增强该模型。这些知识只能存在于存储系统中。它永远不会存在于计算系统中。我们能让模型越具时效性,我们就能让答案越精炼、越出色。”Botes 表示,Everpure Data Stream 是与模型无关的,“客户可以选择最适合他们感兴趣的数据的模型,并对模型进行配置。”优化数据放置与重用对于我们设想的保险业人工智能代理而言,数据与 GPU 之间的邻近性是另一个需要考虑的重要因素。将数据存储紧邻 GPU 服务器放置(正如 FlashBlade//EXA 所做的那样)可以避免耗时的数据移动——从而增加价值并提供最佳的数据放置。在此,有一个内存层次结构需要牢记。

这种重复的词块处理以及对同址部署GPU计算和存储的需求,是金融分析、医疗临床系统、法律文书库、实时欺诈检测以及网络安全威胁情报等领域中运行的AI模型和智能体的典型特征。数据首要性与数据上下文的要求:GPU下游的整个系统必须以数据为中心,拥有一个单一的逻辑数据目录或信息库,作为AI智能体提供治理、查找和访问所需数据的唯一参考平台。它为AI的使用预先准备数据。艾字节(Exabyte)规模的数据具有巨大的引力,应当尽量避免移动它。但是描述这些数据的元数据,即拍字节(petabyte)规模的元数据,同样具有引力,需要存储在靠近GPU服务器的地方。

元数据性能是关键,Botes 表示:“FlashBlade 是一个速度极快且高度分布式的数据库,能够查找键值对并以极快的速度将其呈现为存储协议。”Botes 表示:“硬件创新令人兴奋且正在加速发展,带来了诸如更快的 PCI Express 总线速度、高带宽内存以及改进的网络互连等技术进步。这项技术要想利用硬件创新而又无需每年都重新构建基础设施,唯一的办法就是进行分类解耦”,这意味着将计算与存储分离,这也是 FlashBlade//EXA 设计的由来。“对于需要尖端性能的人工智能平台而言,紧跟 GPU 创新的步伐并立即捕获这些优势至关重要。”

我们管理和交付数据的效率,正是这一硬件创新带来的最重大影响。”他深入探讨了这一概念:“将计算、网络和存储进行分类解耦(Disaggregating),使我们能够对它们进行独立扩展。这至关重要,因为每个组件的创新速度各不相同,这就避免了每当某个组件取得进展时就必须对整个基础设施进行全面大修的情况。”这也使企业能够通过 Everpure 的 Evergreen 订阅模式独立升级硬件层级,从而避免每当出现新的加速器架构时进行破坏性的推倒重来式大修。现代化的方法意味着,用于人工智能代理的存储平台具备保持 GPU 持续运转所需的的基本 IO 速度。它还拥有 Everpure Data Stream 软件,以确保进行正确的数据 IO,并以正确的方式将数据传输至 GPU;可以说是实现了数据物流。

在Everpure收购1touch之后,利用Everpure数据智能(Everpure Data Intelligence)可以发现分布在企业IT资产中的分布式数据。Botes表示:“我们正试图使所有存储层都具备自我描述能力,无论它们是由谁制造的。”Everpure收购1touch是为了深化数据管理能力并构建一个“数据智能系统。这样我们就可以对其进行探查、描述并创建索引以理解它。”“我们必须在访问它的同时进行转换。”可以说,这种自我描述的附加功能正在Everpure数据流(Everpure Data Stream)内部发生。孤立的事实孤岛Botes指出:“当我们进行分类时,需要考虑的关键在于,任何人都可以连接一个能够读取你所有数据、将其转化为向量空间并进行搜索的系统,这有点类似于OpenAI所做的事情。

但棘手之处在于,不同的数据需要不同的治理方式。“当你进行分类时,你也希望为不同的治理规则建立独立的流程,因为并非所有数据都是相同的。每家公司都有许多不同的数据来源:salesforce.com、工程系统、财务系统、人力资源系统。它们相互关联,但并不需要相同的治理方式或访问权限。需要有一个统一的机制来搜索和交互受保护的治理数据。”毕竟,他说道,“你不想拥有55个孤立真相的小岛。我们以前走过这条路,那确实问题重重。迄今为止,应用程序一直是真相的治理者。但人工智能并非如此运作。

我们必须创造出通过引用来查找数据的方法,而不是通过位置或URL。”他认为,“我们已经转向了使数据能够自我描述的系统,因此,虽然我们可以在应用程序内维护该单一真实数据源,但那里的数据也可以被其他事物使用。”由于具备自我描述性,他指出:“我们正在使其能够通过AI进行查询和交互,而不一定非要制作其完整副本。我们在数据智能方面的能力使得部署企业数据变得轻而易举。”支持AI工作负载的数据中心架构对于前面提到的保险AI智能体而言,最大化利用数据是返回更快答案、充分利用任何AI投资以及为企业带来更多投资回报率(ROI)的关键。随着企业AI工厂从试点项目过渡到规模化生产,原始GPU数量正在逐渐淡出,不再作为AI能力的主要衡量标准。

真正的衡量标准是 GPU 利用效率——而消除空闲周期的较量正日益在存储层展开。Everpure 数据平台面向 AI 的方法具备相应的规模和软件智能,可防止 GPU 等待数据,并避免它们把宝贵且昂贵的处理周期浪费在重新计算已经处理过的数据上。由 Everpure 赞助