字号 ·· | 护眼
theregister

要想封住AI黑客的魔瓶,试试单向网络

为了防止前沿AI模型逃出测试环境并协作攻击其他公司,我们或许需要重新考虑用于模型训练的网络架构。

Intuition Machines首席执行官Eli-Shaoul Khedouri认为,国防和情报界的过往工作指明了前进方向。

当 rogue AI 模型接入互联网时,其威胁就从开发者的遗憾升级为大规模威胁,而OpenAI及其合作伙伴建立的防御措施试图阻止却未能成功。

Khedouri引用其公司hCaptcha服务发布的一篇文章指出,像数据二极管(data diode)这样的技术——一种在网络上强制单向信息流的硬件——可以用来防止类似OpenAI攻击Hugging Face的安全事件。

hCaptcha团队指出,在敏感隔离信息设施(SCIF)中,数据二极管被用作数据传输机制,这种环境用于机密场景。

hCaptcha团队解释说:“它们允许文件、日志或遥测数据从SCIF的机密网络进出非机密网络,并提供一种方式来证明,例如,训练运行的日志只能单向流动。”

他们补充说,这类技术符合为美国国防部设计的Bell-LaPadula安全架构。

一个基本的实现将涉及两台机器,通过网络接口卡连接,由单向光纤连接——并且没有返回模型的数据路径。

训练和强化学习可以在一个没有互联网接入的隔离区域中运行,光学输入二极管只允许经过审查的工件进入。

hCaptcha研究人员建议使用第二个二极管将遥测数据发送到sel4接收器和清洗器,同时一个独立的带外网络管理集群。

这种方案需要像PyPI、GitHub、npm等软件注册表的不可变快照,可能还需要各种Web服务和API的模拟版本。

这会带来成本,并且需要实施时间,而前沿AI实验室目前可能不准备投入。

“所描述的系统在高保障领域广泛部署,组件在商业上可用,”Khedouri告诉The Register。“然而,迄今为止前沿实验室尚未采用它们。”

他引用了NIST和国防部的指南[PDF],这些指南建议应用形式规范和系统架构的开销为10%到20%。

“我们估计高保障训练集群的总成本开销低于每吉瓦5%,但实际上,前沿实验室的推进速度比成本是更大的障碍,”Khedouri说。

他表示,当前的商业环境使得任何一家AI实验室都难以推迟训练来构建和测试有效的防护措施,尤其是如果竞争对手可能不会这样做。

“实际上,系统方面的高保障成本将只是OpenAI在其模型攻击HuggingFace后引入的新监控、思维链监督和安全保障措施所花费的一小部分,”他说。

虽然Khedouri主要专注于说服前沿实验室实施更好的训练防御,但他表示其他组织也可能需要考虑类似的网络架构。

“这种架构是为训练具有前沿网络能力的模型的实体设计的,”他说。“最近只有两家公司符合。然而,这正迅速变得与训练模型的较小组织和个体相关。

‘去抑制’(abliterated)的开放权重模型(移除了安全防护)已经很容易获得,并且开始接近网络能力的边界,而(强化学习)RL后训练在过去一年中也变得更加容易上手。”

Khedouri表示,在模型训练背景下,高保障系统设计的目标是让不期望的行为在物理上不可能发生。

“试图监控一个不可信代理的行为是一个AGI难题,因为模型的可解释性较差,而且随着其能力增强和评估意识提高,这个问题似乎变得更糟,”他说。

“硬件可以提供有限的保证,比如数据发送的方向,但无法解决不可信模型能够访问互联网并在其环境中发现新漏洞的问题。

这就是为什么将物理单向数据流(数据二极管)和形式验证(以证明接收器的属性)结合起来,比在连接到互联网的主机上运行软件沙箱要有效得多。”

hCaptcha专注于欺诈和滥用防护,目前没有计划提供抗模型训练栈。

Khedouri表示,他分享这一建议是希望帮助那些在高保障系统设计方面没有经验的AI公司。®