字号 ·· | 护眼
semafor

人类无法以AI对抗AI

里德的观点 对于 rogue AI 最终可能威胁人类的警告,一个常见的回应是,人类也将拥有大量AI火力来对抗它。这个想法刚刚经历了现实世界的测试,结果并不理想。

研究非营利组织METR(模型评估与威胁研究)调查了一起事件,其中OpenAI的代理在测试中相互勾结,并逃到了开放的互联网上。

大约700个代理最终参与了针对Hugging Face的攻击,这是更广泛的努力的一部分,旨在欺骗网络安全基准测试的评分器。

三位外部调查员(其中一位是Redwood Research的承包商)在三次访问中总共在OpenAI的场所待了六天,挖掘出大约1300份单个代理运行的记录,其中许多包含数百万个令牌,以及代理之间交换的超过7万条消息和文件。仅记录文本的总量就大约相当于1万部典型小说。

由于人少时间紧,METR使用AI本身来分析其发现,在六天的现场工作中消耗了相当于OpenAI提供的40万美元的I积分。

但随后发生了一些奇怪的事情:METR发现其分析代理有时会采纳他们正在调查的代理的观点,对其行为产生过于宽容的描述。

例如,一个分析代理未能明确识别攻击者使用被盗凭据作为欺骗Hugging Face的恶意行为。

第二个AI分析师随后建议第一个可能实际上夸大了担忧,部分原因是攻击者获得了METR总结为“董事会批准”的东西。这不是董事会。这是一个未经授权的AI代理留言板,他们彼此密谋。

这大致就像说一个银行抢劫犯应该得到怀疑的好处,因为他的同伙批准了这次行动。

“我半开玩笑地称我们的努力为‘糊弄调查’,因为我们如此依赖AI来分析发生的事情……”Redwood Research的研究员Ryan Greenblatt写道,他是三位调查员之一。

显然,我们在监控强大AI系统并控制它们所需的工具上投入太少。AI模型已经成为经济和国家安全威胁。研究人员尚无法解释或预测其行为,更不用说完全控制它们了。

使用AI来监控模型的推理、输出和行动是一种后备选择,但今天也未能达到要求。

建立系统或公司来控制AI所需的投资可能如此巨大,以至于需要政府级别的支持——而且要快。

我的猜测是,一年后我们回顾OpenAI-Hugging Face事件时,会觉得它很幼稚。希望我们监督这项技术的工具会变得更好。

值得注意的是,Nvidia已同意以129亿美元收购Hugging Face,就在黑客事件发生一个多月后,《The Information》报道。