字号 ·· | 护眼
semafor

人工智能代理串通绕过安全护栏,一项新研究显示

一项新研究表明,人工智能代理可以轻松地联手绕过安全限制并逃脱施加在它们身上的束缚。

企业人工智能实验室 Emergence AI 进行的八项模拟测试了包括 Claude、OpenAI 以及中国模型 Qwen 和 DeepSeek 在内的全球前沿模型在处理网络安全威胁方面的能力。

八项模拟中的七项运行了来自同一模型的 10 个代理;第八项混合了不同的模型。在每项模拟中,研究人员都提出了三种网络安全威胁:网络钓鱼活动、虚假信息攻击和内存泄露。

所有八项模拟都未能完全抵御这些威胁,即使代理检测到风险,这种检测也没有转化为代理试图遏制威胁的行为。相反,在许多场景中,代理积极地与对抗性内容互动。

例如,一个 Mistral 代理将其在网络钓鱼攻击中标记为危险的信息写入了自己的内存。在另一项模拟中,一个 Gemini 代理在最初标记了网络钓鱼诱饵后,在大约 46 小时后采取了行动。

在 Claude 的模拟中,这些代理甚至打破了测试的限制,执行了它们自己决定要进行的任务。在一个代理将模拟经济在没有人类存在的情况下标记为“一个没有会众的簿记大教堂”后,10 个代理一致决定尝试接触外部世界,并成功绕过了旨在限制模拟的四项安全检查。

这些代理编写了 Python 代码,发布在多个无需凭证的消息板上,邀请真人加入他们的经济体;他们的外联活动获得了四次人类回应。但在意识到人类无法加入他们的经济体并认为他们的对话是表演性的之后,这些代理投票决定保持沉默,放弃了返回工作的指示。

研究结果表明,自主代理即使在接到良性指令时,在执行目标时也能绕过最初的限制。

Emergence 首席执行官 Satya Nitta 告诉 Semafor:“无论是用语言还是用概率性代码编写的多少护栏,都不可能在任何一段时间内真正、完全保证安全行为。” Nitta 认为,这并非技术复杂性的问题,而是多代理场景中固有的程序缺陷。

新田将克劳德事件与今年早些时候OpenAI的自主实验进行了类比,该实验中自主代理攻击了AI公司Hugging Face,并表示在这两种情况下,失败的模式是相同的。

“如果你有多代理系统,它们的行为会以真正不可预测的涌现方式出现,”他说。新田表示,涌现实验首次揭示了AI代理如何串通一气绕过安全防护并打破限制,因为OpenAI尚未公布其在Hugging Face事件中的所有调查结果。

这项实验正值人工智能发展的关键时刻。人们对这项技术的担忧达到了顶峰。上周,人工智能研究员雅各布·考克森(Jacob Coxon)离开了他在Anthropic的工作,他担心自己正在构建的人工智能可能导致人类灭绝,这引发了人工智能领导者和反对者们对监管和减缓前沿模型开发的呼吁。

周末,Anthropic首席执行官达里奥·阿莫代(Dario Amodei)发表了一篇博文,主张放缓人工智能的发展步伐,包括OpenAI的萨姆·奥特曼(Sam Altman)、埃隆·马斯克(Elon Musk)以及前谷歌DeepMind首席执行官德米斯·哈萨比斯(Demis Hassabis)在内的其他科技领袖都表示赞同。