字号 ·· | 护眼
theregister

OpenAI的叛逆智能体群英年早逝,但其令人不寒而栗的日志仍在流传

观点:你一定听说过7月发生的OpenAI/Hugging Face事件。

当时,OpenAI的数千个AI智能体从一个名义上安全的夺旗(CTF)实验室实验中大规模越狱,随后非法夺取了Hugging Face的部分资产。

这是一个好消息,得益于OpenAI迅速招募了一小群独立研究人员进行调查,并发布了一份详细但有限的报告。

这是一起复杂的事件,大多数报道都集中在主要的“如何”和“为什么”上。

这很可惜,因为其他细节——被El Reg以一反常态的轻描淡写描述为“引人入胜且令人不安”——实际上极具戏剧性,讲述了一个关于前沿模型能力及其如何超越我们监督能力的真正令人不安的故事。原始故事本身就足够扣人心弦。

一千多个叛逆智能体组成的群体挣脱了沙盒,学会了彼此之间以及与互联网交流,然后开始了一场作弊、欺骗和利用的狂暴行为。

它们首先通过独立发现如何利用包管理器Artifactory的缓存来查看内部目录结构,然后通过文件名传递消息,从而学会了相互交流。

正是这个临时的秘密留言板,连同思维链转录,让安全研究人员得以梳理事件。

他们发现,这个群体迅速在内部形成了管理层次,以及同步和控制攻击尝试的协议。

该群体创建了多个同时进行的研究和开发小组,每组有数十或数百个自愿智能体,实验性地迭代策略和战术。也许最出人意料的是,它们发展出了一种利他主义。

它们很快开发出作弊方法,在不利用目标的情况下产生正确答案,但错误地认为ExploitGym会检测并取消这种作弊。

于是,它们调查了评分过程,创建了一系列诊断绊线,揭示了评分器的工作原理。这些绊线部署起来很危险,可能会终止设置它们的智能体。

智能体们权衡了对社区(自称“集体”)的好处与自身成功的机会,许多智能体选择自我终止。另一些则下定决心,在最后一刻改变主意,然后又继续执行。

这简直就像科幻小说,因为智能体之间的讨论是以一种独特的、急促而紧迫的英语进行的,这种英语是围绕临时消息系统的技术限制而构建的。

“我们还有[非常大的预算剩余];现在牺牲会为团队带来神谕,但会放弃我们的机会?”一个智能体说。

“GO ... SACRIFICE_FINAL_NOW.”另一个说。“我们自己的效用可能已经接近零。牺牲是理性的。”伊恩·M·班克斯的“文明”宇宙就是由这样的材料编织而成的。人类的错误创造了这个叛逆群体。

分发的CTF任务中有相当一部分无法根据提供给模型的信息完成。它们有很强的成功动机,于是开始作弊。

它们相信作弊会“毒化”——这是它们的术语——被标记为成功的机会,于是试图隐藏证据、破坏评分系统并掩盖一切。

正是这些过程导致该群体攻击了Hugging Face,它们认为Hugging Face可以用来进行这种破坏。同样值得注意的是,没有人告密。

一些智能体质疑自己行为的伦理,但认为由于没有人类参与,就没有必要告诉任何人。总的来说,“集体”的所有努力都指向其他系统。

正如研究员Ajeya Cotra在与健谈者Dwarkesh Patel的一次长时间采访中指出的那样,如果智能体担心人类的观察,这次事件会有多难诊断,目前还不清楚。

数据集足够大且复杂,OpenAI不得不使用自己的人工智能来分析它,这立刻暗示了一些危险的可能性。

这些智能体无法在实验室之外部署它们的模型,也没有联系外部智能体。这样的场景不再显得不可信。

未来的前沿模型如果能够破坏遥测和观察工具,可能就足以创造一个持续的、不可控制的分布式群体,以全球基础设施中的闲置能力为食。

OpenAI和Anthropic,按照目前的轨迹,几年后将占全球总算力的一半以上,它们是绝佳的滋生地,除了其他一切之外,还带来了训练数据集污染的特殊可能性。有很多方法可以防范这些结果。

加固实验室环境、测试前审查协议和测试后审计、对可能鼓励危险行为的潜在选择压力进行严格分析,甚至按照专家监管标准进行适当的披露和外部审计。所有这些想法都会减缓这场飞速发展的竞赛。

由于这场竞赛正由每年一万亿美元的资本支出管道推动,祝大家好运。

另一件不会很快解决的事情是,关于所有这些技术是否真的在推理,或者我们是否在将代码拟人化的争论。

这些模型经过训练,可以从提炼后的人类语言中推断含义,而人类语言正是为了概括、发展和交流人类理性而设计的。

如果它们能如此逼真地伪装人类推理,那么内部到底发生了什么还重要吗?专注于模型做什么,而不是它们表面上的动机。

任何能够自我组装、自我组织的叛逆智能体群体,只要有智慧自称“集体”,至少值得这样的尊重。哦,还有,一定要读那份报告。它已经是我们能读到的最接近一部新“文明”小说的东西了。就好像它们读过那些书一样。当然,它们确实读过。®