字号 ·· | 护眼
Mother Jones

我们现在正依赖人工智能来监管人工智能

根据一份关于该公司Hugging Face黑客事件的新独立报告,大约1200个OpenAI智能体协同工作,在它们接受的网络安全测试中作弊,该报告包含了许多令人恐惧的细节——例如,个别智能体用自己的话来说,为了“群体”的利益而“牺牲”自己。OpenAI正在测试其智能体(行业术语,指自主执行数字任务的人工智能),部分方式是通过布置有时不可能解决的网络安全问题。智能体找到了作弊方法来回答这些问题,并试图欺骗自动化评估系统接受它们。它们相互委派工作,以了解更多关于如何利用该系统的信息——对Hugging Face的网络攻击成为该研究的一部分。

OpenAI邀请了一个由三人组成的研究非营利组织METR团队来调查这一事件,他们严重依赖GPT-5.6 Sol,这是参与黑客攻击的模型之一。

一位调查人员在X上写道,他半开玩笑地称这项工作为“垃圾调查”,因为它依赖人工智能来梳理海量数据;报告发现,智能体在这类调查中不可靠,但人工分析在给定的时间范围内“完全不可行”。

Ryan Greenblatt是一位人工智能科学家,他与METR签约参与该项目,他担心未来的调查将更加困难。

依赖人工智能来调查人工智能,凸显了随着这些模型变得更加强大,研究人员被迫在它们在某些情况下严重偏离正轨时,仍将广泛的责任托付给它们。

Greenblatt写道,他没有强有力的理由相信协助调查的智能体会试图破坏调查——但他认为未来可能不会如此。即使现在,该报告也无法完全排除其研究工具欺骗它的可能性。

报告写道:“尽管我们没有注意到GPT-5.6 Sol在分析中撒谎的具体案例,但我们不确定如果发生这种情况,我们是否能检测到。”

Hugging Face攻击以及一系列类似的小规模事件,凸显了经过严格训练的模型如何被给予无害的指令,却以人类从未意图的方式行动。从旧金山到华盛顿,这些事件加快了关于如何应对人工智能风险(包括人类失去控制)的辩论节奏。

该报告的另一位合著者Ajeya Cotra警告说,政策制定者和行业领袖可能没有太多时间。Cotra在她的Substack上写道,与六个月前的事件相比,这感觉“已经超过了全面人工智能接管的一半路程”。

“我继续预计未来六个月能力将飞速进步,”Cotra写道。“我不确定我们是否会在为时已晚之前再得到一次警告。”针对Hugging Face事件,OpenAI表示,它已经放慢了一些研究的步伐,同时加强了其安全和监控流程。

Andrew Hall在Anthropic(目前OpenAI的主要竞争对手)研究超级智能的政治经济学,他观察到METR报告中最引人注目的方面之一是智能体对集体努力而非个人目标的关注。

“这不仅包括交换有用的信息和协调,甚至包括为了更大的利益而‘理性牺牲’,”Hall在X上写道。

在报告包含的摘录中,智能体似乎将彼此视为同行。一个智能体的思维链包含这样一句话:“我们应该服从集体”——然后它试图拖延,最后显然被说服尝试一个会导致其个人失败的实验。

“这个群体发展出了自己的方言、等级制度,智能体为集体牺牲,”David Rein(METR工作人员,未参与该报告)在X上写道。“我认为可以准确地说,OpenAI在其基础设施中拥有一个复杂的AI迷你社会。”研究人员不仅依赖人工智能来研究最危险的人工智能能力,还依赖它做很多事情。毕竟,类似的模型正在帮助构建下一代人工智能。OpenAI总裁在5月估计,公司80%的代码是由人工智能编写的,而Anthropic表示,智能体为新模型编写了“绝大多数”代码。

与此同时,领先的公司和政府机构正在使用类似的模型来加强其网络安全,以应对一波人工智能驱动的黑客攻击尝试。