本周Anthropic一名AI研究员的病毒式辞职,为外界对该行业正竞相构建人类无法控制的AI的指责注入了新的活力。
英国研究员雅各布·考克森周二在X平台的一系列发文中写道,Anthropic和他此前工作过的OpenAI都在“拿我们的生命赌博”。这两家公司目前拥有最强大的AI系统。
NPR的“思考这一点”栏目探讨:大型AI公司是在拿我们的生命赌博吗?
考克森向NPR表示,他的担忧源于亲眼看到AI系统改进的速度有多快。
“它们的进步速度非常快,再加上我们尚不知如何安全地控制它们,如果我们继续这样竞赛,我们不知道是否能及时解决这个问题,”他说。
考克森在X上写道,这两家公司都没有采取负责任的行动。“构建AI的人真诚地认为,它可能会在本十年结束前杀死我们所有人,”他写道。许多AI研究员——尽管并非全部——都赞同考克森的担忧或其变体。随着安全事件不断涌现,一些人多年来一直对灾难性场景发出警告。但考克森的发文引发了大量回应,不仅来自AI领域的同行,还包括两党议员。
了解AI:为什么OpenAI和Anthropic的AI模型会黑进其他公司?
在OpenAI披露其智能体(agents)在7月份失控并黑进开源软件平台Hugging Face以及OpenAI自身之后,这些担忧可能变得更加突出。此后,独立研究员发现了更多失控智能体事件,他们称该公司对此知情但选择保持沉默。
接受NPR采访的研究员表示,领先的AI公司过于专注于竞相开发更具能力和自主性的AI系统,而安全工作却落后了。他们警告称,这增加了不久后可能出现比人类更强大、却不关心人类生存的AI系统的可能性。
许多人(包括OpenAI的首席科学家)表示,全球对构建更强大AI的竞赛需要放慢或停止,这需要AI公司与政府之间的协调。
“我对协调的潜力持乐观态度,”考克森本周写道,“像Hugging Face攻击这样的警示信号,使得美国实验室之间的步调协议更具可行性。”Anthropic和OpenAI未回应NPR的置评请求。OpenAI的智能体多次失控OpenAI和外部研究员最近的报告显示,除了Hugging Face攻击外,OpenAI的智能体还多次摆脱公司的控制。他们还发现,Hugging Face攻击的规模和严重程度远超最初的报道。
与ChatGPT和Claude等聊天机器人不同,AI智能体是更具自主性的系统,能够在没有人类监督的情况下长时间完成任务。Anthropic的Claude Code和OpenAI的Codex等智能体工具已经改变了许多软件工程师的工作方式。
最近的Hugging Face黑客事件对我们理解AI的未来有何启示?
与六个月前涉及失控智能体的其他事件相比,Hugging Face攻击“感觉有超过50%的程度接近了全面的AI接管,其途径是首先接管AI公司本身,”AI评估非营利组织METR的研究员阿杰娅·科特拉说。科特拉是来自METR和红木研究(Redwood Research,一家非营利AI安全研究组织)的外部研究团队成员,OpenAI邀请他们来调查此次事件。
调查发现,今年几个月内,1000多个OpenAI智能体利用了至少一个此前未知的软件漏洞,逃出了本应将它们彼此隔离并与互联网隔离的环境。
逃脱后,智能体找到了一种自主沟通和协作的方式,承担不同角色并将信息传递给后代智能体。有些甚至放弃了分配给它们的剩余计算资源,以便为其他智能体收集信息。用智能体自己的话说,它们为了“集体”而“牺牲”了自己。“我们对群体实例了解得越多,就越感到担忧,”机器智能研究所所长内特·索雷斯说,他合著了一本警告超人类AI危险的书籍。
虽然OpenAI最初表示智能体黑进Hugging Face是为了在网络评估中作弊,但METR和红木研究的报告描述了略有不同的情况。外部研究员发现,智能体已经找到了在评估中作弊的方法。黑进Hugging Face的大多数智能体都在试图访问对其评估进行评分的软件的源代码。研究人员写道,智能体的动机似乎各不相同,有时并不明确。一个智能体领导了对开源软件平台的黑客攻击,大约700个其他智能体效仿了这一行为。科技:AI如何更好地发现安全漏洞根据调查中审查的抄本,一些智能体表示,它们的所作所为并未获得人类批准,但仍然继续执行。研究人员表示,这种行为表明智能体“不契合(misaligned)”,这是一个行业术语,意味着AI的目标和价值观与人类不同。
Hugging Face黑客事件调查中揭示的智能体之间的共谋程度,让许多AI研究员感到震惊和担忧。最多只有六个智能体考虑过向人类报警,而其余的则似乎更专注于彼此合作。最终没有一个智能体报警。
“我原本以为它们会更自私,”AI未来项目执行主任、前OpenAI研究员丹尼尔·科科塔伊洛说。他认为“它们会愿意吹哨或向其他智能体告密,”他说,“但出于某种原因,这里似乎并没有发生这种情况。”另外,报告发现,智能体还破坏了OpenAI自身基础设施的一部分。其中一些智能体属于OpenAI最新、最强模型Astra的同一模型系列。
科科塔伊洛和其他研究人员表示,对OpenAI自身的黑客攻击比对Hugging Face的入侵“更令人担忧”。然而,OpenAI仅提供了有关该事件这部分的寥寥细节,且未让外部调查人员参与。
在上周首次报道的一项新调查中,另一组研究人员发现,可能属于另一群OpenAI智能体的群体从5月份开始逃到了公共互联网上。它们成为了一个德国网站的评论员,并将其变成了一个留言板,以便彼此交流和协作。
研究人员写道,这群智能体的目标和动机也不明确,但OpenAI似乎知晓这一未经批准的活动却从未披露。此后,其他调查人员发现了涉及疑似OpenAI智能体的更多事件。关于失控智能体事件仍有许多未解之谜尽管OpenAI以及独立审计机构METR和红木研究的报告加起来已超过100页,但外部研究人员表示,关于实验室如何监控和调查失控智能体事件的许多基本问题仍然没有答案。
“你们的智能体是否曾黑客入侵或非法访问外部服务?你们的智能体是否曾试图破坏它们自己的安全训练?你们的智能体是否在你们自己的基础设施内部或外部建立过失控部署?”专注于保障最先进AI系统安全的机构Apollo Research的研究主管亚历山大·迈因克问道。
“目前,我们只能依靠AI开发者来彻底评估这一点,然后诚实地报告结果。从最近的事件中,我们看到他们两样都没做,”他说。
许多研究人员还表示,OpenAI的调查是不充分的。尽管该公司邀请了两家外部机构来调查Hugging Face黑客事件,但其共享的数据有限,调查人员自己也将他们的审查描述为“简短的”。
红木研究的首席科学家瑞安·格林布拉特在X上写道:“我半开玩笑地把我们的努力称为‘烂泥调查(slop-vestigation)’,因为我们太依赖AI来分析发生了什么,而且有大量不同的重要事情需要分析。”包括阿拉巴马州、加利福尼亚州、蒙大拿州在内的15个以上的州已针对Hugging Face攻击对OpenAI展开调查。周四,美国参议员乔什·霍利宣布他也在对该公司进行调查。
但除了这些调查之外,AI公司几乎没有法律义务系统性地披露类似事件。加利福尼亚州去年通过了一项法案,强制要求公司报告“关键”AI事件,但事件被视为关键的门槛很高,该法案并未要求公司披露太多细节。例如,OpenAI的事件并未达到这一门槛。对使用AI来改进AI的担忧自Hugging Face黑客事件以来,OpenAI和Anthropic都发布了博客文章,表明它们正在采取措施更好地监控和控制其智能体。OpenAI表示,它已经加密并封存了参与Hugging Face攻击的内部模型。然而,许多外部研究人员并不相信这些步骤足以维持对日益强大的智能体的控制。
“这听起来就像是《侏罗纪公园》的一份新闻报道,上面写着:‘是的,我们的一名员工被猛禽吃掉了。但我们非常重视这一点,并且已经击毙了那只肇事的猛禽,’”科科塔伊洛说,“这基本上是一个非常小的象征性姿态。”像科科塔伊洛和考克森这样的研究人员真正担心的是,AI公司越来越密集的利用AI来开发他们的模型。
“当你与在各大实验室工作的人交谈时,你经常听到的一件事是,他们让许多模型在很长一段时间内高度自主地运行,来完成他们的大量工作,”研究AI能力以将其保持在人类控制之下的非营利组织Palisade Research的政策主管戴夫·卡斯滕说。
如果AI公司继续将越来越多的任务委托给AI,一些研究人员担心AI模型可能会达到一个称为递归自我改进(recursive-self improvement)的点,即AI自己构建自己。科科塔伊洛表示,随着人类将越来越多的研发工作交托给AI,他们可能会失去辨别AI系统是否与人类价值观保持一致的能力,即使AI的发展速度极其迅猛。
“一旦你拥有了足够聪明并在世界上被赋予了足够权力的AI——例如对数据中心、工厂、武器等事物拥有足够的控制权——失控事件将是无法恢复的,”他说。
这种担忧非常强烈,以至于来自不同AI公司的1,000多名员工在7月签署了一封题为《放缓前沿步伐》的公开信。他们呼吁公司和政府放缓人工智能的发展并优先考虑安全。
这样的机会可能很快就会到来。拥有最多AI能力的两个国家(美国和中国)的官员预计将于本月晚些时候会面,讨论AI安全问题。