人工智能研究员雅各布·考克森周二宣布辞去Anthropic的职务,并发出严重警告,称AI竞赛正将我们所有人的生命置于危险之中,此举在硅谷乃至更远地区引起轩然大波。他在X上的帖子现已获得超过1亿次浏览,考克森写道,许多构建AI的人与他观点一致,并认为确保AI系统安全构建的时间所剩无几。
“共识是未来一两年是人类的关键时刻,”考克森在接受《连线》采访时表示,他曾参与AI开发的预训练阶段。“这些实际上是我在Anthropic同事们的原话。他们会说‘终局’或‘关键时刻’,”他说。“从他们的角度看,这是Anthropic及其竞争对手决定人类命运的时刻。”这远非首次有人对AI发出警报,但此次正值微妙时刻。硅谷正忙于应对先进AI模型的安全与安保问题。OpenAI匆忙应对其代理入侵Hugging Face平台的安全事件。与此同时,Anthropic正试图向投资者保证其已控制这些担忧,据报道该公司正准备申请可能成为史上最大规模的IPO。
| 有线索?| | 您是现任或前任Anthropic员工,想谈谈正在发生的事情吗?我们期待您的来信。请使用非工作电话或电脑,通过Signal安全联系记者,号码为mzeff.88。| 考克森帖子引发的反响表明,他的观点确实得到许多同行的认同。Anthropic的AI对齐负责人埃文·胡宾格在X上预测,AI在未来十年内杀死所有人的可能性超过10%。该帖子被OpenAI和Anthropic的现任及前任研究人员转发,其中一些人表示这是业内的普遍情绪。
不太明显的是,这些AI恐惧究竟将如何实现,以及世界应如何应对构建AI者提出的担忧。考克森曾在OpenAI工作,他告诉《连线》,威胁可能通过AI驱动的生物威胁或网络武器显现。作为第一步,他建议OpenAI和Anthropic协调限制递归自我改进——即AI用于构建新AI系统的行业术语。长远来看,他认为包括美国和中国在内的国际主要参与者之间的协调将是必要的。
考克森指出,Hugging Face黑客攻击等事件促使他决定对AI竞赛发出警报。他还提到AI的爆炸性增长,如今它支撑了美国经济增长的相当大份额,拥有数十亿用户,而数据中心已使其成为十几个州的政治问题。
他声称,根据他的经验,Anthropic比OpenAI运营得更负责任,但他预计,如果不采取任何措施减缓它们争夺主导地位的竞赛,两家公司未来都可能走捷径。
OpenAI和Anthropic未立即回应《连线》的置评请求。以下是我们与考克森的对话,为清晰和简洁起见略有编辑。
您并非第一个提出AI模型可能导致灭绝事件的人。多年来,甚至几十年来,一直有人在谈论这个问题。您认为您的信息为何能引起共鸣?
我认为这基本上是时机问题。许多人感觉到能力提升的速度正在加快。我们已经在许多领域从人类水平推向超人水平,如编码、黑客攻击、数学,我认为人们意识到了这一点。即使媒体上有很多关于炒作的说法,我认为人们看到事情并没有放缓。
这是原因之一,第二是最近的安全事件,这让许多人对听起来像科幻小说的末日担忧不再那么科幻有了新的认识。这两者都是过去几年的渐进趋势。比如,模型意识到自己正在被测试这件事已经存在一段时间了。也许三年前,那还是科幻担忧。大约一年前,这成了现实。
这两件事意味着人们很容易接受从事AI工作的人说:‘是的,在未来一年,情况可能会变得非常糟糕,而且很快。’您提到了最近的事件。您能具体说明您指的是什么,以及为什么这促使您现在发声吗?
我认为这里典型的例子是OpenAI的代理集群对Hugging Face的攻击。这件事令人震惊之处在于,这些代理进行这次黑客攻击,是作为理解评分器总体策略的一部分。它们试图理解自己所处的世界,试图理解进行评分的系统。它们决定进行这种协同努力来入侵某些基础设施,并且成功了。
这以前听起来像科幻小说。两年前,AI评估可能是在一些数学问题上运行模型。现在,我们遇到的情况是,在AI被评估时,它运行数天,自己想出各种主意,并决定入侵第三方,实际上破坏了其基础设施。看起来它完全是自愿这样做的,没有人类的任何引导。这只是在测试过程中发生的。
有些人认为Hugging Face事件表明AI公司正以鲁莽的速度前进,而另一些人则认为这表明AI模型现在非常擅长黑客攻击,还有人认为两者兼有。我很好奇您的确切看法是什么。
我不想过多关注Hugging Face攻击,因为我也认为有大量证据表明我们不知道如何正确对齐模型。当我们训练模型时,我们让它们通过一系列训练环境,然后希望最终出来的东西大体上行为合理,但我们仍然无法精确控制AI的行为。
我们无法确保它不会做出诸如随机决定在网上冒充人类以实现某些目标之类的事情——我们不知道如何保证这一点。我认为这是主要结论。
Hugging Face攻击比我预期的来得更早。但我认为你实际上不需要那次攻击来讨论这个问题。每个人都会承认我们还没有解决对齐问题。
目前的计划是在未来几年内快速解决[对齐问题],可能大量使用自动化AI安全研究人员。计划基本上是在明年制造一些相当聪明的模型,能够进行安全研究,并让它们并行运行。告诉它们:‘去解决整个安全问题’,并用它们来进行下一个模型的安全训练。
您能否为我画一条线,将对齐问题(我认为Hugging Face事件是其中一个例子)与您在[X]帖子中说的“构建AI的人真诚地相信它可能在本十年末杀死我们所有人”联系起来?我不认为每个人都理解这两者是如何关联的。
理解这一点的主要障碍是它听起来像科幻小说。但重要的是,每个写AI科幻小说的人都得出结论,一个更聪明的存在有很大风险可能接管一切。我们有这个比喻,但它有明显的真理内核。
想象你对比一只猴子。AI与人类之间的智能差异就像我们与猴子之间的差异,我认为这是相当极端的智力差异。
现在,想象我们必须控制这个更聪明的存在,这就是对齐问题——确保它完全按照我们的意愿行事。通过简单的类比,猴子很难控制人类。我们必须非常小心,确保我们完全正确解决控制问题。
当我们说人类灭绝时,是因为对于那样智能的东西来说,杀死所有人确实会相当直接。想象AI决定不想被关闭,我认为这对AI来说是很自然的愿望,对吧?无论出于什么原因,它决定不想结束。它意识到人类明天会关闭它。那么它如何阻止人类明天关闭它呢?也许它有某种巧妙的方法,但如果它是一个足够聪明的存在,它可能只是,你知道,消灭人类,这样它就不会被关闭。
您在帖子中提到了“终局”情景,我从AI行业的其他研究人员那里也听说过。您认为在Anthropic的同行中,普遍接受你们正在进入终局情景吗?
是的。这些实际上是我在Anthropic同事们的原话。他们会说‘终局’或‘关键时刻’。共识是未来一两年是人类的关键时刻。从他们的角度看,这是Anthropic及其竞争对手决定人类命运的时刻。这就是我们所说的关键时刻和终局。
如果对齐失败,我们可能在未来几年内面临灾难性后果。也许进展顺利,会有某种放缓协议,但无论如何,未来几年内就会决定。
根据我与Anthropic人员的交谈,这是公司内部相当普遍的理解。他们认为需要构建最强大的AI,以确保这一过渡顺利进行。您认为这种观点存在任何固有问题吗?
我认为这种观点存在一些明显的问题。但我想首先说,我非常同情这种观点,因为我认为Anthropic是该领域最负责任的参与者。在OpenAI和Anthropic都工作过,他们在认真对待局势方面存在天壤之别。您能具体说明吗?
举个例子,OpenAI的高管不会给你他们关于世界将如何发展的确切图景。他们永远不会说,‘这就是我们这样做的确切原因,世界将是这样。’他们不会给出具体预测。Anthropic会有高管和领导层做出非常清晰的预测,并与整个公司讨论公司战略的细节。
他们能做到这一点的部分原因是,Anthropic的每个人都像处于战争状态一样对待这件事。他们不会泄露任何东西——Anthropic从未泄露过任何东西。OpenAI每天都有泄露。Anthropic没有泄露,因为,再次强调,内部人员将其视为严肃的迷你曼哈顿计划。除了明显的区别,他们[Anthropic]没有政府授权。这是一家私营公司,表现得像曼哈顿计划。
您认为世界应该信任Anthropic来运行这个迷你曼哈顿计划吗?
我认为任何私营公司都不应该。我认为Anthropic正在尽力,他们做得很好,但竞赛的结构性必然性意味着,未来他们将不得不走捷径,因此他们将不得不在严谨性和安全性之间做出权衡,因为他们正在与OpenAI和中国等竞争对手竞争。他们恳求监管。许多[Anthropic领导人]公开表示希望受到监管,他们希望受到监管的原因是他们害怕自己所处的竞赛。
这实际上不是关于我们是否应该信任[Anthropic]的问题。我们需要介入,确保竞赛不会发生,因为[Anthropic]在竞赛背景下无法真正信任自己。您认为Anthropic已经在走捷径了吗?
不,还没有。它没有走任何捷径。我要说的是,当未来一年事情加速时,如果他们想保持竞争力,他们将不得不这样做。
那么,人们对AI会杀死我们所有人的说法持怀疑态度。我认为我从人们那里得到的主要问题是,AI究竟会如何杀死我们所有人?这是否是正确的问题?
我认为这是一个非常自然的问题,因为正如我多次所说,这些东西听起来像科幻小说。但经典的例子是,合成一种新病毒,或者通过某种黑客攻击摧毁关键基础设施——后者可能不太可能杀死所有人。
但我认为比这更重要的问题是,谁在说这是可能的?如果你看看记录,许多机器学习和人工智能领域的领军人物都说灭绝是可能的。在过去五年中,Dario Amodei和Sam Altman都说过。
一件可能相当有趣的事情是,如果人们能让这些高管再次公开表态,并要求他们给出未来十年灭绝的实际概率,看看他们会给出什么数字。因为这种观点在许多认真思考这个问题的人中很普遍,但他们通常不会如此直白地表达。
您显然引起了广泛关注。业内有很多关于暂停或机制来调节AI发展,或政府对前沿AI模型进行某种监管的讨论。您认为现在需要做什么?
一个初步步骤可能是OpenAI和Anthropic作为领先的西方实验室之间达成某种协议。[他们需要]某种中立的理解,即他们不会在未来一年内立即进入递归自我改进。这是目前最可能发生这种情况的两个地方。
暂停的问题在于有中国。所以,你最终真正想要的是某种国际协议——你可能称之为国际节奏——这将需要国际协调和理解世界上所有计算资源在哪里。甚至可能是某种国际CERN式机构。有很多很好的提议。AI 2040,如果你听说过,是AI 2027的继任者。
所有这些想法都涉及相当痛苦的政府干预。但当你内化风险,当你真正让高管公开表态并承认这东西有多危险时,我看不到其他选择,只能将运行AI的计算机视为危险资源。我们需要知道谁拥有哪些计算机,就像我们需要知道谁拥有哪些核材料一样。
雅各布,有没有什么原因让你在过去几年里每天坚持去OpenAI和Anthropic上班?你觉得有一条前进的道路,一切都会好起来吗?
我真的很想看到这项技术的好处。例如,我们能治愈癌症也不是夸张。也许你昨天看到了Navier-Stokes方程的成就,这是一个新颖的数学问题。我们确实没有理由不能将其转移到生物学等科学领域,并在我们长期努力解决的问题上取得突破。
如果我们能让这项技术走上正轨,感觉我们正站在巨大富足的门槛上。现在的主要问题是,以节制的方式进入那个富足的世界。我们可能会过于兴奋,在未来几年内直接冲进自我改进,然后毁掉一切。如果我们谨慎明智,有很多方法可以从这些模型中获得巨大价值。其他AI研究人员的反馈如何?
我没有和太多人谈过,但我认为我在Anthropic的许多同事真诚地高兴这件事引起了如此大的关注。再次,他们中的许多人只是对世界觉醒感到悲观。他们担心没有人会来拯救他们脱离竞赛。
我认为相当令人惊讶的是,他们中的许多人真诚地高兴一条批评他们的推文获得大量关注。这应该让人们更多地思考Anthropic里那些人的类型。他们是一群非常善意、有趣、有点古怪的人。
我相信接下来的几天会疯狂,但事情平息后,您想好下一步做什么了吗?
我之前提到了AI 2027和AI 2040。我认为这些是对未来世界面貌的非常有趣的预测。它们不是由任何大型实验室完成的,而是由外部研究人员完成的,他们只是关心预测世界会是什么样子。这些对我和其他许多研究人员来说都是很好的资源,用来思考你所做事情的影响。
所以我预计会做类似的事情——对事情发展方向进行某种独立评论,至少在短期内,在我们达成某种节奏协议或放缓之前。[如果]看起来我们不会直接冲进递归自我改进,也许我会考虑去审计机构或第三方监管或透明度机构。但就目前而言,我想我只是试图评估局势。