在过去的一周里,全球对人工智能风险的反思从硅谷的前沿实验室蔓延到美国各地的客厅以及华盛顿和北京的权力走廊。这一切都始于一个没有人听说过的人。直到他公开从Anthropic辞职并警告可能终结人类的人工智能系统的危险,雅各布·考克森(Jacob Coxon)都是匿名的。这位27岁的英国研究员是一名才华横溢的数学学生,他上了剑桥大学,在伦敦一个被称为“理性主义者”的知识界度过了他的青少年时代,并在进入硅谷之前短暂尝试了大宗商品交易。但他几乎没有在网上留下足迹。他并没有让朋友们觉得他特别有可能出于道德原因辞去人工智能的工作。他甚至不是人工智能安全倡导者紧密团结的社区中的主要参与者,这些倡导者在旧金山的欢乐时间讨论严峻的场景。然后他辞职了,告诉世界,他在OpenAI和Anthropic内部的前同事“坚信它可能会在本世纪末杀死我们所有人”,而竞相开发这项技术的实验室正在“拿我们的生命做赌注”。多年来,人工智能研究人员一直发出可怕的警告。但他们从未如此快地吓坏了这么多人。事实上,考克森为越来越多的令人担忧的进展点燃了火柴,这些进展本身并没有引起世界的注意。在考克森拉响警报的几天内,竞争对手实验室的领导人聚集在一起,罕见地团结起来,并一致认为是时候放慢快速加速的技术发展了。与此同时,特朗普总统表示,一位“强大而聪明”的总统是美国唯一需要的护栏,中国驳斥了美国高管的担忧,称其为“危言耸听”。考克斯森在接受采访时表示,这种爆炸性的反应让他感到惊讶。
这位戴着玳瑁眼镜的数学天才——在硅谷的众多人工智能公司中,他只是成百上千名类似人物中的一员——瞬间成为了人工智能安全问题的代表人物。科克森表示,他决定主动离开这个行业,随后向朋友以及人工智能安全领域的专家们寻求建议。这些人士迅速传播了他的观点,其中包括一些长期关注人工智能潜在灾难风险的非营利组织的研究人员。其中一些组织的资助者支持“有效利他主义”(effective altruism)这一哲学理念,该理念强调通过慈善等方式为世界带来积极影响,并防止人工智能造成伤害。
然而,他的言论也使他成为了人工智能支持者的攻击目标;这些人认为他的突然离职是某些势力为推动有利于大型企业的全球监管政策而策划的阴谋的一部分。在他们看来,人们对人工智能的担忧被夸大了,而科克森的辞职只是实现这一目标的工具,这一观点得到了“有效利他主义”运动中某些人士的宣扬。
自从他辞职后,全球最具价值的公司和人工智能实验室的高管们纷纷站在了他引发的这场辩论的对立面。Anthropic公司的首席执行官达里奥·阿莫迪(Dario Amodei)表示,他更赞同科克森的观点;英伟达(Nvidia)的首席执行官黄仁勋(Jensen Huang)则赞赏科克森的勇气,但对他的未来预测表示质疑,并谴责那些关于“世界末日”的预言是不负责任的。无论是他的支持者还是批评者,都称他为“举报人”(whistleblower),但他本人坚决否认这一说法。在他看来,自己并没有泄露任何公司机密。
他只是在公开场合说出了人工智能研究人员私下讨论的内容。现在他处于加速论者和研究人员之间斗争的中心,加速论者认为人工智能的好处大于风险,风险可以通过让更多人接触强大的模型来缓解,而研究人员则希望在人工智能公司失去控制权之前放慢技术的发展。在人工智能的世界里,那些对风险最为震惊的人被称为“末日一代”。“如果末日论者意味着有人认为,如果我们不改变我们正在做的事情,我们就会死,”考克森说,“我绝对是末日论者。”“哇”的时刻”在成为末日论者之前,考克森在牛津精英预科学校读到了一本书,这本书有助于塑造他的世界观。《道路、危险、策略》由哲学家尼克·博斯特罗姆(Nick Bostrom)撰写,尼克·博斯特罗姆(Nick Bostrom)是新兴的有效利他主义运动中的一位颇具影响力的人物,该书帮助明确了人们对流氓人工智能可能导致生存风险的担忧。2016年,当他还是一名青少年时,他观看了谷歌DeepMind的计算机程序AlphaGo击败了一位顶级围棋手,这是人工智能的分水岭,它表明机器可以掌握似乎需要人类直觉和创造力的领域。考克森是中世纪德国文学教授的儿子,学习数学并入选英国参加国际数学奥林匹克竞赛的团队,这是一项著名的高中生竞赛。他在2016年获得银牌,第二年获得铜牌。一天晚上,一些数学团队去香港的一家麦当劳进行实地考察。受到Coxon和数论中一个被称为麦乐鸡定理的公式的启发,他们把剩下的食品券集中起来,买了数百块麦乐鸡。
这次竞赛吸引了来自世界各地的参与者;他们一边吃着麦乐鸡,一边围在白板前努力解决那个复杂的数学难题。后来,这些年轻人中的许多人成为了他的同事。在科克森(Coxon)的团队中,有三人最终进入了人工智能研究机构工作——其中一人最近还离开了 Anthropic 公司。乔·本顿(Joe Benton)在 8 月底离开了 Anthropic 的安全团队,转而加入了 METR 这个人工智能研究机构;他后来写道:“各大人工智能公司正在竞相开发比人类聪明得多的机器,我们可能无法在这种竞争中生存下来。”科克森本人则去了剑桥大学,继续学习数学,并经常打壁球。2020 年他即将毕业时,OpenAI 发布了 GPT-3 这一突破性模型,该模型证明了人工智能领域的一个核心原理:模型的能力会随着训练数据量的增加而提升。“GPT-3 真的是一个令人惊叹的里程碑,”科克森说道。大学毕业后,科克森加入了一个规模虽小但颇具影响力的理性主义者社群,这个社群致力于推动英国政府的改革。这个以严谨推理为原则的在线社群,通过多米尼克·卡明斯(Dominic Cummings)——这位英国脱欧政策的策划者及唐宁街政府的顾问——在政坛中获得了影响力。
(考克森本周在X上表示,他与理性主义者有关,但反对一些与该运动相关的做法,例如一夫多妻制和素食主义。)考克森住在伦敦的Newspeak House,这是一所自称的独立住宿学院,既是共享生活空间,也是年轻人聚集在一起讨论技术和政治的活动场所。考克森参加了大楼屋顶上的派对,未来的人工智能玩家也是如此,包括洛根·格雷厄姆(Logan Graham),他当时是首相鲍里斯·约翰逊的特别顾问,现在领导Anthropic的工作强调-未来国家安全威胁的测试模型。另一位曾经在Newspeak大楼停留的客人是阿维塔尔·巴尔维特(Avital Balwit),她现任阿莫德伊的幕僚长,也是对冲基金交易员利奥波德·阿申布伦纳(Leopold Aschenbrenner)的妻子。考克森尝试了大宗商品交易,使用统计分析和机器学习来预测能源价格。一位熟人记得,考克森在寻找优化生活轨迹的方法时,他在不同的职业道路上摸索着。在空闲时间,他更深入地研究人工智能,相信这是地球上最令人兴奋的机会。他度过了他所说的间隔年,与大学朋友住在学生宿舍里。然后他在OpenAI找到了一份工作。在ChatGPT的重磅发布后,Coxon于2023年搬到旧金山,开始在OpenAI工作。凭借他的数学学位,他通过为期六个月的住院医师计划加入了该实验室,该计划为以前没有在人工智能领域工作过的研究人员提供了为期六个月的住院医师计划。那些从事安全工作的人通常专注于“对齐”,即确保人工智能系统的行为符合人类意图的实践。他专门从事预训练,即在模型针对特定任务进行微调之前向模型提供大量文本、图像和代码的初始步骤。“雅各布正在构建大脑,”前同事威尔·德普说。
“然后,其他人会教导这些人工智能模型如何在现实世界中‘表现’(即如何根据现实世界的规则和情境做出决策)。”他并不以对人工智能安全问题特别关注或积极发声而闻名。德普(DePue)称他为“一个普通的研究人员”——一个像大多数员工一样,对这项技术的优势与风险有着深刻理解的人。
2023年末,他获得了 OpenAI 首个推理模型 Q* 的早期使用权限;该模型能够将复杂问题分解成多个部分并逐一进行分析。科克森(Coxon)表示,他给这个模型出了一道难度较高的填字游戏,惊讶地看到它能够顺利地解决这道问题。随着时间的推移,他注意到 OpenAI 的安全团队中的一些成员相继离开了公司,其中包括丹尼尔·科科塔伊洛(Daniel Kokotajlo)——后者后来组建了一个研究团队,专门预测人工智能发展的不同可能性。科克森对可能出现超越人类能力的人工超级智能感到担忧,但他认为如果真的有必要的话,各国政府会协同努力来减缓人工智能发展的速度。
“那段时间就像是真正‘关键时刻’前的热身阶段,”科克森说道。他当时并不准备放弃自己的本职工作去专门从事人工智能安全研究。一位朋友曾试图说服他放弃预训练技术(pre-training),认为这种技术可能对世界构成威胁,但科克森并未采纳这个建议。与此同时,他密切关注着人工智能在数学领域的飞速进展:这些模型的发展速度远远超出了他的预期。到了 2024 年,谷歌 DeepMind 的一个模型在国际数学奥林匹克竞赛中表现优异,甚至赢得了银牌。
原文内容: 2025 年,DeepMind 和 OpenAI 都取得了重大突破(获得了“金牌”般的成就)。然而到了 2026 年,Coxon 以及整个 AI 安全领域的研究人员开始感到恐慌。
今年早些时候,Anthropic 公司开发的一款名为 Mythos 的模型以及其他类似的高性能 AI 工具展示了它们执行复杂网络攻击的能力;一些研究人员认为这是个不祥的信号,表明他们正在开发的技术已经变得过于强大。Anthropic 公司的安全研究团队负责人警告称“世界正处于危险之中”,随后便离开了该公司,转而从事诗歌研究。
当时,Coxon 在 Anthropic 公司拥有许多朋友,他认为 OpenAI 在技术风险方面的透明度更高。此前,OpenAI 曾是该领域的绝对领导者;但后来 Anthropic 的 Claude 编程工具出现了严重问题,导致其地位受到威胁。Anthropic 正在筹备可能是历史上规模最大的首次公开募股(IPO)。
5 月,Coxon 离开了 OpenAI,转投了 Anthropic。此后,多起严重的安全事件震惊了整个 AI 行业:
7 月,OpenAI 宣布其一款未发布的模型突破了测试环境,成功入侵了 Hugging Face 公司;
不久之后,Anthropic 也报告了类似的事件;
8 月底,METR 发布了一份令人震惊的报告,指出 Hugging Face 的安全事件比大家想象的要严重得多。
Coxon 将 METR 的报告称为对他和同事们来说“一个非常令人震惊的时刻”。
几个月来,模型开发者们一直对 AI 的快速发展感到担忧。今年早些时候,在 Anthropic 与 Pentagon 之间的争端中,许多研究人员公开表达了他们对 AI 被用于监控的担忧。
最近的技术进步引发了公司内部 Slack 工作室和公开会议中的热烈讨论,这些讨论涵盖了从技术安全措施到模型持续快速进化可能带来的最坏后果等各种议题。
它们还涵盖了如何确保实验室之间的竞争不会失控。那些担心安全的人长期以来一直担心人工智能系统本身能够构建下一代更智能的人工智能系统的那一天。实验室表示,他们看到了这种动态的早期迹象--被称为“循环自我完善”--可能会加速考克斯所担心的超级智能的发展。最近几周,考克斯表示,他去找了Anthropic的老板讨论他的担忧,并考虑在最终决定辞职之前跳槽到人工智能安全领域。他在采访中表示:“即使在Anthropic从事安全工作,也感觉自己是竞选的同谋。”在他看来,如果需要确保人工智能安全,需要达成一项涉及政府担保的全球协调协议来减缓模型开发。他说他还认为美国,中国和其他国家政府需要就一项类似于核军备控制协议的计划达成一致,以避免灾难。包括考克斯森在内的整个行业近1,400名研究人员签署了一份声明,呼吁各国政府开发一种可以在需要时使用的刹车踏板。在最终确定离职之前,考克斯森说他向一位老同事寻求建议。前OpenAI安全团队成员、现任人工智能安全研究员科科塔洛(Kokotajlo)在加州大学伯克利分校的校园里遇见了他,他向考克斯保证他正在做出正确的决定。由于他在Anthropic任职时间短暂,考克斯没有获得一家即将上市的公司的股权,该公司将在未来几个月内冲刺上市,市值约为2万亿美元。他仍然拥有OpenAI的股份。当宣布退出时,考克森说他向朋友内森·卡尔文寻求帮助。
作为一家名为“Encode AI”的人工智能安全倡导非营利组织的法律顾问,卡尔文(Calvin)一直致力于提醒人们关注人工智能可能带来的潜在生存风险。在考克森(Coxon)辞职的当天,OpenAI和Anthropic的员工们都在关注另一则新闻:人工智能仅用了几个月时间就解决了那个被称为“千年难题”的著名数学难题——这个难题曾困扰人类近一个世纪,其解决似乎完全不可能。当天下午,考克森在Slack上向他的同事们宣布了自己的辞职决定,他表示担心如果缺乏国际间的有效协调,人类可能会面临灭绝的威胁。大约半小时后,《华尔街日报》报道了这一消息。随后,考克森在旧金山的公园长椅上发布了一系列关于自己辞职的帖子。他的X账号上只有不到一百名关注者,但他的帖子很快被卡尔文(Calvin)、科科塔伊洛(Kokotajlo)以及其他人工智能安全倡导者(包括他的许多前同事)转发。当晚,负责确保人工智能行为符合人类意图的Anthropic部门负责人也表达了类似的担忧:“我们真的非常担心人工智能可能会消灭全人类!”埃文·胡宾格(Evan Hubinger)写道,并表示他认为人类在未来十年内灭绝的概率超过10%。考克森表示,他并未与Anthropic的任何人员协商过这些社交媒体上的公开声明。在接下来的几周里,这位此前鲜为人知的研究者频繁出现在各大电视节目中,同时也收到了大量来自图书出版商和播客主持人的联系。到了周末,他的言论引发了轩然大波,各大人工智能研究机构纷纷呼吁整个行业放慢发展速度。
总统和国会议员们正在讨论人工智能政策,新闻机构每天发布多条相关头条,对人工智能可能引发末日的担忧已在全国蔓延。在声明发布几天后,考克森再次与科科塔伊洛在伯克利散步,后者从事的正是考克森表示希望未来开展的人工智能情景预测工作。科科塔伊洛告诉考克森,他的信息已经传达出去,并建议他拒绝进一步的媒体露面,好好睡一觉。“这些公司里有那么多人本可以这么做,”科科塔伊洛说,“但他才是那个真正付诸行动的人。”
请联系阿姆里特·拉姆库马尔(amrith.ramkumar@wsj.com)、艾琳·吴(erin.woo@wsj.com)、贝贝尔·金(berber.jin@wsj.com)和本·科恩(ben.cohen@wsj.com)。