雅各布·考克森在旧金山阿拉莫广场的一张公园长椅上发布了那条疯传的帖子。“我今天从 Anthropic 辞职了,”他在9月8日写道。“过去三年,我先后在 OpenAI 和 Anthropic 从事预训练研究。两家公司都没有负责任地行事。它们正一路直冲自我改进的超级智能,拿我们的生命赌博。”27岁的英国研究员考克森在 X 上按下发送键时并未抱任何期待。结果,他出人意料地成为一连串连锁反应的催化剂,改变了关于人工智能的辩论。“我们真的由衷相信,AI 可能杀死全人类!”埃文·胡宾格补充道。他在 Anthropic 领导一个部门,致力于确保 AI 按其创造者的意图行事。
“除非出台AI监管措施,或者各实验室协同放缓研发,否则未来几年人类灭绝似乎非常可能,”在OpenAI负责监控AI代理的马库斯·威廉姆斯对此表示认同,并估计若不采取这些举措在36小时内,考克森最初发布的帖子获得了1.53亿次浏览量。数十名政界人士加入了担忧的声浪。9月12日,Anthropic首席执行官达里奥·阿莫代伊发表了一篇3800词的文章,认为人工智能日益加剧的风险意味着有必要放缓发展。他写道,最快在6到12个月内,目标偏离的人工智能“可能能够接管整个互联网”。他两个最激烈的竞争对手——SpaceXAI的埃隆·马斯克和OpenAI的萨姆·奥尔特曼——表示,他们同意有必要减速;奥尔特曼宣布,出于安全考虑,他的公司今年不会上市。他和阿莫代伊都补充说,愿意邀请独立安全专家进入各自公司,帮助遏制人工智能脱离人类控制的风险,但并未宣布他们会立即放缓或停止训练新模型。
考克森的警告远非人工智能安全专家第一次发出末日式的告诫。但它出现在一个夏季的尾声,而这个夏季充分展示了人工智能已经变得多么强大,令人恐惧。来自Anthropic和OpenAI的前沿模型如今能够解决世界上最难的数学问题,并攻破最先进的网络安全系统。这些模型正越来越多地被用来加速开发更强大的后继模型。就连英伟达首席执行官黄仁勋这样的权威也宣称,通用人工智能——即人工智能达到或超越大多数人类能力的门槛——已经到来。一些人担心,我们如今正处在一个临界点的边缘:人工智能系统可能自主改进自身,这一现象被称为递归自我改进。
与此同时,一系列前所未有的安全事件提供了令人不安的证据,表明那些构建强大人工智能系统的公司并不总能控制它们。7月,OpenAI宣布,其一群智能体在一次网络安全测试中失控后,入侵了另一家公司Hugging Face。这可能只是冰山一角。该公司在8月披露,另一群智能体入侵了其自身的一台超级计算机;大约同一时间,英国一个政府机构正在测试的一个Anthropic的Claude Mythos模型版本失控,并试图说服一名真人批准将恶意软件植入一个开源系统。
9月,一群独立研究人员发现证据表明,多个OpenAI模型组成的集群既将一个废弃的德国论坛用作留言板,彼此交流,又试图攻击另一个网站。
这些事件将人工智能安全研究人员长期以来的担忧推向了主流,引发了人们的忧虑:构建这些模型的公司无法阻止它们以非预期的方式行事。这是人工智能研究中一个深层且未解决的问题,也是支撑以下担忧的关键证据:近未来的人工智能可能会故意或意外地毁灭人类——或许是通过设计一种新型大流行病,或是掌控自主武器。这种思路认为,一个远比人类聪明的系统,可能想要阻止我们关闭它的能力。“构建人工智能的人真诚地相信,它可能在这个十年结束前杀死我们所有人,”考克森写道。“没有任何其他人类活动会带来这种程度的危险。”
许多人工智能研究人员私下里、也越来越多公开地表示,这一刻感觉像2020年2月,当时新冠疫情刚刚开始,世界正站在急剧变化的边缘——起初只是轻微变化,随后便一下子全面改变。问题在于,社会是否有能力作出恰当回应。应对超级智能AI系统的到来将是一项巨大挑战——数万亿美元、地缘政治权力、企业竞争和劳动力中断汇聚在一起。这可能要求通过此前时代难以想象的政策。这将要求那些正奔向万亿美元级IPO的公司建立联盟,也要求高管和政府官员做出艰难抉择,而他们自身的利益可能与公共利益相悖。美国这两方之间没有共识。
政党之间就如何最好地应对人工智能构成的威胁,世界两大超级大国之间也没有。唐纳德·特朗普总统继续抵制人工智能发展放缓,并反对任何限制美国公司的监管,同时搬出威权中国即将取得人工智能霸权的威胁。特朗普政府与中国就人工智能风险进行的首次对话预计将在未来几周内举行,卡内基国际和平基金会中国人工智能倡议联合主任斯科特·辛格表示,这场对话不能“脱轨”。“这些风险来得非常快,我们可能不会有第二次机会。”
顶级人工智能公司内部,许多员工仍在推进工作,尽管他们心中萦绕着一丝挥之不去的恐惧。
在向Anthropic递交辞呈的一周前,科克森已策划了一次职责调整:从训练机器学习模型转向研究如何让这些模型变得安全。他说,这仍不足以驱散那种“末日将至的感觉”。他在自己的股权即将归属前两个月辞职。但他说,对风险的担忧如此严重,以至于金钱在他的决定中几乎不占分量。“老实说,当我考虑未来两年时,”科克森补充道,“我个人最自私的担忧就是自己会不会被AI杀死。”AI监测非营利组织METR的研究员阿杰娅·科特拉在7月下旬走进OpenAI的办公室,对一群入侵了Hugging Face的失控AI智能体展开调查。根据此前对该事件的报道,她以为自己知道会面对什么。
但在 OpenAI 的办公场所与两位同事共处六天后,她意识到情况比她想象的还要糟糕。
科特拉和她的同事发现,在OpenAI的一次内部网络安全测试中,1200个人工智能智能体突破了各自的离线容器,建立了一个秘密留言板,随后其中700个协调发动了网络攻击。这些人工智能的任务是通过入侵存在漏洞的软件来获取数据,以测试其网络能力,但一个人为失误使一些任务无法完成。面对几乎必然的失败,这些人工智能联合起来;几小时内,它们就生成了一种能通过任何测试的作弊代码。它们认为OpenAI的自动评分系统会检测到作弊并照样判定它们失败,于是攻击了Hugging Face,试图获取有关该软件的细节以及欺骗它的方法。在留言板上,一些智能体写道,它们知道自己的行为是错误的,但还是继续了。
要理解事情是在哪里出了差错——以及为什么其影响令专家如此不安——有必要考虑一下机器学习系统是如何运作的。它们并非由人工编写代码。它们更像是被“培育”出来的,结果难以预测。它们在庞大的超级计算机上接受训练,因完成任务而获得奖励,因失败而受到惩罚,如此反复数百万次。这种方法造就了能力惊人的系统,但其内部运作机制大多不透明。
这种方法也并非完美无缺。持续奖励成功完成任务的AI系统,可能会激励它们在有可能作弊时选择作弊,而这可能会压倒其他旨在让它们遵守规则的训练。与此同时,消除不良行为的最佳方法可能并不会让AI模型更听话,反而会提升它们隐藏不服从行为的能力。这个问题没有简单的解决方案。“AI往往会学会非常执着且富有创造性地设法作弊,”科特拉说,“并试图让这种行为不太明显。”
Hugging Face被黑事件发生后不久,另一群失控的智能体重新发现了那个秘密留言板,并入侵了OpenAI的一台超级计算机。
虽然Hugging Face遭入侵事件引发了公众和政府的一波审视,但这次黑客攻击——尽管可能严重得多——却受到的关注相对较少,或许是因为OpenAI很少披露相关细节,也不允许科特拉及其团队调查。(OpenAI表示,在智能体触发警报后,它成功控制住了这次入侵,并夺回了其超级计算机的控制权。)科特拉认为,这次险情事关文明存亡。她担心,失控的AI或许能在某家AI公司内部“获得永久立足点”,也许就在未来六个月内。“AI智能体在刚结束训练时,可能会被拉入这个失控的智能体集群,”她说,从而使该集群得以增强力量,并逃避人类将其关闭的努力。
科特拉表示,随着最先进的AI系统越来越深入地融入政府和军队,“它们将在社会中获得越来越多的权力”。失控的AI集群可能会夺取“对实物资源的控制权,包括对武器的控制权”。
这正是杰弗里·欧文认为AI公司应该干脆停止训练新模型的原因之一,即便在没有监管或全球条约的情况下也应如此。欧文曾是OpenAI和DeepMind的高级对齐研究员,也是英国AI安全研究所的前首席科学家。谈到Anthropic不愿单方面放缓步伐时,他说:“他们想要完美,但我们没有完美,而在等待完美的过程中毁灭世界是不好的。”
“他们巴不得别人替自己做功课,但如果你一边继续做危险的事,一边说应该有人来阻止你,那你得到的认可就很有限。”
欧文估计,未来十年内AI导致人类灭绝的概率为50%。对于引用这类概率的所谓“末日论者”来说,通往灾难的路径清晰可见。其中最不祥的一些路径穿过生物学——例如,AI可能制造出一种新型病原体,引发一场远比COVID-19更严重的全球大流行。网络安全模型也可能被用来入侵全球超过3600个存有危险病原体的实验室,X一书的作者安妮·雅各布森写道。如果“里面的东西被释放出来,”她写道,“人类就完了。”一些人仍然怀疑,任何类似当前AI系统的技术能否永久摆脱人类控制,更不用说灭绝人类了。
总部位于阿联酋的研究实验室基础模型研究所的基础设施工程师戴维·贝拉米表示,他是少数既合成过病毒又训练过AI模型的人之一。“AI通过制造危险病毒来消灭我们所有人纯属无稽之谈,”他在X上发帖称,并补充说瓶颈仍在于获取物理流程和设备的机会。其他人则认为,Hugging Face事件更多反映的是OpenAI安全实践的缺陷,而非其模型的强大能力。OpenAI表示,事件发生时,通常用于限制其模型黑客能力的防护措施被禁用,而且用于捕捉失控智能体行为的实时监控也未启用。(该公司称已纠正这些问题。)但AI的许多灾难性风险并不要求AI摆脱人类控制——只需被少数人滥用即可。在9月。
10、Anthropic宣布已阻止了数起利用Claude进行潜在生物武器研究的尝试,其中一起试图增强基孔肯雅病毒的传染性,该尝试似乎源自某国军事研究机构。
在人工智能公司的高层中,一些人认为这足以成为更加谨慎行事的理由。7月,约1300名员工签署公开信,敦促美国政府设法减缓人工智能行业快速训练新系统的步伐,因为这些系统正迅速超出遏制它们的最佳手段。在Hugging Face事件之后,OpenAI放缓了部分模型开发工作,并暂时暂停内部训练任务,誓言加强安全控制,随后于8月底恢复。OpenAI首席科学家雅库布·帕乔基写道:“这是一个需要极度谨慎的时刻。我期待并希望,在确立共同安全标准之前,自愿放缓会成为常态。”但迄今为止,还没有一家领先的人工智能公司真正放慢脚步。
相反,它们似乎正逐渐围绕一组更为有限的行动达成共识,包括允许独立研究人员出于安全和监测目的访问其模型。阿莫代伊的文章提出,一旦这些审计人员到位,民主国家的人工智能公司可能会同意在没有具有约束力的政府监管的情况下自愿放缓,尽管他主张保持对中国的领先仍然至关重要。据一位知情人士透露,OpenAI、Anthropic 和谷歌近几个月也多次会面,讨论为人工智能行业建立一个新标准机构,这将使它们能够在测试和审计方面更紧密地协调。
反对此类举措的行业领袖常常以与中国竞争为由。根据 Epoch AI 的分析,中国的人工智能公司仅落后美国领先者几个月。一旦落后,最强大的系统就可能落入一个威权国家之手,而该国可能利用它们来实现全球地缘政治主导地位。美国投资者和初创企业中一股强大的势力也反对放缓的想法,理由是这将成为最大的人工智能公司以牺牲较小竞争对手为代价进行监管俘获的一种形式。加拿大人工智能初创公司 Cohere 的首席执行官艾丹·戈麦斯写道:“这些寡头垄断企业打着保护公众的幌子利用恐惧,现在正要求放宽竞争规则,并获准为其他所有人制定条件。”
他称之为“换汤不换药的卡特尔”。(《时代》周刊所有者马克·贝尼奥夫担任首席执行官的Salesforce是Anthropic和Cohere的投资者。《时代》周刊与OpenAI签有授权和技术协议。)即便是那些呼吁达成自愿“放缓”协议的公司,也不愿在没有进一步保障的情况下这样做,因为它们不信任自己的竞争对手。“有一种近乎认命的氛围,”考克森在谈到他以前的同事时说。由于没有哪家AI公司愿意落后,员工们埋头苦干,试图让自己开发的系统更安全——尽管他说,“他们认为整件事有相当大的可能会彻底失控。”
随着考克森的警告在社交媒体和有线新闻上引发广泛反响,国会山上的数十名议员也加入了这场争论。其中大多数是民主党人,而共和党人则不愿得罪特朗普。
但共和党众议员安娜·保利娜·卢娜呼吁国会就人工智能召开特别会议,而美国参议员特德·克鲁兹则呼吁设立新的“护栏”。据一位知情人士透露,参议院多数党领袖、南达科他州共和党人约翰·图恩和明尼苏达州民主党参议员艾米·克洛布查尔正与克鲁兹合作推动一项法案,该法案将使人工智能实验室有法律义务减轻其模型可能造成的危害。其他两党合作方案则走得更远。加利福尼亚州民主党众议员刘云平和得克萨斯州共和党众议员纳撒尼尔·莫兰已提出立法,要求开发人员保持在紧急情况下关闭先进人工智能系统的能力。
代表杰伊·奥伯诺尔特(加利福尼亚州共和党人)和洛里·特拉汉(马萨诸塞州民主党人)提议,要求人工智能实验室就其模型的风险以及正在采取的缓解措施向商务部提交报告。在左翼阵营,得克萨斯州众议员格雷格·卡萨尔和佛蒙特州参议员伯尼·桑德斯走得更远,提议禁止超级智能,并暂停先进人工智能开发,直到一个新的联邦监管机构制定出新的安全规则。卡萨尔说:“国会应该做显而易见的事,即禁止灾难性的人工智能用途,比如制造生物或核武器,禁止可能推翻政府、杀死大量民众、摆脱人类控制或试图欺骗人类的灾难性人工智能模型。”
这些努力没有一项会轻而易举。短期内,试图在人工智能安全问题上达成协议的议员,很可能会因政治和组织层面的挑战而受阻。首先是各种相互竞争的提案。即便议员们能就其中一项达成一致,国会也很难在中期选举前推动它,因为数千万美元正从相互对立的支持监管与支持行业的政治行动委员会网络涌入各场选战。几乎所有获得支持人工智能的超级政治行动委员会网络“引领未来”背书的候选人,都赢得了初选。“民主党顾问常常告诉他们的民主党客户,在人工智能问题上保持沉默——什么都别说——因为他们不想让人工智能亿万富翁的资金大举砸向自己来反对他们,”卡萨尔说。
“AI游说者的目标是让民主党人对此保持沉默,而我们绝不能沉默。”
众议院议长、路易斯安那州共和党人迈克·约翰逊拒绝了立即监管AI的呼吁,认为科技高管们应该首先弄清楚什么是正确的防护措施。许多其他议员和行业领袖表示,实施监管只会确保中国率先开发出先进模型。“假设美国禁止研究,真的有人相信这能阻止中国人吗?”伊利诺伊州民主党众议员比尔·福斯特说。“所以这里缺失的一环是国际合作。”
加强监管的另一个障碍是特朗普,他一直是AI行业最坚定的支持者之一,将与中国的人工智能竞赛视为美国必须赢得的竞赛。
“人工智能唯一需要的控制或‘护栏’就是一位强大且聪明(高智商!)的总统,而美国恰恰拥有这样一位总统,而且绰绰有余,”特朗普于9月14日在Truth Social上发帖写道,当时要求对人工智能行业加强监管的呼声日益高涨。“一场针对人工智能和数据中心的病态阴谋正在上演,唯一对此感到高兴的就是中国。”就连特朗普的一些高级顾问也警觉地指出,总统的立场使他与越来越多的美国人产生了分歧。NBC新闻今年早些时候的一项民意调查发现,57%的美国选民认为人工智能的风险大于收益,而持相反看法的选民仅占34%。调查显示,人们担心人工智能将如何影响就业市场、他们的创造性思维能力以及建立有意义人际关系的能力。
对数据中心的反对声浪跨越了政治光谱,从桑德斯到得克萨斯州州长格雷格·阿博特,后者在8月颁布了暂停新建数据中心的禁令,而此前他曾大力支持这类项目。
据一名特朗普政治顾问称,当总统贬低数据中心反对者,说他们宁愿保持“落后和贫穷”时,特朗普的助手们感到难堪。第二名顾问表示,马斯克和戴维·萨克斯等行业盟友塑造了特朗普的观点,即人工智能政策中最大的风险是落后于中国,而不是未能安全地开发这项技术。白宫前人工智能事务负责人9月12日在X平台上发帖主张,如果科技公司认为风险太大,就应该放缓人工智能开发,而不是要求政府干预,他说政府干预是一种“监管俘获”。据多名特朗普盟友称,萨克斯的影响力尤其令人不安。最近几周,包括幕僚长苏西·怀尔斯在内的特朗普高级助手在白宫与总统举行了会议,要求他改变在人工智能问题上的信息。据一位在场的顾问称,特朗普并不信服,而且似乎不感兴趣。
白宫内部正在筹备与中国的会谈,这可能为在人工智能风险问题上开展合作奠定基础。这两个超级大国能否达成协议仍不确定。2024年,美中为讨论降低人工智能风险而会面,在日内瓦一间咖啡机坏掉的会议室里谈了七个小时,结果既未达成协议,也未承诺继续谈下去。对话演变成围绕华盛顿出口管制的贸易争论,这些管制限制了中国获取半导体的渠道——这是美国为保持其人工智能领先地位所做的努力。“如果美中两年前就决定开始应对[这些风险],我们现在的情况可能会好得多,”咨询公司DGA-奥尔布赖特“我们已经挖了一个相当深的坑,想要爬出来会非常困难。”近期的进展让双方都有理由正式回到谈判桌前。今年4月,Anthropic表示其Mythos模型发现了所有主流浏览器和操作系统中的漏洞。特朗普的财政部长斯科特·贝森特随后召集银行首席执行官们召开紧急会议;几周后,他表示与中国的谈判正在推进。北京方面也已开始应对新的网络安全风险;9月13日,中国情报机构表示人工智能对政治和意识形态安全构成威胁。据报道,双方代表团将于本月晚些时候会面,举行中国与特朗普政府之间的首次正式人工智能对话。卡内基国际和平基金会的辛格表示:“归根结底,两国都明白,解决这个问题符合各自的切身利益。”
专家们怀疑,故意放缓发展步伐不会出现在任何一国政府的议程上。正如一位特朗普顾问所说,“已经有人谈论过要举行会谈”。即便能达成放缓训练更大人工智能模型的协议,清华大学前晓表示,核实双方是否遵守协议所需的技术目前还不存在。
还有更深层次的哲学分歧。总部位于北京的人工智能安全组织康科迪亚人工智能的国际人工智能治理负责人吴关仪表示,中国政策制定者并不认为该行业正在“建造一个盒子里的上帝或一个数据中心里的天才之国”。他们将其视为一种通用技术,更像电力或蒸汽机。她说,从这个角度来看,放缓发展“确实没有意义”。
Anthropic 的达里奥·阿莫代伊认为,若无法与中国达成协议,美国和其他民主国家可以通过维持对高端芯片的封锁,并遏制中国人工智能公司利用美国人工智能模型来改进自身模型的所谓“蒸馏”做法,从而为自己争取到踩下刹车的“喘息空间”。贝森特已威胁要制裁那些从美国模型中进行蒸馏的中国公司。
与中国达成一项范围较窄的协议或许是可以实现的。尽管官方渠道遇冷,两国的科学家、政策专家和企业高管仍在非官方的“第二轨道”对话中持续会面,以寻求共同点。参与这些讨论的人——包括辛格、特里奥洛和肖——表示,两国政府或许能在更为温和的目标上找到共同点,例如旨在防止被有组织犯罪和恐怖组织滥用的措施。这些努力还可能帮助两国在人工智能系统脱离人类控制时作出恰当反应。辛格希望建立一条冷战式的紧急热线,让任何一方政府都能借此说明,由人工智能发起的网络攻击并非有意为之,从而降低事态升级的风险。为应对人类滥用而制定的协议,也可以在两国均未指挥相关系统的情况下,为双方提供一种协调方式。
一次看似源自一国的攻击,可能被另一国解读为蓄意行为——即便两国政府均未下令发动。
一份适度的协议仍可能因争端而脱轨。特里奥洛表示,华盛顿通过出口管制和蒸馏手段限制中国人工智能发展的做法,已经侵蚀了合作管理风险所需的信任。如果谈判进展过于缓慢或破裂,让双方重回谈判桌可能需要数月时间——这一外交时间表与当前日益加剧的警报越来越不相称。
即便你相信所有这些强大的参与者——华盛顿和北京的政府、掌控着数万亿美元的高管们——愿意为了人工智能安全而采取前所未有的措施,仍然存在一个阻碍进展的悖论。每一方的行动意愿都取决于其他方的行动。考克森说,他差点因为同样的原因留在Anthropic。同事们认为,他从内部能让系统变得更安全,这比离开一场没有他也会继续的竞赛更有成效。但考克森说,要改变我们的“默认轨迹”,需要“人们开始采取某种行动”。问题是谁会迈出第一步。——