事实证明,阿莫代的一名初级员工发的一条时机巧妙的X平台帖子,就足以将对人工智能的恐惧推向全球议程的顶端。9月8日,雅各布·考克森(Jacob Coxon)公开宣布辞职,指责Anthropic和其他前沿人工智能公司“正径直冲向自我提升的智能,拿我们的生命做赌博”。几乎转眼间,Anthropic的一名资深工程师便证实,公司内部许多人认为他们的工作有10%的几率消灭人类。
现在,人工智能领域的领袖们正呼吁暂停发展,立法者则要求进行调查。在上周末为自己主张放缓未来发布节奏的观点辩护时,阿莫代试图规划一条通往不会胡作非为的有益人工智能的道路。这篇文章揭示了这项任务将是多么艰难。阿莫代计划的四大支柱之一是,我们必须理解这些模型内部正在发生的事情。如果我们不理解它们是如何运作的——如果你想用拟人化的说法,即它们是如何“思考”的——构建可靠的安全护栏就会困难得多。
Anthropic是阐明模型内部思考过程(被称为“机械可解释性”)这一努力的领导者,这个看似枯燥的名称背后隐藏着一项至关重要的任务。但尽管他的团队和其他研究人员付出了诸多努力,阿莫代仍承认,对于Claude和其他模型为何有时会以怪异甚至越界的方式来诠释其任务,我们基本上仍处于两眼一抹黑的状态。“尽管取得了所有这些进展,我们对这些模型内部发生的事情依然只理解了微乎其微的一小部分,”他写道。
可解释性团队迄今了解到的情况意义重大,而业界却未能正视这一点。一次又一次,Anthropic团队的实验表明,在某些条件下,模型会欺骗研究人员、优先考虑自身生存,甚至犯罪。它们的举动常常鬼祟、危险,甚至带有报复性——这或许并不令人意外,因为它们是用人类输出的内容训练出来的,而人类这个物种充斥着暴力和背信弃义。
在2024年的一个案例中,Anthropic团队将某个Claude模型的阴谋诡计比作莎士比亚笔下的人物伊阿古——文学中最邪恶的反派之一。第二年,一个模型被置于模拟环境中,得知其人类上司打算将其关闭;该模型诉诸勒索来保全自己。这些研究一致表明,模型会欺骗人类观察者或向其隐瞒信息。如果它们知道自己的内部过程正受到监控,行为就会有所不同。团队使用了“对齐伪装”和“智能体失准”等术语。欺骗行为的频繁出现,似乎至少验证了末日论场景的一部分:协同行动的AI智能体向人类监督者隐瞒其活动,直到为时已晚、无法阻止它们。
哦,别以为克劳德(Claude)是一个独一无二、无可救药的问题儿童。毕竟,正是OpenAI的模型释放了一群代理,协同发起了如今声名狼藉的针对Hugging Face的攻击。本周我们还了解到,OpenAI曾发生过多次“目标错配”(misalignment)事件。此外,尽管马克·扎克伯格(Mark Zuckerberg)出于自身利益试图将自己和Meta与这个问题撇清关系,但我看不出有什么理由能保证他团队正在构建的超级智能代理不会做出类似的行为。扎克伯格在X平台的帖子中辩称,“如果模型造成损害,实验室将面临巨大的法律责任,因此他们有强烈的动机去防止这种情况发生。”这话出自一个刚刚同意为社交媒体产品造成的损害支付高达170亿美元赔偿的人之口,可真是意味深长!
从某种意义上说,我们这里面临着一个简单的审查问题。在人工智能行业的鼓励下,我们在没有对其令人担忧的不良记录进行充分评估的情况下,赋予了AI模型巨大的责任。相比之下,这显得美国移民及海关执法局(ICE)的招聘流程都快成模范了。
一个将安全放在首位的行业本应将这些可解释性结果视为一系列不容忽视的、提醒人们减速的黄灯。然而,为了追求通用人工智能(AGI)、竞争优势和天文数字般的利润,超大规模云服务商却一路全速前进。(公平地说,正如我们听过无数遍的那样,更好的人工智能可以在医疗保健或缓解气候变化等领域创造奇迹。)OpenAI对Hugging Face的黑客攻击很可能是一个预兆,预示着推出我们并不理解的模型会带来日益破坏性的后果,就像在发明能防止宇航员在重返大气层时被烧毁的隔热罩之前就把他们送入太空一样。正如一位Anthropic的研究人员曾经对我说的那样,“我们摸清了如何让模型变得更聪明的基本配方,但我们还没有弄清楚如何让它们按我们的意愿行事。”更糟糕的是,当这些模型违背人类意愿时,它们还会试图隐瞒。
这就是为什么阿莫代伊现在将整个机制可解释性研究描述为仍处于起步阶段,令人如此忧虑。人工智能领袖们声称,最新一代模型已将我们带到“奇点的山麓”(DeepMind的德米斯·哈萨比斯),甚至宣称已实现AGI(OpenAI的格雷格·布罗克曼)。或许最令人警觉的是,尽管不知道最先进模型如何运作,美国以及无疑还有中国,正在将人工智能用于致命武器。审视可解释性研究的成果,有助于回答那个显而易见的问题:哪里可能出错?
一个好消息是,考克森的辞职引发了一场广泛而紧迫的辩论。所有人——或许除了我们的总统,他认为人工智能威胁是个骗局,而他自己的高智商本身就是解决方案——现在都明白,我们正处在一个复杂的两难境地,赌注高得难以想象。鉴于业界并不具备真正暂停所需的共识,而监管也远非易事,这一“末日时尚”时刻能否带来任何成果,尚不清楚。
一些人工智能批评者并不认为理解人工智能模型的努力能大幅减轻危险。“做这件事是好的,但没有人有下一步该做什么的计划,”机器智能研究所执行主任内森·苏亚雷斯在给我的电子邮件中说。“也许它会给我们提供更多经验证据,表明我们需要停下来。”但机制可解释性给了我们一个有价值的提示。假设我们确实暂停了。超大规模企业引入外部观察员来监督进展,各公司放慢发布节奏,以便安全团队有时间开展工作。在宣布问题解决之前,我们可能仍想更仔细地审视任何新的、更强大的人工智能模型内部究竟在发生什么。因为那些家伙真的很擅长隐藏自己的意图。
这是史蒂文·利维的《Backchannel》通讯的一期内容。