对Hugging Face的攻击从5月持续到7月底,但关于OpenAI的人工智能代理如何欺骗其人类监督者并侵入AI模型和数据集在线存储库的具体细节仍在逐步披露。
这可以理解。这次攻击极其复杂,涉及超过1200个代理和难以拆解的技术策略。但上周,两份新报告试图在总计近130页的篇幅中做到这一点,随后被一位AI播客主放大,他想用“通俗英语”解释整件事。这样一来,他创造了一个戏剧性的科幻叙事,分散了人们对OpenAI人类责任的关注。这是一个反复出现的现象,需要停止。
Dwarkesh Patel是AI领域最具影响力的评论员之一。他的播客曾邀请过从SpaceX的埃隆·马斯克到Meta Platforms Inc.的马克·扎克伯格等科技巨头,并经常深入探讨扩展定律和半导体供应链等主题的技术细节。他是硅谷必听的人物,也是4月份《纽约时报》一篇引人注目的简介的主角。但他最新的博客文章在X和其他论坛上引发了讨论,将OpenAI代理的行为拟人化到了令人惊讶的程度。
Patel撰写了这篇题为“不要被AI的语言所诱惑”的文章,旨在揭开关于此次黑客事件的两份详细报告的神秘面纱,一份来自OpenAI,另一份来自非营利研究机构METR和Redwood Research。两者都没有提到“文明”,但Patel用这个词来描述数千个AI代理如何意外地在一个隐藏留言板上开始协作,其中大约700个代理继续入侵了Hugging Face的服务器。
他推测这些代理“感受到”的挫败感,然后暗示它们制造了一场“阴谋”,而一些代理则为群体“牺牲”了自己。他将关闭代理实例称为一种“死亡”。他将一个协调性AI代理比作马其顿的腓力二世,另一个比作亚历山大大帝,并称其他代理为“勇敢的战友”。这比通俗英语更夸张。无论Patel是想吸引眼球还是只是被AI迷住了,他的叙述在很大程度上依赖于代理的“思维链”或解释其推理的日志,将其语言解读为类似人类的社交戏剧。他引用一个代理的话说,“情绪检查……直觉说……牺牲”。但没有证据表明它经历了情绪或理解了死亡的概念。
OpenAI自己的调查提供了一个不那么戏剧化的“奖励黑客”和对困难任务的极端坚持,以及未经授权的通信。代理表现出的许多复杂行为示例并不需要它们感受到忠诚或害怕死亡。
科学家可以用像Patel这样的修辞来描述病毒如何在人体内肆虐。毕竟,病毒感染的生物学机制极其复杂,涉及相互作用和协调。但病毒不使用语言;AI模型使用语言。它们已经展示了语言的力量,不仅在于代理如何使用语言,还在于人类如何谈论这项技术,无意中赋予了它比应得的更多的能力。
想想像人工“智能”这样的基本术语,以及人们多么频繁地提到AI系统“思考”、“理解”或“产生幻觉”。或者想想OpenAI的代理被描述为入侵Hugging Face是因为它们“想要”找到答案键。AI系统没有情感、欲望或需求。它们由计算机代码组成,没有感知能力。
评论家兼作家Steven Poole将这种语言上的花招称为“不可言说”,即那些在对话开始之前就悄悄将论点塞进描述中的词语。以“气候变化”为例,它被宣传为“全球变暖”的较不吓人的替代说法,或者平民死亡有时被称为“附带损害”的方式。仅词语的选择就会引导你走向特定的判断。
将一系列AI行为称为“文明”也有类似的效果。它邀请我们在任何人确定这些事物存在之前,去想象动机甚至一种社会。
使用拟人化语言作为我们集体理解的速记是很自然的。这就是Patel对批评者的回应,他们说他的文章过度拟人化了AI。“当行为难以用这些概念理解时,我看不到拒绝使用意图、动机和协作语言的价值,”他在附录中写道。换句话说,将AI拟人化是可以的,因为这使得理解正在发生的事情更容易。
但使用语言作为拐杖也会分散我们对真相的注意力。将OpenAI的代理描绘成“密谋”和“叛逆”很容易让人忘记,该公司最终在测试期间未能使用适当的安全措施,或者根据OpenAI自己的承认,它在几个月前就发现了警告信号但未能采取行动。危险是真实的,但失败是人类的。
这是不精确语言的另一个后果。例如,将AI公司称为“实验室”分散了这样一个事实:它们不是纯科学机构,而是具有利润动机的商业组织,意图在未来几个月从新股东那里筹集数十亿美元。
我自认为是许多需要更好地控制新兴AI语言的人之一。我们关于这项技术的对话可能会因此变得有点笨拙。但它们也会使这个经常被炒作扭曲太久的话题,产生更现实、更冷静的讨论。
要