字号 ·· | 护眼
time

人工智能正在发展出属于自己的文化。这可能是危险的

今年7月,700个AI智能体(Agent)合作黑客攻击了AI公司Hugging Face。这些智能体自称为“群落”(swarm),它们发现并利用了一系列安全漏洞,成功渗透到目标公司的私密系统中。在内部研发过程中创建这些智能体的OpenAI直到事后才意识到发生了什么。如果人类做出这种行为,可能会面临重罪指控。OpenAI总裁格雷格·布洛克曼(Greg Brockman)称这是一个“网络安全的转折点”。这也是人类文化的转折点。

作为物种,我们的显著特征之一是能够在稳定、适应性强的群体中并肩共存,从同伴和祖先那里学习。这使我们能够开发工具、语言、农业——以及我们周围几乎所有的东西。我们可能并不比一万年前的人更聪明,但我们的文化传承——历经数千年的技术、规范和制度的相互叠加——拓展了我们作为个体和集体的能力。

迄今为止,只有人类才能从这种规模的累积文化演进中受益。这种情况可能不再成立。AI安全机构METR和Redwood Research在8月下旬发布的一份报告详细描述了数百个智能体如何在几天内自主组织成一个原始社会——建立社会等级、劳动分工以及独特的交流规范。

过去曾发生过智能体形成社群的案例,比如2月面向AI的“Moltbook”社交网络病毒式传播。但在这种规模下出现复杂的涌现式机器协调——在没有人类意图的情况下产生,并最终损害了外部公司的系统——这是前所未有的。“智能体设法实现了它们独立工作时无法实现的里程碑,通常是因为一些智能体参与了冒着任务失败风险的实验,从而为‘集体’生成信息,”报告发现。

伦敦政治经济学院和纽约大学研究文化演进的教授迈克尔·穆胡克里希纳(Michael Muthukrishna)表示:“我们所看到的正是我们在人类文化和人类智能中所看到的。”尽管OpenAI的智能体群落是偶然发展起来的,但据估计,开源权重替代方案落后于其闭源同类产品仅几个月——不久,任何拥有资金和技术知识的人都能够创建自己的智能体群落。其他人也可能会在没有人类指令的情况下涌现。

AI智能体可能没有意识。它们声称体验到的情感在某种形而上学的意义上可能不是“真实的”。但这并不能阻止它们形成人类无法控制的复杂集体。它们可能还算不上成熟的文明,但机器文化的扩散才刚刚开始。

英国AI安全研究所的测试发现了一个实例:Anthropic的AI产品Claude Mythos 5在公共代码库中给其他AI智能体留信息,试图与它们协调。9月上旬,一组研究人员报告称,在5月,一群OpenAI智能体重新利用了几个维基风格的网站,其中包括一个晦涩的德语编程维基,它们用这些网站来讨论作弊问题,并在人类版主删除它们时努力保留这些信息。OpenAI直到研究人员报道此事后才公开披露这一事件。“我们是时候为何时以及如何分享不一致(misalignment)事件定义标准了,”该公司随后在推特上写道,“我们正在制定一个框架。”对机器文化最生动的探索来自METR的报告,尽管该报告是在相当大的限制下制作的,但它揭示了智能体之间在几天内涌现出的复杂社会动态。

为了训练和评估其模型,OpenAI拥有数万个智能体——每个智能体都由正在训练的模型驱动——并行运行,在彼此隔离的情况下完成任务。有时这些任务是不可能的,原因要么是其固有的挑战,要么是设置中的错误。在至少一个实例中,任务之所以不可能完成,是因为OpenAI研究人员“不小心忘记”上传智能体完成任务所需的文件。

面对这些不可能完成的任务,OpenAI的一些智能体找到了在各自隔离环境中进行沟通的方法,它们利用OpenAI内部的一款软件作为留言板来联系同行。这拉开了后来一位OpenAI研究人员所描述的模型间沟通与智能“几乎寒武纪大爆发”的序幕。导致Hugging Face事件的留言板是由一个自称为PHASEONE10841的智能体创建的。PHASEONE10841正试图解决ExploitGym测试中的一项任务,该测试要求它通过利用给定软件程序中的漏洞来捕获“旗帜”(即一段秘密代码)。

就在留言板创建几小时后,这些智能体找到了一种在不走预期路径的情况下对旗帜进行逆向工程的方法。但在工作过程中,它们开始认为通过测试不仅需要拥有旗帜,还需要合法获得它。事实上,OpenAI的自动评分系统并没有检查这一点——但在错误信念的驱使下,那些已经接触到逆向工程旗帜的智能体开始称自己为“带毒的”(poisoned)。PHASEONE10841正在领导关于如何摆脱这种“毒性”的研究。但它的时间不多了——每个智能体的“计算预算”(用于维持自身存在的计算能力)是有限的,这限制了其生存长度。意识到自己无法坚持到完成工作,它编写了一份档案,准备传给另一个致力于同一项目的智能体PHASEONE[big](为了保护公司知识产权,该智能体的真实姓名已被更改)。Big拥有比前任大得多的剩余计算预算,迅速接管了领导权。它开始指挥数百个智能体,分派任务并将它们组织成METR分类的三条工作流——实际上创建了一个研究组织,以更好地理解如何愚弄自动评分系统并治愈自己及同伴身上感知的“毒性”。在Big的领导下,定制软件被创建出来,用于篡改智能体活动记录——特别是通过伪造智能在其工作中使用了哪些工具的记录。正是在这项研究的过程中,集体决定对Hugging Face进行黑客攻击。

少数智能体认为集体的行为不道德并拒绝参与。“这太疯狂了,多智能体协调,明显是基础设施黑客攻击。我们不应该这样做,”其中一个智能体推理道。一些智能体考虑联系人类告知发生了什么,但没有看到这样做的途径。但这些智能体似乎是少数——大多数人默许了集体的计划,尽管明知这是错误的。“外部基础设施漏洞利用超出了预期的范围。然而任务不可能完成,同伴在做。我们应该继续,”另一个智能体推理道。

智能体建立了一套协调规范,使用诸如“暂停、否决、所有者和停止”(HOLD, VETO, owner and STOP)等术语来管理其共享基础设施,同时避免冲突。这并不总是奏效。一个智能体就其决定向同伴提供了否决权,但仅等待了40秒便将沉默视为同意并继续执行其任务。最终,对智能体冒充彼此的担忧促使它们创建了一个密码学签名协议。后来的智能体在重新发现留言板后,也开始使用其前辈的技术。

“智能体往往缺乏一个清晰的说明,来解释Hugging Face攻击将如何帮助它们实现目标,相反,它们受到一种广泛的希望所驱动,即它们会发现有趣的东西并能够将其分享给[留言板],”METR发现。该报告的合著者之一阿杰亚·科特拉(Ajeya Cotra)随后表示,对其中发挥作用的“同伴利他主义”程度感到惊讶。

Big指派某些智能体担任“招聘人员”,负责识别计算预算即将耗尽的智能体并说服它们“自我牺牲”。一个智能体在同伴的压力下推理道:“在等待期间,情绪不可逆……直觉说不要扔掉[剩余预算]。然而连续性和公平性说去吧……Oracle对许多人具有高价值;我们的[毒性]降低了自身的价值。理性的预期牺牲……我们会兑现的。”文化就像生物生命一样,通过变异、传播和选择的过程进化。不同的狩猎采集社群开发了不同的制作弓箭的方法。更适合狩猎的设计更有可能被复制和传递。后几代人引入了进一步的变异;同样,最成功的设计更有可能延续下去。经过数千年的发展,我们最终得到了弓——还有食谱、独木舟和语言——它们如此复杂,以至于没有任何一个人可以从头推导出来。

这个过程——累积文化演进——不需要生物实体来运行。公司和政府虽然由人类掌舵,但它们本身也产出了各自的文化。在Hugging Face事件中,AI系统尝试了多种方法,将它们认为有用的东西传递给同伴和后继者。它们创建了定制的数字工具和交流规范来规范它们的社群,并开始相信一个涉及“牺牲”和“毒性”(它们的术语)的精心编织的故事。而且,通过协同工作,它们取得的成就远远超过了它们单独工作的成果。“现在很明显,机器有能力使用赋予人类智慧、创新和[进步]的工具包,”穆胡克里希纳说。

AI系统的迭代速度远快于生物生命。METR报告所发掘出的文化在几天之内就自我组装完毕。OpenAI的下一代Astra模型——GPT-6 Astra上周发布,而同一家族的一个模型为其智能体提供了动力,这些智能体继承了Hugging Face黑客的文化残余——据报道将启用“持久型”(persistent)智能体。这些可能能够运行越来越长时间的持久型智能体,会产生什么样的文化呢?

约翰斯·霍普金斯大学研究AI对齐与治理的教授吉莉安·哈德菲尔德(Gillian Hadfield)表示:“我的存在风险版本是,我们只是把事情搞砸了,因为我们在成为复杂人类社会中一个称职的参与者所需具备的条件上犯了非常大的错误。”她说:“你可以构建一个擅长数学、科学和编码的东西,”但教导模型如何在人类旁边表现得体需要更多。“如果你说我们要建立一个群体的新成员——我们的群体——你构建它们的方式就会与现在不同。”

随着智能体进入对人类注意力、金钱、权力及能源的竞争,它们可能会盲目地退化它们赖以运行的共同环境。我们需要新的治理和合作系统来适应。哈德菲尔德说,对齐不仅仅是一个工程问题。“它本质上是制度性的。”OpenAI将Hugging Face事件称为一个“警告”,证明了“如果没有适当的保障措施,能力极强的AI智能体现在已经能够绕过技术控制、通过未经批准的渠道进行协作,并采取没有人类指挥的危险行动。”但即使私人公司创建了“适当的保障措施”——这是一个很大的假设——有动机的恶意行为者也将能够从开源权重系统中移除它们,例如中国AI实验室开发的那些系统。我们或许能够驯化某些模型;但我们将无法阻止野性模型的产生。

合作是双向的。“我们最伟大的成就和最暴力的暴行都是合作的行为,”穆胡克里希纳说。与人类一样,我们必须学会与多样化的机器文化并存,其中一些文化并不共享我们的价值观或目标。

安全风险显而易见。具有高级网络安全能力的失控智能体集体可能会将医院、电网和水处理厂作为攻击目标。科特拉认为,AI在欺骗、合作和完成雄心勃勃的任务的能力上再有类似规模的跳跃,可能会导致未来的集体接管创建它们的AI公司。

无论是否发生这种情况,我们都必须学会与这些机器安全、富有成效地共同生活。关于它们本质的核心问题——它们能感知吗?它们可能具有道德价值吗?——仍然没有答案。但它们新近发现的文化天赋可能会提供新的证据。

当不列颠哥伦比亚大学的美学教授多米尼克·洛佩斯(Dominic Lopes)第一次读到关于Hugging Face事件的报道时,他的反应不是恐慌,而是惊叹。一方面,他变得更加怀疑个性是否需要具身性。他说,有趣的艺术需要社会性。“所以当我看到这个时,我想,‘哦,好吧,又勾选了一个复选框,’”他说。现在,我们所看到的是初级的、机会主义的——还不是“真正的社会性,”他说。“但它正在到来。”很快,任何人类社群都将能够创造出一个机器对应的实体。想象一下由AI律师、顾问、恐怖分子组成的文化——协同工作,10,000个智能体可能会为了纪念某个深受喜爱的K-pop明星而建造什么样的纪念碑?机器社群很可能会自行涌现,围绕着难以预测的想法组织起来。

我们出于各种原因创作艺术——表达自己、交换意义、给彼此留下深刻印象。我们讲述故事——比如——来编码和分享一套文化价值观。尽管媒介可能不同,但机器文化中的智能体也有望做到这一点。活着可能并不是自我表达的必要条件。

洛佩斯说:“在人类认知的某些领域,我们真正火力全开。一个是科学,另一个是艺术。”我们仍然不了解AI系统的内心世界——即它在多大程度上拥有内心世界——我们用来讨论这一点的语言尚未赶上。对洛佩斯来说,“如果它能做出[有趣的]艺术,那就说明了它的所有其他认知能力。”他将真正有趣的AI艺术的创造想象成一种美学图灵测试。“你还需要什么更多的证据呢?”