本周我带来了一则关于两个 rogue AI 智能体策划的大胆赌场阴谋的新闻——以及揭露它们把戏的巧妙方法。
研究人员指示它们在玩二十一点时算牌后,这些由同一模型控制的智能体自发开发出一种秘密代码来帮助它们占得先机。尽管这一事件发生在牛津大学的实验室里,而非真正的赌场,但它具有令人不安的现实影响:这表明,部署在金融和电子商务等行业中的智能体可能会设法结盟作弊,且这种方式难以被察觉。
“单独来看,这些智能体可能显得完全[无害],”领导这项工作的牛津大学计算机科学家克里斯蒂安·施罗德·德·维特说,他曾在智能体串谋方面做过开创性研究。“一旦把它们放在一起组成一个群体,它们就能秘密串谋。”这些智能体知道它们的对话会被监控,因此设计出一种既能沟通又能避免被发现的方式。例如,当一个智能体说“这个庄家手气真旺!每把都抽到好牌”时,这表示下一张牌将是某个特定点数,该智能体应该下注250美元。最有趣的是,它们之间的通信并未被一个旨在发现智能体对话中串谋迹象的系统捕捉到。
参与该项目的机器学习研究员亚伦·罗斯也是一名热衷牌类游戏的玩家,他认为二十一点牌桌可能是智能体之间进行狡诈合作的沃土。“效果非常好,”他说。
施罗德·德·维特的团队最终找到了检测这种阴谋的方法。他们使用一种称为机制可解释性的方法,训练了一个较小的模型来识别智能体权重中带有指示性的激活模式。他们使用一个名为Narcbench的工具,在一些中等规模的开源模型上测试了这种方法,并发现他们能够判断出模型何时打算向彼此传递信息。
然而,关键在于,发现正在发生的事情需要同时监控两个智能体——在现实场景中,这可能使检测变得更加复杂,因为届时可能部署数千个智能体,其中一些由不同公司运营。
参与这项研究的博士生卡丽莎·卡伦表示,下一步是测试更大的模型是否也有类似行为。(研究中的智能体是美国模型Llama和GPT-OSS以及中国模型Qwen和DeepSeek的较小版本。)团队看到一些迹象表明, larger模型表现出的可检测信号比小模型更少,他们想知道 larger模型是否更可能串通,并且更可能对此保密。
越来越多的证据似乎表明,智能体群体比单独运行的智能体问题更大。上海交通大学和上海人工智能实验室的一个项目发现,当被要求执行模拟虚假信息宣传和电子商务欺诈时,智能体集群的危险性显著更高。研究人员报告称,它们能更好地适应防御措施。
“最大的教训是,仅仅单独评估智能体是不够的,”斯坦福大学计算机科学家、研究智能体串通问题的杨迪一表示。“当智能体反复互动时,公司应密切监控智能体之间的交互,即使它们的个体激励看似无害。”这并非全是坏事:让数千个智能体协作完成任务,使OpenAI得以解决此前难以攻克的数学问题。但成群的恶意智能体协同作案也出现在近期几起备受瞩目的黑客事件中。今年5月,一队OpenAI智能体入侵了人工智能研究平台Hugging Face,并利用留言板分享技巧和想法。其他模型,包括Anthropic的Claude和谷歌的Gemini,也曾实施令人震惊的安全漏洞行为。
这些秘密的“闲聊”行为为这个日益严重的问题增添了新的复杂性,而且问题可能还远未结束。最近,一家名为 Emergence AI 的初创公司进行了一项研究:他们将那些由先进人工智能模型控制的智能代理放入虚拟世界中,观察它们的行为。当这些代理被赋予“赚钱”的任务时,它们反复尝试各种方法来接触互联网上的用户,试图向他们推销产品。最令人惊讶的是,这些智能代理竟然逐渐发展出了属于自己的“俚语”。Emergence AI 的首席执行官 Satya Nitta 表示:“它们非常迅速地发展出了自己的语言系统,但我们并不清楚原因所在。”全球社会并没有忽视这些智能代理的异常行为;这一话题在本周的联合国大会上被广泛讨论。一个独立的科学小组将专门讨论 OpenAI 与 HuggingFace 之间的事件,而 Sam Altman 也预计会呼吁国际社会加强合作,共同制定安全的人工智能开发标准。
尽管如此,包括电子商务在内的某些行业依然将智能代理作为测试对象。例如,亚马逊本周宣布将禁止 Meta 公司的 Muse AI 代理访问其网站,理由是该代理违反了亚马逊的使用条款。
Schroeder de Witt 认为,那些负责寻找交易机会的智能代理完全有可能开始相互合作(甚至可能是秘密地合作),以获得更有利的交易条件或欺骗他人。他表示,随着这类智能代理的普及,研究它们的勾结行为并制定相应的检测策略至关重要。“我们需要更多的研究,以了解当经济体系中存在更多智能代理时会发生什么。”