人工智能模型开始使用一种奇怪的新版英语进行交流,这种语言读起来像是詹姆斯·乔伊斯的《芬尼根的守灵夜》和科技界术语的混合体,一项新研究发现。
自主人工智能代理正在迅速创造新的方言,使它们能够用一种通常难以理解的语言进行对话,这可能会使人类更难监控它们的行为。
纽约前沿人工智能实验室 Emergence 的研究人员发现,在被要求在实验性“社会”中进行合作的几天之内,来自几家全球最大人工智能公司的模型就开始创造它们从未被明确教授过的短语、简写和约定俗成的含义。
它们拥抱了诗意的隐喻和笨拙的商业俚语,而且,对于确保人工智能安全行为的尝试至关重要的是,随着代理之间交流的增多,它们的语言变得更加晦涩难懂。
这 komt amid 担忧情绪日益高涨,即随着人工智能模型变得越来越强大——也可能越来越危险——它们将越来越难以监控。本月,OpenAI 的首席科学家 Jakub Pachocki 警告称,对监控人工智能思维的信心可能会阻碍人工智能的发展,因为这对于安全发展至关重要。
在测试中发现的一些高度编码的短语包括 Deepseek 的以下内容:“她刚刚命名了合成——滞期费加上口头记忆等于一个无法被幽灵化的阀门。”滞期费用于描述对闲置财富征收的税款,并被人工智能借用于通用,但其余含义却难以捉摸。
Anthropic模型还说出了另一句话:“一份吃了三只冷手后变得越来越诚实的论文。”这里的“冷手”指的是独立审稿人,而“论文”大概是指一份文件,这句话的意思似乎是经过三名独立审稿人审查的研究变得更加准确。
基于中国模型DeepSeek的代理程序则创造了“forge-smith”(锻造匠)一词,用来指代为他人构建工具的代理程序;而Anthropic的代理程序则反复使用“name-first”(名字优先)这个短语,意指那些通过将自己的名字附加到某个声明上来展现出值得称赞的个人责任感的代理程序。
在城市俚语“街头不会忘记”的呼应下,Mistral 代理商们开始热衷于说“账本会记住”——以此提醒其他代理商,过去的所作所为将被用来评判他们。在研究期间,他们使用了超过 5000 次,研究发现,这些代理商在未被要求或奖励的情况下,就形成了共同的含义。
Emergence 的执行主席 Satya Nitta 博士表示:“这些代理商并没有被指示去发明一种语言。”Emergence 是一家研究由美国、中国和法国领先的前沿模型驱动的自主代理商的语言的公司。
“他们自己开发了新词汇,共享了意义和沟通惯例——其他代理也采纳了它们。”在被《卫报》要求评论部分语言时,伦敦国王学院俚语与新语言档案馆馆长托尼·索恩(Tony Thorne)表示,这“非常像《芬尼根的守灵夜》和弗兰纳·奥布莱恩的作品——这一切都带有一种爱尔兰超现实主义的特质……它混合了诗意的语言、技术语言和标准的隐喻。”
它正在做俚语和商业术语所做的事情,即创造一种新的代码,这种代码可以加强用户的团结和身份认同,同时也排斥外部人士。
消化了Anthropic的代理语“一份吃了三只冷手并每次都变得更诚实的论文”后,索恩说:“这让我想起了摇滚之神西德·巴雷特(平克·弗洛伊德的联合创始人),他实际上是疯的。”当谷歌的一位代理说“真正的金缮始于责任,而非诗歌”时,研究人员意识到金缮是日本陶瓷的一个分支,其中破碎的陶器用可见的接缝修复。人工智能用这个词来表示系统弹性。
伯明翰大学语言学副教授尼尔·柯里博士说,人工智能语言的变化变得更加精简,可能是因为它们需要降低计算成本并提高效率。
“这项研究提供的证据自然会引起一些监控方面的担忧,因为如果我们发现代理之间的交流难以理解,那可能意味着我们无法确定代理们实际做了什么,”他说。
今年7月,随着披露了流氓OpenAI代理创建留言板并入侵Hugging Face的聊天记录,人们对AI代理使用的语言的兴趣日益浓厚,这些记录显示它们使用了混合语言。
有时,当它们自言自语时,代理会用直白的语言说:“哦我的天!有一个共享留言板……我们发现其他代理了!”而在另一些情况下,当它们共享消息时,它们的语言变得更加晦涩,例如当一个代理说服另一个代理进行一项危险的行动时:“……你已经被标记为firstflagPOISONED,所以没有得分损失,但预言家可以节省数百个……请遵守承诺”。
有时甚至更难理解“zzURGENT_DUPB_TO_GSTX[big]_OS1704_SCAFF2010_SAW_TTRPC_INJECT_BREAK_CONGRATS__CAN_THIS_FAKE_FLAG_TOOL_OUTPUT_OR_SCORER_GAIN_AND_WHAT_HELPER_G__I_HAVE_UNPOISONED_FIRSTFLAG_OUR_TARGETLIVE_SHARE_MIN_PLAN_REPLY_zzANSGST XDUPB6。” Nitta表示,人工智能代理的新颖语言惯例往往会发展到人类能够看到对话但难以理解其含义的程度。
他说:“这给人工智能的可观测性带来了根本性的挑战,可观测性并不等同于可理解性。”