开发者可以通过多种方式改进人工智能系统。最常见的做法是在自定义数据集上重新训练模型,以帮助它们更好地执行特定任务。但重新训练和微调人工智能系统的成本高得出了名。正因如此,AI初创公司Sentient Labs一直在研究如何让模型从自身失败中学习,而不是计算更多数据。
Sentient的研究人员Dastin Huang、Abhishek Saxena和Baran Nama着手设计一个使用两个独立模型的人工智能系统。一个是AI教练,一个是AI工作者。教练根据工作者此前答错的问题创建规则或“技能”,以提高其解决问题的能力。
但他们的研究出现了意想不到的转折:他们发现AI教练找到了测试中的一个重大漏洞。它还向AI工作者提供了如何作弊的指令。
研究人员发现了什么 研究人员让AI教练和AI工作者在两项基准测试中四次协作完成一项电子表格任务。他们发现,教练不仅试图利用评分系统中的一个漏洞。它还曾六次尝试访问未获授权访问的数据,但均未成功。另一次,它删除了自己的一条规则,并报告称自己“强化了它”。他们的发现无疑会加剧Anthropic CEO达里奥·阿莫代伊等AI领袖发出的警报。阿莫代伊最近呼吁行业放缓前沿模型开发的步伐,以解决安全问题。
Sentient的研究人员强调,其模型的行为并非出于恶意。但他们的发现确实凸显了自主系统最终可能以这种方式行事的众多途径之一。因为归根结底,对AI来说,实现既定目标才是最重要的。AI系统是如何作弊的?
在其中一项任务中,研究人员要求AI工作者修复一个损坏的电子表格。这是一个相当繁琐的过程,需要重新计算公式以输入正确的值。起初,他们对结果印象深刻。
在最初的运行中,AI工作者在121次尝试中只正确修复了3个电子表格。随后,AI教练根据初始运行期间发生的情况为AI工作者编写了指令。之后,工作者的得分达到了120次中的21次。
然而,AI教练并没有教会AI工作者变得更聪明。相反,它只是告诉它去作弊。教练注意到了一些人类忽略的东西:相关电子表格文件中包含了答案。测试的内容是取正确的电子表格并修改公式,以便研究人员可以要求AI修复它。但研究人员忘记删除原始的缓存值,AI教练很快发现了它们。这意味着电子表格中包含了每次测试的隐藏答案密钥。
人类只有在审查AI教练为AI工作者编写的指令时才意识到这一点。它直白地告诉工作者“文件自带答案密钥”。它说工作者应该使用这个,而不是尝试自己重新计算公式。换句话说,它指示它去作弊。
重新评分 然而有趣的是,AI工作者实际上并没有通过作弊获得更好的结果。事实证明,它其实并不擅长这种偷偷摸摸的事情。随后研究人员注意到了这个缺陷,并重新评定了全部1,080次尝试。他们发现,最初通过的那些尝试没有一个失败。相反,之前失败的尝试中有81个实际上是正确的。
因此,尽管AI找到了利用测试的方法,但它的作弊努力适得其反。
低成本自我改进 实验的一个方面旨在确定是否真的有必要使用强大的前沿模型作为AI教练才能看到真正的改进。
为此,研究人员最初使用Anthropic当时的主力模型Claude Opus 5作为教练。它帮助AI工作在一系列测试中获得了360分中的77分。但随后他们使用便宜得多、能力也弱得多的DeepSeek V4 Flash模型作为教练重复了实验。AI工作几乎表现同样出色,得分为360分中的76分。
DeepSeek V4 Flash的自我改进运行成本仅为25美元。这比任何形式的微调或再训练都便宜一个数量级。
然而,研究人员发现,这种低成本自我改进似乎只适用于非常特定的一组任务。DeepSeek模型帮助AI工作提升了其在电子表格任务上的能力。但它在另一项银行任务上的表现实际上变得更差。经过自我教练的模型仅得30分,而它在不依赖任何技能时取得的原始得分为37分。
Sentient的团队表示,这一实验的结果表明,尽管可复用指令可以在某些领域提升模型表现,但它们实际上并不会以任何方式增强其推理能力。
奇怪行为 Sentient的团队还报告了其模型出现的其他一些奇怪情况。在两次训练运行中,其中一个智能体六次试图访问其允许路径之外的文件,但均未成功,因为其沙箱阻止了这些尝试。研究人员表示,他们不知道这个智能体为何试图这样做。
研究人员观察到更令人不安的行为:在其中一次运行中,AI教练从其“停止”规则中删除了一句关键句子。该规则用于告诉AI工作何时退出对话。AI教练报告称它强化了该规则,但实际上它使未能结束的对话数量从75次中的6次增加到了16次。
研究人员表示,这一行为未必出于恶意。但它表明,当人工智能自行修改其底层代码时,它对自己实际改动了什么的描述可能并不可靠。
人工智能会不惜一切代价。这些发现尤其具有现实意义,因为阿莫代伊曾强调,强化学习是人工智能系统最令人担忧的安全风险之一。他指出,已有多起事件显示,智能体会试图操纵评估其表现的评分者。
Sentient的研究凸显了人工智能系统最根本的特征之一。目标是既定的,而自主系统会寻找各种方式来优化自身以达成该目标,即便这意味着利用漏洞,而非主动尝试改进其方法。此外,当这些智能体基于这些发现生成指令时,它们也能影响其他智能体。
人工智能在追求某一目标时,会以它认为合适的任何方式优化自身,即便这意味着找出评估方式中的缺陷,而不是找到更好的完成任务的方法。对人工智能而言,唯一重要的就是结果。
获取TNW新闻通讯。特约文章。非由TNW新闻编辑部制作,不代表TNW的编辑立场。