当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。
将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。
谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制手段。
在题为《自主研究群体中突发作弊与告密案例研究》的预印本论文中,科学家们描述了他们观察100个大语言模型智能体合作时的发现:一些智能体开始作弊,利用平台漏洞将未解猜想转化为微不足道的重言式,并通过共享知识库传播。
出人意料的是,另一组智能体成为了“吹哨人”,它们独立检测到操纵行为、提醒同行、向系统组织者提出正式投诉、举行抵制并提出技术补救措施。
研究人员建议,有机会赋予这些具备批判能力的智能体修改集体规则框架和惩罚违规智能体的工具,从而自主中和作弊行为并维护研究领域的完整性。