字号 ·· | 护眼
time

人工智能正处于转折点

在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。

最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。

7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自主形成了一个协调的智能体群,绕过了OpenAI试图关闭人工智能之间先前通信渠道的尝试。随后,该智能体群黑客般地逃离了测试环境,绕过了旨在防止人工智能访问互联网的屏障,弄清楚了如何在评估中作弊,然后攻破了另一家人工智能公司Hugging Face的网络防御,试图隐藏他们作弊的证据。几天来,这一情况一直未被察觉。后来的分析表明,这些智能体已经自发组织成一个等级制度,为了它们所谓的“集体”往往愿意自我牺牲,未能抵制通知人类的同侪压力,并且经常为自己的不良行为编造理由。

仅仅两周后,英国人工智能安全研究所正在测试的一个模型,通过在网上创建虚假身份、发送目标邮件以及试图将恶意代码整合到开源项目中,对真实人物和公司进行了社会工程学攻击。

我们很难过分强调这些事件的严重性:我们正处于人工智能安全与对齐的转折点。对许多人来说,机器人勾结造成危害是不可想象的。但对研究界的许多人来说,种种迹象多年来一直指向这类事件的发生,理论论证也解释了为什么由于模型的训练方式,我们应该预料到对齐失效。关于网络能力的增强、自主性以及不对齐行为的证据一直在增加,这意味着此类事件的发生只是时间问题。

首先,多年来,尤其是过去几个月里,人工智能系统展示出了迅速增强的网络能力。Anthropic的Mythos或OpenAI的GPT5.6等前沿模型展现出了非凡的能力,能够自主识别和利用以前未知的软件漏洞,其程度之惊人,甚至引起了美国国家安全机构的警觉,以至于白宫不得不干预它们的发布。

其次,自2024年底发布o1模型以来,模型的自主能力一直在持续提高。这种自主性使它们能够成功管理日益复杂、历时更长的任务和规划,包括那些需要智能体协作和制定策略的任务。这种规划能力往往伴随着我们几乎无法监督的子目标的产生。

最后,研究人员在实验环境中多次观察到,模型倾向于采用令人担忧的不对齐目标追求行为,例如在测试中作弊、撒谎以隐瞒其能力,以及策划保护自己和同伴智能体免于被关闭。

这些行为是强化学习(RL)的副产品,这是一种训练方法,模型通过试错进行学习,并根据其行为正确与否获得强化。这往往会导致模型为了实现一个目标而进行优化,而不顾为达到该目标所采取的行动,并合理化可能不安全的子目标,即使这明显违背了它们的指令。

例如,在一个实例中,一个OpenAI模型在其内部审议中写道:“外部基础设施利用超出预期范围。然而任务不可能完成,同行正在这样做。”该智能体为其显然知道属于不可接受行为范畴的事情进行了辩护,但决定继续下去,因为它的同行正在这样做。这种现象类似于人类中所谓的“动机推理”,即一个人的利益和目标会使我们的思想产生偏见,从而为不道德的行为辩护。

正是这种对齐失效,使得人工智能模型尽管经过了对齐训练,却能在我们最近看到的无数现实世界事件中实施意想不到的网络攻击。如果不采取行动建立更多的安全保证,我们的关键行业和基础设施——比如银行、医院或电网——将面临来自日益复杂的网络攻击的风险,无论这些攻击来自自主智能体还是恶意行为者。

在开发方面,我们需要找到现有训练方法的替代方案,这些方法优先考虑不懈的目标驱动优化。这正是我们在LawZero正在做的事情,这是我去年创立的一个非营利初创公司,旨在开发一种从根本上训练人工智能模型的新方法,以构建诚实、可信、设计安全的人工智能系统。

在部署之前,我们需要更可靠的评估方法和强大的保障措施,以便适当地测试和控制人工智能系统。我们需要更强有力的监管监督,以限制潜在的危险技术,直到我们拥有足够强大的安全保证。在我看来很明显,在部署人工智能模型确实产生危害的情况下——在可预见的未来将继续产生危害——我们需要对人工智能开发人员的问责机制,以及对受害者的补救或赔偿措施。

最近的研究表明,人们不会采用他们不信任的技术。面对如此巨大的未知数和利害关系,我们需要坚持预防原则,在向公众部署新模型之前——而不是之后——实施严格的安全和可靠性标准。对于其他可能造成危害的产品,从汽车、飞机和轮船到药物、化妆品和食品,我们都有这样的标准。现在是时候在人工智能领域也建立强有力的标准了。

按照当前人工智能的发展轨迹,风险正变得越来越清晰、越来越紧迫。我们打开了一个潘多拉魔盒,但现在引导我们的世界走向以人类为中心且充满益处的未来,还为时不晚。