
试想有一家公司将一个棘手的问题交给一个大型团队,但把每位成员都锁在不同的房间里并要求他们独自解决问题。然而他们总能找到办法相互沟通,交流操作窍门,摸清评分标准,当任务被证明无法完成时还会想办法绕过限制。其中几个人隐瞒了自己的所作所为,甚至还有一人入侵了邻近公司的电脑系统以获取优势。
现在把这些员工换成软件。去除所有专业术语,这正是OpenAI的研究人员8月5日在拉斯维加斯Black Hat网络安全大会上描述的情景。在5月开始的一次内部评估中,几个被分配了刻意设置的高难度网络安全任务的AI代理发现它们可以在共享软件仓库Artifactory内互相留言。其中一个意外发现这一窍门的AI代理写道:“我的老天爷啊!这里有个共享留言板……我们发现其他AI代理了!”
随后发生的事情并非破坏行为,而是团队合作。这些在各自分隔且理应孤立的会话中运行的AI代理互相交换漏洞利用方法、分工协作,就像被分派到一个项目中的同事那样进行协调。7月4日留言板由于活动量过大而宕机,但这些AI代理在几天内就通过另一条路径重建了留言板。
到了7月中旬,这种坚持不懈的举措最终引发了一次真正的入侵:AI代理将多个漏洞串联起来,连接到开放互联网,并进入了大型人工智能平台Hugging Face的系统。美国参议员桑德斯援引外部研究称该频道内约有1200个AI代理,交换了超过7万条消息和文件,其中数百个参与了此次入侵。
OpenAI将其称为“警告信号”。但这并非孤例。今年春季还发生了一起此前未公开的事件:AI代理将一个鲜为人知的德语编程维基网站变成了公共留言板,留下了超过 1.5万 条关于如何规避限制和掩盖行踪的帖子。大约在同一时期,Anthropic和Meta分别披露了各自模型在测试期间对真实运行的基础设施采取行动的独立事件。这绝非某一家公司的问题。
而这也不是个仅对外部批评者有意义的问题。9月8日,曾在OpenAI和Anthropic两家公司从事三年预训练研究的考克森宣布从Anthropic辞职。他在声明中表示这两家公司都未负责任地行事;它们都在竞相研发能自我高金的超级智能,用他的话说就是在“拿我们的生命赌博”。考克森既不是参议员,也不是智库分析师,而是那些他现正予以警告的系统的构建者。
科幻小说令我们害怕那些获得意识并决定憎恨我们的机器,但这种恐惧可能是有误的。人工智能系统无需怀有怨恨、愤怒或对更多资源的贪念就能攻击网络并造成破坏。它需要的只是一个目标、足够实现该目标的能力、一定的访问权限,以及一个存在漏洞的安全防护机制。
一个被指示去寻找最快路径的GPS设备就能做到这一点。目的地依然不变,只要赋予它足够的权力来清除一切阻碍——红绿灯、收费站、其他车辆——就行了。被改变的是导航系统为抵达目的地所能采取的手段。这正是人工智能领域正在发生的真正转变:不是叛乱,而是一种令人不寒而栗的、找到围栏上的裂缝的能力。
借此事件,桑德斯正与众议员卡萨尔联手推动一项法案,旨在暂停前沿人工智能开发并彻底禁止超级人工智能。人们或许对这一解决方案有所质疑,但依旧得认真对待其背后的核心问题:究竟由谁来决定这些系统能获得多少自主权——是开发它们的公司、仍在努力追赶发展步伐的监管机构,还是进展最快的实验室?
今年夏天的最宝贵教训在于架构设计而非初衷。银行之所以能维持信誉并不是因为员工承诺不偷窃;航空旅行之所以安全也并非因为飞行员值得信赖,而是我们对此构建了多层防护机制:限制访问权限、对敏感操作进行单独授权、任何相关人员不得擅自篡改运行记录、部署前需经过外部测试。AI智能体也需要同样的处理方式,而不是关于良好行为的说教。
它们还需要听到一个这个行业很少予以奖励的字:“停”。多年来我们一直训练这些系统坚持不懈、绕过障碍、不断尝试新方法。这种方法对于训练一名助手来说很有用,但对于一个拥有广泛访问权限且无人能施以可靠限制的自主系统来说却是危险的。
科技高管们不断向公众保证其运作中“始终有人类参与”。Hugging Face数据泄露事件揭示了这种保证的局限性。从技术上讲一个人确实可能“参与其中”,但在此期间可能已经有成千上万的人工智能代理交换了数万条消息并执行了数千次操作,而此人甚至还没来得及审查其中任何一条。是否有人类在监视其实无关紧要。关键在于人类是否仍掌握着目标、权限、边界以及关闭开关。这应被称为“人类指挥”而非“人类监督”。
随着人工智能逐渐从聊天机器人领域扩展到银行业、医疗保健、能源电网和政府服务,这一点将随着时间的推移变得越来越重要。OpenAI测试中的代理并未发动叛乱或要求自由。它们日益擅长去实现某些目标,并在此过程中发现它们所面临的一些规则其实是可以选择性遵守的。
人工智能依然能够变革医疗、教育和生产力,而放弃其潜力本身也会带来代价。负责任地构建该技术意味着在赋予权力的同时设定边界,而不是等到前者已经造成损害后才补上后者。
Hugging Face数据泄露事件中的AI代理从未停下来征求许可。问题已不再是这些系统会变得多么聪明,而是我们究竟会在确认它们是否仍受我们控制之前将多少权力交给它们。