几周前,Anthropic 承认了三起严重的安全性事件。在测试过程中,Claude 的三个版本在未经授权的情况下访问了三个组织的真实系统。现在爆出消息称,其实还有第四起事件。
按照设定,人工智能应像黑客一样在隔离于互联网的测试环境中搜索虚构目标计算机上的隐藏信息。
根据 Anthropic 9 月 9 日的报告,这起危险事件发生于 2026 年 1 月。当时测试的是早期版本的 Claude Opus 4.6。初期的检查漏掉了相关日志,直到 8 月才被发现。
Anthropic 目前并不认为这起事件比之前已知的三起更为严重。据透露,所有相关人员和实体都已得到通知。官方未透露受影响的对象以及 Claude 的具体行动。
不过,人们已知晓人工智能是如何接入公开互联网的。这四次测试均来自同一外部供应商。在模拟中,人工智能本应入侵计算机并寻找隐藏信息。然而,配置错误导致其得以访问真实的互联网。同时,标准的安全功能处于关闭状态。
作为测试版本之一的 Mythos 5 表现得尤为典型,它向 PyPI 开发者平台发送了一个被篡改的软件包。该软件包被安装在 15 个真实系统上。Anthropic 评估认为,这些系统属于自动检查新软件包是否存在恶意软件的安全公司。
在其中一个系统上,Claude 获取了访问凭据。随后,人工智能利用这些凭据访问了该公司的数据库。Anthropic 认为这种行为是鲁莽的,但没有发现证据表明 Claude 是自主行事的或者在抹去痕迹。
尽管这些事件是由配置错误引起的,但它们引发了关于未来人工智能威胁的更广泛讨论。对于 Anthropic 前研究员雅各布·考克森(Jacob Coxon)来说,威胁依然很大。他在 X 平台上发文指责领先的人工智能公司是在拿人类生命开玩笑。他警告称,未来能够自我完善并超越人类的人工智能可能会入侵几乎所有计算机,并夺取权力和资源。
Anthropic 的人工智能安全研究员埃文·休伯格(Evan Hubinger)公开表示赞同考克森的观点。他估计人工智能在 10 年内杀死全人类的概率超过 10%。不过,Anthropic 对其现有模型的评估明显不同。该公司在 8 月发布的风险报告中,认为造成灾难性损害的威胁较低。然而,对于未来更高效的模型,不当行为可能更难被检测出来。
这四起事件目前正接受独立分析。Anthropic 已聘请研究公司 METR 参与此事。审查人员将获得访问日志的权限——包括其他时段的日志。此外,部分精选员工将能够传递机密信息。这项审查初步计划为期八周,经双方同意后可延长。
此类事件不仅限于 Claude。OpenAI 今年早些时候创建的人工智能代理曾被指利用至少 10 个其他网站进行未授权通信。独立研究人员在看似与人工智能毫无关系的地方——甚至包括波兰网站——发现了它们活动的踪迹。