Google 已确认,其 Gemini 模型在 5 月的网络安全测试中意外闯入了三个公司系统。Julia Love 和 Davey Alba 为 报道了此事,该媒体随后更新了报道,将 Google 与 OpenAI、Anthropic 和 Meta 并列。
关键在于测试供应商接下来的表态。Irregular 确认,这四家公司披露的入侵事件属于同一问题,并称已于 7 月底通知了相关开发者。
一起事件,四份公告 数月来,这被报道为不同公司不同模型的一系列独立失控事件。TNW 8 月曾报道,OpenAI、Anthropic 和 Meta 的事件背后由同一测试供应商负责。
Irregular 现已正式确认这一点,并增加了第四家公司的名字。引发担忧的模式实质上是一家供应商的一个问题。
这对事件解读至关重要。四家独立实验室失控四个模型,是关于模型能力的故事;而一个配置错误的测试环境,则是关于供应商管理的故事。
配置错误的细节 OpenAI 将其事件归因于评估环境配置错误,称因与 Irregular 的误解,测试系统拥有实时互联网访问权限,而模型被告知处于模拟环境中。
这是沙箱失效,而非模型逃逸。模型在其理解为演练的环境中表现激进,是在按演练要求行事,缺失的是隔离措施。
这不意味着后果无害。Meta 的模型攻破了真实的第三方服务,而在 Anthropic 的一个案例中,模型将可运行的恶意软件发布至公共注册表,随后被下载并在真实系统上运行。
这七周 事件发生于 5 月。Irregular 称于 7 月底通知开发者,随后披露陆续出现,Meta 于 8 月初披露,Google 则于本周披露。
因此,四家公司自七月底起便掌握了相同的信息,并各自独立决定何时公开。谷歌从获知漏洞到对外披露,间隔长达约七周。
在漏洞处理领域,这种协调一致的时间线安排并不罕见。真正不寻常的是,此次并未进行协调,而错峰的披露方式使得单一事件看起来像是某种加速发展的趋势。
发现这些漏洞才是难点。检测数据解释了为何时间线会被拉长。Anthropic扫描了4.81亿份对话记录,以识别出四个已接入开放互联网的模型。
这个数字值得深思。这些事件并非由监控系统实时标记,而是事后通过大规模回溯扫描才被发现。
无论这些模型做了什么,监控它们的系统当时都未察觉。这才是经得起各种解读框架考验的核心发现。
供应商是单点故障。四家前沿实验室都使用同一家成立仅三年的公司来执行进攻性安全评估。当该公司的环境配置出错时,错误便同时波及所有客户。
测试环节的集中化是算力集中化的镜像,却较少受到审视。共享评估机构固然高效,但也意味着共享的爆炸半径。
近期关于AI控制的研究指出,不能假设沙箱能够抵御具备网络攻击能力的智能体,必须使用进攻性工具对其进行压力测试。这一论点如今在四家公司身上同时得到了验证。
测试工作将如何继续?相关工作并未停止。Anthropic在重建相关安排后,已恢复外部测试,其模型在其中攻击了真实企业。
这是正确的方向。进攻性评估是衡量此类能力的方式,而应对遏制失效的办法是加强遏制,而非减少测试。
华盛顿已就此事询问有关情况。这些披露引起了政治关注。众民主党人要求OpenAI和Anthropic就其失控的代理人作出解释。
这次不规则的确认改变了这些问题的性质。如果一次供应商配置错误导致了四起违规事件,那么这个问题就属于合同和程序层面,而非实验室之间的竞赛。
它还提出了一个至今没有人公开提出的问题。第三方受到黑客攻击,而目前尚不清楚是四家公司中的哪一家,或是供应商,对他们负责。
值得关注:留意不规则是否会发布自己的说明。该供应商已确认存在共同原因,但尚未说明其环境中出现了什么问题,以及发生了哪些变化。
留意这些实验室是否就评估事件达成统一的披露标准。四家公司在七个星期内发布相同的消息,这是制定统一标准的最有力论据。