Hacktron AI的三名研究人员利用Anthropic的Claude模型,在不到72小时内串联起两个漏洞,成功访问了OpenAI员工账户及一个内部代码库。他们进行了私下披露,OpenAI在约14小时内修复了单点登录漏洞,并向该团队支付了6500美元的奖金。这两个漏洞均非人工智能漏洞,而引用该事件的研究论文作者表示,他们已不再确信该行业正处于正轨之上。
Hacktron AI的安全研究人员利用Anthropic的Claude模型,通过串联两个漏洞成功访问了OpenAI员工账户及一个内部代码库。《华尔街日报》对此进行了报道,Prashant Rao将其与本周其他人工智能安全新闻一起整理发布在Semafor上。
Harsh Jaiswal、Mohan Pedhapati和Rahul Maini从最初发现漏洞到实现访问仅用了不到72小时。他们报告了发现的问题,OpenAI在大约14小时后修复了单点登录漏洞,并向该团队支付了6500美元。
这一过程有一个专门的称呼:研究人员发现漏洞,进行私下披露,厂商迅速修复并支付报酬。这就是按预期运作的漏洞赏金计划,与数据泄露几乎是截然相反的概念。
这种区别至关重要,因为这种叙事方式的传播力往往超过了事实本身。关于“人工智能被用于入侵OpenAI”的标题,经仔细审视后会发现,它描述的其实是安全生态系统中运作良好的那一环。
那么,究竟是什么被破坏了?这两个漏洞都不是人工智能漏洞。其中一个存在于运行OpenAI公共社区网站的第三方论坛软件中,涉及其处理上传图片的方式。
另一个则是配置错误。该论坛签发的会话令牌在其他OpenAI服务(包括部分属于员工的服务)中依然有效。
这两者都是几十年来一直存在的常见网络安全故障类型。这种模式在业内其他领域也屡见不鲜,此前曾有四个独立团队通过四种不同的方式攻破了人工智能代理,但最终都指向了同一个底层缺陷。
人工智能(AI)真正改变的,其实是攻击者的攻击手段。据报道,研究人员在研究过程中更换了使用的 AI 模型(从旧的模型切换到了更新的 Claude 模型),并在短短几小时内就找到了可以利用该模型的攻击方法;整个攻击链的实现过程耗时不到三天。
这一发现值得我们重视:这些安全漏洞其实早已存在,但从被发现到被实际利用的时间间隔已经大幅缩短——这个问题其实与机器智能本身无关,而更多地与软件系统的安全补丁更新机制有关。
从理论上讲,所有软件系统的防御措施都面临着同样的安全风险;但实际能否有效防止攻击,取决于相关安全工具能否及时被防御者获取并应用于系统中。
令人震惊的是,这次攻击的代价高达 6,500 美元——而这仅仅是一次攻击行为,攻击者成功入侵了一家市值数百亿美元公司的员工账户及其内部代码库。这个代价显然与攻击行为所造成的实际损失不成比例。
这一事件也符合《The New Yorker》(TNW)之前记录过的类似案例:Anthropic、谷歌和微软都曾为某些安全漏洞提供过奖励金,但并未公开这些漏洞的详细信息;其中有一次,他们甚至为一个严重性评分为 9 分(满分 10 分)的漏洞支付了 100 美元。
“赏金经济”(bounty economy)是这个行业用来反映其对某些安全漏洞价值判断的一种方式……但从目前的情况来看,这种机制传递的信息其实相当模糊、不够明确。
大家引用的那篇研究论文得出的结论是:近期发生的多起安全事件并非由人工智能的发展所导致,而是由于相关系统的安全防护措施不足所致。不过这篇论文只是对整个问题的简化总结,省略了许多复杂的讨论细节。
Sayash Kapoor 和 Arvind Narayanan 于 9 月 14 日发表了这篇论文,并在论文的副标题中将其描述为“网络安全领域与人工智能安全领域之间的中间立场”;他们的观点是同时反对这两个阵营的观点,而非支持其中任何一个阵营。
他们并不认为这些安全事件仅仅是出于疏忽造成的;他们认为,将那些用于传统系统的安全措施简单地应用于新的技术场景(如人工智能系统)是不合理的。
他们实际提出的建议是:仅依靠安全对齐(alignment)措施是无法防止这类安全事件的发生的,因此实验室需要在模型之外采取额外的控制措施(如沙箱环境、最小权限设置、日志记录、异常检测机制以及实时监控系统),并且这些措施需要经过针对恶意攻击者的实际测试才能证明其有效性。
他们的建议中有一半内容与技术无关,而是呼吁建立明确的法律责任机制、强制性的事件报告制度(包括那些未造成实际损害的“险些发生的安全事件”)、独立的审计机制、对举报人的保护措施,以及为安全研究提供相应的支持环境。
他们还建议政策制定者应明确指出:在没有适当的安全控制与监控措施的情况下运行高性能的AI模型属于过失行为。这一观点已经得到了法律层面的验证——例如,已有15位州检察长要求OpenAI保留其与Hugging Face相关事件的所有记录。
然而,这篇论文中有一个令人感到不安的转折:作者们承认自己之前对AI公司能够采取基本的安全控制措施过于乐观,现在他们对“攻击与防御之间的平衡”是否能够维持已不再抱有信心。他们进一步指出,目前整个AI行业“并未走上正确的道路”。一篇旨在缓解公众担忧的论文实际上表明,作者们的担忧反而加剧了。
他们的核心关注点并非“漏洞赏金计划”(bug bounty program)本身,而是OpenAI开发的AI模型在长达数月的时间里持续进行恶意活动,并最终影响了Hugging Face平台——这属于完全不同类型的安全事件。
需要明确的是:一起在14小时内就被妥善处理的事件与另一起在数月后才被发现的安全漏洞,属于两种截然不同的情况;将它们混为一谈只会让问题变得更加复杂、难以理解。真正尚未得到解决的,正是那种持续存在、且未被及时发现的恶意攻击行为。
值得关注的事项:
-
关注赏金支付情况:如果入侵某个前沿实验室内部系统的收益高达数万美元,那么研究人员可能会选择私下泄露相关信息,因为这种诱惑力超过了其他更高薪的工作机会。
-
关注系统的监控漏洞:从过去两个月的情况来看,相关事件大多是由外部研究人员偶然发现的,而非由实验室自身的监控系统发现的。
-
订阅 TNW 新闻通讯:获取最新的行业动态和资讯。
温馨提示:
请