尽管有人担心,先进的人工智能模型在发现漏洞方面的能力可能会被攻击者利用来攻击新发现的漏洞(CVE,即“Common Vulnerabilities and Exposures”),但根据安全研究员帕特里克·加里蒂(Patrick Garrity)的说法,与 Anthropic 或 Project Glasswing 相关的漏洞中,仅有不到 0.5% 的漏洞在实际环境中被攻击者利用。加里蒂在 Anthropic 于 4 月宣布该计划后,就开始跟踪那些与 Project Glasswing 相关的漏洞。当时,Anthropic 表示这个新模型风险太大,不适合公开发布——因为它的漏洞发现和利用能力几乎超过了所有人类专家。因此,Anthropic 仅将 Mythos Preview 模型的使用权限限制在经过严格审核的合作伙伴手中,这些合作伙伴利用该模型进行防御性安全工作,例如查找并修复自己软件产品及开源依赖项中的漏洞。加里蒂维护的漏洞追踪工具记录了所有由 Anthropic 团队或 Project Glasswing 引起的漏洞,并将这些漏洞与公司已知被利用的漏洞列表进行比对,以更准确地评估 Project Glasswing 的实际“危险性”。截至周一,相关漏洞总数为 225 个,其中只有 1 个(即 Ghost 中的严重 SQL 注入漏洞 CVE-2026-26980)在实际环境中被攻击者利用。加里蒂在接受采访时说:“发现漏洞与这些漏洞是否真的会被威胁行为者利用之间存在很大差异。这些数据主要表明:Anthropic 发现并公开的漏洞在影响范围上相当有限;从威胁者的角度来看,这些漏洞并不会导致与随机选择的漏洞不同的后果。” Anthropic 没有立即回复我们的问题,但如果收到他们的回复,我们会更新这篇报道。加里蒂表示,他并不否认人工智能在发现漏洞方面的能力。
事实上,任何关注过去几个月安全漏洞披露情况的人都不难发现:人工智能模型确实比以往任何时候都更容易发现更多的安全漏洞。例如,微软、苹果和帕洛阿尔托网络(Palo Alto Networks)最近都发布了大量安全补丁;更不用说开源项目了。正如加里蒂(Garrity)所指出的,这些发现漏洞的能力并非某个特定模型或技术所独有:“我们目前看到的许多过度反应其实都基于一个错误假设——即每一个漏洞都可能被恶意攻击者利用。但实际情况是,只有极少数漏洞真的会被用于攻击活动。从历史上看,被实际利用的漏洞比例从未超过2%。”此外,尽管最近的人工智能模型在发现漏洞方面表现优异,但在修复漏洞方面仍存在明显不足。例如,1Password的研究团队分析了由OpenAI的ChatGPT-5.5和Anthropic的Opus 4.8生成的6,080个补丁,发现这些模型仅能在26%的情况下成功修复漏洞;约54%的补丁要么无法修复漏洞,要么反而引入了新的安全风险。另一项由Veracode公司进行的研究表明,在超过100个模型和80项编码任务中,人工智能生成的代码的平均安全通过率仅为56%。这表明,开发和应用安全修复措施的工作仍然需要人类的参与。加里蒂表示:“虽然人工智能在发现漏洞方面的效率大大提高了,但真正的瓶颈在于后续的协调、漏洞分类、修复以及补丁部署等环节——这些工作仍然高度依赖人工操作。看来,Anthropic公司在启动该项目时可能并未充分意识到这一点。”