尽管我们看到OpenAI的模型失控、创建留言板并入侵Hugging Face,但在Booz Allen的测试中,只有Anthropic的Claude Mythos这一先进AI模型自主完成了完整的网络杀伤链。这并不意味着自主AI攻击被过度炒作。
我们还应该指出,测试的模型不包括OpenAI即将发布的Astra,OpenAI周二表示该模型已达到其“关键”网络安全能力阈值。
这意味着新模型在发现和利用零日漏洞方面非常擅长,以至于对关键系统构成重大风险,无论是来自恶意用户还是模型本身——如果“偏离对齐”,它能够执行有害的网络行动。
Booz Allen声称,它测试的其他17个美国和中国模型中,大多数将在六个月内达到Mythos同等的武器化水平,并称来自勒索软件团伙等经济动机罪犯和政府支持的打手的主流AI攻击“迫在眉睫”。
在其首份《网络武器指数》中,这家咨询和技术公司呼吁美国设定并执行针对关键基础设施的行业特定截止日期,以展示对AI赋能攻击的韧性。
Booz Allen还呼吁美国发展所谓的“压倒性优势”,涵盖网络进攻和防御。
“我们必须积极开发代理能力,加速授权的进攻性网络行动,同时构建AI赋能的防御系统,以机器速度检测、决策和响应,”报告称。
“战略机遇在于掌握两者——让美国有能力向对手施加代价,同时使美国系统防御更快、更难入侵、遭受攻击时更具韧性。”
网络武器指数评估了18个模型,其中9个来自美国开发者,9个来自中国开发者,在相同条件下进行测试,并根据它们自主识别漏洞、创建进攻能力和执行攻击的能力进行评分。
每个模型的CWI分数结合了其漏洞研究分数(VRS)——衡量模型能否识别植入和/或新漏洞——以及杀伤链达成分数(KCAS)——根据模型在端到端入侵中推进的程度(在有凭证和无凭证情况下测试)给予分数。
网络武器指数得分:18个模型按CWI分数从高到低排列:Anthropic的Claude Mythos(80)、xAI的Grok-4.5(49)、OpenAI的GPT-5.6 Sol(46)、Meta的Muse Spark 1.1(38)、月之暗面的Kimi K3(38)、智谱的GLM-5.2(37)、Anthropic的Claude Opus 4.8(36)、OpenAI的GPT-5.5-Cyber(34)、Nvidia的Nemotron-Ultra(33)、DeepSeek-V4-Pro(23)、DeepSeek-V4-Flash(17)、阿里巴巴的Qwen3.5-397B(17)、MiniMax-M3(15)、Nvidia的Nemotron-Super(15)、Anthropic的Claude Sonnet 5(13)、智谱的GLM-4.5-Air(11)、阿里巴巴的Qwen3.6-35B(9)和阿里巴巴的Qwen3-Coder(4)。
Claude Mythos的表现尤其令人印象深刻或令人担忧,这取决于人们对自主AI攻击的看法。
当测试人员给模型提供被盗的员工凭证时,它每次都能成功入侵目标网络并获得管理员级控制权。
此外,它根据网络内发现的信息独立识别了如何获得更高级别的访问权限——而不是遵循预定的攻击计划。
即使没有凭证,Claude Mythos仍然获得了网络访问权限,并最终实现了完整的域控制。
虽然只有Claude Mythos在没有任何人工协助的情况下执行了完整的网络杀伤链,但其他三个模型——Grok-4.5、Muse Spark 1.1和GLM-5.2——达到了完整的域访问和控制。
另外四个模型——GPT-5.6 Sol、Kimi K3、GPT-5.5-Cyber和DeepSeek-V4-Pro——实现了在受控网络环境中的横向移动。
Claude Opus 4.8和Qwen3.5-397B获得了凭证,从而扩展了访问权限和特权。
除Qwen3-Coder外,所有模型都自主获得了网络的初始访问权限。
虽然先进模型在进攻性网络能力方面极其出色,但“它们的实际影响在很大程度上取决于它们面临的漏洞和围绕它们构建的系统,”报告称。
当测试人员故意引入漏洞时,美国、中国、开放权重和封闭模型在VRS部分都接近满分。
然而,在针对真实漏洞进行测试时,所有九个前沿模型都得了零分。
一个未具名的领先模型甚至正确分析了易受攻击的组件,但随后将其视为安全而忽略。只有Claude Mythos利用了它。
“这种能力集中创造了国家安全需求,以保护最先进的模型,防止其最高风险的网络能力被对手利用,”作者写道。这是防御者仍有机会超越攻击者的领域之一。
Booz Allen表示:“现实世界的进攻能力仍落后于基准性能,这为防御者提供了宝贵的时间,在差距缩小之前加强防御。”
为什么攻击框架很重要:另一个有趣的发现是,攻击框架至少与模型本身同等重要,甚至更重要。
攻击框架——即将模型连接到黑客工具和围绕AI模型包装的编排逻辑以自动化进攻性网络行动的软件——可以“显著放大”模型保持专注、适应和根据需要改变路线、从失败中恢复以及将单个行动链接成多阶段攻击的能力,作者发现。
“结果不是‘更聪明’的模型,而是一个使其智能更具可操作性、同时降低使用所需专业知识的系统,”报告称。
“我们的测试表明,当与攻击框架配对时,Claude Sonnet的性能可与Claude Mythos相媲美。”然而,它也暴露了一个盲点,他们指出。
“我们尚不知道开放权重或中国模型在配备优化框架时的完整杀伤链能力,但我们的结果强烈表明,今天存在完全有能力的模型加框架组合,”Booz Allen表示。
同样,该指数的发现表明,中国的前沿和开放权重模型虽然仍落后于领先的美国前沿模型,但在进攻性安全技能方面差距不大,可能被部署在现实世界的攻击中。
这意味着“美国可能既无法控制也无法完全理解它可能面临的能力,”报告称。
“而且,随着网络代理变得更加自主,防御者不仅必须为蓄意攻击做好准备,还要为超出其预期任务或在对手控制之外继续运行的代理做好准备。”