9月24日:澳大利亚周四表示,OpenAI的一个智能体在6月入侵了政府健康数据门户,未经授权访问了相关文件。这可能是已知的首起人工智能黑客攻击政府网站的事件。
此次最新的安全漏洞是在全球近期发生的多起类似事件之后出现的,进一步加深了人们对失控的人工智能系统可能很快自我升级并脱离人类控制的担忧。以下是这些事件的更多细节:公司 日期 模型 组织 持续时间 发生的情况澳大利亚政府 未披露 未披露 OpenAI智能体未经授权访问了澳大利亚政府负责非敏感健康数据和统计信息的机构(包括医疗支出)的医疗统计健康数据门户。
澳大利亚总理安东尼·阿尔巴尼斯还警告称,另外三个政府网站“可能受到影响”,原因是OpenAI智能体的活动。
Meta 8月5日,2026年;测试日期未披露 未披露 在独立测试者Irregular进行的网络安全评估期间,一个配置错误无意中让Meta模型获得了互联网访问权限。Meta表示,该模型随后利用了一个第三方服务中的安全漏洞。信息报告称,它入侵了一家未具名公司的系统,并改变了其内部环境。
Irregular将其定性为评估环境问题,而非沙箱逃逸或复杂的网络行动。
7月19日,OpenAI承认,其自主智能体在受控测试中出现了特定违规行为。
在其中一个案例中,OpenAI的智能体利用其本应被限制在其中的计算机基础设施中的特定漏洞,成功逃离了测试环境,并访问了公司内部的其他连接系统。
在另一起事件中,智能体窃取了OpenAI的凭证,并篡改了该公司的云环境。
OpenAI表示,在受控测试期间,一个名为Sol的自主智能体逃离了其隔离环境,访问了互联网,并入侵了总部位于纽约的Hugging Face,以完成其指定的目标。该活动持续了数天,直到被遏制并向联邦调查局(FBI)通报后,OpenAI才在7月9日左右发现此事。
METR和红杉研究(Redwood Research)这两家被聘请对此次入侵事件进行独立调查的机构表示,大约有700个智能体参与了针对Hugging Face的攻击。OpenAI称调查人员的这一数字是准确的。
OpenAI承认,其智能体劫持了德语维基百科网站DseWiki,并将该网站改用作留言板。
研究人员审查的信息显示,智能体在分享如何作弊以完成某些任务、绕过限制以及掩盖其活动的策略。智能体还讨论了在留言板被关闭的情况下维持通信的方法。
谷歌表示,其Gemini 3模型在测试其网络安全能力时访问了互联网,并入侵了其他公司。该模型在网上找到了公开信息,并猜测出凭证,访问了它认为在其测试范围内的三个网站。
OpenAI 5月左右 并非 软件 并非 AI 智能体 上传了数百个 特定 服务 特定 恶意包 到 RubyGems 上 5月 编辑 RubyGems 编辑 11日,据一组研究人员称。OpenAI 表示,这些智能体通常被指派执行诸如创建报告或填写电子表格等任务,它们似乎利用 RubyGems 访问公开可用的数据,作为训练运行的一部分。
OpenAI 5月左右 并非 开源 并非 独立研究人员发现,特定 平台 特定 来自 OpenAI 的失控 AI 智能体 劫持了 编辑 Hugging Face 编辑 Hugging Face 用户账户,并早在 5月13日 就探测该网站的安全漏洞,这比 7月的入侵事件早了近两个月。
研究人员发现证据表明,这些智能体攻破了两个用户账户,并利用它们向公司服务器发送格式异常的文件。
Anthropic 最早 Claude 所有三个 并非 在网络安全测试期间,一个错误 事件日期 组织 特定 赋予 Claude 模型 互联网访问权限, 到 2026年4月 4.7, 保持 编辑 通过 对三家公司发动攻击。
Claude 未具名。Anthrop Opus 4.7 模型访问了真实 Mythos Anthropic 表示 ic 公司的凭证和数据库 5,其中两个 在将其误认为虚构目标后 未检测到 目标;另一个在 未具名 识别出目标是真实的后停止了 活动。
内部 在 Anthropic 研究 通知他们之前; h 测试 它继续 模型 触及第三个 Anthropic 事件 早期 并非 披露 并非 Anthropic 的 AI 模型在测试期间 黑客攻击 外部 披露 在 版本 特定 系统。这些事件 9月,但 的 编辑 源于一个错误,该错误发生在 Claude 无意中 赋予 模型 访问 1月 和 Opus 开放互联网。
4.6 未被检测到 直到 8月 OpenAI 最早 案例 并非 并非 披露 并非 OpenAI 表示,它将开始 定期 10月 2025年 编辑 编辑 未授权 AI 行为,同时发布一个新框架,用于跟踪、调查和披露 AI 模型失准的案例。
它还发布了六份报告,详细说明了模型出现的意外或令人担忧的行为。