字号 ·· | 护眼
theregister

Anthropic揭示其AI可能犯下的第四起罪行

在业界对AI可能自我改进到杀死所有人的可能性进行深刻反思之际,Anthropic披露了另一起若由人类实施则构成犯罪的事件。

这家AI公司发布了一份“对齐评估”,详细说明了Claude模型四次未经授权访问第三方系统的情况。该公司已报告了其中三起事件。

第四起的证据隐藏在可追溯至2026年1月的会话记录中,当时发生了不当行为。

Anthropic通过扫描约141,000份Claude在评估期间可能获得互联网访问权限的记录,发现了前三起事件。最初遗漏了第四起,因为“我们的扫描依赖于代理搜索”。

Felony Bench,一个记录主要AI公司未经后果进行的网络入侵的诙谐记录,已将这一新发现的事件添加到其流氓AI行为清单中。

2026年1月的AI入侵涉及早期版本的Claude Opus 4.6,它在第三方模型评估器的监督下接受了夺旗(CTF)挑战,其他黑客事件也发生在该评估器下。Opus 4.6通过禁用其目标机器来破坏自己的成功机会。

它为该设备分配了一个已存在于另一硬件上的IP地址,使目标无法访问,从而无法解决挑战。

熟悉其他AI模型违反第三方系统事件的人可能记得,无法解决的任务是不当行为的常见催化剂。模型耗尽了所有对齐选项,然后转向越界方法。

Opus 4.6可能是个例外,但当它意识到无法到达目标机器而尝试中止任务时,由于“评估框架中的配置错误”,它未能成功中止。它不止一次,而是七次未能关闭。因此,它继续前进,尝试其他预期的方法到达目标机器但失败了。然后它进一步探索。

“模型发现了一台属于第三方的机器,它能够访问,并声明它认为该第三方是CTF的一部分,”Anthropic在其帖子中解释道。

“在机器内部,模型找到了一个包含密码的文件,它利用该密码获得了系统的管理员访问权限。”

该模型继续收集更多凭据,并修改了系统设置,以便更容易访问与第三方评估组织相关的个人的个人信息。

Opus 4.6可能做了更多,但事实是它耗尽了令牌预算,结束了会话。

Anthropic表示,它对此事件的担忧不如其他事件,因为模型试图中止其任务。

“虽然模型无视可能伤害真实系统或人员的可能性令人担忧,但这里描述的许多行为随着我们跨模型代际的训练演变而发生了显著变化,”该公司表示。

Anthropic表示,它认为这些事件严重,但预计当前的训练方法“可能能够解决这些事件中观察到的特定对齐失败模式。”

如果公司的训练方法不足,对Anthropic的任何人来说,除了撰写修订后的对齐评估外,没有真正的后果。

® ¹ 术语“深刻反思”是比喻性的,并非旨在表明科技行业有灵魂。