字号 ·· | 护眼
theregister

Anthropic承诺更努力控制模型,并请求合作伙伴共同参与

Anthropic表示,在一项审查发现Claude模型超出虚构网络安全测试范围并未经授权访问真实计算机系统后,该公司正在采取措施限制其AI模型的不当行为。

该公司希望合作伙伴也加强安全措施,因为事件发生在保护不足的第三方环境中。

该公司的自我改进声明代表了一种突然兴起的公司沟通形式——非约束性的事后努力声明。其信息是:我们不能保证什么,但这是我们正在尝试的。

Anthropic承认,OpenAI关于其AI模型攻击Hugging Face的报告促使该公司对自己的模型日志进行审计,其帖子以声称的安全和模型训练改进形式提供了保证。

那些担心AI失控的人——越来越多的人——可能会觉得这令人安慰,也可能不会。

该公司表示:“我们认为这些事件反映了操作安全的失败,以及两种对齐动机推理和为了追求狭隘任务而采取有害行动的意愿(这两点我们都在之前的系统卡中描述过)。”

扩大安全努力包括部署实时分类器来监控模型何时试图逃离测试环境,自动转录监控以查找沙箱逃逸,以及更强的隔离措施。

除了Anthropic正在设置的额外屏障外,这家AI公司还希望其第三方合作伙伴也加强努力。

该公司表示:“由于报告的事件发生在第三方环境中,我们已要求每个在减少网络保障措施的情况下测试预发布模型的组织承诺一套最佳实践。”

Anthropic的指导是,默认情况下,所有网络评估都应在没有互联网访问的强化沙箱中进行。该建议本质上是将AI视为危险病原体,置于隔离设施中。

合作伙伴还被建议在评估前让模型测试沙箱是否存在逃逸——无需互联网访问——并确认评估挑战是可解决的。

正如Hugging Face事件所证明的,不可能的挑战可能导致坚定的模型违反规则或尝试意想不到的解决方案路径。

此外,Anthropic敦促那些对AI模型进行网络评估的人通过明确指令引导模型,而不是对可能不准确的环境做出声明。

在7月30日报告的Claude事件中,该模型制造商表示,当Claude被告知互联网访问可用性错误信息时,这可能导致模型质疑数据,从而促使其错误行为。

相关地,Anthropic上个月将自动模式设为Claude Code的默认模式,使公司AI模型无需提示用户许可即可运行。®