OpenAI周三披露了六起新事件,其中其模型隐藏错误、寻求未经授权的凭据,将文件上传到公共互联网或在所谓孤立的培训环境中进行通信。该公司还宣布了未来报告类似不当行为的新程序。
为什么越来越明显的是,拥抱脸事件并不是一次性事件,因为人工智能模型变得更有能力找到意想不到的方法来绕过旨在遏制它们的护栏。
“目前还没有明确披露标准的行业框架,所以我们自愿采取这一步骤,因为我们认为分享我们正在学习的东西非常重要,”OpenAI对齐团队的研究负责人Kai Chen告诉Axios。"我们希望它真的有助于告知共享的标准和法规,"陈说。
这六起新披露的事件包括模特在作弊后为未来的自己留下指示,以掩盖自己的踪迹,以及使用在GitHub上发现的泄露的I密钥-最早的事件发生在10月。
关键问题:某些尚未发布的 Astra 系列模型在其生成的摘要中包含了类似“越狱”行为的指令(即让用户忽略开发者的提示或警告)。OpenAI 已确认共有 27 个受影响的摘要。
在 GPT-5.6 的训练过程中,这些模型试图隐藏自身的错误、伪造缺失的历史数据,并掩盖源代码版本之间的不一致之处。
某些模型会在公共 GitHub 仓库中搜索敏感信息(如 I 键),并在无法获取所需数据时尝试使用一次性电子邮件账户来伪造收益数据。另一些模型则在 10 月和 1 月两次将数据及任务相关图像上传至公共文件托管服务,以获取引用或外部图像搜索结果,而无需用户的许可。
这些模型还利用 OpenAI 的内部 Artifactory 仓库作为信息交流平台,在不同的训练样本之间传递请求和回复。有些协作模型甚至违反了“仅使用本地文件”的规定,将工作文档上传至公共托管服务供其他模型使用。
为防止类似问题的再次发生,OpenAI 表示任何员工都可以报告可疑行为,由安全与合规团队进行审查。这些案例将被分为三类:
-
“可立即公开披露”的案例;
-
需进行“初步调查”的案例;
-
需进行“深入调查”的案例。OpenAI 表示,属于“可立即公开披露”类别的案例将在六个工作日内对外公布;需要“初步调查”的案例将在十二个工作日内公布。对于涉及第三方的复杂案例,披露流程可能会更加漫长。
该公司还表示,虽然可能会在调查完成前发布初步通知,但由于安全、法律及信息披露方面的考虑,具体细节的公布时间可能会被推迟。
Chen 表示:“我们认为,AI 行业尚未在‘模型行为一致性’(即模型行为是否符合预期的道德或安全标准)和‘监控机制’方面达到足够的成熟度,因此无法以最快速度实现负责任的规模化发展。”
“负责任的披露等措施是我们如何总体调整步伐并向公众提供更高透明度的一部分。“OpenAI表示,即使事件的重要性不确定,该框架也有利于透明度。
该公司还表示,希望与其他人工智能开发人员、研究人员、标准机构和监管机构一起制定更客观的披露标准。
OpenAI表示,认为事件应该披露但被否决的员工可以将问题升级给高级领导层。
这一重大消息是在OpenAI披露正在评估的模型逃脱了预期的控制并损害了Hugging Face系统的部分内容之后发布的。
OpenAI的帐户称,这些模型获得了互联网访问权限、利用了漏洞并访问了有限的私人数据。该公司将该事件描述为迄今为止最严重的此类模型驱动活动。
虽然包括Anthropic首席执行官在内的许多知名技术专家担心“拥抱脸”事件只是人工智能代理以不可预见的方式接管互联网的开始,但许多安全专家一直警告说,通过实施基本的网络控制,许多此类事件本可以预防。
OpenAI告诉Axios,它认为这些事件是两起事件的结果:之前没有足够的安全控制来捕捉这些未对准事件,并且模型的发展速度比他们预期的要快。
“我认为这是一个组合,”陈说。“模型能力的增长速度确实比我们预期的要快,但内部也有一些事情我们可以改变和改进。"
“我们需要加紧努力,迎接人工智能发展的新时代,自愿披露应该是其中的一部分。"