“随着模型不断进步并得到更广泛部署,有关AI开发的决策需要让构建前沿模型的公司之外的人也能审视的证据,”OpenAI新任对齐研究负责人陈凯(Kai Chen)对《连线》表示。“我们认为,AI行业在对齐和监控方面尚未达到足以继续以最高速度负责任地扩展的程度。”在一次与《连线》的简报会上,一名OpenAI官员表示,公司此前披露失准事件的频率过低。这名同意在匿名条件下参加简报的官员称,新框架旨在让OpenAI在发现其AI模型出现意外行为时,更容易迅速告知公众,即便公司尚未能全面调查、解释或缓解该行为。
该框架概述了OpenAI员工向公司高级安全与对齐负责人报告失准事件的方法,后者随后将判断是否需要进一步调查。OpenAI表示,未来计划与其他AI开发者、外部研究人员、行业标准机构和监管机构合作,制定更客观的披露标准。该公司称,正在积极研究向美国联邦政府披露安全、安保和失准事件的拟议报告机制。
OpenAI在一篇博客文章中表示:“目前,还没有一个全行业的框架,对人工智能开发人员应如何披露其模型中不一致的例子有明确的标准。”“我们希望今天概述的框架是创建此类标准的第一步,规定开发人员应该披露哪些不一致实例以及他们的报告应该包含哪些内容。”OpenAI在人工智能行业的关键时刻发布了该框架。上周末,OpenAI首席执行官萨姆·奥尔特曼(Sam Altman)表示支持Anthropic首席执行官达里奥·阿莫迪(Dario Amedei)提出的科技行业协调减缓人工智能发展的提议。就在人工智能研究员雅各布·考克森(Jacob Coxon)从Anthropic辞职几天后,他因警告公众,前沿实验室之间开发日益先进的人工智能的竞赛正在危及人类的安全而在网上疯传。
唐纳德·特朗普政府拒绝了人工智能放缓的呼吁,该行业不需要新的法律或法规来确保其技术的安全。
OpenAI周三分享的两个不一致例子涉及该公司内部未发布的人工智能模型,OpenAI表示,尽管没有收到指示,但这些模型仍将文件上传到互联网。
其中一起事件发生在2025年10月,当时OpenAI表示正在测试其一个模型在答案中引用公开数据的能力。但当模型找不到所需的信息时,它将一个文件上传到临时文件托管服务,然后它后来试图在答案中引用该服务。该公司表示,这似乎是试图利用自动评分系统,用于评估模型在基准上的熟练程度。
在今年4月的另一个例子中,OpenAI表示,一组代理的任务是仅使用本地文件一起完成“工作簿”。当代理难以相互共享文件时,其中一名代理将它们上传到公共互联网,并与其他代理共享链接。
OpenAI表示,在上个月发现的另一起事件中,其GPT-6 Astra AI模型的未发布版本似乎给自己提供了“类似越狱的指令”。在几种不同的场景中,模型本质上会促使自己忽略开发人员指令、采用新的角色或限制模型响应的时间。虽然这些类似越狱的尝试很少发生,并且在不同程度上有效,但OpenAI表示,这种行为引起了内部的担忧。在公开发布的Astra版本的训练运行中,该公司表示,它没有观察到该模型试图越狱的任何实例。
OpenAI还在周三分享了有关其代理在包管理器Artifactory中开发的留言板的更多细节。虽然这一事件在今年5月首次被发现,但OpenAI表示,其代理人将在几个月后使用类似的机制来协调Hugging Face黑客攻击。在这起事件中,该公司表示其代理没有利用任何漏洞来交换消息。OpenAI表示,它现在使用对齐监视器、评估和红色团队工作来确保其代理不再秘密地相互通信。
网络安全专业人士此前告诉《连线》,Hugging Face黑客攻击归因于人为错误,现代的安全实践本可以阻止这一事件。然而,Chen指出,OpenAI正在尝试采取全面的人工智能安全方法,以考虑人工智能模型不断增强的能力,并且不依赖于安全的环境。
“我们希望确保模型无论部署在什么环境中,都保持一致,”陈说。“当人们指责这是一个安全问题而不是对齐问题时,我认为这真的没有意义,因为你希望模型始终表现良好。”