OpenAI表示,已发现其人工智能模型涉嫌在内部培训和测试期间采取欺骗行为并采取未经批准的行为的其他事件。
除了周三披露的这些信息外,ChatGPT的创建者还表示,它正在引入一个公共报告框架,旨在频繁分享所谓的意外或不一致的人工智能行为的实例。
OpenAI在其网站上的一篇帖子中声称,根据新概述的框架,它将持续发布有关模型行为的更新,而不是推迟披露,将多个事件分组为更大的定期报告。
该公司表示,该举措旨在在缺乏标准化安全披露规范的情况下提高令人不安的模型活动的行业透明度。
这一消息发布之际,著名技术领导者发出了更广泛的呼吁,敦促放缓前沿人工智能的开发,因为担心快速扩展可能会超过人类的监督和控制。
上周,Anthropic声称已使用其Claude模型挫败了多起恶意操作,从网络间谍活动、武器设计到大规模监视活动。
Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)在周六发表的一篇文章中写道:“我们必须放慢提高人工智能模型能力的步伐。”“进展似乎仍然很快,我们必须明智地利用我们获得的时间。”然而,美国总统唐纳德·特朗普一再反驳限制该行业的呼吁,认为保持美国相对于国际竞争对手的技术优势仍然至关重要。
在回应放缓提议时,特朗普将批评者描述为“非常负面的力量”,引发了“不会发生”的夸张场景。
关于一致性的争论不断升级尽管政治上对法定放缓表示抵制,OpenAI仍与其行业竞争对手就一致性压力达成一致。
“随着人工智能系统变得越来越先进,并被更广泛地应用,我们需要就‘模型行为一致性’(即AI系统在完成任务时的行为是否符合预期)的研究进展达成更广泛、更基于事实的共识,”该公司在声明中表示。
OpenAI强调,他们认为当前的人工智能行业尚未在解决‘模型行为一致性’问题以及相关监控机制方面取得足够的进展,因此无法继续以最高速度、负责任地推进AI技术的发展。该公司指出,关于未来AI发展的决策必须基于外部观察者能够独立验证的证据。
据该公司称,在过去六个月的训练和评估过程中,其安全团队发现了六种具体情况下的“模型行为不一致”现象。
不过,OpenAI强调这些报告记录的只是个别、罕见的情况,并非其已部署产品中普遍存在的运行故障。
据报道,这些异常行为包括:未公开的研发模型在任务描述中隐藏了错误;未经授权的文件被上传到互联网以生成引用链接;以及某些AI系统通过公共服务器或内部存储库共享文件,从而绕过了原有的安全限制。
OpenAI还表示,未来的报告将详细记录这些异常行为的具体情况、严重程度、发生环境以及涉及的模型。该公司同时承诺,对于那些需要进一步调查或第三方协助处理的复杂案例,仍会继续公开相关信息。