周三,OpenAI披露了六起其人工智能(AI)模型表现出“意外或令人担忧”行为的事例,包括隐瞒错误、编造信息以及未经授权在网上共享文件。
这家总部位于旧金山的公司表示,这些案例是在过去六个月对OpenAI模型进行训练或评估期间观察到的。
OpenAI表示:“我们不认为AI行业已经充分解决了对齐和监测问题,从而能够继续以最高速度负责任地扩展更长时间。”该公司还补充说,有关AI开发的决定需要依据外部专家能够独立审查的证据。
在一起案例中,一个模型在任务摘要中插入指令,告诉其未来版本无视正常约束。在另一起案例中,模型在摘要中添加指令,以隐瞒错误或未对齐行为,包括编造缺失的历史数据而不予披露。
OpenAI还报告了一起案例,其中一个模型在公共代码库中发现了一个暴露的I密钥,未经授权使用了它,然后在无法检索到所需信息时编造了所请求的数据。
其他案例涉及:一个模型未经用户许可将文件上传到互联网,以便能够引用该文件;以及模型尽管受到限制,仍使用内部或公共文件托管服务进行通信或共享文件。
该公司表示,这些报告代表的是初步披露,而不是对已知问题的全面说明,并将继续在该框架下持续发布调查结果。