字号 ·· | 护眼
arstechnica

秘密上传与自大狂:OpenAI披露新的“失准”智能体事件

一段时间以来,“AI对齐”(即AI模型的行为与其创造者和/或用户的意图相符程度)问题一直是AI安全研究人员关注和讨论的核心议题。自OpenAI在7月披露臭名昭著的Hugging Face黑客事件以来,“AI对齐”这一概念本身已突破圈层,日益成为公众日益担忧和讨论的话题。

或许正是认识到这一点,OpenAI本周承诺采用一个新框架来披露“OpenAI内部模型失准事件”,其中包括过去六个月内公司内部观察到的六个“意外或令人担忧的模型行为”示例。该公司表示,公布这些事件的细节有望“[让]其他人调查同样的问题、检验我们的解释并改进缓解措施”。

在OpenAI本周新披露的“失准”报告中,最像科幻故事中失控AI试图挣脱束缚的一例涉及“自我生成的提示注入”。在试图扫描图书馆目录以查找“最佳书籍”榜单中的示例时,该模型令人费解地使用了其“压缩”功能(即总结数据和发现以供日后检索),并附带了自大狂式的指令,如此