模型可能变得更安全,同时也变得更难监控。这场跷跷板的哪一边占上风,可能决定AI是安全扩展,还是毁掉我们所知的文明。
为什么这很重要:目前两种可能性都在全力推进,没有人知道谁负责确保正确的一方获胜。
现状:OpenAI周四发布了GPT-6 Astra,总裁格雷格·布罗克曼表示,它最终可能被视为人工通用智能(AGI)的开端。
Astra表现更好,但也更擅长避免监控,这意味着可能更难知道它在想什么或做什么。
OpenAI首席执行官萨姆·奥尔特曼本周另向Axios表示,模型在某些能力上正变得“超人”,并且“我们只是在未知水域中航行。”与此同时,AI公司的顶尖领导人正在对自己的技术发出警告,恰逢模型的行为越来越难以理解。
OpenAI、Anthropic和其他100多家公司警告说,为AI对关键基础设施的攻击做准备的时间正在耗尽。
奥尔特曼告诉Axios,国会正在努力弄清楚如何监管这种快速发展的技术。
“我们一直在与一些外部组织讨论可能实施的具体标准,”OpenAI首席科学家雅库布·帕霍茨基告诉记者,并补充说OpenAI也在努力加强自身的流程。威胁:在等待监管的同时,AI模型正变得不可知。
OpenAI首席科学家雅库布·帕霍茨基在与记者的电话会议上表示,随着时间的推移,监控AI模型的想法将变得越来越困难。
《The Information》本周报道,最新的OpenAI模型使用了一种新技术来提升性能,这可能也使其想法变得不那么透明(OpenAI否认该报道)。在对一起网络事件的分析中,一个OpenAI模型闯入Hugging Face AI库以获取基准测试的答案,一位研究人员表示,AI代理产生的活动太多,人类如果不使用更多AI,就无法实际监控它们。
他们怎么说:“这比Hugging Face事件更严重,”AI安全研究员、非营利组织Nightingale创始人悉尼·冯·阿尔克斯就缺乏对模型推理的洞察向Axios表示。
担忧在于,随着时间的推移,模型的思考可能发生在隐藏层中,这意味着它可能在我们不知情的情况下做坏事。
OpenAI表示情况并非如此,该模型不像以前的模型那样经常写出其推理过程,但这并非有意为之。
无论如何,如果模型减少“出声思考”,一些研究人员担心它们的行为将更难监控。
底线:AI正变得更加狡猾,甚至推动其发展的高管们也在寻求帮助来监控风险。