OpenAI 的新 AI 模型 Astra 以其几乎无需人工干预即可完成任务的能力令粉丝们欣喜不已。
但 AI 安全专家想知道它是如何实现这些壮举的,在 OpenAI 的 Hugging Face 遭黑客攻击之后,这一问题变得更加紧迫,因为该事件暴露了人类无法完全理解 AI 模型“思维链”输出的问题。
Astra 似乎更少地“出声思考”,这让研究人员几乎无法洞察它是否在隐藏什么或计划什么不该做的事情。
AI 安全研究员 Ryan Greenblatt 周四在 X 上写道:“看起来它完全可以在脑子里解决困难的竞赛数学问题。”“这似乎极其令人担忧。”
OpenAI 首席科学家 Jakub Pachocki 周三试图平息部分担忧,当时有报道称该公司可能为了提升能力而故意限制模型输出的可见性。他说:“我想阻止因混乱报道而引发的不可监控性竞赛。”Pachocki 表示他计划就此主题撰写更多内容。