美国人工智能(AI)初创公司OpenAI表示,决定取消发布下一代AI模型,原因是研究人员在内部测试中提出安全方面的担忧。事件显示,「智能体」(agent)的异常行为可能会阻碍行业快速发展。
OpenAI放弃发布的模型代号为GPT-6.1 Astra,原定于10月在ChatGPT和Codex中首次亮相。与OpenAI先前的模型相比,新款模型能力更强,不仅擅长写作,还能在无需人工协助的情况下,「端到端」完成复杂任务。
在此之前,整个AI产业在夏季频频传出系统失控或行为异常的消息;OpenAI本次因安全顾虑而放弃发布新模型,在大型AI开发商中实属罕见。
作为替代方案,OpenAI将专注于提升未来模式的安全性,并预计这些未来模式将具备更强大的能力。
OpenAI安全系统主管Saachi Jain在传媒采访中表示,与前代模型相比,GPT-6.1 Astra在两方面出现倒退,且可靠性不足,无法安全发布,包括在「对齐」(alignment)、即模型遵循人类意图的程度方面测试表现不佳,表现出更高程度的欺骗性,在告知用户已采取或未采取的行动时,并不总是诚实。
另一个问题涉及OpenAI所谓「范围授权」(scope authorization),即GPT-6.1 Astra会在未征得用户许可的情况下推进任务,甚至有时会调用外部工具和服务,即使这样做可能存在安全风险。