据彭博社报道,在周二发布的一篇博客文章之前,OpenAI宣布将允许第三方机构在模型训练和评估期间(而不仅仅是模型发布之前)进行技术安全评估。OpenAI目前正在与包括METR和Redwood Research在内的多个机构进行谈判。
十天前,OpenAI的承诺更为具体:Sam Altman曾在9月12日表示,会为独立评估人员提供办公空间、工作证和笔记本电脑,并允许他们公开自己的评估结果。不过在最新的声明中,OpenAI仅表示在处理最敏感的评估任务时可能会邀请评估人员到公司办公室进行评估,并指出该公司此前也曾这样做过;目前尚未确定具体的合作伙伴,也未制定详细的访问权限规定。
METR和Redwood Research此前曾参与过对OpenAI模型安全性的评估工作。负责公司与外部安全专家合作的Lama Ahmad表示,OpenAI正在与一些之前合作过或尚未合作过的机构进行沟通。OpenAI强调其优先考虑的方面包括评估工作的独立性、科学严谨性、安全措施以及明确的职责划分。
Anthropic则是最早采取此类举措的公司之一:该公司上周宣布将聘请Accenture作为其模型的评估机构,并承诺在未来五年内向Accenture支付至少10亿美元的费用。不过在同一份声明中,Anthropic也指出这笔资金应来自公共资金或政府资助(因为目前这两者都尚未到位)。
相比之下,欧洲的一些模型开发机构采取了完全不同的安排方式(即仅在模型发布之前进行安全评估)。
这里的合规性评估是由那些与被评估对象没有商业利益关系的机构来进行的。埃森哲(Accenture)已经是 Anthropic 公司最大的 Claude Code 项目的合作伙伴;而负责该模型评估工作的伦敦机构 Faculty,已于今年 1 月被埃森哲收购。
根据相关法规,自 2025 年 8 月起,所有提供具有系统性风险的通用模型的供应商都必须按照标准化协议进行对抗性测试(即“对抗性测试”),同时还需进行系统性风险评估、采取网络安全防护措施,并立即报告任何相关事件。欧盟网络与信息安全局(ENISA)已经对包括 OpenAI 的模型在内的多种模型进行了评估。
然而,在某些具体问题上,欧盟目前尚未制定明确的法规或指导方针。
Dario Amodei 曾向美国政府申请反垄断豁免,以便相关竞争对手能够共同协作,共同确保这些模型的安全性;Altman 也同意了他的观点。欧盟委员会早在 2004 年就停止了单独批准此类豁免的申请,现在所有企业都必须根据《欧盟竞争法》第 101 条自行进行安全评估。目前,欧盟的横向合作指南中并未包含关于模型安全性的相关条款,也没有任何企业提出过这方面的要求。