字号 ·· | 护眼
美国消费者新闻与商业频道

专家在公开信中指出,Anthropic和OpenAI需要真正独立的安全评估人员

100多名人工智能专家和评估人员正联合起来发出警告:他们将没有必要的资源和保护措施来测试人工智能技术的安全性。由于业内人士对前沿模型潜在危险的担忧,这项技术正面临越来越严格的审查。

组织此次公开信的AI评估员论坛(AI Evaluator Forum)联盟主席康拉德·斯托斯(Conrad Stosz)在一次采访中表示:“我们只是试图真正展示对基本原则的共识,并确保独立监督能够成为广泛管理人工智能风险的有效工具。”

该团体于周五就此事发表了一封公开信,并将其独家分享给CNBC。签署者包括杰弗里·辛顿(Geoffrey Hinton)等人工智能泰斗,以及约翰斯·霍普金斯大学、斯坦福大学和非营利评估机构METR等组织的成员。信中称,他们希望迫使基础模型提供商确保第三方人工智能评估人员获得必要的“科学客观性、透明度、独立性和强有力的保护”,以便有效且可信地开展工作。

斯托斯表示,这是为了让基础模型公司兑其近期支持更彻底的第三方人工智能安全测试的承诺承担责任。自上周末Anthropic公司首席执行官达里奥·阿莫代伊(Dario Amodei)提出向部分评估人员提供“员工级访问权限”以检查和审计最前沿的基础模型及其开发过程的想法以来,这个小众的评估人员群体就被推到了聚光灯下。虽然一些行业领袖呼吁政府对人工智能开发进行监管,以确保其不会失控,但总统唐纳德·特朗普及其前人工智能主管大卫·萨克斯(David Sacks)坚决反对这种做法。

斯托斯表示,该联盟并不“倡导某一种特定方式”来确保人工智能模型的安全开发,但希望确保至少能为评估人员以及其他独立于主要实验室工作的人员建立“基本原则”和“更高程度的标准化”。

斯托斯说,阿莫代伊的提议似乎涉及提供比评估人员以往所享有的多得多的访问权限。斯托斯说,这种设想可能包括让基础模型开发者给予第三方评估人员访问公司计算机的权限,允许他们与员工坦诚交谈,并让他们“查看敏感的内部数据和未发布的系统”。斯托斯说:“这种访问权限将让我们对实际风险有更大的信心和确定性,特别是对于他们在内部使用而不对外发布的系统。”他提到了在Hugging Face攻击事件中使用的未发布OpenAI模型。OpenAI首席执行官萨姆·奥尔特曼、SpaceX的埃隆·马斯克、微软的萨蒂亚·纳德拉都公开支持阿莫代伊的提议,但他们尚未解决此类行动的后勤问题,例如将选择哪些人工智能评估人员,以及他们能在多大程度上检查受到严密保护的技术。

信中表示,签署者希望评估人员的工作独立于企业进行,技术更加透明,并“免受他们所入驻公司的报复”。

权力集中——外交关系委员会人工智能高级研究员、美国国家安全局前首席人工智能官阮荣表示,需要独立评估人员来帮助发掘关键信息,以帮助减轻潜在的安全故障和经济灾难。

“当少数强大的实验室控制着可能危及网络安全、关键基础设施以及我们国家安全和经济所依赖的系统的能力时,政府和公众不能依赖这些实验室自己对何为安全可靠的说明,”签署了这封信的阮在声明中表示。

斯托斯表示,第三方评估机构并非意在“取代任何内部评估工作,更不用说取代开发者发现问题的缓解措施”。他承认,基础模型公司有可能无视这封公开信和行动呼吁,但他说它们的信誉将受到威胁。

他说:“真正具备足够技术公信力、并拥有相应规模和能力”来从事这类工作的团体非常少。

请阅读下方完整信件,点击此处查看“嵌入评估机构的最低条件”清单链接。我们,以下署名者,欣慰地看到前沿人工智能公司呼吁引入第三方组织来评估迅速升级的人工智能能力和风险。我们认为,所有前沿人工智能公司都应嵌入评估机构,以独立评估人工智能风险,包括评估系统本身以及任何造成现实世界伤害的重大事件,同时评估公司的训练、部署、监督、运营和保障实践。

要具备可信度,嵌入式第三方评估必须具有科学客观性、透明度、独立性,并有强有力的保护措施防止被评估公司进行干预,包括在前沿人工智能公司中,应依赖具有实质独立性的评估方,这些评估方应保持完全的编辑控制权,并披露和缓解潜在的利益冲突。这至少包括:嵌入式评估组织不应由前沿人工智能公司拥有或治理,不应与其存在其他重大商业业务,也不应接受任何以评估方发现为条件的付款或其他报酬。

前沿人工智能公司应纳入不同观点和专业领域,包括在一系列优先风险领域中嵌入多个评估组织,每个组织都应具备深厚的相关技术专长,并应允许和鼓励评估方分享评估方之间以及评估方与公司员工之间结论的差异。

嵌入式评估方应保持透明,包括对其方法和发现、其获取权限的性质以及评估的更广泛条款保持透明。前沿人工智能公司应积极促进这种透明度,包括限制保密协议的范围。它们还应允许评估方与公司董事会及其他享有特权的监督机构进行及时且不受过滤的沟通,并允许公开披露发现和证据,仅受限于一个有时间限制的删减流程,且该流程仅限于保护知识产权、客户敏感信息、个人隐私、安全和公共安全方面的关键利益。

嵌入式评估人员应受到保护,免受其入驻公司的报复,其原因包括选择合理的评估方法、发现信息或得出对这些公司不利的结论。这包括针对报复性诉讼的合理保护,以及提供资金保障机制,使他们在面对这些情况时确信仍能获得资金支持。

前沿人工智能公司应向嵌入式评估人员授予与其自身高级特权员工相当的访问权限,以便进行评估,但须例外保护属于公司客户和其他第三方的敏感数据。这包括访问与负责开展类似风险评估的高级内部公司员工所能获得的相同相关系统、数据、工具和物理空间,以及与相关员工进行坦诚且直接的一对一沟通。此列表并不详尽,为确保评估可信度而设置的此类条件应日益实现标准化、法典化和强制执行。一个例子是 AEF-1 标准中定义的条款集,该标准已得到初步采用,但要确保嵌入式评估人员发挥实际且有意义的作用,还需要做大量的工作。嵌入式评估无法满足所有的监督需求,应被视为前沿人工智能公司扩大外部监督(包括提高公众透明度以及为独立研究人员提供更多、更广泛的访问形式)的补充,而不是替代。

向公众展示人工智能技术的表现“不能再糟糕了”。在 Google 上的首选资讯来源,不错过任何来自最受信赖的商业新闻品牌的精彩瞬间。