字号 ·· | 护眼
thenextweb

OpenAI列出了它希望安全评估人员测试的四件事

这种访问权限应使评估人员能够质疑我们的假设、识别我们可能遗漏的风险,并自行得出关于我们防护措施有效性的结论。

OpenAI于周二发布了该文件,阐述其希望外部安全评估人员开展的工作。文件由Lama Ahmad撰写,她负责公司与外部安全专家的合作事务。

公司周二表示,将在开发早期阶段向独立审查开放其模型。这份文件是该承诺的具体落实。它列出了四个评估领域,以及工作应遵循的七项原则。

两个奠定基础的定义 在OpenAI的定义中,安全声明是指关于模型的具体断言,该断言关乎其安全性,且可通过证据进行检验。声明应列明其涵盖的风险和条件,以及其假设和局限性。

安全论证则将这些声明汇集为一个结构化的论据。它解释为何公司能妥善管理特定活动的风险。同时还必须陈述其假设、不确定性以及残余风险。

Sam Altman上周使用了相同术语。他主张在以安全论证为基础的联邦框架下控制节奏,而非叫停发展。

四大领域 首先是对安全论证本身的独立评估。这涵盖训练、评估、内部部署和外部部署。OpenAI预期多位评估人员将按专长分工负责不同部分。评估内容包括:证据是否站得住脚;团队是否真正遵循了安全论证的条件;以及训练方法是否奖励欺骗、奖励黑客行为或规避限制。

第二是防护栈。OpenAI希望评估人员使用其所谓的“灰盒访问”进行工作。他们将测试防护措施能否抵御越狱攻击,以及能否阻止网络和生物领域的能力提升。

它还希望在真实运行条件下进行授权测试。智能体如何与访问控制、沙箱隔离以及检测和响应系统交互?哪些防御措施能够预防、检测或遏制有害行为,哪些又会失效?

该部分的三个问题直指公司核心。其错位监控器是否存在可能导致失控的漏洞?监控是否贯穿训练、评估和部署全流程,且无人能轻易禁用?随着模型能力增强,思维链监控的可靠性能维持在何种程度?

第三个领域涉及“准备框架”下的能力评估,该框架追踪化学与生物风险、网络安全以及 AI 自我改进。OpenAI 询问自身是否设定了正确的阈值,以及一旦模型开始超越这些阈值,评估是否会随之更新。

第四个领域是对错位事件的独立调查。OpenAI 以自身的 Hugging Face 事件为例。调查人员将需要网络取证技能、对齐专业知识,以及大规模分析思维链的能力。

原则对双方的要求 双方应首先商定范围,然后在评估开始前预先约定主张。OpenAI 希望公开说明某项主张是源自公司还是评估方。结论必须说明评估遗漏了什么。

评估方应获得与主张相称的访问权限,前提是在法律、安全和知识产权限制之内。文件指出,在直接访问不切实际的情况下,可指定公司代表,或采用隐私保护机制。

他们还应解释其方法、标准及不确定性。报告应将直接发现与解读分开。在尚无标准可循的情况下,评估方必须为其选定的标准提供理由。

在独立性方面,评估人员应披露利益冲突。这包括财务激励、与开发者的关系,以及先前参与待审查工作的情况。OpenAI 建议实行回避或隔离期,并表示薪酬安排不应影响调查结果。

调查结果本身应足够具体以便采取行动。OpenAI 要求评估人员指出具体差距,并提供足够详细的信息,以便实验室加以弥补。在适当的情况下,报告还应为构建、部署和防御智能体的人员提炼经验教训。有利于实验室的部分 七项原则中有三项给予了公司回报。

当评估人员无法在其自身环境中满足安全要求,或数据特别敏感时,OpenAI 表示在公司管理的设备或场所工作可能是合适的。

在适当情况下,文件指出实验室应在发布前获得合理的整改期限。文件未规定该期限的具体长度。

在发布方面,实验室可要求编辑敏感信息。评估人员保持编辑独立性。他们可以说明实质性编辑发生的位置,以及这些编辑对报告造成的影响。

文件遗漏的背景 OpenAI 表示已向评估人员提供可见的思维链访问权限。该公司还声称提供了前所未有的机密数据和内部部署访问权限。

《准备框架》承担第三优先级领域。OpenAI 于 8 月解散了运行该框架的团队,将工作转移至其他小组。

资金问题未被提及。在加利福尼亚州,参议院第 813 号法案为独立验证组织开辟了路径,评估人员由谁支付费用的问题自该模式出现以来一直伴随其后。

该文件还建立在OpenAI过去一周发布的两份出版物之上。一份是周一发布的标准倡议,主张美国应牵头开展前沿AI领域的国际合作。另一份是9月16日发布的错位报告框架。

谁来实际执行这些工作?OpenAI表示,正在与多家第三方就符合这些领域的提案进行对话。但它未透露任何一方的名称。

公司表示,没有任何单一评估机构能够或应该涵盖所有紧迫的前沿安全问题。它补充称,将在独立评估生态系统成长的过程中审慎推进。

此处描述的评估与发布无关,而非绑定某次发布。部分评估将持续数周,其他评估则将持续数月。