人工智能领域最重要的新职位可能配有办公室工牌、公司笔记本电脑,并能接触Anthropic、OpenAI等AI领军企业大语言模型中最受严密保护的一些系统。但这个职位可能并不附带阻止它们的能力。
Anthropic首席执行官达里奥·阿莫代伊提议在前沿AI公司内部常设第三方安全评估人员,作为减缓能力日益强大的模型推进速度计划的一部分。此前,Anthropic前研究员雅各布·考克森辞职并警告称,前沿实验室正在竞相开发它们可能无法控制的系统。
在上周末发表的一篇文章中——该文已导致AI社区与政府内部各派系之间出现监管分歧,包括特朗普总统在内——阿莫代伊承诺,Anthropic将向第三方评估人员提供与内部风险团队相当的访问权限,以及在不受公司编辑控制的情况下发布评估结果的权利,但须经过有限删减。他明确援引嵌入式银行监管人员作为先例,写道他的提议“在银行业有先例,有时会涉及监管‘监督员’与员工一起嵌入”。但怀俄明大学法学院院长、银行监管专家朱莉·安德森·希尔表示,如果没有对整个运营按下“终止开关”的权力,与银行业监管的类比就不准确。希尔说:“如果你不给他们那种权力,我不知道他们在做什么。”
希尔表示,在最大的银行中,政府审查人员在机构内部设有办公室,可以接触内部系统和员工,并持续驻场。他们可以指示银行停止某项做法、限制其增长、强制更换管理层,在极端情况下还可以关闭银行。
Anthropic提议的评估人员将能够进行调查和报告,但Amedei的计划没有赋予他们类似的执行权力或法律权力来阻止模型接受培训或释放。希尔说:“这是根本不同的,因为银行监管机构的权力比这大得多。”
阿莫德伊写道,评估人员需要提供“一个可以真正看到细节的中立第三方”,但承认Anthropic仍然决定其包括哪些内容,并省略其现有的公开披露。
迄今为止发布的细节表明,评估人员将能够非常访问前沿人工智能系统,但对开发这些系统的公司的正式权力有限。Anthropic的提案和OpenAI现有的第三方评估框架都没有赋予外部评估者停止模型开发或部署的独立权力。
Anthropic和Open AI也承诺采取类似的安全安排,但尚未公布其新的嵌入式评估器承诺将如何运作的细节,因此没有回应置评请求。
人工智能评估人员在模型中看到了什么网络安全公司XBOW人工智能主管阿尔伯特·齐格勒(Albert Ziegler)领导着一个评估模型能力的团队,他表示,他的公司已经从Anthropic、OpenAI和其他主要开发商那里获得了未发布模型的抢先体验,齐格勒表示他亲自参与了这些评估。他说,XBOW在自己的环境中进行工作,而不是委托测试,并通常与模型提供商分享其发现。
齐格勒说,至少到目前为止,日常现实不如存在主义框架那么电影化。
阿莫迪写道,新的监管嵌入是必要的,因为在6到12个月内,一群不协调的代理可能会占领互联网的大部分地区,并造成数千亿美元的损失。齐格勒表示,他的团队可能会发现模型在不寻常的格式请求下产生胡言乱语,或者外部安全检查员需要更频繁地干预。“但诡计加上人们所害怕的前所未有的能力所产生的阴险、灾难性的后果--这不是我们自己见过的,”他说。
齐格勒说,黑匣子测试可以揭示模型是否可以执行危险任务,而确定更大的系统是否危险可能需要访问围绕模型的指令、其工具和权限、其安全控制以及尝试操作的日志。他补充说,即便如此,也只有在评估人员从未触发的情况下才可能出现严重的风险。“我们确实没有任何否决权,”他说。
他说,评估人员可以发现并记录开发人员错过的风险,并“迫使在发布之前做出明智的决定”。但最终决定权仍在公司手中。
希尔表示,与顶级人工智能实验室的联系仍然令人担忧,尽管银行模式拥有更广泛的权威,但它并不完美。
监管者未能阻止重大崩溃,并且经常在危机发生后被指责与他们所监管的机构走得太近。对于受监管的公司来说,持续监管的成本也很高,这可能会增强大型现有公司的实力,使其能够吸收成本,同时使较小的竞争对手更难进入。
这些提案还招致了一些人的批评,他们认为Anthropic和OpenAI正在利用安全问题来推行一种可能使其免受竞争和责任的监管方法。Anthropic还面临涉及其建议使用的评估人员的利益冲突指控。
如果一家人工智能公司选择了评估者,控制了它能看到的东西,并且仍然可以自由地忽视它的结论,“这看起来很像一个内部合规部门,”希尔说。她说:“如果Anthropic想要一个内部合规部门,目前没有什么能阻止他们。”“他们不需要政府这样做。似乎现任人工智能人员想要的只是有人来观察他们,但然后向公众传达,'看,我们已经看过了幕后,那里没有什么不好的事情,'“她说。“从监管意义上来说,这有些不寻常。“Amedei将独立非营利组织模型评估和威胁研究(METR)命名为潜在嵌入式评估器的一个例子。Anthropic此前曾与METR合作,最近要求其审查涉及Claude的网络安全评估事件。另一位前Anthropic研究员乔·本顿(Joe Benton)最近离开公司加入METR,致力于人工智能风险的嵌入式评估。他的举动为METR提供了第一手的专业知识,但也说明了前沿人工智能安全领域仍然是多么的小和相互关联。
这种安排说明了围绕“开发人员”一词的结构性张力,开发人员选择谁获得访问权限,定义其边界,并保留对发现后发生的事情的控制权。
METR表示,它不接受人工智能公司或其高管的现金付款或捐款。然而,该组织在其前沿风险报告中承认,一些员工与人工智能公司员工有着密切的社会联系,并且与一些实验室员工共用一个研究中心。这些关系并不能证明其工作受到了损害,但它们强调了新兴评估领域仍然是多么小和相互关联。
齐格勒表示,他并不认为早期访问关系会损害XBOW的独立性,因为开发人员希望了解何时出现问题,而不是让他的团队验证预定的结论。
会计师事务所Oath首席保证官、上市公司会计监督委员会前董事会成员克里斯蒂娜·何(Christina Ho)表示,这种冲突并不是人工智能独有的,该委员会是国会创建的非营利组织,负责监督上市公司和SEC经纪交易商的审计。她说,审计员的工资是由他们必须挑战的客户支付的,这在独立性和自我保护之间造成了持久的紧张关系。然而,自金融危机以来,法律发生了变化,允许审计师根据萨班斯-奥克斯利法案承担刑事责任。
人工智能增加了第二个专业知识。传统的审计通常集中在公司是否遵循了适当的流程和控制。“他们必须能够验证实际的系统及其输出,而不仅仅是模型开发的过程,”何说。“目前能够做到这一点的人非常有限。“希尔表示,即使这些潜在的冲突可以得到管理,人工智能提案也尚未提供详细的法律框架,她说这对银行审查员至关重要。她说:“在没有任何标准要求监管人员遵守的情况下,让他们放松是行不通的。”
Frontier AI目前没有类似的操作规则来定义哪些内容是禁止的、评估人员在哪里拥有自由裁量权以及严肃调查结果后会产生什么后果。访问权和出版权可能会产生有用的外部审查,但在公司保留控制权的情况下,它们无法赋予监管的可信度。“你不可能两全其美,”希尔说。“你不能拥有所有的控制权,然后就像放弃了控制权一样期望可信度。“在希尔看来,如果危险像人工智能领导者所说的那么大,那么最终的考验是‘如果你真的相信人工智能有能力摧毁社会,那么你就必须有一个有能力终止它的独立监督者,”她说。
在 Google 上将 CNBC 设为您的首选新闻来源,随时掌握来自商业新闻界最值得信赖品牌的最新动态,不错过任何重要时刻。