9月18日:AI实验室Anthropic周五表示,将与Accenture合作,对其前沿AI模型进行独立评估,两家公司在未来五年内各承诺至少投入10亿美元,以建立相应的评估能力。
随着监管机构、企业和研究人员对AI开发者施加日益增长的压力,要求确保其先进模型的安全性和可靠性,这一合作应运而生。
近期多起事件,包括AI代理突破受限环境的案例,引发了对AI可能在有限人为干预下自行发展、使其行为更难监控和控制的担忧。
周六,Anthropic首席执行官Dario Amodei呼吁AI公司放慢前沿模型的研发步伐,并让独立评估者获得更大的系统访问权限。
竞争对手OpenAI周三表示,将开始定期发布关于模型异常或令人担忧行为的报告,并已发布了六份此类事件报告。
Accenture旗下专注AI业务的Faculty将主导此次合作,对Anthropic的模型进行评估和红队测试,开展对齐评估并检验模型安全防护措施。
两公司的投资将支持Anthropic所称的“嵌入式评估”,即独立评估者在AI公司内部工作,拥有相当于员工的访问权限。
Anthropic表示:“从这个视角,嵌入式评估者可以评估公司的运营情况,验证其是否履行安全承诺,并识别盲点。”评估者还可以报告事件,为公众提供更为详尽的收益与风险说明。
Anthropic和Accenture计划与其他评估者及AI开发者以类似方式合作。