周三,Baseten在其研究部门Base Labs的推动下,与Hugging Face和Goodfire AI共同发布了新的安全基础设施标准,旨在为开放权重模型构建安全评估和监控体系。
这一举措正值关于开放权重模型安全性的争议之际——这些模型由于一种被称为‘abliteration’的技术而可能变得危险。
目前,托管开源AI模型的Hugging Face已经列出了超过6000个被‘abliteration’攻击的模型。
Baseten是一家AI推理服务提供商,今年早些时候成立的研究团队将致力于开发和发布训练及监控开放模型的方法。
该公司将未来的工作定位为一个‘标准’,该标准将透明地融入模型的训练和部署过程中,而不是事后添加。公司在X平台上表示:‘我们认为开放性对AI安全有利。
开放性能够提高对模型行为的透明度,最重要的是,比封闭源代码提供更有效的手段将安全研究转化为可操作且透明的控制措施。’
虽然三家公司尚未披露具体的合作技术细节,但Goodfire在回应Baseten的‘安全必须内置于开放模型中,并由服务这些模型的人提供’这一主张时,暗示了自己可能在其中扮演关键角色。
Goodfire专注于揭示AI模型的‘黑箱’机制,以解释模型的决策过程。’
Baseten在今年6月完成了15亿美元的F轮融资,估值飙升至130亿美元;其合作伙伴Goodfire AI同样资金雄厚,今年早些时候获得了由B Capital领投的1.5亿美元B轮融资,用于推进其模型可解释性平台的发展。
展望未来,Baseten向更广泛的开发者生态系统发出了开放邀请,希望他们能共同参与这一框架的构建。
‘我们正在共同打造一个对所有人来说都是安全且可访问的开放模型生态系统,’该公司表示。