字号 ·· | 护眼
techcrunch

人工智能实验室希望设立内部审计部门——但或许他们应该先锁好前门

上周末,在他的一名研究人员因担心人工智能可能导致人类灭绝而辞职后,Anthropic首席执行官达里奥·阿莫迪(Dario Amedei)写道,外部组织需要“验证对安全实践和承诺的遵守情况,报告事件,并帮助评估不仅完成的人工智能模型,而且还包括培训管道和流程的一致性。”OpenAI、谷歌和SpaceXAI的高管已经团结起来支持Amedei的计划,该计划已迅速成为新兴人工智能安全推动的核心支柱。

但可能有一种更简单、更有效的解决方案隐藏在众目睽睽之下。互联网安全专家表示,实验室需要专注于日志和权限等网络安全基础知识,应用与人类用户相同的严格防御措施。它不像第三方审计和协调工作那么令人兴奋,但它最终可能会更有效。

“在我看来,他们似乎在外包,”Luta Security首席执行官凯特·穆索里斯(Kate Moussoris)在谈到Amedei的提议时告诉TechCrunch。“从我的角度来看,说[第三方审计]是解决方案是一个奇怪的提议。微软表示,这就像我们不编写值得信赖的计算备忘录,而是放慢开发速度一样。”这份备忘录是由当时的微软首席执行官比尔·盖茨(Bill Gates)在2002年撰写的,他呼吁员工确保他们的软件在一系列广泛宣传的计算机蠕虫接管当时新生的企业系统之后是可靠和安全的。人工智能行业可能也处于类似的转折点,因为新技术的价值和风险变得越来越清晰。

虽然一致性仍然是一个重要问题,但从明年开始担任加州大学Berekely教授的人工智能研究员Sayash Kapoor认为,“与一致性投资相比,控制权的边际投资更有可能有效。我们认为这些事件表明,尽管有已知技术,但公司内部缺乏对人工智能控制的重视。”引发这些担忧的事件围绕前沿模型被要求完成训练任务(通常是网络安全评估),然后访问开放的互联网并渗透封闭的第三方系统以试图这样做。他们这样做通常是因为应该包含这些代理的“沙箱”环境配置不当;讽刺的是,Anthropic的一次突破发生是因为第三方评估人员没有关闭正确的门。

安全公司Tailscale的首席执行官艾弗里·彭纳伦(Avery Pennarun)表示:“作为一个职业,我们知道如何阻止访问互联网。”“如果你读完所有这些大型长[报告]--‘哇,这是一次非常令人印象深刻的多阶段攻击,等等。’听着,你给了它下载东西的权限。你不应该在互联网之外单独这样做。”这是一个问题,但更大的问题是前沿实验室不知道这些活动。

监视特工“真正意义重大的是,他们所做的事情的所有发现要么是因为受害者看到了一些东西,要么是在其他一些情况下……这是网络活动,而这些活动实际上都不是来自直接监控人工智能,”穆苏里斯指出。

在一个案例中,OpenAI代理接管了一个已不复存在的德国维基论坛,在评估中作弊,这些代理在公司的任何人似乎注意到之前活跃了几周。TechCrunch采访的安全专家表示,实时监控是防止未来爆发的关键,并且每个代理会话都应该有时间限制并到期。

前谷歌安全高管、现任初创公司CredyStory负责人Shapor Naghibzadeh表示,解决方案是“将代理放入一个盒子中,从外部对其进行大量监视,并监视一切跨越边界的事情。每个工具调用、每个流程、每个网络连接,没有例外。.为了方便而打开的一个洞就是被使用的那个。旁路正是经历了这种例外。[At谷歌,]我看了很多次那部关于人类攻击者的电影,这些模型至少同样擅长找到被支撑打开的门。”OpenAI已开始朝着这个方向前进,宣布已开始通过其Astra模型监控所有使用工具的推理,但代价是“高昂的计算成本”。Anthropic也表示正在加强其安全程序,包括扩大其模型的可观察性。两家公司都没有回应TechCrunch关于如何跟踪和控制人工智能代理的问题。

其他问题是代理使用共享基础设施,这使得他们能够在Hugging Face攻击期间进行通信。与人共同创建Django Web框架的软件开发人员西蒙·威廉姆森(Simon Willison)写了一篇他称之为“致命三重”的文章--当代理人同时访问不受信任的输入、互联网和私人信息时,这就是灾难的根源。

彭纳伦说:“技巧是你可以选择三冠王中的任何两条腿,经纪人也可以拥有任何两条腿。”“如果你需要这三个,那么你需要将其分配给至少两个特工……也许他们可以通过受控渠道相互交谈。”对前沿专家的同情TechCrunch采访了解到,前沿实验室安全人员的工作很困难。Naghibzadeh指出,地球上的每个民族国家行为者都在试图窃取他们的模型权重,并对他们的I发起蒸馏攻击,以及任何大型数字公司的基本安全任务。

“研究基础设施很难上升到那个优先级列表的顶端,尽管现在这种情况肯定正在改变,”他说。“将安全事件公开确实有助于让内部所有人围绕改进这一目标保持一致。”这是穆苏里斯提到的一点。目前,当实验室发现其智能体已渗透第三方系统时,并没有正式的受害者通知程序,而且很可能还发生过其他未被广泛报道的事件。尽管她担心直接监管模型的法律可能带来意想不到的后果,但她认为政策制定者应推进的一个想法是强制通知。

而且,尽管很明显安全最佳实践并未得到遵循,专家表示这些实验室正在做前人从未做过的工作——“它们所做的工作比典型企业多出几个数量级,”网络安全公司 Embrodiery 的首席执行官扎克·科尔曼告诉 TechCrunch。

尽管对齐可能不是起点,但它不能被忽视。网络安全专家无奈地接受,若要有任何机会实时追踪其他智能体的行为,就必须使用 AI 智能体来监控它们;而在这种情形下,欺骗的可能性便抬头。穆苏里斯说:“你被困住了,只能用 AI 来试着应对这件事,即便 AI 现在并不一定安全。”

这项工作只会变得更难。穆苏里斯说,智能体现在所做的一切,“都是在大声地做”——它们在公共论坛上发帖,它们的思维链和其他推理痕迹都是英文。“这些仍然人类可读,”她说,“所以只要这种情况还能持续,就尽量加以利用,因为它不会永远持续下去。”