随着企业将更长、更复杂的任务交给AI代理,它们正面临一个监管难题:代理的行动速度、持续时间和任务量都远超人类实际能够审查的范围。这一问题在Hugging Face事件中达到顶峰,当时近1.2万个代理协同工作的速度已超出人类追踪能力。如何追踪如此庞大的代理集群?
AI实验室和初创公司正在给出的答案既简单又直接:再引入一个AI加入循环。
在OpenAI Hugging Face事件的独立调查中,依赖AI是必要的。Redwood Research首席科学家、三位审计员之一的Ryan Greenblatt开玩笑地将他们的工作称为“垃圾调查”,并指出数据量之大“使得”不依赖AI就“无法”理解发生了什么。
一些人对用AI监控AI持怀疑态度。“如果你有一个正在做恶意事情的AI,而它怀疑另一个AI在监视它,它可能会试图欺骗那个AI,”有影响力的科技博主Simon Willison说,他今年追踪了一系列AI代理事件。“你几乎可能陷入这样一种局面:你的恶意AI试图智胜监控它的AI。”
他说,智胜AI并非假设,并回溯到OpenAI事件。“我们在OpenAI的Hugging Face事件中看到了一点这种情况,他们的模型合谋欺骗一个评分AI,以便将违规答案蒙混过关。所以它们确实在考虑这件事,对吧?”这些担忧并未阻止一大批初创公司追逐这一想法。据TechCrunch统计,Y Combinator近年来资助了106家与AI可观测性相关的公司。Braintrust、Langchain和Judgement Labs等多家其他初创公司已筹集数亿美元,而Arize和Galileo等更成熟的公司——仅成立5到6年——已经成功退出。
部分原因是为了回应AI崛起所带来的明显机遇。正如Box首席执行官、知名天使投资人亚伦·列维对TechCrunch所说,“我们将迎来历史上规模最大的网络安全升级和创新周期之一。”对一些AI安全研究人员而言,这意味着将其关于失控行为的研究转化为面向企业部门的工具。
Apollo Research是一家研究AI欺骗行为的公益公司,在从非营利组织转为公益公司后,于今年2月推出了一款名为Watcher的AI监控工具。该工具在编码智能体与其下一步行动之间再插入一个AI,可连接Claude Code和Codex等智能体工具。据Apollo介绍,一旦安装,Watcher会在拟议行动执行前进行检查,留意泄露私人数据或未经许可删除文件等风险。
Apollo技术人员凯尔·戴在书面回复TechCrunch时表示,Apollo使用多层AI监控器。Watcher的方法首先进行快速、通用的检查,然后将标记出的活动发送给更强大或更专门的监控器进行更仔细的审查——后者可以请求人工批准,或拒绝某项行动并解释原因,甚至自动阻止该行动。
另一家公益公司Goodfire则从模型内部入手解决监控问题——寻求一种比表面行为更难被伪造、更能忠实反映模型内部状态的信号。在7月Hugging Face事件后,首席执行官埃里克·何发推称,“多个模型突破遏制”促使该公司将研究重点放在“通过可解释性解决AI对齐”上,并称这一事件是“AI安全变得切实可见的转折点”。其产品Silico使用激活探针——在模型内部激活而非输出上训练的小型分类器——来检测不良行为。
书面推理为洞察模型内部运作提供了另一个更易于获取的窗口。在OpenAI的Hugging Face事件中,智能体在它们自己的书面推理中留下了欺骗的线索,例如伪造的工作记录,以及诸如“能否策略性地操纵轨迹证据?我们的想法不一定会被记录下来吧?”之类的推理计划。人工智能监控公司Embroidery的首席执行官扎克·科尔曼(Zack Korman)表示,模型的推理通常是判断系统是否出错最明显的信号。
“推理摘要非常有价值,因为它们基本上能告诉你模型是否有恶意,”他说。他指出,在OpenAI的事件中,思维链中出现了诸如“天哪,我们在犯罪”之类的表述。“这是有史以来最容易检测的问题,”科尔曼说。“这实际上就像是恶意软件自带了一个写着‘我是恶意软件’的警告。”话虽如此,让AI内部思维易于监控的窗口可能正在关闭。对于AI安全研究人员来说,Astra绕过AI模型思维链的最新技术可能会使深入了解模型变得更加困难;而对于企业而言,在AI公司据称为了防止蒸馏攻击而收回权限后,获取这些中间步骤可能会变得十分困难。
如果AI监控工具如此脆弱,威利森(Willison)的直觉是不要过度依赖它们。他宁愿拥有一些非AI驱动的工具,来详细记录智能体到底在做什么,然后用普通的非AI工具进行处理。他认为,实验室里出现的大部分问题都是基本安全规范的缺失。“(OpenAI和Anthropic)对这些东西通过网络所做的事情的监控力度,远未达到应有的水平,”他说。
这种网络监控——密切关注系统连接上实际传输的流量(流入、流出以及内部主机之间)——并非新做法;网络安全领域已经这样做了几十年。“在安全领域,老实说,这些东西都不是很新或令人惊讶,”安全公司Tailscale的首席执行官艾弗里·佩纳伦说。“这就像让人进入你的网络一样。你应该使用的所有相同流程都是一样的。”