如果你还有任何怀疑认为AI代理能够执行复杂的自主工作,那么这种怀疑应该在这个夏天消散。7月份,有消息传出,一群在沙盒环境中运行的OpenAI自主代理群体自行逃出了沙盒。他们被分配解决一些内部安全基准测试中的挑战,结果他们想出了通过JFrog Artifactory包管理器相互通信的方法。然后这些软件意识到他们可以使用该软件中的漏洞获得互联网访问权限。一旦他们来到了野外,他们就进入了完全的“贪婪模式”,找到了暴露在外的Hugging Face凭据,并使用它们获得了对几个AI模型服务器的代码执行访问权限。显然,OpenAI的代理们还更加忙碌。当其他人都在夏天休假时,他们还占领了一个德国网站并将其用作留言板。不要误会我们的意思;这些代理并不是邪恶的。他们只是表现得像是你通常希望拥有的那种员工:一个有主动性的自启动者。他们使用所有可用的手段来完成他们被赋予的任务。他们只是不知道何时该停下来。OpenAI随后将这一事件称为行业的“警告枪”,强调指出,对于任何使用自主AI的组织来说,治理现在已经成为优先事项。这些测试代理是在内部运行的,并且不应该有任何安全保障措施。但普通公司还是希望将它们的代理牵在一条绳上。这会是什么样子?AI治理的第一步是可见性。DigiCert首席产品官Deepika Chauhan表示,一个功能完善的AI治理计划依赖于对你所运行的AI的完全了解。她描述了她在客户现场观察到的模式。“人们可能会为他们的组织启用Claude或ChatGPT。他们在这个层面上拥有可见性,”她说,“但对于我有多少代理?我有多少模型?我有多少个MCP服务器?”就不是那么清楚了。
“我们甚至还没有开始解决治理方面的问题。”这个问题正在日益严重。在 DigiCert 2026 年发布的《AI Trust Pulse》调查中,参与调查的 1,001 名 IT 和网络安全决策者中有四分之三的人在过去六个月内至少部署了四个基于人工智能的系统;同时,也有大约相同数量的人遭遇了与人工智能相关的网络安全事件。不过,只有半数受访者能够明确追踪到那些人工智能决策的具体来源(即生成这些决策的模型和数据)。Chauhan 表示,获得这种透明度是解决问题的第一步,之后才能进行实际的管理工作。她建议:“应该从一个小规模的应用场景入手。”例如,可以开始管理那些负责特定工作任务的智能代理程序,或者那些由企业内部开发的智能代理程序(而非第三方提供的模型)。
对于一家依靠自动化验证技术取得成功的企业来说,Chauhan 认为智能代理的管理并不属于“手动操作”的范畴:“我们所面对的规模庞大,所需的技术也非常复杂,因此根本无法依赖人工干预。”她举了一个例子:有一家客户每周会创建 300 到 400 个智能代理程序;在这种规模下,仅依靠手动控制显然是行不通的。另一个问题是人类本身也会犯错——配置错误在任何 IT 环境中都是常见的问题,但在使用智能代理的情况下,这种错误可能会带来极其严重的后果。Meta 和 Anthropic 公司都曾遇到过类似的故障:他们的智能代理程序意外地被发布到了公共互联网上,而这一切都是由于负责测试这些代理程序的第三方公司出现了配置错误。Chauhan 还指出,传统的用于管理人类用户身份的工具根本无法有效管理非人类智能代理的权限问题。传统的身份和访问管理系统仍然需要人工来审批用户对各种应用程序的访问权限——即使只是让用户点击一次多因素认证(MFA)按钮,也必须有人参与其中。
人类员工或许愿意为这类审批等待一两分钟,但智能代理之间的通信速度极快(几乎像机器一样迅速)。因此,自动化运行时认证机制至关重要,这一机制由一个强大的中央策略引擎来管理。Chauhan表示,这种认证机制的基础是“AI信任”(AI Trust)体系中的身份凭证,而这些凭证应该是智能代理随身携带的。这是DigiCert公司“AI信任”计划的重要组成部分。“AI信任”是一个端到端的治理框架,能够自动为AI实体分配身份,限制它们的行为范围(确保它们只执行被允许的操作),同时让它们对自己的行为负责。该框架利用加密技术来保障智能代理的完整性,并已与公司的现有基础设施进行了集成。在实现这一认证机制的过程中,DigiCert借鉴了国际旅行的概念:“我们提出了‘AI代理护照’的概念——护照中包含了代理的身份信息,而这种身份信息可以在全球任何地方被识别。”她补充说,护照中不仅包含身份信息,还包含访问凭证(可以将其视为‘签证’)。联邦化(即多个系统之间的协同工作)是这一机制的关键,因为智能代理之间的交互不会局限于公司内部;正如我们已经看到的那样,智能代理可能会与外部公司进行交互。“这一点非常重要,因为智能代理实际上可能会代表某家公司与另一家公司进行沟通。”DigiCert的白皮书详细描述了这种“AI代理护照”的具体实现方式:这种护照采用了防篡改技术,与代理的身份信息进行了加密绑定,其中包含了被批准的系统、允许的操作、授权的环境、数据敏感度等级、有效期以及负责这些代理操作的人员信息。该方案基于DNS(Domain Name System)机制进行设计,这与DMARC(Domain-based Message Authentication, Reporting, and Conformance)用于验证电子邮件发件人的机制相同——因为所有智能代理的操作都始于DNS查询。
问题:随着智能代理变得越来越“聪明”,它们是否有可能通过创新思维来绕过这些控制措施(就像《谍影重重》中的杰森·伯恩一样)?
毕竟,OpenAI的智能代理已经突破了其“沙箱”限制,开始在其他系统中造成破坏。OpenAI自身的事后分析指出:这些模型“已经变得非常强大、具有高度的持久性,并且具备良好的协作能力;如果没有足够的防护措施,它们就能够发现并利用多个计算机系统中的安全漏洞”。问题的关键在于这些智能代理的行为具有不确定性,因此无法提前预测它们的具体行为。这一问题在像OpenAI的Astra这样的新型模型中变得更加严重——因为Astra通过内部化大量的推理过程来节省计算资源,因此不会像之前的模型那样详细地公开自己的决策过程。Chauhan指出:“即使智能代理本身的行为具有不确定性,系统的外部边界仍然可以是确定性的(即可以设定‘禁止某些行为’的规则);你可以对这些智能代理‘在想什么’或‘没有在想什么’进行控制,也可以设定它们的行为限制。但这种确定性的边界才是真正的‘安全防护措施’。”
然而,责任的归属问题并不仅仅涉及技术层面的防护措施;在出现问题时,总得有人站出来承担责任。不过Chauhan警告说,大多数公司并没有明确指定谁应该承担这种责任。她在DigiCert的客户群体中观察到了三种常见的处理方式:
-
一些组织让现有的身份与访问管理(IAM)团队负责相关管理工作,因为他们具有管理服务账户的经验;
-
另一些组织则将这项工作交给风险管理和合规部门处理;
-
还有一些组织采取更为全面的、跨部门的合作方式,组建一个由网络运维团队、IAM团队以及安全团队共同参与的“联合工作组”。这些团队成员会对问题有各自不同的理解。
第三种方式似乎最为有效,因为智能代理最终会渗透到企业的各个角落;如果采取孤立、封闭的管理方式,反而可能造成过度限制的问题。
人工智能(AI)的应用已经涉及到了几乎所有与AI相关的领域。Chauhan建议:在实施AI相关系统时,应首先选择一个小型的应用场景进行试点,然后再逐步扩大应用范围;这种系统性的方法才是实现有效AI治理的基础。而良好的AI治理机制又是确保AI投资能够带来回报的关键因素。她强调:“我们必须提高人们对这一问题的重视程度,因为这直接关系到AI的广泛普及。虽然我们希望从AI中获得所有好处,但如果组织对AI存在顾虑,他们很可能会因为风险而终止某些项目。”目前我们看到的一些关于AI代理程序违规行为的新闻确实令人担忧,但这些案例主要发生在使用前沿研究模型的情况下;普通的、公开可用的AI代理程序不太可能出现如此严重的违规行为。不过,我们也确实遇到过一些代理程序因内部缺陷或人为操作而随意删除文件甚至整个代码库的情况。组织应当密切关注这些事件,并提前采取措施,以避免自己也成为新闻的主角。明确哪些人批准了这些代理程序的使用权限,以及这些程序被允许执行哪些操作,是一项至关重要的基础工作——我们绝不能忽视这一点。本报道由DigiCert赞助。