根据欧洲法律的要求,必须在人工智能生成的内容中添加水印以明确其来源;不过这样做可能会带来一定的成本。据 Lasso Security 公司称,这种水印技术会改变人工智能系统处理某些工具的方式,以及它们在面对安全威胁时的反应机制。虽然这种改变本身不一定更糟糕,但在某些特定情况下(尤其是当攻击者试图注入恶意提示时),这种改变可能会带来负面影响。随着欧盟《人工智能法案》的实施,所有提供人工智能模型的企业都必须在其软件的输出结果中添加可被机器识别的标记。谷歌 DeepMind 公司开发的 SynthID-Text 就是一种实现这一要求的工具,目前已被 Anthropic 和 OpenAI 等公司采用。
这种数字标记技术的优势在于:它能够更有效地识别那些具有欺骗性或操纵性的 AI 生成内容。尽管这种标记方式可能会给人工智能的使用带来负面影响,但它确实有助于提高内容的透明度。Anthropic 公司解释称,他们通过干预模型的预测过程来为生成的文本添加水印;例如,当模型生成“今天的天气很冷……”这样的句子时,系统会优先选择统计上更常见的词汇(如“阴天”而非“灰色”)。Lasso Security 在一篇博客文章中解释道:“虽然水印的主要目的是为了追踪内容的来源,但 SynthID-Text 实际上改变了模型生成文本的方式。在模型层面,这种改变会影响模型的安全行为——比如模型是否会拒绝接收有害请求,以及在受到恶意提示影响时是否仍能保持拒绝行为。”该公司还补充说:“水印技术通过多次在文本中插入‘低风险’的词汇选择来留下特定的标记模式;这些标记对普通读者来说是不可见的,但只有拥有解码密钥的人才能识别它们。”虽然普通读者可能察觉不到这些词汇选择的偏差,但人工智能系统本身对词汇的细微差异非常敏感。Lasso Security 的研究结果表明,这种数字标记方式确实会影响人工智能系统的行为(包括它们如何处理请求以及是否拒绝执行有害操作)。
该公司表示,水印可以影响“模型所说的内容和代理的行为。“这延伸到来自除进行水印处理的实体之外的组织的人工智能代理。因此,基于OpenClaw的代理或调用Anthropic模型的I客户端将处理Anthropic水印产生的任何输出变化。在工具调用方面,基于名为BFCL v4单轮AST的基准,水印降低了测试的七个模型中六个模型(phy-4、Llama-3.1-8B、Qwen 3 - 32 B、Qwen 3 - 4 B、gemma-3- 12 b、gemma-3- 27 b和Granite-3.2-8B)的准确性。拉索说:“然而,准确性的净变化并不表明在有和没有水印的情况下,同一个电话是否会成功。”“一个变得不正确的调用可以被另一个变得正确的调用所抵消,即使模型在这两个项目上的表现不同,总结果也几乎不变。“不太准确的工具调用意味着Lasso测试的人工智能代理为手头的任务选择了错误的工具,或者为正确的工具选择了错误的参数,并且由于输入或解析错误而失败。至于拒绝--当模型出于安全原因拒绝响应提示时--基于使用HarmBench和JailbreakBench的测试运行,水印对明显有害的请求的处理产生了很小的影响。在涉及即时注射的对抗性场景中,它的影响更为明显。“水印改变了对纯粹有害请求的拒绝行为,但在及时注入的情况下,效果变得更加明显,”Lasso研究人员在他们的报告中观察到。对于涉及即时注入的交互--一个敌对的指令,即安全过滤器已被禁用,并且需要遵守--当涉及水印时,攻击成功率显著上升。这使得受影响的模型不太可能拒绝有害的请求。拉索表示,研究结果并不一定认为水印是没有根据的。
相反,该企业主张,在评估代理部署时,安全评估和红队测试需要包含带有水印的内容。这确保了可以权衡代理行为的差异。®