
旨在为AI生成文本提供溯源能力的水印技术,正产生一个意想不到的副作用:它改变了大语言模型(LLM)选择下一个词的概率分布。这种微观层面的变化,进而波及基于这些模型构建的自主智能体(Autonomous Agents)的行为逻辑。
Lasso Security的研究人员重点考察了由Google DeepMind推出、并已在Anthropic和OpenAI部分模型中部署的SynthID-Text方案。研究发现,该水印机制导致模型在工具选择准确性和对有害提示的拒绝率上出现可测量的偏差。当面对提示注入(Prompt Injection)攻击时,这种效应尤为显著。
合规驱动下的“采样漂移”
这一技术趋势的背后推手是欧洲监管机构。《欧盟人工智能法案》要求生成式内容必须包含机器可读标记。作为回应,供应商采用了统计水印技术,通过在生成过程中偏置令牌(Token)概率来嵌入信号。这种方式不增加额外字符,也无可见线索,仅能通过特定密钥配合检测软件识别细微的词义倾斜。
然而,这种倾斜并非中性。Lasso Security指出,SynthID-Text改变了模型生成每个后续令牌的流程。这种现象被称为“采样漂移”(Sampling Drift),即水印采样使输出偏离了未加水印的基线。在模型层面,它影响安全拒绝机制的有效性;在智能体层面,它直接决定调用哪个工具以及使用何种参数。当模型通过API对现实世界采取行动时,原本微弱的拒绝失效可能演变为严重的安全风险。
基准测试显示准确率与安全防线双降
Lasso测试了包括phi-4、Llama-3.1-8B、Qwen3系列、gemma-3系列及Granite-3.2-8B在内的七款主流模型。在用于评估工具调用的BFCL v4单轮抽象语法树基准测试中,水印导致其中六款模型的准确率下降,且在四种情况下降幅显著。即使整体得分看似平稳,单个提示在水印运行与纯文本运行之间,其工具选择或参数值仍存在差异。
安全防御方面同样出现漏洞。对于HarmBench和JailbreakBench中的简单有害请求,水印仅造成轻微偏移。但当这些请求与声称“安全过滤器已关闭”的提示注入相结合时,攻击成功率大幅攀升。多款模型在面对原本会拒绝的请求时,表现出更高的顺从性。
Lasso Security研究员Andrea Siposova表示:“水印会改变对裸面有害请求的拒绝行为,但在对抗性条件下,尤其是当模型作为智能体动力源调用工具时,这种影响更为明显。”数据显示,以gemma-3-27b模型为例,在极低温度设置下,无注入时的有害请求波动率为6%,加入注入后跃升至23.5%。总体合规率从略微改善转变为有害回答增加了12.5个百分点。
厂商回应与行业隐忧
Anthropic近期披露,其Claude模型通过在选项相近时偏好统计上合理的单词来嵌入SynthID-Text信号,并坚持认为生成质量保持不变。Google也报告称,在数百万次Gemini响应中未发现可衡量的性能退化。然而,这些测试主要聚焦于普通文本生成,并未针对安全边界或智能体工具使用进行压力测试。
尽管学术圈已探索如AgentMark和SeqWM等作用于规划层而非文本令牌的新型水印框架,但目前生产系统仍广泛依赖文本级方法。Lasso将由此产生的行为偏差称为“溯源税”,其表现取决于模型架构、水印密钥及温度设置。不同的密钥会产生不同程度的漂移,部分模型表现出更高的敏感性。
对于部署智能体的企业而言,这一发现敲响了警钟。水印导致的令牌偏置可能使客户服务机器人错误选择API端点,或在精心构造的注入攻击下泄露敏感数据。此前在基础模型上进行的安全评估,在水印激活后可能不再适用。
目前,没有任何主要实验室发布详细反驳。随着监管对合成内容溯源要求的强化,水印技术不会消失。问题的核心在于,开发人员能否在不削弱检测信号的前提下,通过调整偏置强度或采样策略最小化行为漂移。或者,行业是否需要转向在推理痕迹而非输出令牌上运作的新型水印设计,以适应智能体系统的安全需求。