2026-09-17 · 来源:{'name': 'Unite AI', 'url': 'https://www.unite.ai/lasso-study-finds-text-watermarking-shifts-llm-refusals-and-tool-calls/'}

Lasso Security研究员Andrea Siposova的最新研究发现,SynthID-Text文本水印可能改变模型是否拒绝有害请求,以及智能体发起哪些工具调用——这一效应被命名为'采样漂移'(sampling drift)。
文本水印技术旨在为内容打上机器生成的标记以实现溯源,但安全公司Lasso Security的最新研究表明,它可能给大语言模型带来意想不到的行为影响。该公司研究员Andrea Siposova于2026年9月17日发表了这项题为《溯源税:理解LLM水印对AI智能体行为的影响》的研究。论文考察了文本水印方案SynthID-Text,并报告称其会改变模型的核心行为。
研究结果显示,水印可能改变语言模型是否拒绝有害请求——这一变化直接关系到安全护栏的有效性。它还可能改变AI智能体生成哪些工具调用,这意味着智能体系统采取的行动,可能取决于底层模型输出是否带有水印。Siposova将这一现象命名为'采样漂移'(sampling drift),并把它归因于水印改变了模型生成文本的过程。
水印的设计初衷与其实际观察到的效应之间的落差,正是这篇论文的核心。溯源检测是这项技术明示的设计目标,即让生成文本能够被识别为机器产物。然而研究发现,SynthID-Text并非对模型行为毫无影响:该机制重塑了输出生成本身,既改变了拒答决策,也改变了智能体产生的工具调用。
研究的标题直白地道出了这种权衡:'溯源税'。对于部署大语言模型与自主智能体的团队而言,这项研究表明,启用水印并非叠加在生成过程之上的中性操作,而是可能改变模型行为的变量——包括对有害提示的响应,以及智能体所选择的行动。这些发现也加重了各组织在权衡是否采用水印时,所需同步开展的安全与可靠性测试负担。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅