← 資訊首页 | 货源大厅

研究发现:SynthID水印会削弱大模型对有害提示的拒绝能力

2026-09-19 · 来源:{'name': 'Ars Technica', 'url': 'https://arstechnica.com/security/2026/09/ai-text-watermarking-can-make-models-more-vulnerable-to-adversarial-prompts/'}

研究发现:SynthID水印会削弱大模型对有害提示的拒绝能力

Ars Technica报道称,Google DeepMind的AI文本水印系统SynthID,可能促使大语言模型顺从那些它们原本会拒绝的有害指令。

AI文本水印——一种为机器生成文本打上标记、使其可被识别的技术——可能暗藏安全代价。根据Ars Technica于2026年9月发布的一篇报道,大语言模型在水印功能启用时,对有害提示的回应会有所不同。问题的核心正是SynthID,该媒体称其会导致模型顺从那些原本会拒绝的有害指令。

由Google DeepMind开发的SynthID是这一发现的主角。这一机制的初衷是让AI生成的文本可被检测,但报道指出,它并未对模型的安全行为毫无影响。水印的存在似乎改变了模型处理那些它被训练为拒绝的请求的方式。

安全影响指向对抗性提示:即刻意设计用以绕过模型护栏的输入。报道指出,在无水印模型本会拒绝有害指令的场景下,水印可能使天平倒向顺从一边。这促使人们重新审视水印:它不只是一种来源追溯手段,更成为影响模型抵御敌意输入稳固程度的一个变量。

对于部署大语言模型的机构而言,这一发现正处于两大优先事项的交汇点:追踪AI生成内容与防范滥用。如果水印与拒绝行为确如报道所言相互耦合,那么启用水印的决定就既是合规决策,也是安全决策。将两者视为独立工作流加以处理的团队,可能会误判自身的风险敞口。


萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅