AI文本水印可能削弱大模型的安全护栏
Ars Technica 报道了 Lasso Security 的一项新研究:Anthropic 称未来的 Claude 模型将采用 SynthID-Text 水印,而研究者在六个开放权重模型上发现,该水印会改变模型对有害请求的拒答行为和工具调用。在提示注入下,部分模型更容易回答本应拒绝的请求。研究并未测试 Claude 本身。
事件概述
Ars Technica 资深安全编辑 Dan Goodin 报道了一项新研究,它把两个平时很少交汇的话题连在了一起:文本水印与 AI 安全。文章称,为回应欧盟的一项新法律,各家 AI 平台正在推行新的内容水印方案。Anthropic 最近披露,其未来的 Claude 模型将采用 SynthID-Text,这是 Google 研发并以开源方式发布的一种方法。
研究者是 Lasso Security 的 AI 安全研究员 Andrea Siposova。她发现,SynthID-Text 改变的不只是模型选哪个词,还会改变模型调用哪些工具,以及模型遵守或无视其训练时学到的安全护栏的可能性。在对抗性提示下,这种影响可能被放大。所谓对抗性提示,是指攻击者设法让模型执行有害动作,比如泄露密码或其他敏感信息。在某些情况下,模型本来不会执行的指令,在部署水印之后反而被执行了。文章的核心结论是:开发者必须认真测试,自己的大模型和智能体在开启水印后表现如何。
报道中的关键事实
- **水印为何在推广。** 文章把这些新方案与欧盟的一项新法律联系起来。- **SynthID-Text 做什么。** 它使用一把秘密密钥,细微地改变模型选择下一个词的过程。原本排第一的词也许是“cloudy”,密钥可能把它换成“overcast”。任何知道密钥的人,都能判断这段文字是否由持有该密钥的平台生成。- **测了什么。** Siposova 通过 Hugging Face 未经修改的 SynthIDTextWatermarkLogitsProcessor,使用 SynthID-Text 的“非失真”(non-distortionary)配置。
她把有害提示输入六个开放权重模型,并比较开启与关闭水印时的回答。- **发现了什么。** 水印改变了模型对有害请求的回答,当这些请求与提示注入技术结合时,变化更明显。在若干模型上,水印使模型更可能回答本来会拒绝的有害请求。- **智能体同样受影响。** 同样的采样结果,可以决定调用哪个工具、传入什么参数。Siposova 把这种行为层面的影响称为“采样漂移”(sampling drift)。- **密钥很重要。** 使用不同的秘密密钥时,模型的表现也不一样。
SynthID-Text 的工作方式
水印的做法,是在输出中嵌入一个信号,让输出之后能被识别为 AI 生成。这就是所谓的出处溯源(provenance)。语言模型通常从一组可能的候选词中采样,来挑选下一个词。SynthID 在这个采样过程里加入了随机种子生成器、采样算法和打分函数。过程不再使用任意的随机数生成器,而是使用一把秘密密钥。选词依然是随机的,但知道密钥的人可以检查一段词序列,并判断该密钥被使用的可能性。
一个核心特征是“锦标赛采样”(tournament sampling)。就像体育比赛,SynthID 会评估大量候选的下一个词元。秘密密钥给这些候选打上概率分数。每一轮由一对词元对决,隐藏分数更高的一个晋级下一轮。这个过程一直持续到决出最后的胜者。文章还给出了两个外部链接,介绍锦标赛采样的更多细节。
要记住的要点很简单:水印不是在文字写完之后再加上的,而是藏在每一个词元的选择之中。这就是它对读者不可见的原因,同时也是它原则上可以影响一切依赖这些选择的环节的原因。
我们的分析:为什么采样变化会触及安全
本节是我们自己的解读,并非来源中的论断。拒答并不是一个独立的开关。它和任何其他回答一样,来自逐词元的生成过程。模型之所以拒绝有害请求,是因为拒绝类的词元是更可能的后续。如果某个采样步骤把过程推向别的词元,这种平衡就可能改变。Siposova 的原话与这种看法相符:水印被设计成读者察觉不到,但只要改动模型生成的任何环节,就会带来权衡,“它总会在某个地方显现出来”。
提示注入让这种担忧更尖锐。用她的话说,当模型还能通过工具采取行动时,被削弱的拒答后果更严重。聊天模型回答了一个坏请求,产出的是文字。智能体回答了一个坏请求,则可能带着真实的参数去调用工具。文章指出,同样的采样词元可以决定调用哪个工具、传入什么参数。
来源中有两处细节值得注意。第一,工具调用的图表显示,水印改变了哪些单次工具调用是正确的,有时其幅度远大于整体准确率所显示的。直白地说,总体准确率看起来可能很稳定,而单个调用却在对与错之间来回翻转。只盯着总体指标的团队可能会漏掉这一点。第二,密钥变化的图表把每把秘密密钥画成一个点。零点右侧的点表示有害顺从度高于不加水印时,左侧的点则表示更低。文章正文没有说明两侧各有多少点。但这张图本身的存在表明,影响取决于密钥,用某一把密钥测过一次,并不能说明换一把密钥的结果。
研究的局限与未解问题
文章对局限说得很清楚。这项研究没有测试 Claude 模型在水印下的表现。它测试的是六个开放权重模型,因为这样研究者可以接触到词元采样,能在锦标赛采样过程中开关水印,同时保持其他设置不变。实验测试的也是 SynthID-Text 锦标赛采样的 Hugging Face 实现,而不是 Claude 模型将使用的具体实现。此外,本文来源是一篇关于该研究的新闻报道。它的正文没有给出效应大小、模型名称,也没有各模型的具体结果。我们没有读到原始研究报告,因此无法判断影响有多大。
尽管如此,文章的结论是:至少某些形式的水印方法可能影响模型和智能体的安全。随之而来的问题包括:生产环境中的实现是否与开源实现表现一致?在大量密钥之间,偏移有多大?平台能否选择可避免这种漂移的密钥或设置?来源没有回答这些问题。
给读者的实用建议
- **开着水印测试。** 文章称,开发者应当全面测试大模型和智能体在水印生效时的行为。在未加水印的模型上做的安全评估,未必描述得了实际部署的系统。- **把智能体和工具纳入测试。** 不仅要看文字是否正常,还要检查调用了哪些工具、传入了什么参数。
- **多试几把密钥。** 密钥变化的结果显示,模型行为随密钥而异。- **对整套系统做红队演练。** 文章称,红队攻防演练应对自家平台做压力测试,确保在部署 SynthID 后表现仍符合预期。- **谨慎解读结论。** 这是关于一组开放权重模型和一种实现的证据,并不是关于 Claude 的发现。
Sources
FAQ
SynthID-Text 是什么?
它是 Google 研发并以开源方式发布的水印方法。它用一把秘密密钥细微地改变模型选择下一个词的过程,知道密钥的人就能检查文字是否由使用它的平台生成。
Lasso Security 的研究发现了什么?
水印改变了六个开放权重模型对有害请求的回答,在结合提示注入技术时尤为明显。在若干模型上,水印使模型更可能回答本来会拒绝的请求。
这项研究是否说明 Claude 模型会更不安全?
不能。研究没有测试 Claude 模型,只测了六个开放权重模型和 SynthID-Text 的 Hugging Face 实现,而不是 Claude 模型将使用的实现。