OpenAI发布欧盟AI法案合规蓝图:C2PA元数据加逐词水印,宣称对抗改写检出率超99.8%
OpenAI公布了应对欧盟AI法案文本溯源、水印与合成内容透明度要求的技术框架。方案把符合C2PA标准的加密元数据与多层统计水印结合起来,并在自回归解码阶段逐词嵌入水印。OpenAI称,该系统对对抗性改写的检测准确率超过99.8%,且对生成困惑度的影响可以忽略。公司还将向欧洲公共机构和企业审计伙伴开源验证工具。需要注意,上述数字来自OpenAI自述,测试条件和独立复现结果尚未公开。
OpenAI近日公布了一份技术蓝图,说明如何满足欧盟AI法案对文本溯源、水印和合成内容透明度的要求。蓝图由两层组成。第一层是符合C2PA标准的加密元数据,第二层是多层统计水印。OpenAI还表示,将向欧洲公共机构和企业审计伙伴开源验证工具。 以下内容中的性能数字,都来自OpenAI的自述。截至发稿,我们没有看到测试集规模、文本长度分布、误报率或第三方复现结果。读者应把它们当作厂商声明,而不是已验证的事实。 先看监管背景。欧盟AI法案第50条为生成式AI设定了透明度义务:提供方须以机器可读格式标记输出,使其可被识别为人工生成或操纵;部署方在特定情形下须披露深度伪造和公共利益文本由AI生成。具体的标记与标注做法,欧盟正在通过行业行为准则细化。法案并没有规定唯一的技术手段,因此各厂商需要自行选择方案,并向监管方证明其有效。OpenAI这份蓝图,就是一次主动给出答案的尝试。
再看技术机制。第一层,C2PA是由多家公司推动的内容来源与真实性标准。它把一份经数字签名的清单绑定到内容上,记录由谁、用什么工具生成。验证方检查签名链,即可确认清单未被篡改。它的优点是可加密验证、可审计。它的弱点同样明显:元数据是外挂的。文本被复制粘贴、经过截图或转存为纯文本时,清单很容易丢失。 第二层正是为弥补这一弱点而设。统计水印把信号写进文字本身。公开文献中最常见的做法,是在每一步解码时,依据前文生成一个伪随机的词表划分,轻微抬高某一部分词的采样概率。检测方知道密钥后,只需统计文本中落入偏好词表的词所占比例,用假设检验判断它是否显著高于随机水平。因为信号分散在许多词里,复制后依然存在。OpenAI称其方案是多层的,但没有在摘要里披露各层的具体构造,细节有待完整文档。
OpenAI强调的另一点是逐词水印在自回归解码中零延迟。自回归模型每次只生成一个词。水印的做法,是在采样前对logits做一次轻量调整。这个操作相对于一次完整的前向计算开销很小,所以说不增加可感知的延迟,在原理上是说得通的。至于生成质量,OpenAI称困惑度几乎不受影响。已有研究表明,水印强度与文本质量之间存在权衡:信号越强,越容易检测,但对分布的扰动也越大。OpenAI没有给出具体的困惑度数值,这一权衡点究竟落在哪里,仍是未知。
最受关注的数字是对抗性改写下超过99.8%的检测准确率。改写攻击是水印的天敌,攻击者可用另一个语言模型把整段文字换一种说法,把原有词序列打散。要在这种攻击下仍保持很高检出率,通常需要足够长的文本,或者让信号绑定在语义而非表层词形上。准确率这个指标本身也不够完整。如果正负样本比例失衡,高准确率可能掩盖较高的误报。对监管用途而言,更重要的是固定误报率下的检出率,因为把人类写的文字误判为AI生成,会带来严重的现实后果。这些信息目前都缺位。
对开发者和企业,蓝图的意义有三点。其一,合规成本会上升,但也有了可参照的实现路径。使用OpenAI模型的下游产品,可能在不改动代码的情况下继承水印与元数据。其二,必须区分角色。法案对提供方和部署方的义务不同,在API之上再封装产品的公司,需要弄清自己处在哪一档。其三,元数据保留成为工程要求。内容管线里任何会剥离或重写文本的环节,都可能让C2PA清单失效,需要在设计时考虑。 开源验证工具是另一个值得关注的部分。监管机构与审计方若只能依赖厂商的私有检测接口,就缺乏独立性。公开工具让第三方可以自行检验,也让学界有机会复现。不过,工具要真正有用,需要同时公开检测算法、阈值设定和误报率说明。至于密钥如何管理,也是悬而未决的问题:检测通常要持有水印密钥,密钥泄露会让攻击者有针对性地抹除水印,甚至伪造水印去陷害他人。 产业层面,这份蓝图可能产生标准化效应。当最大的模型厂商给出一套被认为可行的做法,其他厂商和开源模型社区很可能被拿来对标。但开源权重模型是个难题:用户可以自行部署并关闭水印,因此水印覆盖不了所有AI文本。法案对此的解释和执法力度,还有待观察。 总体来看,这是一次有分量的技术与合规表态,但不是定论。真正的检验,将来自独立评测、监管机构对做法的认可,以及真实环境中的对抗测试。这份蓝图能否成为行业通行做法,取决于细节披露的完整程度,也取决于监管机构是否愿意把它当作合规的参照。在这些结果出现之前,读者应谨慎对待那组漂亮的数字。