OpenAI發布歐盟AI法案合規藍圖:C2PA元數據加逐詞浮水印,宣稱對抗改寫檢出率超99.8%
OpenAI公布了因應歐盟AI法案文本溯源、浮水印與合成內容透明度要求的技術框架。方案把符合C2PA標準的加密元數據與多層統計浮水印結合起來,並在自迴歸解碼階段逐詞嵌入浮水印。OpenAI稱,該系統對對抗性改寫的檢測準確率超過99.8%,且對生成困惑度的影響可以忽略。公司還將向歐洲公共機構和企業稽核夥伴開源驗證工具。需要注意,上述數字來自OpenAI自述,測試條件和獨立重現結果尚未公開。
OpenAI近日公布了一份技術藍圖,說明如何滿足歐盟AI法案對文本溯源、浮水印和合成內容透明度的要求。藍圖由兩層組成。第一層是符合C2PA標準的加密元數據,第二層是多層統計浮水印。OpenAI還表示,將向歐洲公共機構和企業稽核夥伴開源驗證工具。 以下內容中的性能數字,都來自OpenAI的自述。截至發稿,我們沒有看到測試集規模、文本長度分佈、誤報率或第三方重現結果。讀者應把它們當作廠商聲明,而不是已驗證的事實。 先看監管背景。歐盟AI法案第50條為生成式AI設定了透明度義務:提供方須以機器可讀格式標記輸出,使其可被識別為人工生成或操縱;部署方在特定情形下須披露深度偽造和公共利益文本由AI生成。具體的標記與標註做法,歐盟正在透過行業行為準則細化。法案並沒有規定唯一的技術手段,因此各廠商需要自行選擇方案,並向監管方證明其有效。OpenAI這份藍圖,就是一次主動給出答案的嘗試。
再看技術機制。第一層,C2PA是由多家公司推動的內容來源與真實性標準。它把一份經數位簽章的清單綁定到內容上,記錄由誰、用什麼工具生成。驗證方檢查簽章鏈,即可確認清單未被竄改。它的優點是可加密驗證、可稽核。它的弱點同樣明顯:元數據是外掛的。文本被複製貼上、經過截圖或轉存為純文字時,清單很容易遺失。 第二層正是為彌補這一弱點而設。統計浮水印把訊號寫進文字本身。公開文獻中最常見的做法,是在每一步解碼時,依據前文生成一個偽隨機的詞表劃分,輕微抬高某一部分詞的取樣機率。檢測方知道金鑰後,只需統計文本中落入偏好詞表的詞所佔比例,用假設檢定判斷它是否顯著高於隨機水平。因為訊號分散在許多詞裡,複製後依然存在。OpenAI稱其方案是多層的,但沒有在摘要裡披露各層的具體構造,細節有待完整文件。
OpenAI強調的另一點是逐詞浮水印在自迴歸解碼中零延遲。自迴歸模型每次只生成一個詞。浮水印的做法,是在取樣前對logits做一次輕量調整。這個操作相對於一次完整的前向計算開銷很小,所以說不增加可感知的延遲,在原理上是說得通的。至於生成品質,OpenAI稱困惑度幾乎不受影響。已有研究表明,浮水印強度與文本品質之間存在權衡:訊號越強,越容易檢測,但對分佈的擾動也越大。OpenAI沒有給出具體的困惑度數值,這一權衡點究竟落在哪裡,仍是未知。 最受關注的數字是對抗性改寫下超過99.8%的檢測準確率。改寫攻擊是浮水印的天敵,攻擊者可用另一個語言模型把整段文字換一種說法,把原有詞序列打散。要在這種攻擊下仍保持很高檢出率,通常需要足夠長的文本,或者讓訊號綁定在語義而非表層詞形上。準確率這個指標本身也不夠完整。如果正負樣本比例失衡,高準確率可能掩蓋較高的誤報。對監管用途而言,更重要的是固定誤報率下的檢出率,因為把人類寫的文字誤判為AI生成,會帶來嚴重的現實後果。這些資訊目前都缺位。 對開發者和企業,藍圖的意義有三點。其一,合規成本會上升,但也有了可參照的實現路徑。使用OpenAI模型的下游產品,可能在不改動程式碼的情況下繼承浮水印與元數據。其二,必須區分角色。法案對提供方和部署方的義務不同,在API之上再封裝產品的公司,需要弄清自己處在哪一檔。其三,元數據保留成為工程要求。內容管線裡任何會剝離或重寫文本的環節,都可能讓C2PA清單失效,需要在設計時考慮。 開源驗證工具是另一個值得關注的部分。監管機構與稽核方若只能依賴廠商的私有檢測介面,就缺乏獨立性。公開工具讓第三方可以自行檢驗,也讓學界有機會重現。不過,工具要真正有用,需要同時公開檢測演算法、閾值設定和誤報率說明。至於金鑰如何管理,也是懸而未決的問題:檢測通常要持有浮水印金鑰,金鑰洩露會讓攻擊者有針對性地抹除浮水印,甚至偽造浮水印去陷害他人。 產業層面,這份藍圖可能產生標準化效應。當最大的模型廠商給出一套被認為可行的做法,其他廠商和開源模型社群很可能被拿來對標。但開源權重模型是個難題:使用者可以自行部署並關閉浮水印,因此浮水印覆蓋不了所有AI文本。法案對此的解釋和執法力度,還有待觀察。 總體來看,這是一次有分量的技術與合規表態,但不是定論。真正的檢驗,將來自獨立評測、監管機構對做法的認可,以及真實環境中的對抗測試。這份藍圖能否成為行業通行做法,取決於細節披露的完整程度,也取決於監管機構是否願意把它當作合規的參照。在這些結果出現之前,讀者應謹慎對待那組漂亮的數字。