OpenAI、EU AI法対応の出所証明設計図を公開:C2PAメタデータとトークン単位透かしで言い換え攻撃下の検出率99.8%超を主張
OpenAIは、EU AI法が求めるテキストの出所証明、透かし、合成コンテンツの透明性に対応する技術的枠組みを公開した。C2PA準拠の暗号メタデータと、自己回帰デコード中にトークン単位で埋め込む多層の統計的透かしを組み合わせる。同社は、敵対的な言い換えを受けても検出精度が99.8%を超え、生成のパープレキシティへの影響は無視できる水準だと説明している。欧州の公的機関や企業の監査パートナー向けに検証ツールもオープンソース化する。数値は同社の自己申告であり、試験条件や第三者による再現は未公開である。
OpenAIは、EU AI法が求めるテキストの出所証明、透かし、合成コンテンツの透明性に対応するための技術的な設計図を公開した。構成は二層である。第一層はC2PA準拠の暗号メタデータ、第二層は多層の統計的透かしだ。OpenAIは、欧州の公的機関と企業の監査パートナー向けに検証ツールをオープンソース化するとも述べている。 以下の性能数値はすべてOpenAIの自己説明に基づく。執筆時点で、試験データの規模、文章長の分布、誤検出率、第三者による再現結果は確認できていない。検証済みの事実ではなく、事業者の主張として読んでほしい。 まず規制の背景である。EU AI法の第50条は、生成AIに透明性の義務を課している。提供者は出力を機械可読な形式で表示し、人工的に生成または操作されたものと識別できるようにしなければならない。導入者は、特定の場合にディープフェイクや公共の関心事に関するAI生成テキストを開示する必要がある。具体的な表示方法は、EUが行動規範を通じて詳細化を進めている。法は単一の技術を指定していないため、各社は方式を自ら選び、有効性を規制当局に示す必要がある。今回の設計図は、その答えを先に示そうとする試みだ。
次に技術的な仕組みを見る。第一層のC2PAは、多数の企業が支える、コンテンツの出所と真正性の標準だ。デジタル署名付きのマニフェストをコンテンツに結び付け、誰がどのツールで作ったかを記録する。検証側は署名の連鎖を確かめ、マニフェストが改ざんされていないことを確認できる。長所は、暗号的に検証でき、監査もしやすい点にある。弱点もはっきりしている。メタデータはコンテンツの外側に付く情報である。テキストをコピーして貼り付けたり、スクリーンショットにしたり、プレーンテキストで保存したりすると、マニフェストは簡単に失われる。 第二層は、この弱点を埋めるためにある。統計的透かしは、信号を文章そのものに書き込む。公開されている研究で最も一般的な方法は、デコードの各ステップで働く。直前の文脈から語彙の擬似乱数的な分割を作り、一方の語彙の選択確率をわずかに引き上げる。検出側は鍵を持っていれば、優先された語彙に入る語の割合を数え、その割合が偶然より有意に高いかを仮説検定で判断する。信号は多数の語に分散しているため、コピーしても残る。OpenAIは自社の方式を多層だと説明するが、各層の具体的な構成は概要では明かされていない。詳細は正式な文書を待つ必要がある。
OpenAIが強調するもう一つの点は、トークン単位の透かしが自己回帰デコード中に遅延ゼロであるということだ。自己回帰モデルは一度に一語ずつ生成する。透かしは通常、サンプリングの前にロジットを軽く調整する。この操作は、順伝播全体に比べれば非常に軽い。そのため、体感できる遅延がないという主張は、原理的には理にかなっている。品質について、OpenAIはパープレキシティへの影響がほとんどないと述べる。先行研究では、透かしの強さと文章品質のあいだにトレードオフがあることが示されている。信号が強いほど検出は容易になるが、出力分布の乱れも大きくなる。OpenAIは具体的なパープレキシティの数値を示しておらず、この方式がトレードオフのどこに位置するかは不明だ。
最も注目される数字は、敵対的な言い換えを受けても検出精度が99.8%を超えるという主張である。言い換えは透かしの天敵だ。攻撃者は別の言語モデルに文章を言い換えさせ、元の語の並びを崩せる。この攻撃下で高い検出率を保つには、十分な長さの文章が必要になるか、表層の語形ではなく意味に信号を結び付ける必要があるのが普通だ。精度という指標自体も不完全である。陽性と陰性の標本比率が偏っていれば、高い精度が高い誤検出を隠すことがある。規制用途では、固定した誤検出率のもとでの検出率のほうが重要だ。人間が書いた文章を機械生成と誤判定すれば、現実に深刻な結果を招くからである。こうした情報は今のところ欠けている。
開発者と企業にとって、この設計図の意味は三つある。第一に、遵守コストは上がるが、参照できる実装経路ができた。OpenAIのモデルを使う下流の製品は、コードを変えずに透かしとメタデータを引き継げる可能性がある。第二に、役割の区別が必要になる。法は提供者と導入者に異なる義務を課しており、APIの上に自社製品を載せる企業は、自分がどちらにあたるかを把握しなければならない。第三に、メタデータの保持がエンジニアリング上の要件になる。コンテンツ処理の流れの中で、テキストを削除したり書き換えたりする工程があると、C2PAのマニフェストが無効になりうる。設計の段階で考慮が必要だ。
オープンソースの検証ツールも注目に値する。規制当局や監査人が事業者の非公開の検出窓口にしか頼れないなら、独立性が足りない。公開ツールがあれば、第三者が自分で検査でき、研究者が再現する機会も得られる。ただし、本当に役立つためには、検出アルゴリズム、閾値の選び方、誤検出の挙動も併せて公開される必要がある。鍵の管理も未解決の問いだ。検出には通常、透かしの鍵が必要となる。鍵が漏れれば、攻撃者は狙いを定めて透かしを消せるし、他人を陥れるために透かしを偽造することさえできる。 業界全体では、この設計図が標準化の効果を持つ可能性がある。最大手のモデル事業者が実行可能に見える方式を示せば、他社やオープンモデルのコミュニティもそれを基準に比べられるだろう。ただし、オープンウェイトのモデルは難題として残る。利用者が自分で展開して透かしを切ることができるため、どの透かし方式もAI生成テキストのすべてを覆えない。法がこの点をどう解釈し、どこまで執行するかは今後を見守る必要がある。 総じて、これは重みのある技術的かつ遵守上の表明だが、結論ではない。本当の試験は、独立した評価、規制当局による方式の承認、実環境での敵対的な試験から来る。それらの結果が出るまでは、見栄えのよい数字を慎重に扱うべきだ。