OpenAI legt Blaupause für EU-KI-Verordnung vor: C2PA-Metadaten und Token-Wasserzeichen, laut Angaben über 99,8 % Erkennung

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OpenAI hat einen technischen Rahmen veröffentlicht, mit dem sich die Anforderungen der EU-KI-Verordnung an Herkunftsnachweis, Wasserzeichen und Transparenz synthetischer Inhalte erfüllen lassen sollen. Er verbindet C2PA-konforme kryptografische Metadaten mit einem mehrschichtigen statistischen Wasserzeichen, das während der autoregressiven Dekodierung Token für Token eingebettet wird. Laut OpenAI liegt die Erkennungsgenauigkeit auch nach adversarialem Paraphrasieren über 99,8 %, bei vernachlässigbarem Einfluss auf die Perplexität. Prüfwerkzeuge sollen als Open Source an Behörden und Auditpartner gehen. Alle Zahlen stammen von OpenAI selbst; Testbedingungen und unabhängige Nachprüfung fehlen bislang.

OpenAI hat eine technische Blaupause veröffentlicht, wie sich die Anforderungen der EU-KI-Verordnung an Herkunftsnachweis von Texten, Wasserzeichen und Transparenz synthetischer Inhalte erfüllen lassen. Das Design besteht aus zwei Schichten. Die erste sind C2PA-konforme kryptografische Metadaten. Die zweite ist ein mehrschichtiges statistisches Wasserzeichen. Außerdem will OpenAI Prüfwerkzeuge als Open Source für europäische Behörden und Auditpartner von Unternehmen bereitstellen. Alle Leistungszahlen unten stammen aus OpenAIs eigener Beschreibung. Zum Redaktionsschluss liegen uns weder der Umfang des Testsatzes noch die Verteilung der Textlängen, die Falsch-Positiv-Rate oder eine Nachprüfung durch Dritte vor. Sie sind als Herstellerangaben zu lesen, nicht als geprüfte Tatsachen. Zunächst der regulatorische Hintergrund. Artikel 50 der EU-KI-Verordnung legt generativer KI Transparenzpflichten auf. Anbieter müssen Ausgaben in einem maschinenlesbaren Format kennzeichnen, damit sie als künstlich erzeugt oder manipuliert erkennbar sind. Betreiber müssen in bestimmten Fällen Deepfakes und KI-generierte Texte offenlegen, die zur Information der Öffentlichkeit veröffentlicht werden. Die praktischen Methoden der Kennzeichnung verfeinert die EU über einen Verhaltenskodex. Die Verordnung schreibt keine einzelne Technik vor. Jeder Anbieter muss deshalb einen Ansatz wählen und gegenüber der Aufsicht belegen können, dass er wirkt. OpenAIs Blaupause ist ein früher Versuch, diese Antwort zu liefern.

Nun zur Technik. Die erste Schicht ist C2PA, ein von vielen Unternehmen getragener Standard für Herkunft und Echtheit von Inhalten. Er bindet ein digital signiertes Manifest an einen Inhalt und hält fest, wer ihn mit welchem Werkzeug erzeugt hat. Wer prüft, kontrolliert die Signaturkette und kann feststellen, dass das Manifest nicht verändert wurde. Die Stärke liegt in der kryptografischen Prüfbarkeit und Auditierbarkeit. Die Schwäche ist ebenso klar: Die Metadaten reisen neben dem Inhalt. Wird Text kopiert und eingefügt, als Screenshot festgehalten oder als reiner Text gespeichert, geht das Manifest leicht verloren. Die zweite Schicht soll diese Lücke schließen. Ein statistisches Wasserzeichen schreibt das Signal in den Text selbst. Der in der öffentlichen Literatur gängigste Ansatz wirkt bei jedem Dekodierschritt. Aus dem vorhergehenden Kontext wird eine pseudozufällige Aufteilung des Vokabulars abgeleitet, und die Auswahlwahrscheinlichkeit eines Teils des Vokabulars wird leicht angehoben. Ein Detektor, der den Schlüssel kennt, zählt, wie viele Wörter in den bevorzugten Teil fallen, und prüft mit einem Hypothesentest, ob dieser Anteil deutlich über dem Zufall liegt. Weil das Signal über viele Wörter verteilt ist, übersteht es das Kopieren. OpenAI nennt sein Verfahren mehrschichtig, doch die Zusammenfassung verrät nicht, wie die Schichten aufgebaut sind. Diese Details müssen in der vollständigen Dokumentation folgen.

OpenAI betont außerdem, dass das Wasserzeichen auf Token-Ebene bei der autoregressiven Dekodierung keine Latenz hinzufügt. Ein autoregressives Modell erzeugt jeweils ein Token. Ein Wasserzeichen passt üblicherweise vor dem Sampling die Logits leicht an. Das ist im Vergleich zu einem vollständigen Vorwärtsdurchlauf eine billige Operation. Die Aussage, es gebe keine spürbare Verzögerung, ist daher im Prinzip plausibel. Zur Qualität sagt OpenAI, die Perplexität werde kaum beeinflusst. Frühere Forschung zeigt einen Zielkonflikt zwischen Stärke des Wasserzeichens und Textqualität: Ein stärkeres Signal ist leichter zu erkennen, stört aber die Ausgabeverteilung stärker. OpenAI nennt keine Perplexitätswerte, sodass offen bleibt, wo das System auf diesem Zielkonflikt liegt. Die Schlagzeilenzahl ist eine Erkennungsgenauigkeit von über 99,8 % bei adversarialem Paraphrasieren. Paraphrasieren ist der natürliche Feind eines Wasserzeichens. Ein Angreifer kann ein anderes Sprachmodell bitten, eine Passage umzuformulieren, wodurch die ursprüngliche Wortfolge durcheinandergerät. Eine sehr hohe Erkennungsrate unter diesem Angriff zu halten, verlangt meist ausreichend lange Texte oder ein Signal, das an die Bedeutung statt an Oberflächenformen gebunden ist. Auch Genauigkeit ist eine unvollständige Kennzahl. Sind positive und negative Proben ungleich verteilt, kann hohe Genauigkeit eine hohe Falsch-Positiv-Rate verdecken. Für regulatorische Zwecke zählt die Erkennungsrate bei fester Falsch-Positiv-Rate mehr, denn menschliche Texte als maschinell erzeugt einzustufen, hat reale Folgen. Diese Angaben fehlen bisher.

Für Entwickler und Unternehmen ist die Blaupause in dreifacher Hinsicht wichtig. Erstens steigen die Compliance-Kosten, doch es gibt nun einen Referenzpfad. Nachgelagerte Produkte auf Basis von OpenAI-Modellen könnten Wasserzeichen und Metadaten ohne Codeänderung erben. Zweitens müssen Rollen getrennt werden. Die Verordnung weist Anbietern und Betreibern unterschiedliche Pflichten zu, und wer ein eigenes Produkt um eine API legt, muss wissen, auf welcher Seite er steht. Drittens wird die Aufbewahrung der Metadaten zur technischen Anforderung. Jeder Schritt in einer Content-Pipeline, der Text entfernt oder umschreibt, kann das C2PA-Manifest entwerten. Die Pipeline muss entsprechend entworfen werden. Auch die quelloffenen Prüfwerkzeuge verdienen Beachtung. Wenn Aufsicht und Prüfer nur auf die private Erkennungsschnittstelle eines Anbieters zurückgreifen können, fehlt ihnen Unabhängigkeit. Öffentliche Werkzeuge erlauben es Dritten, selbst zu prüfen, und geben der Forschung die Chance zur Nachprüfung. Damit sie wirklich nützen, müssen mit der Veröffentlichung aber auch der Erkennungsalgorithmus, die Schwellenwerte und das Verhalten bei Falsch-Positiven offengelegt werden. Das Schlüsselmanagement bleibt eine offene Frage. Die Erkennung braucht in der Regel den Schlüssel des Wasserzeichens. Ein durchgesickerter Schlüssel erlaubt es Angreifern, das Wasserzeichen gezielt zu löschen oder sogar eines zu fälschen, um jemanden zu belasten.

Auf Branchenebene kann die Blaupause eine normierende Wirkung haben. Wenn der größte Modellanbieter einen als praktikabel geltenden Ansatz zeigt, werden andere Anbieter und Gemeinschaften offener Modelle vermutlich daran gemessen. Modelle mit offenen Gewichten bleiben ein schwieriger Fall: Nutzer können sie selbst betreiben und das Wasserzeichen abschalten, sodass kein Verfahren allen KI-Text erfasst. Wie die Verordnung hier ausgelegt und durchgesetzt wird, bleibt abzuwarten. Insgesamt ist dies eine gewichtige technische und regulatorische Positionierung, aber kein Urteil. Die eigentliche Bewährungsprobe kommt von unabhängigen Evaluierungen, von der Anerkennung des Ansatzes durch die Aufsicht und von adversarialen Tests im Feld. Bis diese Ergebnisse vorliegen, sollten Leser die schönen Zahlen mit Vorsicht behandeln.

Sources