OpenAI dévoile son plan de conformité à l'AI Act européen : métadonnées C2PA et filigrane au niveau du token, avec 99,8 % de détection annoncés

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OpenAI a publié un cadre technique pour répondre aux exigences de l'AI Act européen en matière de provenance des textes, de filigranage et de transparence des contenus synthétiques. Il associe des métadonnées cryptographiques conformes à C2PA et un filigrane statistique multicouche, inséré token par token pendant le décodage autorégressif. OpenAI affirme une précision de détection supérieure à 99,8 % face à la paraphrase adverse, avec un impact négligeable sur la perplexité. Des outils de validation seront publiés en open source pour les autorités publiques et les partenaires d'audit. Ces chiffres sont déclarés par OpenAI, sans conditions de test ni réplication indépendante à ce jour.

OpenAI a publié un plan technique pour répondre aux exigences de l'AI Act européen en matière de provenance des textes, de filigranage et de transparence des contenus synthétiques. La conception comporte deux couches. La première est constituée de métadonnées cryptographiques conformes à C2PA. La seconde est un filigrane statistique multicouche. OpenAI indique aussi qu'elle publiera en open source des outils de validation destinés aux autorités publiques européennes et aux partenaires d'audit des entreprises. Tous les chiffres de performance ci-dessous proviennent de la description d'OpenAI elle-même. À l'heure où nous écrivons, nous n'avons vu ni la taille du jeu de test, ni la distribution des longueurs de texte, ni le taux de faux positifs, ni aucune réplication par un tiers. Il faut les lire comme des déclarations de fournisseur, non comme des faits vérifiés. Commençons par le contexte réglementaire. L'article 50 de l'AI Act impose des obligations de transparence à l'IA générative. Les fournisseurs doivent marquer les sorties dans un format lisible par machine afin qu'elles puissent être identifiées comme générées ou manipulées artificiellement. Les déployeurs doivent, dans des cas définis, signaler les hypertrucages et les textes générés par IA publiés pour informer le public. L'Union affine les méthodes pratiques de marquage et d'étiquetage au moyen d'un code de bonnes pratiques. Le texte ne prescrit pas une technique unique : chaque acteur doit choisir une approche et être prêt à démontrer son efficacité aux régulateurs. Le plan d'OpenAI est une tentative précoce de fournir cette réponse.

Voyons maintenant les mécanismes. La première couche est C2PA, une norme de provenance et d'authenticité des contenus soutenue par de nombreuses entreprises. Elle lie à un contenu un manifeste signé numériquement, qui consigne qui l'a produit et avec quel outil. Le vérificateur contrôle la chaîne de signatures et peut confirmer que le manifeste n'a pas été altéré. L'atout est la vérifiabilité cryptographique et l'auditabilité. La faiblesse est tout aussi nette : les métadonnées voyagent à côté du contenu. Quand un texte est copié-collé, capturé en image ou enregistré en texte brut, le manifeste se perd facilement. La seconde couche sert à combler cette lacune. Un filigrane statistique inscrit le signal dans le texte lui-même. L'approche la plus courante dans la littérature publique agit à chaque étape du décodage. Une partition pseudo-aléatoire du vocabulaire est dérivée du contexte précédent, et la probabilité d'échantillonnage d'une partie du vocabulaire est légèrement relevée. Un détecteur qui détient la clé compte combien de mots tombent dans la partie favorisée et recourt à un test d'hypothèse pour savoir si cette part dépasse nettement le hasard. Comme le signal est réparti sur de nombreux mots, il survit à la copie. OpenAI décrit son dispositif comme multicouche, mais le résumé ne dit pas comment les couches sont construites. Ces détails attendent la documentation complète.

OpenAI insiste aussi sur le fait que le filigrane au niveau du token n'ajoute aucune latence pendant le décodage autorégressif. Un modèle autorégressif produit un token à la fois. Un filigrane ajuste en général légèrement les logits avant l'échantillonnage. C'est une opération peu coûteuse comparée à une passe avant complète, de sorte que l'absence de latence perceptible est plausible en principe. Sur la qualité, OpenAI affirme que la perplexité est à peine affectée. Les recherches antérieures montrent un compromis entre la force du filigrane et la qualité du texte : un signal plus fort se détecte mieux mais perturbe davantage la distribution de sortie. OpenAI ne donne aucune valeur de perplexité, si bien que la position du système sur ce compromis reste inconnue.

Le chiffre phare est une précision de détection supérieure à 99,8 % face à la paraphrase adverse. La paraphrase est l'ennemie naturelle d'un filigrane. Un attaquant peut demander à un autre modèle de langage de reformuler un passage, ce qui brouille la séquence de mots d'origine. Conserver un taux de détection très élevé sous cette attaque exige généralement des textes assez longs, ou un signal lié au sens plutôt qu'aux formes de surface. La précision est de plus une métrique incomplète. Si les échantillons positifs et négatifs sont déséquilibrés, une précision élevée peut masquer un taux de faux positifs élevé. Pour un usage réglementaire, le taux de détection à faux positifs fixé compte davantage, car étiqueter un texte humain comme produit par une machine a des conséquences réelles. Aucune de ces informations n'est encore disponible.

Pour les développeurs et les entreprises, le plan compte de trois façons. D'abord, le coût de conformité va augmenter, mais il existe désormais une voie de référence. Les produits construits sur les modèles d'OpenAI pourraient hériter du filigrane et des métadonnées sans changer de code. Ensuite, il faut distinguer les rôles. Le texte attribue des obligations différentes aux fournisseurs et aux déployeurs, et une société qui enveloppe son produit autour d'une API doit savoir de quel côté elle se trouve. Enfin, la conservation des métadonnées devient une exigence d'ingénierie. Toute étape d'une chaîne de contenu qui supprime ou réécrit le texte peut invalider le manifeste C2PA ; la chaîne doit donc être conçue en conséquence. Les outils de validation en open source méritent également l'attention. Si régulateurs et auditeurs ne peuvent s'appuyer que sur le point d'accès de détection privé d'un fournisseur, ils manquent d'indépendance. Des outils publics permettent à des tiers de mener leurs propres vérifications et donnent aux chercheurs une chance de reproduire les résultats. Pour être vraiment utile, la publication doit toutefois divulguer aussi l'algorithme de détection, le choix des seuils et le comportement en matière de faux positifs. La gestion des clés reste une question ouverte. La détection exige généralement la clé du filigrane. Une clé divulguée permet à un attaquant d'effacer le filigrane de façon ciblée, voire d'en forger un pour incriminer quelqu'un.

Au niveau de l'industrie, ce plan peut avoir un effet de normalisation. Lorsque le plus grand fournisseur de modèles montre une approche qui semble praticable, les autres acteurs et les communautés de modèles ouverts risquent d'être jugés à cette aune. Les modèles à poids ouverts demeurent un cas difficile : les utilisateurs peuvent les déployer et désactiver le filigrane, de sorte qu'aucun schéma ne couvre tout le texte produit par IA. La manière dont le règlement sera interprété et appliqué sur ce point reste à observer. En somme, il s'agit d'une prise de position technique et réglementaire de poids, mais pas d'un verdict. Le vrai test viendra d'évaluations indépendantes, de la reconnaissance de l'approche par les régulateurs et de tests adverses sur le terrain. D'ici là, les lecteurs doivent traiter ces beaux chiffres avec prudence.

Sources