Un cadre de Microsoft parle du « plus grand vol de travail »
Selon Ars Technica, une requête en jugement sommaire déposée par les plaignants de la presse, menés par le New York Times, a été rendue publique. Elle cite Brent Hecht, directeur de la science appliquée chez Microsoft, qui parlait du « plus grand vol de travail de l'histoire humaine ». Microsoft répond que ces documents ne reflètent que l'avis d'un employé.
Ce qui s'est passé
D'après Ars Technica, une requête en jugement sommaire déposée par les plaignants du secteur de la presse, menés par le New York Times, a été rendue publique jeudi. Elle expose des documents internes de Microsoft et d'OpenAI que les deux entreprises s'étaient efforcées de garder à l'abri des regards. Les organes de presse affirment que ces documents montrent comment les deux groupes percevaient la menace pesant sur l'information avant de lancer des produits comme ChatGPT et Copilot.
La phrase la plus frappante vient de Brent Hecht, directeur de la science appliquée chez Microsoft. Selon les organes de presse, il a averti à plusieurs reprises que l'aspiration d'articles pour entraîner des IA était « un vol stupéfiant d'une ampleur sans précédent », peut-être le « plus grand vol de travail de l'histoire humaine ». Dans un autre document, il aurait écrit que le projet de collecte massive d'articles faisait « une parodie complète de l'idée de "fair use" ». Or le fair use est précisément la défense sur laquelle Microsoft et OpenAI s'appuient dans cette affaire.
Microsoft conteste cette lecture. Son porte-parole affirme que les documents de Hecht « reflètent le point de vue individuel d'un employé, ne constituent pas une analyse juridique et ne représentent pas la position de l'entreprise ». OpenAI n'avait pas répondu à la demande de commentaire d'Ars au moment de la publication.
Les faits clés de la requête
Tous les points ci-dessous sont des affirmations des plaignants ou des citations de documents qu'ils invoquent.
- **Une « boucle fatale ».** Un document de Microsoft décrit une « doom loop » qui « nuira en même temps aux performances de nos modèles et à l'ensemble du web ». Le même texte ajoute : « Il est très inhabituel qu'un produit final menace les bases économiques de ses fournisseurs essentiels, mais c'est la situation que nous avons créée pour notre activité de LLM à l'égard de sa "chaîne d'approvisionnement en contenu". »
- **Une « menace existentielle ».** Nick Turley, responsable de ChatGPT chez OpenAI, a écrit dans un message interne que les éditeurs feraient face à une « menace existentielle » de la part de produits commerciaux entraînés sur des contenus de presse et capables de remplacer les fournisseurs d'information.
- **Les données de clics.** Selon Ars, Microsoft a enregistré des baisses du taux de clics de 83 à 93 % pour certains plaignants, et de 51 à 94 % pour d'autres.
- **La rémunération.** Hecht reconnaît dans un document de Microsoft que « presque personne n'avait prévu que les contenus qu'il a créés soient utilisés de cette façon, et personne n'est rémunéré pour cet usage ».
- **L'échange sur le paywall.** Satya Nadella a déclaré sous serment que les entreprises d'IA ne devraient pas violer les conditions d'utilisation des sites de presse en contournant les paywalls. Pourtant, les messages internes d'OpenAI montrent que, lorsque Nick Ryder a informé le président Greg Brockman qu'une « astuce » permettait aux robots d'OpenAI de « contourner » le paywall du NYT, Brockman a répondu : « Ah, bien. »
- **La substitution.** Nadella a aussi reconnu que les chatbots servent de substituts, en volant des clics parce qu'ils donnent « l'information directement sur la plateforme d'IA plutôt que de vous obliger à aller à la source ». Un ingénieur d'OpenAI a écrit que « quelle que soit la visibilité des liens, les utilisateurs ne cliqueront pas ». Turley a estimé qu'il n'y a « aucune bonne raison de cliquer » quand le chatbot fournit l'information. Il a qualifié les chatbots de « largement substitutifs, point final » et prédit qu'ils le deviendront « de plus en plus à mesure qu'ils s'amélioreront ».
Comment les plaignants ont cherché des sorties textuelles
La requête décrit aussi la manière dont les organes de presse ont testé les produits. Ils sont allés au-delà de la méthode initiale, qui consistait à demander sans cesse « quelle est la ligne suivante ? ». Dans certains cas, les chatbots ont produit de longs extraits d'articles quand on leur demandait des résumés. D'autres sorties venaient de demandes de points clés en liste. Les requêtes demandant d'« évaluer le biais » d'un article ont été particulièrement efficaces. Les chatbots ont aussi reproduit des parties d'articles quand on leur demandait de choisir n'importe quel article sur la page d'accueil d'un site.
Les plaignants ne demandent au tribunal de statuer que sur les articles dont les sorties « démontrent un recouvrement textuel important ». Ils se disent convaincus que les « finalités substitutives de la copie par les défendeurs pèsent contre le fair use ». Les autres articles seraient traités au procès.
Ils affirment aussi que les deux groupes ont créé un filtre qui compliquait les tests des organes de presse. Hecht a estimé qu'un tel filtre pourrait passer pour une « dissimulation accidentelle », car il donnerait aux « personnes qui ont des droits sur le contenu moins de visibilité sur ce qui a servi à l'entraînement ».
Accusations sur les licences et l'origine des données
Les organes de presse disent que les mises en garde internes n'ont pas poussé Microsoft et OpenAI à acheter des licences. Selon eux, les deux groupes ont ainsi supplanté les éditeurs sur un autre marché, d'une manière que ceux-ci ne pouvaient pas anticiper. La requête contient deux accusations précises. D'abord, Microsoft aurait violé les « normes du secteur » en vendant à OpenAI, comme données d'entraînement, un jeu de données acheté pour Bing, sans consulter des organes de presse qui n'auraient pas approuvé ce détournement de leur accord pour l'exploration ordinaire d'un moteur de recherche. Ensuite, OpenAI aurait « agi de façon inappropriée » en obtenant, auprès d'un tiers lié par un accord interdisant tout usage commercial, un jeu de données de 1,8 million d'articles du NYT. Les employés d'OpenAI savaient qu'il « ne serait pas approprié » d'utiliser ces données « pour entraîner un modèle », allèguent les plaignants, mais ils l'ont fait.
Il s'agit d'allégations contenues dans une requête. L'article ne fait état d'aucune décision du tribunal à leur sujet.
Contexte : pourquoi l'argument de la substitution compte
Le fair use est un critère juridique souple. Une de ses questions centrales est de savoir si la copie nuit au marché de l'œuvre d'origine. C'est pourquoi les plaignants insistent sur la substitution. Si un chatbot remplace le site d'information aux yeux du lecteur, et s'il répète en plus le texte des articles mot pour mot, les plaignants estiment que le préjudice pour leur marché est évident. La requête soutient que « les tribunaux ont rejeté les thèses selon lesquelles copier des articles pour fournir un produit qui se substitue à la demande d'information relève du fair use ».
Les plaignants présentent aussi le problème comme un dilemme d'action collective. Selon eux, les entreprises d'IA « restent impuissantes à sortir de cette "doom loop" », parce que l'ensemble du secteur gagnerait à ce que chacune paie pour soutenir la production d'œuvres, mais que chaque entreprise a intérêt à prendre le contenu gratuitement pendant que d'autres paient. Conclure que copier des articles pour l'IA n'est pas du fair use « résoudrait ce dilemme du prisonnier en plaçant toutes les entreprises d'IA, OpenAI et Microsoft comprises, sur un pied d'égalité ». Ils citent aussi les AI Overviews de Google, lancés peu après ChatGPT, qui ont absorbé encore plus du trafic destiné aux sites d'information.
Notre analyse
Nous lisons ce dossier comme une histoire de preuves, plus que d'une citation isolée. Le mot « vol » est vif et fera les titres. Mais la réponse de Microsoft est un argument juridique valable : un avis interne n'est pas une conclusion de droit. Devant un tribunal, ce qui pèsera davantage, c'est peut-être la répétition, dans de nombreux documents et chez des personnes différentes, du même constat. Des ingénieurs, des responsables produit et un PDG sont cités pour dire que les utilisateurs ne cliquent pas et que les chatbots remplacent la source.
Les chiffres de clics sont la partie la plus difficile à écarter pour les défendeurs. D'après l'article, ils proviennent des données des entreprises elles-mêmes. Un tribunal devra tout de même décider si la baisse vient de la copie, d'une nouvelle façon de trouver l'information, ou des deux. Selon la description de Microsoft, le témoignage de Nadella portait sur « les changements en cours dans la façon dont les gens trouvent et consomment l'information », non sur le droit d'auteur. C'est dans cet écart entre une tendance du marché et une faute juridique que se jouera le débat sur le fair use.
L'échange sur le paywall est une question distincte. Il concerne la manière de collecter les données, pas l'apparence des sorties. Il pourrait influer sur l'appréciation de la bonne foi des défendeurs par le juge, mais nous ne savons pas quel poids un tribunal lui donnera.
Limites et questions ouvertes
Cet article est le compte rendu d'une journaliste sur la requête d'un seul camp. Les plaignants ont choisi les documents à mettre en avant et la façon de les présenter. Microsoft et OpenAI ont leurs propres écritures, et Ars ne cite pas du tout la position d'OpenAI.
Certaines citations nous parviennent par la description des plaignants, donc leur contexte complet reste invisible. La requête ne demande une décision que sur une partie des articles, et l'article ne dit ni quand le tribunal statuera, ni si l'affaire ira au procès. Rien ici ne constitue une constatation de contrefaçon.
Pistes pratiques pour les lecteurs
- **Observateurs des politiques publiques :** suivez la façon dont le tribunal traite les avis internes et les données d'usage. La décision pourrait influer sur l'avenir des licences pour les contenus de presse.
- **Éditeurs :** l'affaire suggère que les données de clics et de substitution peuvent devenir des preuves majeures dans les litiges avec les entreprises d'IA.
- **Équipes produit en IA :** les documents internes peuvent devenir publics en cas de litige.
Vos propos sur les risques, l'origine des données et les paywalls pourront être lus plus tard par un juge.
- **Tous les autres :** traitez avec prudence des citations divulguées et unilatérales. Attendez les écritures en réponse et la décision avant de conclure.
Sources
FAQ
Qu'a dit Brent Hecht ?
Selon les plaignants, le directeur de la science appliquée de Microsoft a averti à plusieurs reprises que l'aspiration d'articles pour entraîner des IA était « un vol stupéfiant d'une ampleur sans précédent », peut-être le « plus grand vol de travail de l'histoire humaine ». Dans un autre document, il parle d'une « parodie » du fair use.
Comment Microsoft répond-il à ces documents ?
Un porte-parole affirme que les documents de Hecht « reflètent le point de vue individuel d'un employé, ne constituent pas une analyse juridique et ne représentent pas la position de l'entreprise ». Microsoft défend ses produits comme un fair use transformatif. OpenAI n'avait pas répondu à la publication.
Quelles données de clics la requête cite-t-elle ?
Selon Ars, Microsoft a enregistré des baisses du taux de clics de 83 à 93 % pour certains plaignants et de 51 à 94 % pour d'autres. Les plaignants y voient, avec les propos internes, une preuve de substitution.