Microsoft-Manager: KI-Scraping größter Arbeitsdiebstahl?

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Laut Ars Technica wurde ein Antrag auf summarisches Urteil der Nachrichten-Kläger unter Führung der New York Times freigegeben. Er zitiert Brent Hecht, Director of Applied Science bei Microsoft, der das Abgreifen von Nachrichten für KI-Training als möglicherweise „größten Diebstahl von Arbeit in der Geschichte der Menschheit“ bezeichnete. Microsoft sagt, es sei die Sicht eines einzelnen Mitarbeiters.

Was geschehen ist

Laut Ars Technica wurde am Donnerstag ein Antrag auf summarisches Urteil freigegeben, den die Nachrichten-Kläger unter Führung der New York Times eingereicht haben. Er enthält interne Dokumente von Microsoft und OpenAI, die beide Unternehmen der Öffentlichkeit vorenthalten wollten. Die Nachrichtenhäuser behaupten, diese Dokumente zeigten, wie beide Firmen die Gefahr für den Nachrichtenmarkt einschätzten, bevor sie Produkte wie ChatGPT und Copilot auf den Markt brachten.

Der auffälligste Satz stammt von Brent Hecht, Director of Applied Science bei Microsoft. Nach Darstellung der Nachrichtenhäuser warnte er wiederholt, das Abgreifen von Nachrichten für KI-Training sei „ein erstaunlicher Diebstahl von beispiellosem Ausmaß“ und vielleicht der „größte Diebstahl von Arbeit in der Geschichte der Menschheit“. In einem anderen Dokument soll er geschrieben haben, der Plan, Nachrichten breit abzugreifen, sei „eine komplette Verhöhnung der Idee des ‚Fair Use‘“. Fair Use ist genau die Verteidigung, auf die sich Microsoft und OpenAI in diesem Verfahren stützen.

Microsoft widerspricht dieser Lesart. Ein Sprecher sagt, Hechts Dokumente „spiegeln die persönliche Sicht eines einzelnen Mitarbeiters wider, sind keine Rechtsanalyse und geben nicht die Haltung des Unternehmens wieder“. OpenAI hatte auf die Anfrage von Ars zum Zeitpunkt der Veröffentlichung nicht geantwortet.

Die wichtigsten Fakten aus dem Antrag

Alle folgenden Punkte sind Behauptungen der Kläger oder Zitate aus Dokumenten, auf die sie sich berufen.

  • **Eine „Doom Loop“.** Ein Microsoft-Dokument beschreibt eine „Doom Loop“, die „die Leistung unserer Modelle und zugleich das gesamte Web schädigen wird“. Dasselbe Dokument sagt: „Es ist höchst ungewöhnlich, dass ein Endprodukt die wirtschaftliche Grundlage seiner wichtigsten Zulieferer bedroht, aber genau diese Lage haben wir für unser LLM-Geschäft im Hinblick auf seine ‚Content-Lieferkette‘ geschaffen.“
  • **Eine „existenzielle Bedrohung“.** Nick Turley, der ChatGPT-Chef bei OpenAI, schrieb in einer internen Nachricht, Verlage stünden vor einer „existenziellen Bedrohung“ durch kommerzielle Produkte, die mit Nachrichteninhalten trainiert wurden und Nachrichtenanbieter ersetzen können.
  • **Klickdaten.** Laut Ars verzeichnete Microsoft bei einigen Klägern Einbrüche der Klickrate um 83 bis 93 Prozent, bei anderen um 51 bis 94 Prozent.
  • **Vergütung.** Hecht räumte in einem Microsoft-Dokument ein: „Fast niemand wollte, dass die von ihm geschaffenen Inhalte auf diese Weise genutzt werden, und niemand wird für ihre Nutzung vergütet.“
  • **Der Austausch über die Paywall.** Satya Nadella sagte unter Eid, KI-Unternehmen sollten die Nutzungsbedingungen von Nachrichtenseiten nicht verletzen, indem sie Paywalls umgehen. Interne OpenAI-Nachrichten zeigen jedoch: Als Nick Ryder Präsident Greg Brockman mitteilte, man habe „einen Hack“ gefunden, mit dem OpenAI-Crawler die NYT-Paywall „umgehen“ könnten, antwortete Brockman: „Ah, schön.“
  • **Substitution.** Nadella räumte auch ein, Chatbots wirkten als Ersatz und nähmen Klicks weg, weil sie „die Information direkt auf der KI-Plattform liefern, statt dass man zur Originalquelle gehen muss“. Ein OpenAI-Softwareingenieur schrieb, „egal wie deutlich wir die Links zeigen, Nutzer werden nicht klicken“. Turley meinte, es gebe „keinen guten Grund zu klicken“, wenn der Chatbot die Information liefert. Er nannte Chatbots „weitgehend substitutiv, Punkt“ und sagte voraus, sie würden „immer substitutiver, je besser sie werden“.

Wie die Kläger wortgleiche Ausgaben testeten

Der Antrag beschreibt auch, wie die Nachrichtenhäuser die Produkte prüften. Sie gingen über die frühe Methode hinaus, einen Chatbot immer wieder zu fragen: „Wie lautet die nächste Zeile?“ In manchen Fällen erzeugten Chatbots lange Artikelauszüge, wenn Nutzer Zusammenfassungen verlangten. Andere Ausgaben entstanden, als man nach den wichtigsten Stichpunkten eines Artikels fragte. Besonders erfolgreich waren Prompts, die Chatbots baten, die „Voreingenommenheit“ eines Artikels zu bewerten. Chatbots gaben zudem Teile von Artikeln wieder, wenn Nutzer sie baten, irgendeinen Artikel von der Startseite einer Website auszuwählen.

Die Kläger bitten das Gericht nur um eine Entscheidung zu Artikeln, bei denen die Ausgaben „umfangreiche wortgleiche Überschneidungen“ zeigen. Sie seien überzeugt, dass die „substitutiven Zwecke des Kopierens durch die Beklagten gegen Fair Use sprechen“. Rechtliche Bedenken zu anderen Artikeln würden im Prozess vorgebracht.

Die Kläger behaupten außerdem, die beiden Firmen hätten einen Filter gebaut, der es Nachrichtenhäusern erschwerte, die Chatbots zu testen. Hecht meinte, ein solcher Filter könne als „versehentliche Vertuschung“ wahrgenommen werden, weil „Menschen, die Rechte an den Inhalten haben, weniger Einblick darin bekommen, was für das Training verwendet wurde“.

Vorwürfe zu Lizenzen und Datenbeschaffung

Die Nachrichtenhäuser sagen, die Warnungen von Insidern hätten Microsoft und OpenAI nicht dazu gebracht, Nachrichteninhalte zu lizenzieren. Damit hätten die Firmen die Verlage in einem anderen Markt verdrängt, auf eine Weise, die diese nicht vorhersehen konnten. Der Antrag enthält zwei konkrete Vorwürfe. Erstens soll Microsoft gegen „Branchennormen“ verstoßen haben, indem es einen für Bing gekauften Datensatz als Trainingsdaten an OpenAI verkaufte, ohne Nachrichtenhäuser zu fragen, die diese Umwidmung ihrer Zustimmung zum gewöhnlichen Crawling durch Suchmaschinen nicht gebilligt hätten. Zweitens soll OpenAI „unangemessen gehandelt“ haben, indem es von einem Dritten, der per Vereinbarung an eine nicht kommerzielle Nutzung gebunden war, einen NYT-Datensatz mit 1,8 Millionen Artikeln erhielt. OpenAI-Mitarbeiter wussten, dass es „nicht angemessen wäre“, diese Daten „zum Training eines Modells“ zu verwenden, behaupten die Kläger, und taten es trotzdem.

Das sind Behauptungen in einem Antrag. Der Artikel berichtet von keiner gerichtlichen Feststellung dazu.

Hintergrund: Warum das Substitutionsargument zählt

Fair Use ist ein flexibler Rechtsmaßstab. Eine zentrale Frage lautet, ob eine Kopie dem Markt für das Originalwerk schadet. Deshalb konzentrieren sich die Kläger auf die Substitution. Ersetzt ein Chatbot für den Leser die Nachrichtenseite und wiederholt er zudem Artikeltexte wortwörtlich, sehen die Kläger den Schaden für ihren Markt als offensichtlich an. Der Antrag führt an, „Gerichte haben Behauptungen zurückgewiesen, das Kopieren von Nachrichtenartikeln für ein Produkt, das die Nachfrage nach Nachrichten ersetzt, sei Fair Use“.

Die Kläger stellen das Problem auch als Dilemma des kollektiven Handelns dar. KI-Firmen seien „machtlos, aus dieser ‚Doom Loop‘ auszubrechen“, weil es der ganzen Branche nützen würde, wenn jedes Unternehmen zahlte, um die Produktion kreativer Werke zu erhalten, es für jedes einzelne Unternehmen aber besser sei, Inhalte gratis zu nehmen, während andere zahlen. Ein Urteil, dass das Kopieren von Nachrichten für KI kein Fair Use ist, würde „dieses Gefangenendilemma lösen, indem es alle KI-Firmen, auch OpenAI und Microsoft, auf eine gleiche Basis stellt“. Sie verweisen auch auf Googles AI Overviews, die kurz nach dem Start von ChatGPT eingeführt wurden und noch mehr Verkehr aufsogen, der zuvor zu Nachrichtenseiten ging.

Unsere Einschätzung

Wir lesen dies als Geschichte über Beweise, weniger über ein einzelnes Zitat. Das Wort „Diebstahl“ ist grell und wird die Schlagzeilen bestimmen. Doch Microsofts Antwort ist ein berechtigtes juristisches Argument: Eine interne Meinung ist keine rechtliche Schlussfolgerung. Vor Gericht zählt womöglich mehr das Muster aus vielen Dokumenten und von verschiedenen Personen in zwei Unternehmen, die denselben Effekt beschreiben. Ingenieure, Produktchefs und ein CEO werden zitiert, dass Nutzer nicht klicken und Chatbots die Quelle ersetzen.

Die Klickzahlen sind für die Beklagten der am schwersten wegzudiskutierende Teil. Laut Artikel stammen sie aus den eigenen Daten der Unternehmen. Ein Gericht muss dennoch entscheiden, ob die verlorenen Klicks vom Kopieren kommen, von einer neuen Art, Informationen zu finden, oder von beidem. Nach Microsofts Darstellung ging es in Nadellas Aussage um „Veränderungen, wie Menschen Informationen finden und konsumieren“, nicht um Urheberrecht. In dieser Lücke zwischen einem Markttrend und einem Rechtsverstoß wird der Fair-Use-Streit entschieden.

Der Paywall-Austausch ist eine eigene Frage. Er betrifft, wie Daten gesammelt wurden, nicht wie die Ausgaben aussehen. Er könnte beeinflussen, wie ein Richter den guten Glauben der Beklagten sieht, doch wir können nicht sagen, wie viel Gewicht ein Gericht ihm beimessen wird.

Grenzen und offene Fragen

Der Artikel ist der Bericht einer Reporterin über den Antrag einer Seite. Die Kläger haben gewählt, welche Dokumente sie hervorheben und wie sie sie einordnen. Microsoft und OpenAI haben eigene Schriftsätze, und Ars zitiert die Position von OpenAI gar nicht.

Manche Zitate erreichen uns nur über die Beschreibung der Kläger, ihr voller Zusammenhang bleibt unsichtbar. Der Antrag verlangt nur für einen Teil der Artikel eine Entscheidung, und der Artikel sagt weder, wann das Gericht entscheidet, noch ob es zum Prozess kommt. Nichts hier ist eine Feststellung einer Rechtsverletzung.

Praktische Hinweise für Leser

  • **Politikbeobachter:** Achten Sie darauf, wie das Gericht interne Meinungen und Nutzungsdaten behandelt. Die Entscheidung könnte mitbestimmen, ob Lizenzen für Nachrichteninhalte zur Regel werden.
  • **Verlage:** Der Fall legt nahe, dass Klick- und Substitutionsdaten in Streitigkeiten mit KI-Firmen zu Schlüsselbeweisen werden können.
  • **KI-Produktteams:** Interne Dokumente können in Prozessen öffentlich werden.

Aussagen über Risiken, Datenherkunft und Paywalls könnten später von einem Richter gelesen werden.

  • **Alle anderen:** Gehen Sie mit durchgesickerten, einseitigen Zitaten vorsichtig um. Warten Sie auf die Erwiderungsschriftsätze und die Entscheidung, bevor Sie ein festes Urteil fällen.

Sources

FAQ

Was hat Brent Hecht gesagt?

Laut den Klägern warnte Microsofts Director of Applied Science wiederholt, das Abgreifen von Nachrichten für KI-Training sei „ein erstaunlicher Diebstahl von beispiellosem Ausmaß“, vielleicht der „größte Diebstahl von Arbeit in der Geschichte der Menschheit“. In einem anderen Dokument sprach er von einer „Verhöhnung“ des Fair Use.

Wie reagiert Microsoft auf die Dokumente?

Ein Sprecher sagt, Hechts Dokumente „spiegeln die persönliche Sicht eines einzelnen Mitarbeiters wider, sind keine Rechtsanalyse und geben nicht die Haltung des Unternehmens wieder“. Microsoft verteidigt seine Produkte als transformativen Fair Use. OpenAI hatte bei Veröffentlichung nicht geantwortet.

Welche Klickdaten nennt der Antrag?

Laut Ars verzeichnete Microsoft bei einigen Klägern Einbrüche der Klickrate um 83 bis 93 Prozent, bei anderen um 51 bis 94 Prozent. Die Kläger werten das zusammen mit internen Aussagen als Beleg für Substitution.