Microsoft幹部「AIのニュース収集は史上最大の労働の窃盗」

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Ars Technicaによると、ニューヨーク・タイムズなど報道機関側の略式判決の申立書が封印解除されました。Microsoftの応用科学ディレクターBrent Hechtが、AI学習のためのニュース収集を「人類史上最大の労働の窃盗」かもしれないと警告したと引用されています。Microsoftは一人の従業員の見解だと反論しています。

何が起きたのか

Ars Technicaによると、ニューヨーク・タイムズを中心とする報道機関側の原告が提出した略式判決の申立書が、木曜日に封印解除されました。申立書には、MicrosoftとOpenAIが公開を避けようとしてきた社内文書が含まれています。報道機関側は、両社がChatGPTやCopilotのような製品を世に出す前から、ニュース業界への脅威を理解していたことを、これらの文書が示していると主張しています。

最も目を引くのは、MicrosoftのApplied Science部門ディレクター、Brent Hechtの言葉です。報道機関側によれば、彼はAI学習のためにニュースをスクレイピングすることを「前例のない規模の驚くべき窃盗」と繰り返し警告し、「人類史上最大の労働の窃盗」かもしれないと述べました。別の文書では、ニュースを広く収集する計画は「フェアユース」という考え方を「完全に愚弄するもの」だと書いたとされています。フェアユースは、この訴訟でMicrosoftとOpenAIが頼っている抗弁そのものです。

Microsoftはこの読み方に異を唱えています。同社の広報担当者は、Hechtの文書は「一人の従業員の個人的な見解を反映したものにすぎず、法的分析ではなく、会社の見解を表すものでもない」と述べました。Arsの掲載時点で、OpenAIはコメント要請に応じていません。

申立書にある主な事実

以下は、すべて原告側の主張、または原告が引用する文書の言葉です。

  • **「ドゥームループ」。** Microsoftの文書は、「私たちのモデルの性能と、ウェブ全体の性能を同時に損なう」ドゥームループを描いています。同じ文書には、最終製品がその重要な供給者の経済基盤を脅かすのは「非常に異例だが、それが私たちのLLM事業の『コンテンツ・サプライチェーン』に対して作り出した状況だ」とあります。
  • **「存亡の脅威」。** OpenAIのChatGPT責任者Nick Turleyは、ニュースで学習し、ニュース提供者の代わりになり得る商用製品は、出版社にとって「存亡の脅威」になると社内メッセージに書きました。
  • **クリック率のデータ。** Arsによると、Microsoftは一部の原告でクリック率が83〜93%低下し、他の原告では51〜94%低下したと記録しています。
  • **対価の問題。** Hechtは、Microsoftの文書で「自分が作ったコンテンツがこのように使われることを意図した人はほとんどおらず、その利用に対する対価も受け取っていない」と認めています。
  • **ペイウォールをめぐるやり取り。** MicrosoftのCEO、Satya Nadellaは宣誓証言で、AI企業はペイウォールを回避してニュースサイトの利用規約に違反すべきではないと述べました。しかしOpenAIの社内メッセージでは、Nick RyderがGreg Brockman社長に、OpenAIのクローラーがNYTのペイウォールを「回避する」ための「ハック」が見つかったと伝えたところ、Brockmanは「ああ、いいね」と返信しています。
  • **代替性。** Nadellaは、チャットボットが「元の情報源に行く代わりに、AIプラットフォーム上でその場で情報を与える」ことでクリックを奪っていると認めました。OpenAIのソフトウェアエンジニアは「リンクをどれほど目立たせても、ユーザーはクリックしない」と社内で書いています。Turleyは、チャットボットが情報を提供するなら「クリックする良い理由はない」と述べ、チャットボットは「要するに代替的だ、以上」であり、性能が上がるほど「ますます代替的になる」と予測しました。

原告はどのように逐語的な出力を試したか

申立書は、報道機関がこれらの製品をどう検証したかも説明しています。初期のように「次の一行は?」と繰り返し尋ねる方法にとどまりませんでした。ユーザーが要約を求めただけで、チャットボットが記事の長い抜粋を出力した例があります。記事の要点を箇条書きで求めた場合の出力も挙げられています。特に効果的だったのは、記事の「偏りを評価して」と頼むプロンプトです。サイトのトップページから好きな記事を選ぶよう頼むと、記事の一部を再現した例もありました。

原告が裁判所に判断を求めているのは、出力が「広範な逐語的重複を示す」記事に限られます。被告の複製の「代替的な目的はフェアユースに不利に働く」と確信しているからです。それ以外の記事に関する法的な論点は、公判で提起するとしています。

原告はさらに、両社が報道機関によるチャットボットの検証を難しくするフィルターを作ったと主張しています。Hechtは、そのようなフィルターは「うっかりした隠蔽」と受け取られかねないと指摘しました。「コンテンツに権利を持つ人々が、何が学習に使われたのかを見えにくくなる」ためです。

ライセンスとデータ調達をめぐる主張

報道機関側は、内部の警告があったにもかかわらず、MicrosoftとOpenAIがニュースのライセンス契約に向かわなかったと述べています。その結果、両社は出版社が予想できない形で別の市場を奪ったと主張します。申立書には具体的な主張が二つあります。第一に、MicrosoftはBing用に購入したデータセットを、OpenAIの学習用データとして販売し、「業界の慣行」に反したとされます。通常の検索エンジンのクロールへの同意をそのように転用することを、報道機関は承認しなかったはずですが、相談はなかったとされています。第二に、OpenAIは、商用利用しない契約に縛られた第三者から、180万本のNYT記事のデータセットを入手し、「不適切な行為」をしたとされます。OpenAIの従業員は、そのデータを「モデルの学習に」使うのは「適切ではない」と知りながら、使ったと原告は主張しています。

これらは申立書の中の主張です。記事は、裁判所がこれらについて何らかの判断を示したとは伝えていません。

背景:なぜ「代替」が争点なのか

フェアユースは柔軟な法的基準です。その中心的な問いの一つは、複製が元の作品の市場を害するかどうかです。原告が代替性に焦点を当てるのはそのためです。チャットボットが読者にとってニュースサイトの代わりになり、しかも記事の文章をそのまま繰り返すなら、市場への損害は明白だと原告は考えます。申立書は「ニュースへの需要の代わりとなる製品を提供するためにニュース記事を複製することをフェアユースとする主張を、裁判所は退けてきた」と述べています。

原告は、この問題を集団行動の問題としても描いています。AI企業は「このドゥームループから抜け出す力がない」と述べます。業界全体としては、各社が創作物の生産を支えるために支払う方が得ですが、個々の企業にとっては、他社が支払う間に無料で取る方が得だからです。AIのためのニュース複製がフェアユースではないと認められれば、「OpenAIとMicrosoftを含むすべてのAI企業を同じ土俵に立たせ、この囚人のジレンマを解決する」と主張しています。GoogleのAI Overviewsにも触れています。ChatGPTの登場後まもなく導入され、ニュースサイトに向かっていたトラフィックをさらに吸収したという指摘です。

私たちの見方

これは一つの発言よりも、証拠の物語だと私たちは読みます。「窃盗」という言葉は強烈で、見出しになります。ただし、社内の個人の意見は法的結論ではないというMicrosoftの反論は、法的には筋が通っています。法廷では、二つの会社の異なる人々が複数の文書で同じ効果を述べているというパターンの方が重要になるかもしれません。エンジニア、製品責任者、CEOが、ユーザーはクリックしない、チャットボットは情報源の代わりになる、と述べたと引用されています。

クリック率の数字は、被告にとって最も無視しにくい部分です。記事によれば、これは両社自身のデータです。それでも、クリック減少が複製によるのか、情報の探し方の新しい変化によるのか、両方なのかを、裁判所は判断しなければなりません。Microsoftの説明では、Nadellaの証言は「人々が情報を見つけ、消費する方法の変化」に関するもので、著作権法の話ではありません。市場の傾向と法的な不正の間のこの溝で、フェアユースの争いは決着するでしょう。

ペイウォールをめぐるやり取りは別の問題です。出力の見た目ではなく、データの集め方に関わります。裁判官が被告の誠実さをどう見るかに影響するかもしれませんが、どれほどの重みが与えられるかは分かりません。

限界と未解決の問い

この記事は、一方の申立書についての一人の記者の報告です。どの文書を強調し、どう位置づけるかは原告が選んでいます。MicrosoftとOpenAIには独自の書面があり、ArsはOpenAIの立場を引用していません。

引用の一部は原告の説明を通じて伝わっているため、全文脈は見えません。申立書は記事の一部についてのみ判断を求めており、裁判所がいつ判断するのか、公判に進むのかは記事に書かれていません。ここには侵害の認定は一つもありません。

読者への実践的な示唆

  • **政策ウォッチャー:** 裁判所が社内の意見や利用データをどう扱うかに注目してください。この判断は、ニュースのライセンスが標準になるかどうかを左右するかもしれません。- **出版社:** この事件は、クリック率と代替性のデータがAI企業との紛争で重要な証拠になり得ることを示唆します。
  • **AI製品チーム:** 社内文書は訴訟で公開され得ます。リスク、データ調達、ペイウォールに関する発言は、後に裁判官に読まれるかもしれません。- **その他の読者:** 流出した一方的な引用は慎重に扱い、被告の反論書面と裁判所の判断を待ってから結論を出してください。

Sources

FAQ

Brent Hechtは何と述べましたか?

報道機関側によれば、Microsoftの応用科学ディレクターは、AI学習のためのニュース収集を「前例のない規模の驚くべき窃盗」、おそらく「人類史上最大の労働の窃盗」だと繰り返し警告しました。別の文書では、フェアユースを「完全に愚弄する」ものだと書いたとされます。

Microsoftはこれらの文書にどう反応していますか?

広報担当者は、Hechtの文書は「一人の従業員の個人的な見解にすぎず、法的分析ではなく、会社の見解ではない」と述べています。同社はAI製品を変容的なフェアユースだと擁護しています。OpenAIは掲載時点で未回答でした。

申立書はどんなクリック率データを挙げていますか?

Arsによると、Microsoftは一部の原告でクリック率が83〜93%、他の原告で51〜94%低下したと記録しました。原告は社内の発言と合わせて、代替性の証拠だと主張しています。