Microsoft内部文書、AI学習データ収集を「労働窃盗」と表現

AI学習データ収集を象徴するマシンラーニングのイメージ AI

NYT対Microsoft・OpenAI訴訟をめぐり、これまで黒塗りだった裁判資料の内容が2026年9月17日以降相次いで明らかになりました。資料には、Microsoftのブレント・ヘクト氏(応用科学部門ディレクター)がAI学習データのスクレイピングを「人類史上最大の労働窃盗」と表現した2023年1月の社内メモや、OpenAI幹部同士のやり取りが含まれています。開発者にとっても、学習データの扱い方や将来のライセンス費用を左右しかねない重要な訴訟として注目されています。

背景と文脈

今回明らかになった資料は、ニューヨーク・タイムズ(NYT)が2023年末にMicrosoftとOpenAIを著作権侵害で提訴した訴訟の一部です。NYTは、自社記事が無断でAIの学習データに使われた上、ChatGPTやCopilotが記事の内容をほぼそのまま再現できる点を問題視しています。同種の訴訟は他の出版社や作家からも相次いで起こされており、生成AIをめぐる著作権訴訟の中でも特に注目度の高い事案となっています。

両社は、著作物を学習に使う行為は「フェアユース」(著作物を権利者の許諾なく利用しても、目的や利用の性質によっては著作権侵害にならないとする米国の法理)に該当すると主張し、争いは長期間にわたって平行線をたどってきました。これまで両社の社内文書の多くは黒塗り(レダクション)された状態で提出されていましたが、訴訟の証拠開示手続きの中で裁判所が一部の公開を認め、今回の一連の報道につながりました。

学習データの収集がフェアユースの範囲に収まるかどうかは、生成AI業界全体のデータ調達の商習慣を左右する論点です。今回の内部文書は、MicrosoftとOpenAI自身がスクレイピングのリスクや報道機関への影響を社内でどう認識し議論していたかを示す証拠として、訴訟の行方を占ううえで重視されています。裁判所が最終的にどのような判断を下すかによって、今後AI企業が学習データを調達する際の前提条件が大きく変わる可能性があります。

技術/ビジネス面

裁判資料と司法を象徴する法廷のイメージ
Photo by Markus Spiske on Unsplash

裁判資料には、複数の生々しいやり取りが記録されています。Microsoftの応用科学部門ディレクターであるブレント・ヘクト氏は、2023年1月付の社内メモの中で、AI学習データのスクレイピングを前例のない規模の驚くべき窃盗と評したうえで、より踏み込んだ表現として「人類史上最大の労働窃盗」とまで述べていたことが分かりました。さらに2024年1月の社内プレゼンテーションでは、Copilotのような生成AI製品が、自らのコンテンツの供給元である報道機関の経済基盤を脅かす悪循環の状態に陥っていると指摘していたことも明らかになっています。

OpenAI側の資料からも際どいやり取りが見つかっています。研究者のニック・ライダー氏がNYTのペイウォール(有料会員向け記事を課金なしでは読めなくする仕組み)を回避する方法を見つけたとグレッグ・ブロックマン氏に伝えたところ、ブロックマン氏は「いいね」とだけ返信していました。資料はまた、OpenAIの学習用データセット「WebText」「WebText2」が、Common Crawl(ウェブ上の膨大なページを収集・保存する非営利プロジェクト)経由で数百万件規模のニュース記事に大きく依存して構築されていたことも示しています。加えてMicrosoft自身の社内調査では、Copilotが従来のBing検索に比べ、NYTサイトへのクリックスルー(検索結果からサイトへ実際に訪れる割合)を最大93%も減少させていたという結果も出ていました。

これからどうなるか

今回の資料は、フェアユースの主張の説得力に影響を与える可能性があります。企業側が学習データの経済的損害を社内で認識していたと示す文書は、原告側にとって有利な証拠となり得るためです。あわせてOpenAI幹部がChatGPTを出版社への「存立を揺るがす脅威」と捉えていたことも明らかになっており、報道機関の経営への影響を軽視していなかった実態が浮き彫りになっています。

裁判の行方次第では、AI企業がニュースサイトなどのコンテンツを学習データとして利用する際に、ライセンス契約や対価の支払いが今後の標準的な商習慣として定着する可能性があります。実際に一部のAI企業は既に大手メディアとのライセンス契約を進めており、今回の訴訟の結果はその流れを加速させるか、逆に無償利用を追認するかの分かれ目になりそうです。LLM APIを使ってアプリを開発しているエンジニアにとっても他人事ではありません。学習データの権利処理コストが上がれば、その負担が将来的にAPIの利用料金という形で転嫁される可能性があるためです。

まとめ

NYT対Microsoft・OpenAI訴訟の未封印資料から、Microsoft幹部がAI学習データのスクレイピングを「人類史上最大の労働窃盗」と表現していたことや、OpenAI内部での際どいやり取りが明らかになりました。裁判の結論はまだ出ていませんが、AI企業のデータ調達のあり方や、開発者が支払うコストの構造にも波及しうる重要な論点として、今後の展開が注目されます。

参考リンク

アイキャッチ画像: Photo by Google DeepMind on Unsplash

タイトルとURLをコピーしました