arXiv論文:ウェブ上のAI生成文は学習に有害になり得る

a close up of a sheet of paper with numbers on it AI

ウェブ上の文章は、すでに3割近くがAIの書いたものです。arXivに9月30日に投稿された論文「How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text」は、そうした文章をモデルの学習に混ぜると何が起きるかを大規模に調べました。800個のモデルを実際に事前学習した結果、AI文は少量なら学習を助けるものの、増やすと逆効果に転じると報告しています。

背景と文脈

LLM(Large Language Model、大規模言語モデル)の事前学習データは、大半がウェブから集めた文章です。ところが、そのウェブにAI生成文が急速に増えています。論文によると、品質フィルタ(FineWeb)を通した後でも、2026年6月のデータの27.5%がAI生成と判定されました。8月には31.1%に上昇しています。判定にはPangramという検出ツールが使われました。

これまでの議論は、モデルが自分の出力で学習を重ねて劣化する「モデル崩壊」や、意図的に作る合成データが中心でした。今回の対象は違います。多くのモデルが人間の読者向けに書いた文章が、ラベルなしで学習データに混入する「野生の」AI文です。

なぜ人間の文章が重要なのでしょうか。言語モデルは、文章の「ばらつき」や珍しい表現も含めて統計を学びます。AIが書いた文章は、モデルが出しやすい言い回しに偏りがちです。それを大量に学習すると、現実の人間の言葉の多様さを捉えにくくなります。この論文はその影響を、損失という数値で定量的に示した点に意義があります。

技術/ビジネス面

white wooden CD rack inside the room
Photo by CHUTTERSNAP on Unsplash

実験では、人間の文章に加えるAI文の比率を変えながら、800個の言語モデルを事前学習しました。そして人間の文章とAI文それぞれに対する検証損失(モデルが未知の文章をどれだけ外すかを示す値で、低いほど良い)を測っています。

結果は条件で分かれます。人間の文章が少ない「データ不足」のモデルでは、AI文を足すと最初は人間文への損失が下がります。しかし効果はすぐ頭打ちになり、足し続けると悪化に転じます。人間の文章を十分に与えたモデルでは、AI文はほぼ最初から損失を押し上げました。同じ量の新しい人間の文章なら、損失は下がり続けています。

既存のスケーリング則(モデルとデータを増やすと性能がどう伸びるかを式で表したもの)は、この挙動を予測できませんでした。代表的なChinchilla則(Hoffmann氏らが2022年に示した式)もその一つです。そこで著者らは、効用と害を別々の項で表す新しい式を提案しました。AI文のトークンの価値が正から負へ変わることを表せます。

小さなモデルで当てはめた式は、最大3.6倍大きなモデルの損失を予測できました。誤差は既存の最良の式より41%小さくなっています。研究チームは、AI文を含む83B(830億)トークンのコーパス「WildAI」も公開しました。

この研究が示す規模感も押さえておきます。比率を変えた800個のモデルは、それぞれ別の条件で学習されています。単発の実験ではなく、条件を網羅して式に当てはめたため、予測が小型から大型へ外挿できました。推測ではなく、再現できる関係式として提示した点が、実務での使いやすさにつながります。

これからどうなるか

実務への示唆は三つあります。人間の文章を目標とするなら、AI文をフィルタで除くことです。データを拡張するなら、AI文を足すより先に人間の文章を繰り返し使うほうが有利です。さらに検証損失は、人間文とAI文で別々に報告すべきだと提案しています。

自前でファインチューニング(既存モデルを追加データで調整する作業)や社内向けの継続学習をしている開発者は、集めたデータの出どころを点検するとよいでしょう。クロールしたウェブ文書に、AI生成文が3割ほど混じっている前提で、判定ツールを前処理に入れるかどうかの判断材料になります。

一方で、目標がAI文の生成や識別であれば、AI文にも価値は残ります。今後は、検出ツールの精度や、他言語・他分野でも同じ傾向が出るかが論点です。

注意したいのは、この結果が「AI文は常に悪い」という意味ではないことです。データが極端に少ないときは補助になりますし、整えられたAI文が役立つ用途もあります。大事なのは、目的に応じて混ぜる量を設計し、混ぜた効果を人間文と分けて測ることです。公開されたWildAIは、その検証に使える素材になります。

まとめ

ウェブ文章の約3割はAI生成で、事前学習に混ぜると少量では効果があっても、増えると人間文への性能を下げると示されました。AI文の価値が正負で変わる新しいスケーリング則も提案されています。学習データを扱う開発者は、出どころの点検を始めるきっかけになります。

参考リンク

アイキャッチ画像: Photo by Bozhin Karaivanov on Unsplash

タイトルとURLをコピーしました