OpenAIが、EU域内のChatGPTとCodexの出力する文章に、見えない透かしを入れると発表しました。技術名は「textGrain」で、読み手には分からない形でAIが書いた文章の痕跡を残します。背景には、8月2日に適用が始まったEUのAI法の透明性要件があります。一方で、社内の試験では、語の1割を言い換えるだけで検出率が約92%から66%に下がることも示されました。TechCrunchの報道をもとに整理します。
背景と文脈
EUのAI法は、AIが生成したコンテンツを、他のシステムが識別できる形で印を付けるよう、提供事業者に求めています。画像や音声では透かしの研究が先行してきましたが、文章は短く、編集もされやすいため、難度が高い分野です。
ここでいう透かしとは、出力に統計的な目印を埋め込み、後から「この文章はこのモデルが作った可能性が高い」と判定できるようにする技術です。電子透かしと呼ばれる画像の技術と、考え方は近いものです。
対象はEU域内の利用者です。展開は今後数週間かけて、ChatGPTとCodexの全プランの対象ユーザーに広がる予定で、EU外には適用されません。
文章の透かしは、画像よりも難しい課題です。文章は情報量が少なく、人が手で書き直すだけで、痕跡が簡単に薄れるためです。規制が求める「識別できる形」と、技術的に確実にできることの間には、まだ距離があります。
技術/ビジネス面

textGrainの仕組みは次の通りです。言語モデルは文章を作る際、次の単語の候補を確率つきで並べます。textGrainは、秘密の鍵を使って候補を並べ替え、特定の語がわずかに選ばれやすくなるよう偏りを作ります。
1語ごとの偏りは小さく、読者は違いに気づきません。しかし文章全体では、鍵を知る側だけが検出できる統計的なパターンが残ります。コピーして貼り付けても、このパターンは保たれます。
APIの開発者は、世界のどこからでも、設定で手動でオンにできます。既定はオフです。
限界も明確に示されました。語の10%を同義語に置き換えると、検出率は約92%から66%に下がります。短い文章、数学の答え、翻訳された文章も、確実な検出が難しいとされています。
OpenAIは、透かしが見つからなくても人間が書いた証拠にはならないと注意を促しています。検出ツールも、当面は承認された研究者や専門組織に限って提供する方針です。信頼性を見極める段階にあるためです。
検出は、鍵を持つ側が文章を調べ、偏りのある語がどれだけ多いかを統計的に数える方法です。文章が長いほど偏りは積み重なって見つけやすく、短いほど判定は不安定になります。数学の答えのように、語の選択肢がほとんどない文章で効きにくいのも、このためです。
翻訳に弱いのも同じ理由です。別の言語に変換すると、元の語の並びが失われ、偏りの痕跡も消えます。意図的な書き換えで外せる点は、透かしの根本的な限界です。
これからどうなるか
注目点は、検出ツールがいつ、どの範囲に開放されるかです。現在は研究者や専門組織に限られており、教育機関や企業の採用担当者が使える形になるには時間がかかります。
開発者の視点では、2つの実務的な影響があります。1つ目は、EU向けにChatGPTやAPIの出力を使うサービスでは、透かしの有無が将来の運用に関わりうることです。API側で透かしをオンにするかは、コンプライアンスの担当と相談しておく価値があります。2つ目は、透かしを前提にした「AI文章かどうかの自動判定」を、プロダクトに組み込まないことです。検出率が66%まで下がる例がある以上、判定を根拠に人を評価する運用は危険です。
他社が同様の仕組みを入れるのか、規格の統一が進むのかも、今後の見どころです。
透かしは、悪意のある利用を完全に防ぐ道具ではなく、善意の利用者の透明性を高める道具と見るのが現実的です。
まとめ
OpenAIはEU向けに、文章の透かしtextGrainを導入します。規制対応が目的で、検出は万能ではありません。言い換えで検出率が下がるため、透かしを使った自動判定を判断の唯一の根拠にしないことが、実装者の基本姿勢になります。
参考リンク
アイキャッチ画像: Photo by Akshar Dave🌻 on Unsplash

