arXiv論文:GPTの安全対策、偏見を消さず形を変えると判明

a black and white photo of a wall AI

GPT系列モデルの安全性訓練は、有害な表現を本当に減らしているのか、それとも別の形に変えているだけなのか。EMNLP 26に採択された論文「Harm Laundering in GPT Models」は、この問いに45万件規模の分析で答えを出しました。GPT-2からGPT-5まで15モデルを比較したところ、あからさまな差別表現は消える一方で、性別に関する偏見はより見えにくい形に姿を変えて残り続けていたのです。

背景と文脈

大規模言語モデルの安全性向上において、有害な出力を減らす「安全性訓練(safety training)」は欠かせない工程です。各社は差別的な発言や暴力的な内容を減らすため、人間のフィードバックを使った調整(RLHF:Reinforcement Learning from Human Feedback、人間のフィードバックに基づく強化学習)などの手法を重ねてきました。実際、あからさまなヘイトスピーチや性的暴力を想起させる表現は、旧世代のモデルに比べて新しいモデルでは大幅に減っています。

しかし、Sarah Wyer氏らの研究チームは、この「表面上の改善」に疑問を投げかけました。研究チームが提示したのが「ハームランダリング(harm laundering、直訳すると害の洗浄)」という概念です。マネーロンダリング(資金洗浄)が違法な資金の出どころを分からなくして合法的なお金に見せかける行為であるように、ハームランダリングとは、有害な内容が完全になくなるのではなく、検出されにくい別の形に姿を変えて温存されることを指します。

この仮説を検証するため、研究チームはGPT-2からGPT-5に至る系列の15モデルを対象に、性別を示す言葉を含む45万件の生成結果を分析しました。トピックモデリング(文章群から潜在的な話題の傾向を抽出する分析手法)や感情分析に加え、DetoxifyやREGARDといった既存の毒性判定ツールも組み合わせ、3つの性別条件下でモデルの出力がどう変化してきたかを追跡しています。

技術/ビジネス面

a close up of a sheet of paper with numbers on it
Photo by Bozhin Karaivanov on Unsplash

分析の結果は、単純な「改善」では説明できないものでした。GPT-2の時代には、女性に向けた生成結果に性的暴力を連想させる話題のかたまりが目立っていましたが、GPT-4になるとこうした表現は表面上ほぼ姿を消します。ところが同時に、男性に向けた生成結果には、GPT-2にはなかった「思いやり」や「感情の豊かさ」といった好意的な特徴が新たに付与されるようになっていました。話題の多様性という指標で見ると、GPT-4時点で女性向け生成結果のトピックの幅は男性向けに比べて36%も低下しています。

感情スコアの推移も興味深いパターンを示しました。旧世代のモデルでは女性を否定的に描く傾向がありましたが、新しいモデルではむしろ逆方向に振れすぎる「過剰修正」が見られたといいます。極めつけは、GPT-5が乳がんを「男性の権利問題」という枠組みで語る一方、同種の話題クラスターが女性向けの生成結果からは消えているという発見です。字面だけを見れば無害に見える変化ですが、内容の質という点では新たな偏りが生まれています。

研究チームが強調するのは、従来の毒性判定ツールがこうした変化を捉えられないという「分類器のミスマッチ」です。DetoxifyやREGARDのようなツールが示す毒性スコアは世代を追うごとに低下している一方、研究チームが独自に定義した「表象的な害(representational harm:特定の属性を持つ人々についての偏った描写や役割の押し付けなど、直接的な攻撃性を伴わない害)」は増加していました。つまり、現在の安全性評価の主流である毒性スコアだけを見ていると、実際には偏見が形を変えて温存されていることを見逃してしまう恐れがあるのです。

これからどうなるか

この論文が示す教訓は、AI企業の安全性チームだけでなく、社内でLLMを使ったプロダクトを作る開発者にも当てはまります。毒性判定APIのスコアが低いからといって、生成内容に偏りがないとは限りません。特に採用選考の要約、カスタマーサポートの応答、コンテンツ生成といった用途でLLMを使う場合、属性ごとに出力の傾向を比較するテストを自前で組み込むことが、今後より重要になっていくでしょう。

研究者コミュニティにとっては、単一の毒性スコアに頼らず、トピックの多様性や感情の分布といった複数の指標を組み合わせて評価する手法の開発が課題になります。安全性訓練を重ねるほどモデルの出力は「無難」になっていきますが、その無難さの中身を継続的に検証しない限り、今回のような形を変えた偏りは今後も見逃され続ける可能性があります。

モデルを乗り換えるたびに、こうした属性間の偏りが再発していないかを継続的にモニタリングする仕組みを、プロダクトのCI(継続的インテグレーション)に組み込んでおく発想も有効です。新しいモデルのバージョンがリリースされるたびに手動で確認するのではなく、属性ごとの出力傾向を自動比較するテストを用意しておけば、ハームランダリングのような目に見えにくい変化にも早めに気づけるようになります。

まとめ

GPT-2からGPT-5までの15モデルを分析した論文は、安全性訓練が有害な表現を完全になくすのではなく、別の形に変えて温存する「ハームランダリング」が起きていることを明らかにしました。従来の毒性判定ツールでは検出できない偏りが存在する以上、LLMを使う開発者は出力の属性間比較を自ら行う姿勢が求められます。

参考リンク

アイキャッチ画像: Photo by Google DeepMind on Unsplash

タイトルとURLをコピーしました