Google DeepMindが、非公開の最新モデルを対象にした「二重盲検評価」の試験運用を発表しました。評価する側にはモデルの重み(学習済みパラメータの実体)を見せず、Google側には試験問題を見せない仕組みで、対象は軽量モデルのGemini Flash Liteです。MLCommons、シンガポールAI安全研究所、OpenMined、AVERIが協力し、ベンチマーク(AIの性能を測る統一テスト)の点数がどこまで信用できるかという業界共通の課題に切り込みました。
背景と文脈
AIモデルの性能比較では、MMLU(57分野の知識・推論を問う代表的ベンチマーク)やGSM8K(小学校レベルの算数推論ベンチマーク)のような共通テストのスコアがよく使われます。ただしこの仕組みには弱点があります。テスト問題がインターネット上に公開されていると、モデルの学習データに紛れ込む可能性があるのです。
この現象は「ベンチマーク汚染」と呼ばれます。問題を覚えた状態で解いているだけなら、スコアは実力ではなく記憶力を測っていることになります。しかも一度汚染が疑われると、後から潔白を証明する手段がほとんどありません。開発元が独自に用意した評価で好成績を発表しても、外部からは検証しづらいというのが実情でした。
特に懸念が大きいのはサイバーセキュリティ関連の評価です。攻撃・防御能力を測るベンチマーク問題は、公開してしまうこと自体が悪用リスクにつながります。安全性を測るテストほど、外部に問題を渡しにくいというジレンマがありました。
今回の取り組みには、業界横断の性能測定基準MLPerfで知られるMLCommonsが評価全体の調整役として関わっています。プライバシー保護技術を専門とする非営利団体OpenMinedと、シンガポール政府傘下のAI安全研究所も参加しており、単独企業の自己評価にとどまらない体制を作っている点が特徴です。
技術/ビジネス面

今回の仕組みは、Google Cloudの機密コンピューティング(Confidential Computing:データを処理している最中も暗号化したまま扱う技術)機能「Confidential Space」を土台にしています。試験問題とモデルの重みを、暗号化されたGPU専用の隔離環境の中だけで処理する方式です。評価する側はモデルの中身に触れず、Google側は問題の中身に触れないまま、採点結果だけが外に出てきます。
試験対象に軽量モデルのGemini Flash Liteを選んだのも狙いがあるとみられます。応答速度が速く扱いやすい小型モデルでまず仕組み全体を検証し、負荷の大きい大型モデルや、より機密性の高いセキュリティ評価へ段階的に広げていく計画と考えられます。
手順としては、外部の評価団体が用意した試験セットを暗号化した状態で隔離環境に投入し、その中でGemini Flash Liteが回答を生成、採点まで完結させてから結果だけを取り出します。第三者機関が「本当に見せずに測った」ことを暗号的に検証できる点が、自己申告のベンチマーク発表と大きく異なります。
Googleはこの手法を業界標準にしたい考えです。今回はまず軽量モデルでの試験運用ですが、狙いはサイバーセキュリティ関連など公開しにくい評価にこそこの仕組みを広げ、外部から信頼できる形で安全性を証明できるようにすることです。
これからどうなるか
開発者にとっての意味は、ベンチマークの数字をそのまま鵜呑みにしない習慣がこれまで以上に大事になる、という点です。モデル選定の際に「どの機関がどう測ったか」まで確認できる評価が増えれば、比較の精度は上がります。逆に自己申告のスコアしかない発表は、相対的に説得力が下がっていくとみられます。
自社でAIモデルの評価基盤を作っている開発チームにとっても示唆があります。社内ベンチマークをそのまま外部にも使わせたい場合、今回のような暗号化技術を使った検証可能な評価の仕組みは、将来的に参考になる設計パターンです。
この取り組みが広がれば、ベンダーの性能アピールに対して「第三者による二重盲検スコアはあるか」を尋ねるのが標準的な確認事項になっていく可能性があります。今後、他の大手AI企業が追随するかどうかも注目点です。
一方で、暗号化された隔離環境での処理は通常の評価より手間とコストがかかります。当面はすべてのベンチマークがこの方式に置き換わるわけではなく、悪用リスクの高いセキュリティ評価や、規制当局向けの認証など、信頼性が特に重視される場面から優先的に導入されていくとみられます。
まとめ
Google DeepMindは、モデルの重みと試験問題を互いに見せないまま採点できる二重盲検評価をGemini Flash Liteで試験運用しました。ベンチマーク汚染という業界共通の課題への一つの解決策であり、特にセキュリティ評価での活用が期待されています。
参考リンク
- Piloting the world’s first double-blind AI evaluations — Google DeepMind
- Google DeepMind Seals Gemini Test to Protect Benchmarks — TechRepublic
アイキャッチ画像: Photo by Solen Feyissa on Unsplash

