SWE-PolyVision登場、AIの複数画像バグ診断力を検証

AI研究のイメージ AI

新しいベンチマーク「SWE-PolyVision」が、AIコーディングエージェントに複数画像を使った推論力を問いかけています。研究チームが2026年9月に発表したこの評価基盤は、スクリーンショットや操作動画など複数の視覚情報を使います。それらを組み合わせて、ソフトウェアの不具合を特定・修正できるかを測るものです。36のオープンソース組織から集めた92件の実タスクを使い、AIが証拠をつなぎ合わせる力を検証します。

背景と文脈

AIコーディングエージェントの評価には、以前から画像を使うベンチマーク(ベンチマーク:AIの性能を一定の基準で測るためのテストセット)がありました。ただし多くは、1枚のスクリーンショットを「補足情報」として与えるだけでした。見なくてもテキストの情報だけである程度解けてしまう設計になっていたのです。

実際の開発現場では、バグ報告は1枚の画像で完結しません。エラー画面のスクリーンショット、修正前後のUI比較、操作を記録した動画など、複数の視覚的証拠がバラバラに存在します。それらを突き合わせて初めて、原因が見えてくることが多いのです。SWE-PolyVision: Benchmarking Cross-Image Abductive Reasoning for Repository-Level Software Engineeringは、この「複数画像をまたいだ推論」を正面から測る目的で作られました。

論文のキーワードになっているのが、アブダクション推論(アブダクティブ推論とも呼ばれます)です。これは、手がかりが断片的にしかない状況で、最も筋が通る原因を推理する考え方を指します。刑事が現場に残る複数の証拠から犯人を推理する過程に近いとイメージすると分かりやすいでしょう。1枚の画像だけでは分からない不具合の原因を、複数の視覚情報を突き合わせて突き止められるかが問われます。ベンチマークは公開タスク48件に加え、非公開の保留タスク44件も用意しました。モデルが問題を丸暗記して解いてしまう「過学習」を防ぐ工夫です。

技術/ビジネス面

コードをデバッグするプログラマーの画面
Photo by Jantine Doornbos on Unsplash

SWE-PolyVisionは、36のオープンソース組織のリポジトリ(リポジトリ:ソースコードの変更履歴を保存しておく場所)を対象にしています。そこから集めた92件のタスクで構成されています。付属する視覚素材は静止画像402枚、動画6本にのぼります。各タスクには最低でも2つ以上の視覚的な入力が用意されています。

評価は3つのモードに分けて行われました。文章のみで解く「Text-only」と、AIが画像を直接見て解く「Native Vision」の2つがあります。加えて、専用ツールで画像を確認しながら解く「Tool-mediated Vision」も用意されています。各タスクには、修正前のリポジトリと、修正の正しさを自動判定する検証プログラムがあらかじめ用意されています。人手を介さずに正解・不正解を判定できる仕組みです。

研究チームは11種類のコーディング向けAIモデルで、この3モードを比較しました。画像を見られるようになると、解けるタスクの顔ぶれが変わることが分かりました。ただしその効果はモデルごと・タスクごとにばらつきが大きく、一様に成績が上がるわけではありません。一部のケースでは、画像とテキストの手がかりがうまくかみ合い、原因を正しく特定して検証まで通る修正にたどり着く例も見られました。ただし、それが安定して起きるのは一部のモデル・一部のタスクに限られていました。

例えば、UIのレイアウト崩れを示すスクリーンショットと、操作手順の動画を組み合わせて初めて原因が絞り込めるタスクがあります。片方の情報だけを見たモデルは、的外れな修正を提案しがちでした。Tool-mediated Visionのように画像を拡大・比較しながら確認できる仕組みがあっても、その恩恵を引き出せるかはモデルの設計次第という点も見えてきました。

これからどうなるか

この結果は、AIコーディングエージェントが「複数画像を使った診断」をまだ安定してこなせないことを示しています。画像を渡せば必ず精度が上がるわけではありません。モデルとタスクの相性次第という点は、実運用を考えるうえで重要な注意点です。

ブログを読んでいる開発者にとっての意味は明快です。バグ報告にスクリーンショットや操作動画を添えてAIエージェントに渡しても、原因特定を全面的に任せきるのはまだ早いといえます。特に複数の画像を突き合わせないと分からない不具合では、AIの提示した修正案を鵜呑みにせず、テストや自動検証で裏付けを取る工程を残しておくのが安全でしょう。

今後、この種のベンチマークで高いスコアを出すモデルが登場すれば、画像付きのバグ報告をAIに任せられる範囲も広がっていくと見られます。逆にいえば、「画像を見て自動修正できる」という製品説明があっても、精度はタスク次第でばらつく前提で受け止めておくのが実務的でしょう。

まとめ

SWE-PolyVisionは、複数の画像や動画にまたがる証拠を統合してバグを直せるかを測る新しいベンチマークです。92件のタスクと11モデルの比較から、視覚情報がAIの成績を変える一方、その効果はモデルとタスク次第でばらつくことが分かりました。複数画像を使ったバグ診断は、まだ発展途上の課題といえます。今後の改善を追ううえで、注目すべき指標の一つになりそうです。

参考リンク

アイキャッチ画像: Photo by Google DeepMind on Unsplash

タイトルとURLをコピーしました