arXiv新指標Relay-Bench、GPT-5.5が43%どまり

machine learning research abstract AI

研究者のLiam Swayne氏は2026年7月20日、arXivに21ページの論文を投稿し、大規模言語モデル(LLM:Large Language Model、大規模言語モデル)が複数分野をまたいで推論する力を測る新しいベンチマーク(AIの性能を測る評価基準)「Relay-Bench」をarXiv(査読前の論文を公開するプレプリントサーバー)で公開しました。最先端モデルGPT-5.5(xHighモード)ですら正答率43.3%にとどまり、既存の指標では見えなかった弱点が浮き彫りになりました。複数の作業を連続でこなすAIエージェント(人の指示なしに一連の作業を自律的に進めるAIの仕組み)の実用性を考えるうえで、開発者にも参考になる結果です。

背景と文脈

これまでのAIベンチマークの多くは、数学・コーディング・一般知識といった単一分野の能力を個別に測るものが中心でした。しかし実際の開発現場でAIエージェントに任せる作業は、複数分野の知識を組み合わせて連続的にこなす場面がほとんどです。たとえば不具合調査では、ログを読み解く情報抽出力と、原因を推定する論理的な推論力、修正コードを書くコーディング力を同時に求められます。

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chainsと題されたこの論文は、こうした「複数分野をまたぐ連続タスク」を測る指標が乏しい現状に着目しました。既存の代表的なベンチマークでは、GPT-5.5のような最先端モデルが8割以上の高いスコアを記録し、指標として飽和(モデルの実力差を測れなくなる状態)しつつある問題もありました。単一分野を測るベンチマークでモデル同士の差がほぼ付かなくなると、開発者はどのモデルを選んでも大差ないと誤解しがちですが、実務は単一分野で完結しないため、この誤解を正す指標が求められていました。論文では、モデル同士の実力差がまだはっきり開いている「飽和していない」状態のベンチマークを維持することが、今後のモデル選定にとって重要だと位置づけています。

技術/ビジネス面

puzzle problem solving chain
Photo by Kelli McClintock on Unsplash

Relay-Benchは、視覚的推論・コーディング・数学・情報抽出(ウェブ検索を伴うものを含む)・一般知識・データ分析といった分野の小問を、2問から13問まで連結し、1つのプロンプトにまとめて出題します。文章のみで完結する形式で、画像や音声などマルチモーダル(複数の種類のデータを同時に扱う仕組み)な入力は求めません。プロンプトの記述をあえて複雑にしたり、文脈を長く冗長にしたりする工夫も加え、難度を高めています。たとえば、あるグラフを文章で説明した内容を読み取って必要な数値を割り出し(情報抽出と数学)、その数値を使う処理をコードで実装する(コーディング)、といった具合に、複数分野の小問が一つの流れとして連結される構成です。

モデル側にはコード実行やウェブ検索などのツール利用を制限なく認めたうえで評価した結果、最高スコアを記録したGPT-5.5(xHighモード)でも正答率は43.3%にとどまりました。同じモデルが既存の代表的なエージェント評価では8割を超えるスコアを出すことを踏まえると、単一分野での推論力の高さが、複数分野を連続してこなす力に直結しないことを示す結果です。

これからどうなるか

Relay-Benchの結果は、AIエージェントを複数工程の業務に組み込む際、単純な精度指標だけでは実力を見誤る危険性を示しています。開発者にとっては、単一タスクのベンチマークで高スコアのモデルを選んでも、複数分野をまたぐパイプライン(不具合調査からコード修正、テストまでを一気通貫で任せるような使い方)では期待通りに動かない可能性があります。

実務では、こうした連鎖的なタスクを一括で任せず、分野ごとに工程を区切って人が要所を確認する設計が、当面は現実的な選択肢になりそうです。既存のコーディング特化ベンチマークで高スコアのモデルを採用していても、複数工程を連続で任せる自動化パイプラインでは想定外の失敗が起きうる点を、開発チームは前提として持っておく必要があります。特に、途中の工程でエラーが出ても気づかずに次の工程へ進んでしまうような自動化フローは、Relay-Benchが示す弱点の影響を受けやすいため、要所ごとにログを検証するステップを挟む設計が安全です。ベンチマークが飽和しつつある現状を踏まえると、今後も同様の「複合タスク型」評価基準が増える見込みです。

まとめ

研究者のLiam Swayne氏が発表した新ベンチマークRelay-Benchは、複数分野をまたぐ推論力を測る指標です。最先端のGPT-5.5でも正答率43.3%にとどまり、既存の評価では見えなかった弱点を示しました。AIエージェントの実力評価に一石を投じる結果です。

参考リンク

アイキャッチ画像: Photo by Bozhin Karaivanov on Unsplash

タイトルとURLをコピーしました