新ベンチマークOSWorld-Pro、AI操作成功率75.7%に低下

black laptop computer turned-on displaying source code on table AI

NVIDIAなどの研究チームが、パソコン操作を自動でこなすAIエージェントを評価する新しいベンチマーク「OSWorld-Pro」をarXivで公開しました。最終的な成否だけでなく、作業の途中経過まで細かく採点する仕組みが特徴です。この方式で測り直すと、最上位クラスのAIモデルでも成功率が大きく下がることが分かりました。見た目の完了率だけでは、AIエージェントの実力を測りきれない実態が浮き彫りになっています。

背景と文脈

マウス操作やアプリ切り替えなど、人間がパソコンで行う作業をAIエージェントに代行させる「コンピュータ操作AIエージェント」の開発が各社で進んでいます。ブラウザで資料を探して表計算ソフトに転記する、といった単純作業から、複数のアプリをまたいだ業務フローの自動化まで用途は広がりつつあります。その実力を測る代表的な指標が「OSWorld」というベンチマークで、実際のOS上でタスクを最後までやり遂げられたかどうかを見る仕組みでした。

ただし、この最終結果だけを見る評価には弱点がありました。途中で遠回りをしていても、無駄なクリックを繰り返していても、最後にたまたま正解にたどり着けば満点になってしまいます。逆に、正しい手順をほぼ踏んでいたのに最後の一歩でつまずいたケースと、最初から見当違いの操作をしていたケースが、同じ「失敗」として扱われてしまう問題もありました。これでは、AIエージェントがどこでつまずきやすいのか、開発者側が改善のヒントを得にくい状況です。

特にコンピュータ操作AIエージェントは、1つのタスクをこなすために数十回のクリックやキー入力を連鎖させます。途中の1ステップでも判断を誤ると、その後の操作すべてが的外れな方向に進んでしまう「エラーの連鎖」が起きやすい構造です。最終結果だけを見る評価方法では、この連鎖のどこに弱点があるのかを突き止められません。

技術/ビジネス面

man in blue crew neck t-shirt standing beside woman in orange tank top
Photo by ThisisEngineering on Unsplash

OSWorld-Proは、300以上のタスクを2800個以上の「サブゴール(最終目標に至るまでの中間的な達成目標)」に分解し、6万7000件超の人手によるアノテーション(AIの出力や途中経過に正解・不正解などのラベルを付ける作業)をもとに、途中経過ごとに正しく進めているかを判定します。判定にはLLM(Large Language Model、大規模言語モデル)自身を審査役として使う「LLM-as-judge」方式を採用し、どの段階でつまずいたのかを特定できるようにしています。

この手法で測定した結果、Anthropicの上位モデル「Claude Opus 5」の成績は、従来のOSWorldでの83.4%から、OSWorld-Proでは75.7%まで下がりました。研究チームは、目標と無関係な操作をしてしまう「サブゴール逸脱」や、クリック位置がわずかにずれる入力ミスなど、具体的な失敗パターンを複数特定しています。最終結果だけを見ていた従来の評価では、こうした細かなつまずきが見えていなかったことになります。研究チームはClaude Opus 5以外の複数のモデルでも同様に測定しており、いずれも従来のOSWorldスコアより低い数値になったと報告しています。つまり、現行の主要モデルに共通する課題である可能性が高いということです。

これからどうなるか

ブラウザ操作やRPA(Robotic Process Automation:定型作業をソフトウェアで自動化する仕組み)的な用途でAIエージェントを組み込もうとしている開発者にとって、この結果は示唆に富んでいます。自社のプロダクトでAIエージェントの評価をする際も、成功・失敗の二択だけでなく、途中のどこで失敗しやすいかをログとして残す設計にしておくと、原因の切り分けやプロンプト改善がしやすくなりそうです。特に金融や医療など、途中の手順そのものが監査対象になる業務では、プロセス単位の評価基準がそのまま説明責任の材料になり得ます。また、自動テストのカバレッジを最終画面のスクリーンショット比較だけに頼っている場合も、途中経過のログを残す設計に切り替えることで、リグレッションの原因特定が格段に速くなりそうです。

まとめ

OSWorld-Proは、AIエージェントの評価を「結果」から「過程」へと広げる試みです。見た目の成功率の裏にある弱点を可視化した点で、今後のエージェント開発における品質基準の参考になりそうです。成功率という一つの数字を鵜呑みにせず、どんな手順で目標に到達したかまで確認する視点が、これからのエージェント選定では欠かせなくなりそうです。

参考リンク

アイキャッチ画像: Photo by Jantine Doornbos on Unsplash

タイトルとURLをコピーしました