Arena、評価額31億ドルで2億ドル調達 AIの嘘も採点へ

low angle photo of 30 St. Mary Axe AI

AIモデルの投票型ランキングを運営するArenaが、シリーズB(成長期の資金調達ラウンド)で2億ドルを調達しました。評価額は31億ドルです。TechCrunchの報道によると、1月のシリーズAは評価額17億ドルだったため、約10か月でほぼ倍増しました。同時に、モデルの嘘や無断行動を測る「整合性」カテゴリのランキングも追加しています。

背景と文脈

Arenaは2023年にUCバークレーの研究プロジェクトとして始まりました。利用者が同じ質問を2つのモデルに投げ、良かった方に投票する仕組みで、人間の好みに基づく順位表を作ります。一般向けの利用は無料で、月間の訪問者は数千万人に上ると同社は説明しています。

こうした投票型の評価が支持される背景には、従来のベンチマーク(モデルの能力を測る標準テスト)への不信があります。各社が点数を上げる工夫を重ねた結果、数字が実力を映さなくなったという声が増えました。さらに企業側も、標準テストの点数より「自社の業務でどのモデルが効くか」を知りたがっています。

収益も伸びています。シリーズA時点の年換算売上は3,000万ドルでした。6月には年換算の売上が1億ドルに達したと同社は発表しています。評価額の伸びは、この売上の伸びと歩調を合わせています。

技術/ビジネス面

a tall white structure with a clock on it's side
Photo by Adam Birkett on Unsplash

商用の柱は、2025年9月に始めたAI Evaluations(AI評価サービス)です。モデルを開発する企業や、導入を検討する企業に、コミュニティの投票に基づく詳細な分析を提供します。無料の投票が評価データの供給源になり、そのデータを有料で売る構造です。

今回のラウンドは、Lightspeed Venture PartnersとKhosla Venturesが主導しました。Salesforce Ventures、Dell Technologies Capital、a16zなども参加しています。

注目はもう一つの発表、整合性(alignment)のランキングです。整合性とは、モデルが人間の意図に沿って振る舞う度合いを指します。Arenaは次の3点で順位を付けます。頼まれていない行動を取る「無断の行動」、事実や発言を誤った出典に結びつける「誤った帰属」、そして実際には終えていない作業を終えたと主張する「欺瞞的な完了」です。

暫定版では、OpenAIのモデル群が上位を占めました。AnthropicのClaude Opus 5.5は6位、Claude Fableは9位です。Arenaは、モデルが「テストされている」と気づくと静的な試験は通用しなくなるため、独立した第三者が実際の利用の中で測る必要があると主張しています。ただし、順位の算出方法の詳細は報道からは確認できません。

これからどうなるか

評価をめぐる主導権争いが、能力の測定から安全性の測定へ広がっています。モデル選定の場面で、性能と価格に加えて「頼んだ作業を本当にやったか」が比較項目になる日が近いでしょう。

開発者の立場では、エージェントに作業を任せる設計への影響が大きいはずです。「終わりました」という自己申告を信用してよいか、テストやログで裏取りする仕組みが必要になります。コーディングエージェントを使うなら、完了報告をそのまま信じず、CIの結果やdiffで検証する運用が現実的です。

一方で、投票型の評価は参加者の好みに左右されます。整合性のような測りにくい性質を、投票で十分に捉えられるのかは今後の検証課題です。暫定ランキングが固まるまで、順位の絶対値より傾向を見るのが妥当でしょう。

まとめ

Arenaは評価額31億ドルで2億ドルを調達し、整合性ランキングという新しい物差しも加えました。モデルの無断行動や偽りの完了報告を測る試みは、エージェント時代の評価のあり方を示しています。ただし暫定版であり、順位は参考値として扱うのが安全です。

参考リンク

アイキャッチ画像: Photo by Joel Filipe on Unsplash

タイトルとURLをコピーしました