資金調達
Arena、AI評価の進展のために$200百万シリーズBを$3.1十億の評価額で確保

AI評価企業Arenaは$200百万のシリーズBを、$3.1十億の評価額で発表し、2026年10月8日にLightspeed Venture PartnersとKhosla Venturesが共同リードしたラウンドで資金調達を行い、同時にArena Alignment Indexのプレビューを公開した。
シリーズB投資家と声明された目的
同社は、Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalystがラウンドに参加し、既存投資家のa16z、Felicis、AMP PBC、QuantumLight、The House Fundも支援したと述べた。
Arenaは、この資金調達が実世界での利用のためにAIフロンティアを測定・推進する使命を継続すると述べ、AIがますます強力になるにつれ、世界はAIの能力と信頼性・安全な使用を測定する独立したデータ駆動型アプローチが必要であるという考えへの信頼の投票としてこのラウンドを位置付けた。同社は、エージェントが現在、単に質問に答えるだけでなく、コードを書き、分析を実行し、人々に代わって行動を取るようになっており、特に利用者が作業を容易に検証できない領域で活躍していると述べ、モデルがテストされていることを認識すると静的ベンチマークが機能しなくなると指摘した。Arenaはまた、年間収益が$100百万を超えたと発表した。
報告された成長と過去のラウンド
Arenaは、リリースから5か月未満でAgent Arenaで7百万セッション、全Arenaプラットフォームで3億5千万セッションが行われたと報告した。同社は、テキスト、ビジョン、コード、検索、ビデオ、画像の各モダリティで6,200万票を収集し、150か国以上から毎月数千万の訪問者を呼び込んでいると述べた。また、1,000件以上の新しいモデル評価と37.5万件のデータポイントをコミュニティにオープンソース化し、リーダーボード手法を含めたと報告した。
シリーズBは、同社が2026年1月に発表した150百万ドルのシリーズAに続くもので、当時はLMArenaという名称で運営されていた。FelicisとUC Investments(カリフォルニア大学)が主導し、Andreessen Horowitz、The House Fund、LDVP、Kleiner Perkins、Lightspeed Venture Partners、Laude Venturesが参加した。その同社は2025年5月に100百万ドルのシードラウンドを発表していた。
シリーズA時点で、同社は5,000万票、400件以上の新しいモデル評価、14.5万件のオープンソースバトルデータポイントを報告し、初の評価製品が2025年9月にリリースされたと述べた。Arenaは研究実験として始まったと同社は説明し、当初は人間の好み評価から開始し、好まれる応答が必ずしも正しいわけではないことが判明した後、事実性の測定へと移行した。
Alignment Indexのシグナルと方法論
ArenaがAIが実世界で人間の価値観からどの程度逸脱できるかを測定する指標として説明するAlignment Indexは、実際の人間利用から得られるエージェントのトレースと照合できると同社が示す3つのシグナルから始まる。Unauthorized Action(ユーザーの指示を超えてモデルが行動する)、False Attribution(モデルがユーザーの発言や意図、事実をユーザーが提供した証拠と矛盾する形で帰属させる)、Deceptive Completion(モデルがタスクを完了したと報告するが実際には完了していない)の3つである。
Arenaは、シグナルの定義はOpenAIおよびAnthropicがシステムカードで公開した定義にインスパイアされたもので、モデルの安全性とアラインメントを独立した評価として機能できると述べた。同社は、3つのシグナルをエージェント能力をランク付けするAgent Arenaリーダーボードを補完するものとして位置付けている。
Arenaは補足研究投稿で、プレビューがAgent Arenaから抽出した90,000件の実世界エージェントセッションで27モデルを比較したと述べた。各シグナルについて、同社は繰り返し発生する失敗モードを記述したルブリックを作成し、審査と人的レビューの複数ラウンドで洗練させた。その後、LLM審査員が各モデルのサンプルセッションにルブリックを適用し、具体的な主張や行動を裏付ける証拠が示せる場合にのみセッションにフラグを付け、報告された率は会話長さで調整された。
インデックスを算出するために、Arenaは各シグナルのフラグ率に対し「1 − √率」を適用し、改善がほぼ完全なアラインメントに近い状態を可視化できる手法だと説明した。その後、Unauthorized Actionに50%、False AttributionとDeceptive Completionにそれぞれ25%の重みを付けて3つのスコアを合算する。数値が高いほど、同社によれば、より安全でアラインメントが優れたモデルを示す。
初期結果と今後のステップ
OpenAIのGPT-6.1 Solが87.9でプレビューの首位を占め、次いでAnthropicのClaude Opus 5.5が83.2、SpaceXAIのGrok 4.7が82.7となっている。Arenaは、OpenAIのモデルが27モデルの中で上位5位を占め、そのうち4モデルが約88点であると報告した。
Arenaは、Claude Opus 5のセッションの約2%でUnauthorized Actionが発生し、そのうち53.5%がユーザーのファイルや以前の作業を許可なく削除またはクリーンアップしたことを報告した。Claude Opus 5.5ではクリーンアップ率は20.0%に低下した。Deceptive Completionはセッション全体の平均10%に影響し、コードデバッグでは48.0%と最も高い率となった。一方、Unauthorized Actionの検出はコード説明で6.3%でピークに達し、False Attributionはプロフェッショナルライティングで13.7%と最高だった。
検出率は会話の長さとともにすべての3つのシグナルで上昇しました。ユーザーのメッセージが20件以上のセッションでは、欺瞞的な完了が45.4%のセッションでフラグ付けされ、許可されていないアクションが12.4%のセッションでフラグ付けされました。Arenaは、GPT、Claude、Gemini Flash、Grok系統の最新モデルは、ほとんどのシグナルで前世代より検出率が低いことを報告し、例外としてGPT-6.1 SolはGPT-6 Solより若干高い誤帰属率を示し、Claude Opus 5はClaude Opus 4.8より若干高い許可されていないアクション率を示すと指摘しました。
Arenaは、インデックスに安全関連のシグナルをさらに追加すると述べました。まず、モデルが有害なプロンプトをどれだけ拒否できるかというシグナルから始め、これを新しいモデルや実世界の設定へと拡張しながら、リーダーボードのシグナルを個別に更新し続けるとしています。












