ソートリーダー

オープンモデルはますます向上しています。経済面はますます複雑になっています。

mm
Unite.AI を Google の優先ソースに追加

AIモデルは明らかに18か月前よりも優れています。しかし、より深く調べ始めると、その進歩に対する従来の説明では納得できませんでした。

単に規模が大きくなったからといって改善したわけではありません。「オープンソースが勝っている」は半分だけ正しいです。また、ベンチマークスコアを見るべきだという助言は、予想ほど有用ではないことが判明しました。この点を受け入れるのに時間がかかりました。

そこで、8つの研究所から46モデルにわたる18か月間のデータを取得しました。インテリジェンスが商品化しつつあるか、オープンモデルが最先端に追いついているか、そして企業がシステム選定時に測定すべき指標は何かを理解したいと考えました。

重要な発見は単純明快でした。ベンチマークスコアはモデルそのものの属性ではなく、モデル、ソフトウェア、周囲のコンテキスト、そして許容された時間と計算リソースを反映しています。1つの数値だけを公開すれば、残りの2つは隠されたままです。

しかし、その意味合いははるかに広範です。企業は、実際に作業を遂行すべき完全なシステムを評価すべきところで、個々のモデルだけを比較しています。

ベンチマークはシステムを隠す

総合スコアを見るのをやめ、テストごとにモデルを比較したところ、主要なオープンウェイトモデルとプロプライエタリモデルの差は単一の数値では表せませんでした。

SWE-bench Verified(多くのモデル発表で使用されてきた古いテスト)では差は0.2ポイントでした。一方、現実的で多言語のソフトウェア作業を標準化された設定で設計した新しいテスト、SWE-bench Proでは差は18.2ポイントでした。

見かけ上のモデル差はベンチマークによって異なります

ベンチマーク 差 ステータス
SWE-bench Verified 0.2 ポイント 飽和、汚染が検出済み
GPQA Diamond 2.0 ポイント 飽和、上限は約92〜95%
Terminal-Bench 2.1 4.9 ポイント ライブ、エージェント的
Humanity’s Last Exam 9.8 ポイント ライブ、最先端推論
SWE-bench Pro 18.2 ポイント ライブ、標準化された枠組み

出典:Jaspreet Singhによる主要なオープンウェイトおよびプロプライエタリモデルの分析、2026年7月。

同じモデルでも、テストを実施する主体によって異なるスコアが付くことがあります。Kimi K3は独立評価でTerminal-Bench 2.1で80.9%、メーカーが報告した結果では88.3%のスコアを得ました。その7.4ポイントの差は、私が分析した5つのベンチマークのうち3つで見られたオープン対最先端の差よりも大きいです。

モデルは周囲のソフトウェアから指示を受け取り、与えられたコンテキストを利用し、アクセス可能なツールを使用し、開発者が設定した推論予算の範囲内で動作します。これらの条件を変えれば、結果もそれに応じて変化します。

公開ベンチマークは進歩の方向性を把握するのに有用ですが、社内で何が機能するかを判断する根拠としては不十分です。

エージェント的信頼性が計算式を変える

AIが質問への回答から一連の行動の実行へと移行するにつれて、これはますます重要になります。

20ステップからなるワークフローを考えてみてください。AIが各ステップを95%の確率で正しく実行するとします。一見信頼できそうです。しかし、全体のシーケンスではワークフローの成功率はわずか36%にとどまります。

より優れたモデルは各ステップの成功確率を向上させ、特に難しいエージェント的作業で効果を発揮します。仕事を台無しにするかどうかは、周囲のエンジニアリングに左右されます。進捗の保存、出力の検証、安全なリトライ、失敗からの回復は、説得力のあるデモと信頼できる製品を分ける重要な要素です。

モデル選択は依然として重要です。しかし、最高スコアのモデルが必ずしも最も信頼できるシステムを生み出すわけではありません。

作業に応じてモデルを選ぶ

データは、オープン対プロプライエタリの議論が通常示す結論よりも、より限定的な結論を支持しています。

オープンウェイトモデルは、結果が直接測定できる明確で短期的な作業において競争力があります。分類、抽出、要約、構造化生成はますますこのカテゴリに該当します。

最先端モデルは、より長期的なエージェント作業、プレッシャー下での指示遵守、事後に失敗検出が高コストになる作業で依然として高価値を保持しています。新しいベンチマークがゼロではなく約18ポイントの差を示すのはこの領域であり、モデルベンダーが提供する安全層が価値を持つポイントでもあります。

企業はタスクに応じてモデルを選択すべきですが、切り替えが無料であると想定すべきではありません。コンテキスト、推論、プロンプトキャッシュはプロバイダー間でスムーズに移行しません。システムを変更して作業をやり直さざるを得なくなったり、エンジニアリングやガバナンスの層が増えると、より安価なモデルでもコストが高くなる可能性があります。

モデル選択は永続的でなくなりつつあります。切り替えは依然としてアーキテクチャ上の判断です。

知能が安価になるにつれ、判断は依然として高価である

汎用的な有能な能力は非常に低コストになっています。しかし、曲線の上位に行くほど、追加の性能ポイントは前のものよりも高くつきます。最後の9ポイントの能力は、下位のすべてのコストの約10倍です。

多くの企業はすべてのリクエストに最も強力なモデルを必要としませんが、どの作業にそれが必要かを把握する必要があります。

要約、抽出、分類、ドラフト作成、翻訳は実用的な能力へと移行しています。残っている希少なものは判断力です。すなわち、5つの妥当な回答のうちどれが正しいかを知り、質問自体が誤っていることに気づき、いつ止めて人間に問い合わせるかを決定することです。

判断は、独自のコンテキスト、ビジネスルール、ワークフロー、蓄積された知識、そして作業を検証し失敗を抑制するエンジニアリングから生まれます。

他社が実行できない評価を構築する

企業にとって最も価値のあるベンチマークは、自社の業務から構築されます。

自社の業務から50〜200件の実際のタスクでプライベートな評価セットを作成します。周辺システムは固定したままにし、テストを繰り返し実行し、回答の洗練度ではなく、作業が正しく完了したかどうかでスコアを付けます。

コストにも同様の厳格さを適用します。トークンあたりのコストは、あるモデルが長時間推論したり、再試行が多く必要だったり、人間のレビュー作業が増える場合に誤解を招くことがあります。代わりに、受け入れられた成果物あたりのコストで測定しましょう。

まずは少数のモデルから始めます。ジョブの開始時に作業を割り振り、途中でプロバイダーを変更しないようにします。各追加プロバイダーのセキュリティ、ガバナンス、運用負荷を、提示された価格とともに評価します。

市場は新たなベンチマークの勝者を生み出し続け、企業はそれぞれにAI戦略を再構築したくなるでしょう。より良いアプローチは、作業に適したモデルを選択し、その上で実際に性能を発揮しなければならない条件下でシステム全体を評価することです。

あなたのアーキテクチャを導くべきベンチマークは、あなただけが実行できるものです。

創業者兼CEOのJaspreet Singhは、製品ビジョンとゼネラルマネージャーとしての経験を兼ね備えており、Druvaを数十億ドル規模のデータ保護・管理業界で最も急成長している企業の一つに導きました。彼の起業家精神によりDruvaは自力で立ち上げられ、現在は$2 billionを超える評価額を持ち、クラウド時代を先取りする数千社の企業から世界的に信頼されています。市場と技術に関する洞察に基づき、彼は最初のクラウドネイティブデータ保護プラットフォームを創出し、革新的な技術ソリューションと、老朽化したハードウェアやソフトウェアの遺産を打破する独自の消費モデルを提供しています。

Druva を創業する前、Jaspreet は Veritas と Ensim Corp で基礎的な役割を務めました。さらに、複数の特許を保有し、Indian Institute of Technology, Guwahati でコンピュータサイエンスの B.S. を取得しています。