ソートリーダー

AIは停滞していない、間違ったスコアボードを見ているだけだ

mm
Unite.AI を Google の優先ソースに追加

経営陣はAIのロードマップについて再考し始めている。2023年のジェネレーティブツールの初期的なブームの後、勢いが減速したのかどうか尋ねるのは自然なことだ。しかし、その疑問はスコアボードを誤解している。AIの進歩は停滞していない。方向が変わっただけだ。

表面では指数関数的な変化が感じられた、流暢な文章、まとまりのある要約は、今ではより深い、より重大な分野で起こっている:推論、コード、ワークフロー・オーケストレーション、多モーダル理解。これらの進歩は、目につきにくいが、はるかに大きな影響力をもたらす。まだAIの文章を書く能力でそれを測っているのなら、実際の変革を見逃している。

実際の成果は仕事が行われる場所で起こっている

進歩は、最も重要な場所で加速している。新しい厳格なベンチマークであるGPQAでは、大学院レベルの科学的推論を評価し、モデルパフォーマンスはほぼ49%ポイント年間で増加した。MMMUでは、クロスドメインおよび多モーダルタスクをテストし、スコアは19ポイント近く上昇した。SWE-benchでは、実際のGitHubコードベースを修正し、自動テストに合格するベンチマークで、1年間で4.4%から71%以上に跳んだ。

これらは些細な改善ではない。これらは、大規模な言語モデルが、精度、推論、複雑なシステム全体での統合を要求するタスクをマスターしていることを示している。特に、SWE-benchは、トイ・プログラムを超えて、モデルが実際のソフトウェア開発に参加できるかどうかを示し、かつては数年先と思われたしきい値を示している。

同時に、企業は期待を進化させている。モデルが「一般的に賢い」だけでなく、「特に有用」である必要がある。ドメイン適応モデル、ツール接続システム、多エージェント・フレームワークへの移行は、運用可能なパフォーマンス、監査可能なパフォーマンス、実際のワークフローへの統合に対する需要の増加を反映している。

物語は現実と一致していない

なぜ停滞しているように感じるのか。2つの理由がある。まず、初期の注目を集めたベンチマーク、テキストのまとめ、メールの生成、シンプルなチャット・タスクは、天井効果に達している。モデルがこれらのタスクで90%の精度を達成すると、改善は些細なものに思える。これは停滞ではなく、進歩の天井効果だ。

今日の改善は、長いコンテキスト・メモリ、ツールの統合、推論時の推論、ドメイン特有の精度を伴う。これらの能力は、ウイルス的なデモを生み出さないが、実際のワークフローでモデルが何ができるかを劇的に向上させる。伝統的な言語ベンチマークは停滞しているが、運用ベンチマークは、現実世界の推論、ツールの使用、企業の信頼性に関連付けられており、以前よりも速く改善されている。そのギャップが、断片的な停滞感を生み出している。表面は変わらないが、実践者は変化を感じている。

デモからデプロイへ

AIはもう、華やかなデモや狭いプロトタイプに限定されていない。信頼性、精度、成果物の提供が重要な企業環境への本格的なデプロイの門槛を越えている。構造化された、タスク特有のシステムへの移行がすでに始まっている。

2026年までに、40%の企業アプリケーションには、タスク特有のAIエージェントが組み込まれることになる。これは、2025年の5%から大幅な増加だ。これらのエージェントは、プロンプトに応答するだけでなく、タスクを実行し、ワークフローをオーケストレートし、財務、セキュリティ、顧客運用などの分野で有形の成果をもたらすように設計されている。

この進化は、技術的なシフトを反映している。OpenAIを含む主要なAI開発者は、ブルート・フォース・スケーリングから推論時の推論に移行し、モデルが問題を考慮し、出力を検証し、外部ツールと動的に相互作用できるようにしている。かつては狭い自動化に思えたものが、計画し、適応し、信頼性を持って実行するエージェントになっている。これは、より大きなAIではなく、実際の仕事をするためのスマートなAIだ。

そして、その実際の仕事は、想像ではなく、測定されている。企業は、証明実験のサイクルを超えて、明確なKPIとビジネス目標を伴う本格的なデプロイに移行している。この成熟段階は、新しさではなく、信頼性についてである。

経営陣が間違えること

企業のリーダーが直面している実際のリスクは、AIの進歩が停滞したということではない。そう信じて、正に表面下で能力が加速している時に投資を中止することだ。

先を行っている組織は、次のGPTスタイルの発表を待っているのではない。今日のAIを、高価値の、クロスファンクショナルなワークフローに組み込み、測定可能なビジネス・インパクトをもたらしている。AIを使用する組織の2/3以上が、デプロイに直接関連する、顕著なコスト削減または収益増加を報告している。最も成功した採用者は、AIを複数のビジネス機能に統合し、全プロセス・チェーンを自動化したものだった。

しかし、多くの経営陣は、古い評価フレームワークを使用し続けている。学術的なベンチマークに頼りすぎて、実際の企業タスクの複雑さを反映していない。トークン効率を最適化しすぎて、精度、回復性、統合の運用上の価値を軽視している。

これは技術的な遅れだけではなく、戦略的な遅れだ。AIへのアプローチを再考した企業とそうでない企業の間のギャップが広がっている。すぐに、デプロイされたモデルの数ではなく、獲得した市場シェアと実現した時間あたりの価値で測られることになる。

AIの評価を再考する方法

スコアボードを更新する時だ。組織は、タスクの完全な完了、ツールのオーケストレーション、クロスモーダル・ワークフローを追跡する必要がある。モデルは、質問に「答える」だけでなく、複数ステップのタスクを完了し、障害から回復し、既存のシステムに統合できる出力を生成する能力で評価されるべきだ。

GPQA、MMMU、SWE-benchのようなベンチマークは、始まりだ。しかし、企業の特定のドメインとワークフローを中心に構築された内部ベンチマークは、さらに重要だ。

現代のAIは、高価値の成果をもたらす能力があるが、重要なのは、それをテストすることだ。

次の成功の波を定義するものは、最もパラメーターの多いモデルではなく、特定のビジネス・コンテキスト内で信頼性を持って動作するシステムだ。精度、監査可能性、ツール・チェーンのサポート、エラーからの回復は、流暢さや口調よりも重要になる。

フロンティアは移動した

AIは停滞していない。実際の仕事が行われるレイヤー、システムが推論し、検証し、ドメイン間で相互作用する必要があるレイヤーに移行している。新しさの段階を超えて、インフラストラクチャー段階に入っている。

このシフトを理解している企業は、すでに優位性を築いている。次の華やかなデモを待っているのではなく、実際の生産性を獲得し、解決までの時間を短縮し、プロセスを精度とスピードで拡大している。

もしも、あなたがまだ古いスコアボードを見ているのなら、他の場所で得点が加算されているのを見逃している。次のリーダーは、花火を待っていた人ではなく、ノイズを見抜き、実際の信号に応じた人だ。

スティーブ・ウィルソンは、ExabeamのチーフAIオフィサーであり、グローバル企業向けの高度なAI駆動型サイバーセキュリティソリューションの開発を主導しています。経験豊富なテクノロジー専門家として、ウィルソンはグローバル2000企業向けの大規模クラウドプラットフォームとセキュアシステムの構築を経てきました。彼は、AIとセキュリティの分野で、深い技術的専門知識と実際の企業での応用を結び付けることで広く尊敬されています。ウィルソンはまた、モダンソフトウェアスタックにおけるGenAIシステムのセキュリティを確保するための実践的なガイドである「The Developer’s Playbook for Large Language Model Security」(O’Reilly Media)の著者でもあります。