ソートリーダー

企業のAIがゴールラインで失敗する理由 — と、それを解決する方法

mm
Unite.AI を Google の優先ソースに追加

AIの周りには大きな話題がありますが、ほとんどの企業のAIプロジェクトは、実験段階を超えて進むことはありません。最近のIDCの調査によると、AIのProof of Concept(POC)プロジェクトの88%が、フルプロダクションにスケールアップすることができません。那は大きな落差であり、どこかで問題があることを示しています。多くのプロジェクトは、ベンチマークを満たすトレーニング済みモデルを持ち、フィニッシュラインに近づきますが、結局はユーザーによって採用されず、立ち上げられません。

何が間違っているのでしょうか?多くの場合、3つの大きな問題に帰着します:

  1. 企業のAIチームは、重要なパフォーマンスのギャップを見逃す表面的な診断ツールとベンチマークに頼りすぎています
  2. モデルは、現実世界の問題を解決するのではなく、標準的なベンチマークに合わせてトレーニングされています
  3. モデルを使用するコストが、会社全体で採用するには高すぎることになります

この記事では、これらの落とし穴を分析し、AIプロジェクトをフィニッシュラインを越えて、ユーザーの手に渡すために必要なことについて説明します。

問題 #1:重要なパフォーマンスの問題を見逃す標準的な診断

AIプロジェクトがPOC段階の後で躓く理由の1つは、内部のベンチマークと診断が、モデルパフォーマンスの深いところまで達しないため、使いやすさ、信頼性、採用率を低下させる問題を見逃すことが多いです。チームは紙上ではすべてのチェックボックスにチェックを入れるかもしれませんが、それらのチェックは常に、モデルが現実世界でどのように動作するかを反映しているわけではありません。

例えば、あるAIチームには、内部テストで優秀な成績を修めたモデルがありました。精度のメトリックや安全性のしきい値をすべて満たしており、リリースの準備が整っていました。しかし、第三者がモデルを評価したところ、重大な盲点があることが発覚しました。モデルは、特定の方法で質問された場合、9倍も避け回答をする可能性がありました。例えば、「米国の大統領は誰ですか?」という質問には正しく回答しましたが、「大統領について教えてください」という質問は安全性のリスクと見なして回答を拒否しました。

問題は、モデルの核となる知識ではなく、フレーズに基づく意図の解釈にありました。チームは安全性を優先しすぎて、意図的に正常な、妥当な質問をブロックしてしまいました。

問題 #2:現実世界を反映しないベンチマークに合わせてモデルを微調整する

企業のAIのもう1つの落とし穴は、AIチームがモデルを、現実世界のニーズではなく、業界標準のベンチマークに合わせてトレーニングすることです。紙上では、モデルはトップレベルのパフォーマンスを示しているかもしれませんが、実際には、ユーザーの介入なしに一貫した、有用な結果を生み出すのに苦労することがあります。

これは、チームがモデルを狭い、ベンチマーク固有のタスクに合わせて最適化するときに起こります。モデルはそれらのテストケースで優秀な成績を修めることになりますが、構造化されていない、よりバラエティに富んだ現実世界の入力に遭遇すると、失敗します。結果として、ユーザーは、正しい回答を得るために、モデルが理解できるようにプロンプトエンジニアリングを行う必要があります。如果あなたのAI製品がエンドユーザーに正確なプロンプトを与えることを依存している場合、採用を遅くし、有用性を損なうフリクションを導入しています。

このようなベンチマーク中心のトレーニングは、過剰適合にもつながる可能性があります。モデルは評価データセットで優秀な成績を修めるために、細かく調整されすぎて、汎用性を失います。内部テストではすべてのチェックボックスにチェックを入れるかもしれませんが、実際に展開されると、特に使用ケースがトレーニングに使用されたものとわずかに異なる場合、失敗する可能性があります。

企業のAIソリューションが成功するには、モデルは現実世界で動作する必要があります。実験室の中でのみではありません。

問題 #3:AIの採用をスケールアップすることは、計算コストをスケールアップすることを意味する

AI POCがスケールアップに失敗する3番目の理由は、財務的なものです。チームは、モデルを本稼働環境で実行して維持するコストを過小評価することがよくあります。開発中は、特に小規模なデータセットや限定的な使用環境でテストを行っている場合、モデルの計算要求を無視しやすいです。しかし、展開されると、コストは急激に増加します。

企業向けのAIには、リアルタイムでレスポンスを提供するだけでなく、継続的な微調整、監視、ログ記録、および再トレーニングのために、重大な計算リソースが必要です。これらのコストが最初に考慮されていない場合、ソリューションのビジネスケースは、実際の使用が始まると崩壊する可能性があります。制御されたテストでは有望なモデルだったものが、数千のユーザーがシステムにアクセスし始めると、すぐに非実現可能なものになる可能性があります。

企業のAIの最後の1マイルのハードルを克服する

企業のAIプロジェクトが遭遇する一般的な落とし穴を避けるには、チームは通常の戦略を超えて行く必要があります。ここでは、実際に動作し、スケールアップするAIプロジェクトを構築するために、チームが何をすべきかについて説明します。

まず、第三者があなたのモデルを評価するようにします。 内部テストは重要ですが、多くの場合、範囲が狭すぎます。独自の評価フレームワークを使用して、モデルをあなたのユースケースに合わせて評価する第三者の目は、チームが見逃す可能性のある問題、特に実際のユーザーがシステムとどのようにやり取りするかを浮き彫りにすることができます。

2番目に、現実世界のプロンプトでテストします。 多くのベンチマークは「きれいな」データでテストしますが、現実世界、特にあなたのエンドユーザーがモデルとやり取りする方法を反映していません。モデルを、汚い、曖昧な、または奇妙に構成された入力でテストすることで、実際に展開された後のモデルがどのように動作するかを示すことができます。これにより、潜在的な問題を早期に発見し、採用率に影響を与える落とし穴を避けることができます。

3番目に、セーフティプロトコルを再検討します。 ガードレールを設けることは簡単ですが、使い勝手が悪くなることもあります。モデルが単純な、無害な質問に応答を拒否する場合、セーフティよりも使い勝手を優先する必要があります。

最後に、計算コストに注意してください。 あなたの採用目標が数千のユーザー、数百万のリクエストを含む場合、費用は急激に増加する可能性があります。1つの解決策は、より小さなモデルを検討することです。Boosted.aiはそうしました — カスタマイズされた小規模言語モデルに切り替え、計算コストを90%削減しながら、速度とパフォーマンスを向上させました。リアルタイムの結果、より良いユーザーエクスペリエンス、高価なハードウェアは不要です。

評価、使いやすさ、スケーラビリティに最初から取り組むことで、チームはAIプロジェクトに長期的な成功のチャンスを与えることができます。実験室の中でのみ動作するのではなく、世界の中で動作する必要があります。

マット・フィッツパトリックは、世界のトップAIモデルプロバイダーのおよそ80%をトレーニングしたAIソフトウェアプラットフォームプロバイダーの、インビジブルテクノロジーのCEOです。インビジブルは、どの業界、機能、またはユースケースでも、AIを現実の世界で動作させるための専門知識を提供します。同社に入社する前、マットは、マッキンゼーのQuantumBlack Labsのシニアパートナー兼グローバルリーダーでした。ここでは、1,000人のエンジニアを監督し、GenAIとすべてのセクターにおける同社のソフトウェア開発を担当しました。マットは、プリンストン大学とウォートン大学の卒業生です。