ソートリーダー

ジェネレーティブAIの未来はエッジにある

mm
Unite.AI を Google の優先ソースに追加

ChatGPTやジェネレーティブAIの出現は、テクノロジーの歴史における画期的な瞬間であり、インターネットやスマートフォンの登場に匹敵する。ジェネレーティブAIは、知的な会話を持ち、試験に合格し、複雑なプログラムやコードを生成し、目を見張る画像やビデオを作成する能力を示している。GPUは、クラウドやデータセンターでジェネレーティブAIモデルを実行しているが、これは長期的な解決策ではなく、特に推論の場合、コスト、電力、待ち時間、プライバシー、セキュリティなどの要因により、スケーラブルではない。この記事では、これらの要因と、ジェネレーティブAIのコンピューティングワークロードをエッジに移行する動機を説明する。

ほとんどのアプリケーションは、高性能プロセッサで実行される。デバイス(例:スマートフォン、デスクトップ、ラップトップ)またはデータセンターで実行される。AIを使用するアプリケーションのシェアが増加するにつれて、これらのプロセッサは、CPUのみで不十分になる。さらに、ジェネレーティブAIワークロードの急速な増加は、GPUを搭載した高価で電力消費の大きいAI対応サーバーの需要を押し上げ、インフラストラクチャーのコストを増加させている。これらのAI対応サーバーのコストは、通常のサーバーの7倍になる可能性があり、GPUが追加コストの80%を占める。

さらに、クラウドベースのサーバーは500Wから2000Wの電力を消費するのに対し、AI対応サーバーは2000Wから8000Wの電力を消費する。データセンターは、これらのサーバーをサポートするために、追加の冷却モジュールとインフラストラクチャーのアップグレードが必要であり、これらのコストはコンピューティング投資よりも高い可能性がある。データセンターは、すでに年間300テラワット時(TWh)の電力を消費しており、世界全体の電力消費量の約1%を占める。データセンターの消費電力は、2030年までに世界全体の電力消費量の5%に達する可能性がある。また、ジェネレーティブAIデータセンターへの投資は、2027年までに500億ドルの資本支出に達する見込みである。

データセンターの電力消費量は、すでに300テラワット時であり、ジェネレーティブAIの採用によりさらに増加する見込みである。

AIのコンピューティングコストとエネルギー消費量は、ジェネレーティブAIの大量採用を妨げる。スケーラビリティの課題は、AIのコンピューティングをエッジに移行し、AIワークロードに最適化された処理ソリューションを使用することで克服できる。このアプローチにより、待ち時間、プライバシー、信頼性、機能性が向上するなどのメリットも得られる。

コンピューティングはデータに従ってエッジに移行する

10年前、AIが学術的な世界から現れたときから、AIモデルのトレーニングと推論は、クラウドまたはデータセンターで行われてきた。多くのデータがエッジで生成され消費されている(特にビデオ)ため、推論をエッジに移行することで、企業の総所有コスト(TCO)を削減できる。クラウドでのAI推論コストは繰り返し発生するのに対し、エッジでの推論コストは、ハードウェアの初期費用のみである。エッジAIプロセッサを使用することで、システムの全体的な運用コストを削減できる。従来のAIワークロードと同様に、ジェネレーティブAIワークロードもエッジに移行することで、企業と消費者に大きな節約になる。

エッジに移行し、推論機能を実行するための効率的なAIアクセラレータを使用することで、他のメリットも得られる。主なメリットは待ち時間である。例えば、ゲームアプリケーションでは、ジェネレーティブAIを使用して非プレイヤーキャラクター(NPC)を制御し、強化できる。エッジAIアクセラレータを使用してLLMモデルを実行することで、ゲームコンソールまたはPCでNPCに特定の目標を与えることができ、ストーリーに意味のある参加を可能にする。ローカルエッジ推論からの低待ち時間により、NPCのスピーチと動きがリアルタイムにプレイヤーのコマンドとアクションに応答することができ、没入感のあるゲーム体験を提供する。

ヘルスケアなどのアプリケーションでは、プライバシーと信頼性が非常に重要である(例:患者評価、薬剤推奨)。データと関連するジェネレーティブAIモデルは、患者データを保護するために(プライバシー)オンプレミスでなければならない。また、クラウドのAIモデルへのアクセスを妨げるネットワークの停止は、災難的になる可能性がある。エッジAIアプライアンスを使用して、各企業顧客(この場合はヘルスケアプロバイダー)専用のジェネレーティブAIモデルを実行することで、プライバシーと信頼性の問題を解決し、待ち時間とコストを削減できる。

エッジデバイス上的ジェネレーティブAIは、ゲームでの低待ち時間を保証し、ヘルスケアでの患者データを保護し、信頼性を向上させる。

クラウドで実行されるジェネレーティブAIモデルは、約1兆パラメータに達する。これらのモデルは、一般的な質問に効果的に対応できる。ただし、企業固有のアプリケーションでは、モデルが使用例に適した結果を提供する必要がある。例えば、ファストフードレストランで注文を取り扱うためのジェネレーティブAIベースのアシスタントを構築する場合、そのアシスタントは、レストランのメニュー項目、アルレルギー、成分を学習する必要がある。モデルサイズを最適化するために、スーパーセットLLMを使用して、約100〜300億パラメータのLLMをトレーニングし、顧客固有のデータで追加のファインチューニングを実行することができる。このようなモデルは、精度と機能性が向上した結果を提供できる。また、モデルのサイズが小さいため、エッジのAIアクセラレータで実行できる。

ジェネレーティブAIはエッジで勝つ

ジェネレーティブAIがクラウドで実行される必要がある場合もある、特にChatGPTやClaudeのような一般的なアプリケーションの場合。しかし、企業固有のアプリケーション、例えばAdobe PhotoshopのジェネレーティブフィルやGithub Copilotの場合、エッジのジェネレーティブAIは、将来のみならず、現在も重要である。目的のあるAIアクセラレータがこれを可能にする鍵である。特に、企業固有のアプリケーションの場合、エッジのジェネレーティブAIは、将来のみならず、現在も重要である。Purpose-built AIアクセラレータは、これを可能にする鍵である。

シリコンバレーのベテランであり、Kinara IncのCEOであるRavi Annavajjhalaは、ビジネス開発、市場、エンジニアリングを含む20年以上の経験を持ち、最先端のテクノロジー製品を構築し、それらを市場に導入しています。Deep Visionの最高経営責任者としての彼の現在の役割では、Raviはその取締役会に参加し、Ara-1プロセッサをプレシリコンからフルスケール生産に、そして2世代目のプロセッサAra-2を大量に導入するために5,000万ドルを調達しました。Deep Visionに参加する前に、RaviはIntelとSanDiskでエグゼクティブリーダーシップの役割を果たし、収益の成長を促進し、戦略的なパートナーシップを進化させ、業界を牽引する最先端の機能と能力を持つ製品ロードマップを開発しました。