AIモデルとプラットフォーム

ニューラル・プロセッシング・ユニットの台頭:デバイス上のジェネレーティブAIの高速化と持続可能性の向上

mm
Unite.AI を Google の優先ソースに追加

ジェネレーティブAIの進化は、コンピューティング・デバイスとのやり取りと経験を再定義するだけでなく、コンピューティングの核となる部分も再定義しています。ジェネレーティブAIを限られた計算資源を持つデバイスで動作させる必要性は、変革の重要な原動力です。この記事では、この課題とそれを解決するために登場しているニューラル・プロセッシング・ユニット(NPUs)について説明します。また、最新のNPUプロセッサのいくつかを紹介し、ジェネレーティブAIの分野で先駆的な役割を果たしています。

デバイス上のジェネレーティブAIインフラストラクチャーの課題

ジェネレーティブAIは、画像合成、テキスト生成、音楽作曲など、多大な計算資源を必要とします。従来、これらの要求は、クラウド・プラットフォームの膨大な能力を利用することで満たされていました。しかし、このアプローチには、デバイス上のジェネレーティブAIのために、インターネット接続の常時接続と集中型インフラストラクチャーへの依存などの課題があります。この依存関係は、遅延、セキュリティの脆弱性、エネルギー消費の増加をもたらします。

クラウドベースのAIインフラストラクチャーの骨格は、主に中央処理装置(CPU)グラフィック処理装置(GPU)に依存して、ジェネレーティブAIの計算要求を処理します。しかし、これらのプロセッサは、デバイス上のジェネレーティブAIに適用されたときに、重大な障害に直面します。CPUは、汎用タスクに設計されており、ジェネレーティブAIワークロードの効率的で低消費電力の実行に必要な専用アーキテクチャが不足しています。彼らの限られた並列処理能力は、スループットの低下、待ち時間の増加、消費電力の増加につながり、デバイス上のAIにはあまり適していません。一方、GPUは並列処理に優れていますが、主にグラフィック処理タスクのために設計されています。ジェネレーティブAIタスクを効果的に実行するには、GPUは、消費電力が高く、熱を大量に発生させる特殊な集積回路を必要とします。また、彼らの大きな物理的なサイズは、コンパクトなデバイス上のアプリケーションでの使用を困難にします。

ニューラル・プロセッシング・ユニット(NPUs)の登場

上記の課題に対応して、ニューラル・プロセッシング・ユニット(NPUs)が、ジェネレーティブAIをデバイス上で実装するための変革的なテクノロジーとして登場しています。NPUsのアーキテクチャは、主に人間の脳の構造と機能、特にニューロンとシナプスが情報を処理する方法にインスパイアされています。NPUsでは、人工ニューロンが基本的な単位として機能し、生物学的ニューロンと同様に、入力を受け取り、処理し、出力を生成します。これらのニューロンは、学習プロセス中に調整される強度でニューロン間で信号を伝達する人工シナプスで相互接続されています。これは、脳でのシナプス重みの変化のプロセスを模倣しています。NPUsは、入力層、隠し層、出力層に組織化されています。入力層は生データを受け取り、隠し層は中間処理を実行し、出力層は結果を生成します。この層構造は、脳の多段階的で並列な情報処理能力を反映しています。ジェネレーティブAIも同様の構造の人工ニューラル・ネットワークで構成されているため、NPUsはジェネレーティブAIワークロードを管理するのに適しています。この構造的整合性により、特殊な集積回路の必要性が減り、よりコンパクトで、エネルギー効率が高く、高速で、持続可能なソリューションが実現します。

ジェネレーティブAIの多様な計算ニーズへの対応

ジェネレーティブAIには、画像合成、テキスト生成、音楽作曲など、各々が独自の計算要求を持つ幅広いタスクが含まれます。たとえば、画像合成は行列演算に大きく依存し、テキスト生成には順次処理が含まれます。これらの多様な計算ニーズに対応するために、ニューラル・プロセッシング・ユニット(NPUs)は、システム・オン・チップ(SoC)テクノロジーにCPUとGPUとともに統合されています。

これらの各プロセッサには、独自の計算上の強みがあります。CPUは順次制御と即時性に特に優れており、GPUは並列データ・ストリーミングに優れています。一方、NPUsはコアのAI操作に最適化されており、スカラー、ベクトル、テンソル演算を扱うことができます。ヘテロジニアス・コンピューティング・アーキテクチャを利用することで、タスクは各プロセッサの強みとタスクの要求に基づいて割り当てることができます。

NPUsは、AIワークロードに最適化されているため、ジェネレーティブAIタスクをメインCPUから効率的にオフロードできます。このオフロードにより、高速でエネルギー効率の高い動作が保証され、AI推論タスクが加速され、ジェネレーティブAIモデルがデバイス上でよりスムーズに実行されるようになります。NPUsがAI関連タスクを処理することで、CPUとGPUは他の機能にリソースを割り当てることができ、全体のアプリケーションのパフォーマンスが向上し、熱効率も維持されます。

NPUsの実世界での例

NPUsの進歩は勢いを増しています。以下は、NPUsの実世界でのいくつかの例です:

  • QualcommのHexagon NPUsは、低電力で低リソースのデバイスでのAI推論タスクの加速に特化しています。テキスト生成、画像合成、オーディオ処理などのジェネレーティブAIタスクを処理するように設計されています。Hexagon NPUは、QualcommのSnapdragonプラットフォームに統合されており、Qualcomm (QCOM ) AI製品を搭載したデバイスでのニューラル・ネットワーク・モデルを効率的に実行します。
  • AppleのNeural Engineは、AシリーズとMシリーズチップの重要なコンポーネントであり、Face ID、Siri、拡張現実(AR)などのAI駆動の機能をサポートしています。Neural Engineは、Face IDのための顔認識、Siriのための自然言語処理(NLP)、およびARアプリケーションのためのオブジェクト追跡とシーン理解の強化などのタスクを加速します。これにより、AppleデバイスでのAI関連タスクのパフォーマンスが大幅に向上し、シームレスで効率的なユーザー体験が提供されます。
  • SamsungのNPUは、AI計算を専門に行うプロセッサで、同時に数千の計算を処理できます。最新のSamsung Exynos SoCsに統合されており、多くのSamsungスマートフォンを動かします。このNPUテクノロジーにより、低電力で高速なジェネレーティブAI計算が可能になります。SamsungのNPUテクノロジーは、フラッグシップTVにも統合されており、AI駆動のサウンドイノベーションを可能にし、ユーザー体験を向上させます。
  • HuaweiのDa Vinciアーキテクチャは、彼らのAscend AIプロセッサのコアであり、AI計算能力を強化するために設計されています。このアーキテクチャは、高性能の3Dキューブ・コンピューティング・エンジンを採用しており、AIワークロードに強力です。

まとめ

ジェネレーティブAIは、デバイスとのやり取りとコンピューティングを再定義しています。限られた計算資源を持つデバイスでジェネレーティブAIを実行する課題は大きく、従来のCPUとGPUはしばしばこれに応えられません。ニューラル・プロセッシング・ユニット(NPUs)は、専用のアーキテクチャでジェネレーティブAIの要求に応えることを約束する、有望な解決策を提供しています。NPUsをSoCテクノロジーにCPUとGPUとともに統合することで、各プロセッサの強みを利用し、デバイス上でのAIパフォーマンスをより高速で、効率的で、持続可能なものにできます。NPUsが進化を続けるにつれ、デバイス上のAI能力を強化し、アプリケーションをより反応性が高く、エネルギー効率が高くすることが期待されています。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。