AIモデルとプラットフォーム

GPUの壁が崩壊する:ポスト・トランスフォーマー・アーキテクチャの見えない革命

mm
Unite.AI を Google の優先ソースに追加

過去5年間、人工知能業界は、実質的に1つの言葉、つまり「トランスフォーマー」と同義でした。2017年に発表された「Attention Is All You Need」という論文以来、このアーキテクチャは業界を支配してきました。GPTからClaudeまで、ほとんどの注目すべきモデルは、同じ根底にある自己注意メカニズムを使用しています。私たちは、より良いAIへの道は、単にスケールを増やすことであると考えていました。実践的には、これは、より多くのデータで、より大きなGPUクラスターで、より大きなトランスフォーマーをトレーニングすることを意味します。

この信念は多くのブレークスルーをもたらしましたが、現在、限界に達しています。私たちは「GPUの壁」に当たっています。これは、生の計算能力だけではなく、メモリ帯域幅と経済的持続可能性の壁です。世界は、1兆パラメータモデルのレースに注目していますが、研究室では、根本的な変化が起こっています。新しい波の「ポスト・トランスフォーマー・アーキテクチャ」が現状の限界を打ち破るために登場しています。この変化は、AIをより効率的、よりアクセスしやすく、より無限のコンテキストで推論できるようにすることを約束しています。

シリコンの天井:トランスフォーマーが壁に当たる理由

変化が必要な理由を理解するには、まず現在の体制のボトルネックを理解する必要があります。トランスフォーマーは非常に強力ですが、特定の点で非常に非効率的です。彼らの能力の核心は、「注意メカニズム」にあります。これにより、モデルはシーケンス内の各トークンを見て、各トークンと他のトークンの関係を計算できます。これにより、コンテキストを非常によく理解できます。

しかし、この能力は、二乗法則という致命的な欠点を伴います。ドキュメントの長さを2倍にすると、計算作業は2倍ではなく4倍になります。無限コンテキストのモデルを目指して、ライブラリやコードベース全体を読むことができるようにすると、計算要求は非常に高くなります。

しかし、より直接的な問題はメモリ、特に「KVキャッシュ」(キー・バリューキャッシュ)です。トランスフォーマーは、テキストを流暢に生成するために、GPUの高速メモリ(VRAM)に、直前に発言したすべてのことを保持する必要があります。会話が長くなると、このキャッシュは膨張し、巨大なメモリを消費して、3つの段落前に何が起こったかを思い出すだけで大量のメモリを消費します。

これにより、「GPUの壁」が生じます。チップが不足しているのではなく、メモリ帯域幅が不足しています。エンジンが大きくなりすぎて、燃料を与えることができなくなっています。長い間、業界の解決策は、単にNVIDIA H100を購入することでした。しかし、この無茶なやり方は、減少する収穫に達しています。二乗的に燃料を消費するエンジンではなく、新しいアーキテクチャが必要です。

見えない革命

主流の研究がLLMに焦点を当てている間、研究者の一群は古いアイデアを再検討しています:再帰型ニューラルネットワーク(RNN)。トランスフォーマーの前に、RNNは言語の標準でした。テキストを逐次的に処理し、内部の「状態」を更新しながら、単語ごとに処理していきました。非常に効率的でした。なぜなら、全ての歴史を参照する必要がなく、単にその「要点」をメモリに保持していたからです。

RNNは、長距離の依存関係を処理できないことと、トレーニングが遅かったことから失敗しました。文の始まりを忘れてしまいます。さらに、並列化できなかったため、トレーニングが遅かったのです。つまり、単語Aを処理する前に単語Bを処理できませんでした。トランスフォーマーはこれを解決しました。すべてを一度に処理し(並列化)、すべてをメモリに保持しました(注意)。

現在、トランスフォーマーとRNNの長所を組み合わせた「状態空間モデル」(SSM)が登場しています。これらは、トランスフォーマーと同じトレーニング速度(並列化可能)を提供し、RNNと同じ推論効率(線形スケーリング)を提供します。

この新しい波の中で注目すべきアーキテクチャの1つは、Mambaです。2023年末にリリースされ、2024年を通じて改良されたMambaは、モデルが情報を処理する方法に根本的な変化をもたらします。トランスフォーマーとは異なり、Mambaは「選択的な状態空間」を使用します。

トランスフォーマーとMambaの違いを理解するために、トランスフォーマーを、読んだ本をすべて机の上に開けたままにしておく学者に例えることができます。Mambaは、学者が本を1回読んで、重要な洞察を効率的なノートにまとめる学者に例えられます。Mambaが次の単語を生成するとき、生のテキストを参照するのではなく、圧縮された状態を参照します。

この違いは、AIの展開の経済性を変えます。MambaやRWKV(レセプタンス加重キー・バリュー)などのアーキテクチャでは、シーケンスの長さが長くなっても、計算コストは爆発的に増加しません。理論的には、100万語のコンテキストを与えても、10語のコンテキストを与えた場合と同じ計算コストで次のトークンを生成できます。

再帰の復帰

Mambaの背後にある技術的ブレークスルーは、「選択性」です。RNNを近代化しようとした以前の試みは、柔軟性がなかったため失敗しました。情報を均等に圧縮しました。重要な情報かノイズか関係なく、Mambaはモデルがデータをストリーミングするにつれて、どの情報を記憶してどの情報を忘れるかを動的に決定するメカニズムを導入しました。

モデルが重要な情報、たとえばコードブロック内の変数定義を受け取った場合、「ゲート」を開けて強く状態に書き込みます。ただし、フィラー・ワードや無関係なノイズに遭遇した場合、ゲートを閉じて、制限されたメモリ容量を重要なものに保ちます。

この選択性は、古いRNNが直面した「忘れ」問題を実質的に解決します。多くのテストで、Mambaベースのモデルは、同じサイズのトランスフォーマーと同じパフォーマンスを発揮しながら、推論時に最大5倍高速で実行されます。さらに重要なのは、メモリのフットプリントがはるかに小さいことです。これにより、高性能LLMを、クラウドにオフロードせずに、ラップトップ、エッジコンピューティング・ネットワーク、またはスマートフォンなどのデバイスで実行できる可能性が開けられます。

また、Hyenaという、サブ二乗アーキテクチャの登場も見られます。Hyenaは、長い畳み込みを使用してデータを処理します。Mambaと同様に、Hyenaはトランスフォーマーの重い「注意」レイヤーを取り除き、ハードウェアの実行コストがはるかに低い数学演算に置き換えることを目指しています。これらのモデルは、既存のトランスフォーマーに挑戦し始めています。

ハイブリッドの台頭

革命は、トランスフォーマーの完全な置き換えではなく、むしろハイブリッドへの進化かもしれません。すでに、Jamba(AI21 Labsより)などのモデルが登場しています。これは、トランスフォーマー・レイヤーとMamba・レイヤーを組み合わせたものです。

このハイブリッド・アプローチは、トランスフォーマーの限界に対処するための実用的な方法を提供します。トランスフォーマーは、特定のタスク、特にコンテキストからの詳細なコピーに対して、依然として非常に強力です。Mamba・レイヤー(大部分のデータ処理と長期メモリを処理)とトランスフォーマー・注意レイヤー(鋭い即時推論を処理)を組み合わせることで、最良の両世界を結び付けるモデルが得られます。

ハイブリッド・モデルは、実際に使用可能な巨大なコンテキスト・ウィンドウを作成します。現在、多くの「長いコンテキスト」のトランスフォーマーは、100,000トークンを処理できることを主張していますが、コンテキストが満たされると、パフォーマンスは急激に低下します。これは「真ん中で迷子になる」現象として知られています。ハイブリッド・アーキテクチャは、長距離を超えても一貫性を維持するように設計されています。なぜなら、SSMレイヤーは、時間の経過とともに状態を圧縮して運ぶように設計されているからです。

これらの開発は、業界の焦点を「トレーニング・コンピュート」(モデルを構築するために必要なクラスターの規模)から「推論の経済学」(モデルを1億ユーザーに提供するコスト)にシフトさせます。如果ハイブリッド・モデルがトランスフォーマーの10%のコストでユーザーを提供できる場合、AIアプリケーションのビジネス・ケースは一夜で変わります。

AI展開の未来

このポスト・トランスフォーマー革命の影響は、データセンターに限定されません。GPUの壁は、歴史的に、最先端のモデルを構築して実行できるのは、数十億ドル相当のハードウェアを持つ大手テクノロジー企業だけであることを保証する門番として機能してきました。MambaやRWKVのような効率的なアーキテクチャは、この力を民主化します。如果GPT-4レベルのモデルを、テラバイトのVRAMを必要とせずに、消費者向けのカードで実行できる場合、AIの中央集権的なコントロールは緩和されます。クラウドにパケットを送信せずに、プライベートデータのみを処理するローカル、プライベートAIエージェントがコンピューター上で実行される可能性が見られます。

さらに、この効率性は、「エージェントAI」システムを解放するための鍵です。これらのシステムは、複雑なタスクを完了するために、バックグラウンドで数時間または数日間実行されます。現在のトランスフォーマーは、長期間にわたって継続的に実行するには、費用が高く遅いため、実行するには高額です。効率的で線形時間のアーキテクチャは、ユーザーを破産させずに、ハードウェアをオーバーヒートさせずに、継続的に「考える」と処理できます。

結論

トランスフォーマーはAIのヘッドラインを支配してきましたが、裏では静かな革命が進行しています。GPUの壁は、研究者にメモリと計算の方法を再考させるように促しています。Mambaやハイブリッド・モデルなどのポスト・トランスフォーマー・アーキテクチャは、効率性が次の時代を定義することを証明しています。これらの革新は、巨大なコンテキスト・ウィンドウを実用的にし、推論を安価にし、先進的なAIをデータセンターの外でアクセス可能にします。AIの未来は、より大きなモデルではなく、記憶、推論、効率的にスケールするスマートなモデルにあります。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。