AIモデルとプラットフォーム

MoE-LLaVA: 大規模ビジョン言語モデルを効率的にスケーリングするためのエキスパートの混合

mm
Unite.AI を Google の優先ソースに追加

最近のビジョン言語モデルの進歩により、これらのフレームワークを大幅にスケーリングすることで、さまざまなダウンストリームタスクのパフォーマンスが大幅に向上することが示されています。MiniGPT、LLaMAなどのビジョン言語モデルは、視覚投影層と画像エンコーダーをアーキテクチャに組み込むことで、注目すべき能力を達成しています。これらのコンポーネントを実装することで、ビジョン言語モデルは大規模言語モデルの視覚認識能力を強化します。パフォーマンスをさらに向上させるために、モデルのサイズとパラメーターの数を増やし、データセットのスケールを拡大することができます。

InternVLなどのモデルは、画像エンコーダーを6億パラメーター以上に拡大していますが、他のモデルはバックエンドを13億パラメーターに拡大し、幅広いタスクで優れたパフォーマンスを達成しています。IDEFICSは、80億パラメーター以上のビジョン言語モデルをトレーニングしました。これらのスケーリング方法は、34億、70億、または100億パラメーターで事前トレーニングされた大規模言語モデルのパフォーマンスに匹敵または超えることができます。しかし、スケーリングには欠点があります。トレーニングと推論のコストが大幅に増加するためです。これは、計算にすべてのパラメーターを活性化する必要があるため、高い計算需要と、結果として高いコストが発生するためです。

この記事では、MoE-LLaVAについて説明します。MoE-LLaVAは、エキスパートの混合(Mixture of Experts、MoE)を基盤とするスパースビジョン言語モデルのアーキテクチャです。MoE-LLaVAは、MoE-Tuningと呼ばれる有効なトレーニング戦略を使用して、ビジョン言語モデルのパフォーマンス低下を解決します。MoE-Tuningは、マルチモーダルスパース学習のパフォーマンス低下を革新的に解決し、パラメーターの数は多くてもトレーニングと推論のコストは一貫したモデルを構築します。MoE-LLaVAのアーキテクチャは、デプロイ時にトップ-kのエキスパートのみを活性化し、残りのエキスパートを非活性化するように設計されています。

MoE-LLaVAフレームワーク、メカニズム、方法、アーキテクチャ、および主要な画像およびビデオ生成フレームワークとの比較について調べます。

MoE-LLaVA: 大規模ビジョン言語モデルを効率的にスケーリングする

大規模ビジョン言語モデルは、視覚投影層と画像エンコーダーを活用してモデルサイズを拡大することで、パフォーマンスを向上させます。MiniGPT-4、InternGPT、InternVLなどのモデルは、このアプローチでパフォーマンスを向上させています。実際のアプリケーションでは、高品質のトレーニングデータで大規模言語モデルまたは大規模ビジョン言語モデルをスケーリングする必要があり、モデルを並列デバイスにデプロイする際の複雑さと効率が増加します。トレーニングと推論のコストが増加する主な理由は、フレームワーク内のすべてのパラメーターで計算が行われるためです。

一方、スパースMoEまたはエキスパートの混合モデルは、固定された活性化パラメーターでデータを処理することで、フレームワークを効果的にスケーリングすることを実証しています。このアプローチは、自然言語処理分野で広く採用されています。ただし、エキスパートの混合を直接使用してスパース大規模ビジョン言語モデルをトレーニングすることは、LLMをLVLMに変換し、同時にモデルをスパース化することでパフォーマンスが低下するため、課題があります。エキスパートの混合モデルを使用してLLMとLVLMをスケーリングするには、LVLMをスパース化するために初期化する必要があります。MoE-LLaVAフレームワークは、MoE-Tuningと呼ばれる3段階のトレーニング戦略を導入します。

MoE-Tuningプロセスでは、最初の段階で、多層パーセプトロンを使用して視覚トークンを大規模言語モデルに適応させます。次に、LVLMを一般的なマルチモーダル理解能力で事前強化するために、LLMのすべてのパラメーターをトレーニングします。最後に、3段階目で、エキスパートの初期化重みとしてFFN(Feed Forward Network)を複製し、エキスパートの混合層のみをトレーニングします。トレーニングプロセスは、LVLMの初期化からスパースエキスパートの混合モデルへの段階的な移行を支援します。

MoE-LLaVAフレームワークは、視覚投影層、視覚エンコーダー、MoEブロック、複数のスタックされたLLMブロック、ワードエンベディング層で構成されています。視覚投影層は、視覚トークンを大規模言語モデルの入力ドメインにマッピングします。視覚エンコーダーは、入力画像を視覚トークンのシーケンスに処理します。MoEブロックは、トークンをエキスパートにルーティングし、エキスパートはトークンを処理します。

MoE-LLaVA: 方法とアーキテクチャ

MoE-LLaVAフレームワークは、視覚投影層、視覚エンコーダー、MoEブロック、複数のスタックされたLLMブロック、ワードエンベディング層で構成されています。視覚投影層は、視覚トークンを大規模言語モデルの入力ドメインにマッピングします。視覚エンコーダーは、入力画像を視覚トークンのシーケンスに処理します。MoEブロックは、トークンをエキスパートにルーティングし、エキスパートはトークンを処理します。

アーキテクチャ

次の表に、MoE-LLaVAフレームワークの詳細な構成がまとめられています。

MoE-LLaVAフレームワークは、視覚投影層、視覚エンコーダー、MoEブロック、複数のスタックされたLLMブロック、ワードエンベディング層で構成されています。視覚投影層は、視覚トークンを大規模言語モデルの入力ドメインにマッピングします。視覚エンコーダーは、入力画像を視覚トークンのシーケンスに処理します。MoEブロックは、トークンをエキスパートにルーティングし、エキスパートはトークンを処理します。

MoE-Tuning

MoE-Tuningは、3段階のトレーニング戦略です。最初の段階で、多層パーセプトロンを使用して視覚トークンを大規模言語モデルに適応させます。次に、LVLMを一般的なマルチモーダル理解能力で事前強化するために、LLMのすべてのパラメーターをトレーニングします。最後に、3段階目で、エキスパートの初期化重みとしてFFN(Feed Forward Network)を複製し、エキスパートの混合層のみをトレーニングします。

ステージ1

最初のステージでは、画像トークンを大規模言語モデルに適応させることが主な目的です。MoE-LLaVAフレームワークは、多層パーセプトロンを使用して画像トークンを大規模言語モデルの入力ドメインにマッピングします。画像パッチは、擬似テキストトークンとして扱われます。このステージでは、MoE-LLaVAフレームワークはLLMをトレーニングして画像を説明し、LLMにMoE層を適用しません。

ステージ2

2段階目では、MoE-LLaVAフレームワークは、多モーダルインストラクションデータでモデルを調整して、フレームワークの能力と制御性を高めます。MoE-LLaVAフレームワークは、LLMをLVLMに変換し、多モーダル理解能力を付与します。テキスト認識や論理画像推論タスクなどのより複雑なインストラクションを使用して、モデルに強い多モーダル能力を付与します。伝統的に、密なモデルのトレーニングプロセスはこのステップで完了とみなされます。ただし、MoE-LLaVAフレームワークは、LLMをLVLMに変換し、同時にLVLMをスパース化する際に課題に直面しました。MoE-LLaVAフレームワークは、次のステージの初期化としてこのステージの重みを使用して、スパースモデルの学習の難しさを軽減しようとします。

ステージ3

3段階目では、エキスパートの初期化としてFFN(Feed Forward Network)を複製します。次に、テキストと画像トークンをエキスパートの混合層に供給し、ルーターはエキスパートと各トークンの間のマッチング重みを計算します。各トークンは、最大確率を持つトップ-kのエキスパートによって処理され、ルーターの重みに基づいて加重和が計算されます。トップ-kのエキスパートが活性化されると、モデルは残りのエキスパートを非活性化します。このアプローチにより、MoE-LLaVAフレームワークは、無限に可能なスパースパスを備え、幅広い能力を備えたモデルを構築します。

MoE-LLaVA: 結果と実験

MoE-LLaVAフレームワークは、CLIP-Largeを視覚エンコーダーとして使用し、多層パーセプトロンは2層で構成され、GELU活性化層が2層の間にあることを特徴としています。MoE-LLaVAフレームワークは、フィードフォワードニューラルネットワークとエキスパートの混合層の交互の置換を使用し、エキスパートの混合層は合計レイヤーの50%を占めます。次の表には、MoE-LLaVAフレームワークをトレーニングおよび評価するために使用されるさまざまなデータセットとそのサンプルサイズが含まれています。

ゼロショット画像質問回答

次の図は、MoE-LLaVAがソフトルーターを備えたスパースモデルのLVLMであることを示しています。MoE-LLaVAフレームワークは、5つの画像質問回答ベンチマークで評価され、LLaVA 1.5フレームワークと比較して、5つのベンチマークで優れた画像理解能力を示しています。

オブジェクトホールユーション評価

オブジェクトホールユーションの評価には、MoE-LLaVAフレームワークはPOPE評価パイプラインを使用します。結果は次の表に示されています。MoE-LLaVAフレームワークは、すべてのフレームワークの中で最も強力な結果を示し、入力画像と一貫したオブジェクトを生成する能力を示しています。さらに、MoE-LLaVAフレームワークは、与えられた質問に対する正確なフィードバックを提供する能力を示すために、はい比率をうまくバランスさせています。

最終的な考察

この記事では、MoE-LLaVAについて説明しました。MoE-LLaVAは、エキスパートの混合モデルと学習可能なルーターを備えた大規模ビジョン言語モデルのベースラインです。MoE-LLaVAモデルの核心は、複数のスパースパスで構成されており、フレームワークはこれらのパスを使用して各トークンをエキスパートにルーティングします。トークンは、活性化されたエキスパートによって共同で処理され、非活性化されたパスはサイレントに維持されます。MoE-LLaVAフレームワークは、エキスパートの混合エンコーダ層を反復的にスタックして、より大規模で強力なLVLMへのスパースパスを提供します。MoE-Tuning戦略は、マルチモーダルスパース学習のパフォーマンス低下を革新的に解決し、パラメーターの数は多くてもトレーニングと推論のコストは一貫したモデルを構築します。MoE-LLaVAフレームワークのアーキテクチャは、デプロイ時にトップ-kのエキスパートのみを活性化し、残りのエキスパートを非活性化するように設計されています。

Kunal Kejriwal は、Python、PostgreSQL、Redis、そして GCP と AWS のクラウドインフラストラクチャを専門とするバックエンドエンジニアです。3 年間にわたり本番システムの構築とスケーリングを経験しており、AI インフラストラクチャ、分散システム、機械学習ワークロードのデプロイに関するアーキテクチャについて執筆しています。