AIモデルとプラットフォーム

イーグル:エンコーダーの混合を使用したマルチモーダル大規模言語モデル設計空間の探索

mm
Unite.AI を Google の優先ソースに追加

マルチモーダル大規模言語モデル(MLLMs)では、複雑な視覚情報を正確に解釈する能力が重要な焦点となっています。最近の研究では、視覚的認識の強化がホールユーションを大幅に減らし、光学文字認識や文書分析などの解像度感受性タスクのパフォーマンスを向上させることが示されています。いくつかの最近のMLLMsは、ビジョンエンコーダーの混合を使用してこれを実現しています。にもかかわらず、専門家の選択や複数のビジョンエクスパートの統合などの重要な側面に関する体系的な比較や詳細な削減研究が不足しています。この記事では、ビジョンエンコーダーの混合と解像度を使用したMLLMsの設計空間の包括的な探索、イーグルフレームワークについて説明します。イーグルは、ビジョンエンコーダーの簡単な連結が、より複雑な混合アーキテクチャーや戦略と同等の有効性があることを発見しました。さらに、イーグルは、ビジョンエンコーダーと言語トークン之间のギャップを埋めるために、事前同期を導入しました。

イーグルの研究は、MLLMsの一般的なアーキテクチャ設計に関連しています。以前の代表的なオープンソース研究に加えて、他の著名なMLLMsファミリーには、MiniGPT-4、Lynx、Otter、QwenVL、CogVLM、VILA、GPT-4V、Gemini、Llama 3.1などがあります。視覚シグナルが言語モデルに統合される方法に応じて、MLLMsは「クロスモーダル注意」モデルと「プレフィックスチューニング」モデルに大別できます。前者は、クロスモーダル注意を使用して視覚情報をLLMsのさまざまなレイヤーに注入します。後者は、視覚トークンを言語トークンシーケンスの一部として扱い、テキスト埋め込みと直接結合します。イーグルのモデルは、LLaVAスタイルのマルチモーダルアーキテクチャーに従って、プレフィックスチューニングファミリーに属します。

イーグルの研究は、MLLMsのためのビジョンエンコーダー設計の改善に焦点を当てた研究に密接に関連しています。初期の研究では、CLIPやEVA-CLIPなどの視覚言語同期タスクで事前トレーニングされたビジョンエンコーダーを採用していました。より強力なビジョンエンコーダー、たとえばSigLIPやInternVLは、より優れた設計、より大きなモデルサイズ、より効果的なトレーニングレシピを使用して視覚言語タスクを強化するために提案されています。モデルは低解像度の画像で事前トレーニングされることが多く、細かい詳細をエンコードする能力が不足している可能性があるため、高解像度への適応が頻繁に実行され、MLLMの入力解像度が増加します。高解像度への適応に加えて、LLaVA-NeXT、LLaVA-UHD、Monkey、InternLM-XComposer、InternVLなどのモデルは、画像を低解像度のパッチに分割して個別に処理するタイル化または適応タイル化を使用して、高解像度の入力を処理します。ビジョンエンコーダーを追加することで高解像度の処理が可能になるというアプローチは、タイル化技術とは少し異なりますが、両者は互換性があり、組み合わせることができます。

イーグル:エンコーダーの混合を使用したマルチモーダルLLMsの設計空間

大規模言語モデル(LLMs)の成功は、視覚的認識能力を有することを可能にすることへの大きな関心を引き起こしています。マルチモーダル大規模言語モデル(MLLMs)の核心には、画像を視覚トークンに変換し、テキスト埋め込みと結合するという典型的な設計があります。CLIPは、視覚的表現がテキスト空間と同期するため、ビジョンエンコーダーとしてよく選択されます。アーキテクチャー、トレーニングレシピ、ビジョントークンが言語モデルに注入される方法に応じて、MLLMsの著名なファミリーには、Flamingo、BLIP、PaLI、PaLM-E、LLaVAなどがあります。イーグルの研究は、高解像度の視覚特徴を低解像度の視覚トークンに統合することを提案するMini-GeminiやLLaVA-HRなどのモデルと密接に関連しています。解像度の問題を超えて、これらの事前トレーニングされたビジョンエンコーダーは、テキストの読み取りやオブジェクトのローカライズなどの特定の機能が不足している可能性があります。これに対処するために、さまざまなモデルは、ビジョンエンコーダーを統合します。ビジョンエンコーダーは、さまざまなビジョンタスクで事前トレーニングされており、ビジョンエンコーダーの機能を強化するために使用されます。

たとえば、MousiやBraveなどのモデルは、チャネルまたはトークン方向に沿って視覚トークンを結合して、さまざまなビジョンエンコーダーからの視覚トークンを結合します。RADIOは、さまざまなビジョンエンコーダーの能力を単一のモデルに統一するために、マルチティーチャー蒸留方法を導入します。MoAI、IVE、Prismerは、ビジョンエクスパートの出力、たとえばOCR、検出、または深度推定を使用して、MLLMsが回答を生成するための追加情報を提供します。MoVAは、画像と指示に基づいて最適なビジョンモデルを割り当てるために、ルーティングネットワークを設計します。

最近の研究では、強力なビジョンエンコーダー設計が、MLLMのホールユーションを減らし、光学文字認識などの解像度感受性タスクのパフォーマンスを向上させるために重要であることを示しています。いくつかの研究では、ビジョンエンコーダーの能力を強化するために、事前トレーニングデータやパラメータをスケールアップしたり、画像を低解像度のパッチに分割したりします。ただし、これらのアプローチは、多大なトレーニングリソースを必要とします。効率的で強力な戦略は、さまざまなタスクや入力解像度で事前トレーニングされたビジョンエンコーダーを混合することです。たとえば、CLIPエンコーダーと高解像度エンコーダーを融合したり、さまざまなエンコーダーからの特徴を順番に追加したりします。この「ビジョンエクスパートの混合」アプローチは、有効であることが証明されていますが、詳細な設計空間の研究と厳格な削減がまだ不足しています。これは、イーグルがこの分野を再検討する動機となります。重要な質問は、どのビジョンエンコーダーの組み合わせを選択するか、どのようにしてさまざまなエクスパートを融合するか、そしてトレーニング戦略をどのように調整するかです。

これらの質問に答えるために、イーグルは、ビジョンエンコーダーの混合設計空間を体系的に調査します。設計空間の探索には、次のステップが含まれます。1)さまざまなビジョンエンコーダーをベンチマークし、高解像度への適応を検索すること。2)ビジョンエンコーダーの融合戦略を「リンゴとリンゴ」の比較で行うこと。3)複数のビジョンエンコーダーの最適な組み合わせを逐次的に特定すること。4)ビジョンエクスパートの事前同期とデータの混合を改善すること。探索ステップは、以下の図に示すように、イーグルがビジョンエンコーダーの混合設計空間を探索するための包括的なアプローチを提供します。

イーグルの研究では、さまざまなタスクや解像度で事前トレーニングされたビジョンエンコーダーのパフォーマンスを調べます。ラウンドロビンアプローチを使用して、イーグルは基本的なCLIPエンコーダーから始めて、各ラウンドで最も改善をもたらすエクスパートを追加します。

イーグルの研究は、MLLMsのホールユーションを減らし、解像度感受性タスクのパフォーマンスを向上させるために、強力なビジョンエンコーダー設計の重要性を強調しています。イーグルは、ビジョンエンコーダーの混合設計空間を体系的に調査し、ビジョンエンコーダーの最適な組み合わせを特定し、ビジョンエクスパートの事前同期とデータの混合を改善することで、MLLMsのパフォーマンスを向上させることができます。

イーグル:方法論とアーキテクチャー

イーグルの目標は、ビジョンエンコーダーを融合するための最小限の設計を見つけることです。これは、詳細な削減と不要なコンポーネントの削除を伴います。イーグルは、基本的なCLIPエンコーダーを、さまざまなアーキテクチャー、事前トレーニングタスク、解像度を持つビジョンエクスパートのセットに拡張します。イーグルは、さまざまなビジョンエンコーダーの融合アーキテクチャーと方法を比較し、複数のエンコーダーを持つトレーニング戦略を最適化します。

イーグルは、LLaVA-1.5と同じ事前トレーニングデータを使用して、ビジョンエンコーダーを融合します。イーグルは、事前トレーニングデータでモデルを事前トレーニングし、次に、LLaVA-1.5、Laion-GPT4V、ShareGPT-4V、DocVQA、synDog-EN、ChartQA、DVQA、AI2Dなどのタスクから収集されたデータでモデルを微調整します。

イーグルは、Vicuna-7Bを言語モデルとして使用し、学習率を1e-3と2e-5に設定します。イーグルは、ビジョンエンコーダーを融合するための最適な方法を探索し、ビジョンエンコーダーの混合設計空間を体系的に調査します。

強力なCLIPエンコーダー

イーグルは、CLIPモデルから探索を開始します。CLIPモデルは、多くのMLLMsの主な選択肢となっています。CLIPモデルは、マルチモーダルタスクを強化することが知られていますが、その限界もよく知られています。たとえば、多くのMLLMsは、CLIPの事前トレーニング解像度(たとえば224 × 224または336 × 336)を入力解像度として使用します。この場合、エンコーダーは、OCRや文書理解などの解像度感受性タスクに重要な細かい詳細を捉えるのに苦労することがあります。

イーグルは、ビジョンエンコーダーの混合設計空間を体系的に調査し、ビジョンエンコーダーの最適な組み合わせを特定し、ビジョンエクスパートの事前同期とデータの混合を改善することで、MLLMsのパフォーマンスを向上させることができます。イーグルは、ビジョンエンコーダーの混合設計空間の包括的な探索を提供し、MLLMsのパフォーマンスを向上させるための新しいアプローチを示します。

イーグル:実験と結果

イーグルは、ビジョンエンコーダーの混合設計空間を体系的に調査し、ビジョンエンコーダーの最適な組み合わせを特定し、ビジョンエクスパートの事前同期とデータの混合を改善することで、MLLMsのパフォーマンスを向上させることができます。イーグルは、Vicuna-v1.5-7B、Llama3-8B、Vicuna-v1.5-13Bを言語モデルとして使用し、CLIP、ConvNeXt、Pix2Struct、EVA-02、SAMなどのビジョンエンコーダーを使用します。

視覚質問回答タスク

イーグルは、GQA、VQAv2、VizWizなどの視覚質問回答ベンチマークでモデルを比較します。イーグル-X5は、GQAとVQAv2で最先端のパフォーマンスを達成し、追加のビジョンエクスパートを統合することの利点を強調しています。

OCRとチャート理解タスク

イーグルは、OCRBench、TextVQA、ChartQAなどのベンチマークで、OCR、文書、チャート理解の能力を評価します。イーグルは、TextVQAで競合他社を大幅に上回り、高解像度アーキテクチャーとさまざまなビジョンエンコーダーの統合による利点を示しています。

以下の図は、OCRと文書理解の例を示しています。高解像度適応とビジョンエクスパートの統合により、イーグルは画像内の小さなテキストを識別し、ユーザーの指示に基づいて情報を正確に抽出できます。

マルチモーダルベンチマーク評価

イーグルは、MME、MMBench、SEED、MathVista、MMMU、ScienceQA、POPEなどのベンチマークで評価され、さまざまな視点からMLLMsの能力を示します。イーグルは、パフォーマンススコア、認識スコア、知識スコアなどのさまざまなメトリックを使用して、MLLMsのパフォーマンスを評価します。

最終的な考え

この記事では、イーグルについて説明しました。イーグルは、ビジョンエンコーダーの混合を使用したマルチモーダル大規模言語モデルの設計空間の包括的な探索です。イーグルは、ビジョンエンコーダーの最適な組み合わせを特定し、ビジョンエクスパートの事前同期とデータの混合を改善することで、MLLMsのパフォーマンスを向上させることができます。イーグルの結果は、基本的な設計空間の考慮の重要性を強調しています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。