AIモデルとプラットフォーム

Mini-Gemini: マルチモダリティビジョン言語モデルの潜在能力を高める

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデルの進歩は、自然言語処理、またはNLPの開発を大幅に加速させました。トランスフォーマー・フレームワークの導入は、言語モデルの新しい波の開発を促進する重要なマイルストーンとなり、OPTやBERTなどの言語モデルの開発を促し、これらのモデルは深い言語理解を示しています。さらに、GPT、またはジェネレーティブ・プレトレーニング・トランスフォーマー・モデルは、自己回帰モデリングによる新しいパラダイムを導入し、言語予測と生成のための堅牢な方法を確立しました。GPT-4、ChatGPT、Mixtral、LLaMAなどの言語モデルの出現は、複雑な言語処理タスクにおけるパフォーマンスの向上をもたらしています。既存の方法の中で、インストラクション・チューニングは、事前トレーニングされた大規模言語モデルの出力を改良するための重要なテクニックとして登場しています。また、これらのモデルの特定のツールとの統合は、視覚タスクの適応性を強調し、将来的な応用の道を開いています。これらの応用は、従来のテキストベースのLLMの処理を超えて、多モーダル・インタラクションを包含しています。

さらに、自然言語処理とコンピューター・ビジョン・モデルの収束は、言語とビジョンのモデルを組み合わせて、クロスモーダルな理解と推論能力を実現する、ビジョン言語モデルの出現をもたらしました。視覚と言語モデルの統合と出現は、言語処理と視覚理解の両方を必要とするタスクの進歩に重要な役割を果たしています。CLIPなどの革命的なモデルの出現は、視覚タスクと言語モデルの間のギャップをさらに縮め、クロスモーダルな応用の実用性と実現可能性を実証しました。最近のフレームワークであるLLaMAとBLIPは、カスタマイズされたインストラクション・データを使用して、モデルの強力な能力を示す効率的な戦略を開発しています。さらに、大規模言語モデルの画像出力との統合は、最近の多モーダル・リサーチの焦点であり、最近の方法は、画像生成を直接行わずに、画像出力と交互のテキストを生成するために、画像検索アプローチを使用することができます。

しかし、ビジョン言語モデルの基礎的な推論と視覚的な対話を促進する迅速な進歩にもかかわらず、GPT-4などの高度なモデルのパフォーマンスとビジョン言語モデルの間にはまだ大きなギャップがあります。Mini-Geminiは、ビジョン言語モデルの潜在能力を高めて、ビジョン言語モデルのパフォーマンスを向上させるために、3つの側面からビジョン言語モデルの潜在能力を高めることを目指しています。具体的には、VLMガイド付き生成、ハイクオリティなデータ、ハイレゾリューションの視覚トークンです。視覚トークンを強化するために、Mini-Geminiフレームワークは、視覚トークンの数を増やさずに、高解像度の精製を行うための追加の視覚エンコーダーを提案しています。さらに、Mini-Geminiフレームワークは、画像と推論ベースの生成の正確な理解を促進するために、高品質のデータセットを構築することを目指しています。全体として、Mini-Geminiフレームワークは、ビジョン言語モデルの潜在能力を高め、画像の推論、理解、生成能力を同時に既存のフレームワークに与えることを目指しています。この記事では、Mini-Geminiフレームワークを詳細に説明し、メカニズム、方法論、フレームワークのアーキテクチャ、そして最新のフレームワークとの比較について探ります。では、始めましょう。

Mini-Gemini: マルチモダリティビジョン言語モデルの加速

これまでの大規模言語モデルの進化は、注目に値する多モーダルな機能を備えています。現在のビジョン言語モデルの重要な部分となっています。しかし、大規模言語モデルの多モーダルなパフォーマンスとビジョン言語モデルの間にはまだギャップがあります。最近の研究は、画像やビデオを使用して、大規模言語モデルのビジョンを組み合わせる方法を探しています。視覚タスクそのものの場合、画像の解像度は、最小の視覚的な妄想とともに、周囲の環境を明示的に表現するための重要な要素です。ギャップを埋めるために、研究者は、ビジョン言語モデルの視覚的な理解を高めるためのモデルを開発しています。最も一般的なアプローチは、解像度を高めたり、視覚トークンの数を増やしたりすることです。視覚トークンの数を高解像度の画像で増やすと、視覚的な理解が向上しますが、特に複数の画像を処理する場合、計算要件と関連するコストが増加することがあります。さらに、既存のモデルの能力、既存のデータの品質、適用性は、加速された開発プロセスに不十分であり、研究者は「ビジョン言語モデルの開発を、許容可能なコストで加速する方法は何か」と疑問に思うのです。

Mini-Geminiフレームワークは、この質問に答えるための試みです。ビジョン言語モデルの潜在能力を、3つの側面から探ります。具体的には、VLMガイド付き生成または拡張されたアプリケーション、ハイクオリティなデータ、ハイレゾリューションの視覚トークンです。まず、Mini-Geminiフレームワークは、ConvNetアーキテクチャを使用して、高解像度の候補を効率的に生成し、視覚的な詳細を強化しながら、視覚トークンの数を維持します。さらに、Mini-Geminiフレームワークは、公開されているハイクオリティなデータセットを統合して、データの品質を高め、生成と大規模言語モデルのパフォーマンスを向上させることを目指しています。Mini-Geminiフレームワークの多面的な戦略により、ビジョン言語モデルの潜在的な能力を探り、明らかなリソース制約の下で重要な進歩を達成します。

一般的に、Mini-Geminiフレームワークは、テキストと画像の両方を入力および出力として処理できる、任意の入力から任意の出力へのパラダイムを使用しています。特に、Mini-Geminiフレームワークは、入力画像の視覚トークンを効率的に強化するためのパイプラインを導入し、双子のエンコーダー・システムを特徴とします。双子のエンコーダーは、高解像度の画像用と低解像度の視覚エンベディング用の2つのエンコーダーで構成されています。推論時、エンコーダーは、注意メカニズムで動作します。低解像度のエンコーダーは、視覚的なクエリを生成し、高解像度のエンコーダーは、参照用のキーと値を提供します。データの品質を高めるために、Mini-Geminiフレームワークは、タスク指向のインストラクション、生成関連のデータ、ハイレゾリューションの応答など、公開されているリソースを使用して、さらに多くのデータを収集および生成します。増加したデータの量と品質の向上は、モデルの全体的なパフォーマンスと能力を向上させます。さらに、Mini-Geminiフレームワークは、ビジョン言語モデルの先進的な生成モデルの統合により、テキストと画像の同時生成をサポートします。

Mini-Gemini : 方法論とアーキテクチャ

Mini-Geminiフレームワークの核となる部分は、概念的に単純であり、3つのコンポーネントで構成されています。

  1. フレームワークは、低解像度の視覚エンベディングと高解像度の候補を提供するための双子の視覚エンコーダーを使用します。
  2. フレームワークは、低解像度の視覚クエリと高解像度の領域の間でパッチレベルのマイニングを行うためのパッチ・インフォ・マイニングを提案します。
  3. Mini-Geminiフレームワークは、テキストと画像の両方の生成と理解のために、大規模言語モデルのテキストと画像を統合します。

双子の視覚エンコーダー

Mini-Geminiフレームワークは、テキストと画像の両方を入力として処理できます。次の画像に示すように、Mini-Geminiフレームワークは、対応する高解像度画像から低解像度画像を生成するために、バイリニア補間を使用してプロセスを開始します。

次に、フレームワークは、これらの画像を処理し、2つの並行的な画像フローでマルチグリッドの視覚エンベディングにエンコードします。具体的には、Mini-Geminiフレームワークは、低解像度のフローに対して従来のパイプラインを維持し、視覚エンベディングをエンコードするために、CLIP事前トレーニング済みのビジョン・トランスフォーマーを使用します。これにより、モデルは、大規模言語モデルの後のインタラクションのために、視覚パッチ間の長距離関係を維持できます。高解像度のフローに対して、Mini-Geminiフレームワークは、高解像度の画像処理のためのCNNまたはConvolution Neural Networksベースのエンコーダーを採用します。

パッチ・インフォ・マイニング

双子の視覚エンコーダーがLRエンベディングとHR特徴を生成した後、Mini-Geminiフレームワークは、ビジョン言語モデルの潜在能力を高めるために、パッチ・インフォ・マイニングを実装することを提案します。効率性を維持するために、Mini-Geminiフレームワークは、低解像度の視覚エンベディングをクエリとして使用し、HR特徴候補から関連する視覚的なヒントを取得することを目指します。フレームワークは、HR特徴マップをキーと値として使用します。

上の画像に示すように、式は、視覚的なヒントを精製し、合成するプロセスをカプセル化し、後の大規模言語モデルの処理のために、先進的な視覚的なトークンを生成することになります。プロセスは、各クエリのマイニングを、HR特徴マップの対応するサブ領域に、ピクセル単位の特徴数で制限することを保証し、計算の実行可能性と詳細の豊かさのバランスを維持します。

テキストと画像の生成

Mini-Geminiフレームワークは、視覚トークンと入力テキスト・トークンを、大規模言語モデルの入力として連結します。従来のビジョン言語モデルのように、Mini-Geminiフレームワークは、テキストのみまたはテキストと画像の両方を入力および出力としてサポートし、画像とテキストの理解と推論能力が優れているため、高品質の画像を生成できます。最近の研究が、生成モデルのテキスト・エンベディングと大規模言語モデルの間のドメイン・ギャップに焦点を当てているのとは異なり、Mini-Geminiフレームワークは、言語・プロンプトのドメインでのギャップを最適化することを目指しています。具体的には、ユーザーの指示を、高品質のプロンプトに翻訳して、潜在的な画像を生成します。さらに、インストラクション・チューニングとクロスモーダル・アライメントの理解のために、Mini-Geminiフレームワークは、公開されているハイクオリティなデータセットからサンプルを収集し、GPT-4ターボ・フレームワークを使用して、画像生成をサポートするための13Kのインストラクション・フォローのデータセットを構築します。

Mini-Gemini : 実験と結果

パフォーマンスを評価するために、Mini-Geminiフレームワークは、HRビジョン・エンコーダーとして事前トレーニング済みのConvNext-Lフレームワークを使用し、LRビジョン・エンコーダーとしてCLIP事前トレーニング済みのビジョン・トランスフォーマーを使用します。トレーニングの効率を確保するために、Mini-Geminiフレームワークは、2つのビジョン・エンコーダーを固定し、パッチ・インフォ・マイニングのプロジェクターをすべてのステージで最適化し、インストラクション・チューニング・ステージで大規模言語モデルの最適化を実行します。

次の表は、Mini-Geminiフレームワークのパフォーマンスを、さまざまな設定で最新のモデルのパフォーマンスと比較しています。観察すると、Mini-Geminiは、通常の解像度で一貫して最新のフレームワークを上回り、効率的なモデルのカテゴリでGemma-2Bと組み合わせたときに、卓越したパフォーマンスを示しています。さらに、大規模言語モデルの使用により、Mini-Geminiフレームワークの拡張性が明らかです。

また、高解像度と拡張された視覚トークンでのパフォーマンスを評価するために、実験は、LRビジョン・エンコーダーに対して672の入力サイズ、視覚エンコーダーに対して1536の入力サイズで行われます。HRビジョン・エンコーダーの主な目的は、高解像度の候補情報を提供することです。観察すると、Mini-Geminiフレームワークは、最新のフレームワークと比較して、優れたパフォーマンスを示しています。

さらに、Mini-Geminiフレームワークの視覚的な理解能力を実世界の設定で評価するために、開発者は、さまざまな推論と理解タスクにモデルを適用しています。観察すると、Mini-Geminiフレームワークは、パッチ・インフォ・マイニングとハイクオリティなデータの実装により、幅広い複雑なタスクを解決できます。しかし、さらに印象的なのは、Mini-Geminiフレームワークが、単なる認識能力を超えて、細部への注意を示し、複雑な要素を詳細に説明する能力を持っていることです。

次の図は、Mini-Geminiフレームワークの生成能力の包括的な評価を示しています。

ChatIllusionやAnyGPTなどの最近のモデルと比較して、Mini-Geminiフレームワークは、多モーダルな理解能力が優れており、入力指示と一致するテキストから画像へのキャプションを生成し、画像からテキストへの回答で概念的な類似性が高いことを示しています。さらに印象的なのは、Mini-Geminiフレームワークが、テキストのトレーニング・データのみを使用して、高品質のコンテンツを生成するための強力な能力を示していることです。これは、Mini-Geminiの強力な意味的解釈と画像・テキスト・アライメント能力を示しています。

最終的な考え

この記事では、ビジョン言語モデルの潜在能力を高めるための強力でストリームライン化されたフレームワークであるMini-Geminiについて説明しました。Mini-Geminiフレームワークの主な目的は、ハイクオリティなデータ、戦略的な設計、拡張された機能の範囲を使用して、ビジョン言語モデルの潜在能力を高めることです。Mini-Geminiは、ビジョン言語モデルのパフォーマンスを向上させるために、3つの側面からビジョン言語モデルの潜在能力を高めることを目指しています。具体的には、VLMガイド付き生成、高品質なデータ、ハイレゾリューションの視覚トークンです。視覚トークンを強化するために、Mini-Geminiフレームワークは、視覚トークンの数を増やさずに、高解像度の精製を行うための追加の視覚エンコーダーを提案しています。さらに、Mini-Geminiフレームワークは、画像と推論ベースの生成の正確な理解を促進するために、高品質のデータセットを構築することを目指しています。全体として、Mini-Geminiフレームワークは、ビジョン言語モデルの潜在能力を高め、画像の推論、理解、生成能力を同時に既存のフレームワークに与えることを目指しています。

Kunal Kejriwal は、Python、PostgreSQL、Redis、そして GCP と AWS のクラウドインフラストラクチャを専門とするバックエンドエンジニアです。3 年間にわたり本番システムの構築とスケーリングを経験しており、AI インフラストラクチャ、分散システム、機械学習ワークロードのデプロイに関するアーキテクチャについて執筆しています。