AIモデルとプラットフォーム

LLaVA-UHD: 任何アスペクト比と高解像度の画像を効率的に認識する

mm
Unite.AI を Google の優先ソースに追加

最近の進歩と大型言語モデルの発展により、ビジョン言語推論、理解、インタラクションの能力が大幅に向上しました。現代のフレームワークでは、ビジョン言語モデルの能力を視覚的に解釈できるように、視覚信号をLLM(Large Language Model)に投影します。これは、視覚エンコーディング戦略が重要な役割を果たすさまざまなシナリオです。ただし、現実世界の画像は、シナリオの範囲が広いだけでなく、解像度とアスペクト比も大きく異なります。これは、さまざまなドメインとタスクのLLMに大きな課題をもたらします。現実世界の画像の大きな変動性に立ち向かうために、現代の大型言語モデルは、低解像度(例:LLaVA-UHDの場合、224×224)と固定のアスペクト比(1:1)で画像を認識します。解像度とアスペクト比が事前に決定されているため、モデルはぼけた画像を推測するだけとなり、モデルは事実に基づいていないテキスト応答を生成することになります。

この記事では、LLaVA-UHDという新しいアプローチについて説明します。LLaVA-UHDは、LLaVA-1.5とGPT-4Vフレームワークを代表的な例として取り、視覚エンコーディング戦略の根底にある体系的な欠陥を暴くことを試みています。LLaVA-UHDフレームワークは、高解像度と任意のアスペクト比の画像を認識できるように設計されています。LLaVA-UHDフレームワークは、3つの重要なコンポーネントで構成されています。まず、ネイティブ解像度の画像を小さな可変サイズのスライスに分割する画像モジュール化戦略があります。次に、視覚エンコーダーによって生成された画像トークンをさらに凝縮する圧縮モジュールがあります。最後に、大型言語モデルにスライス トークンを整理する空間スキーマがあります。包括的な実験により、LLaVA-UHDフレームワークは9つのベンチマークで最先端の大型言語モデルを上回ることが示されています。さらに、LLaVA-UHDフレームワークは、推論計算の94%しか使用せずに、6倍大きな解像度(672×1088)の画像をサポートできることが示されています。

LLaVA-UHD: 任何アスペクト比と高解像度の画像を効率的に認識する

ビジョン言語推論、理解、インタラクションは最近大幅に進歩しました。これは、大型言語モデルの進歩によるものです。現代のフレームワークでは、視覚信号をLLM(Large Language Model)に投影することで、LLMが視覚的に世界を解釈できるようにします。これは、視覚エンコーディング戦略が重要な役割を果たすさまざまなシナリオです。ただし、現実世界の画像は、シナリオの範囲が広いだけでなく、解像度とアスペクト比も大きく異なります。これは、さまざまなドメインとタスクのLLMに大きな課題をもたらします。現代の大型言語モデルは、低解像度(例:LLaVA-UHDの場合、224×224)と固定のアスペクト比(1:1)で画像を認識します。解像度とアスペクト比が事前に決定されているため、モデルはぼけた画像を推測するだけとなり、モデルは事実に基づいていないテキスト応答を生成することになります。

ベンチマークLMMは、高解像度と可変アスペクト比の画像を認識できない理由は2つあります。まず、視覚エンコーダーは固定解像度で事前に訓練されているため、モデルとエンコーダーは解像度とアスペクト比が異なる画像を扱うことが難しくなります。これにより、モデルの適応性が大幅に低下します。2つ目は、高解像度の画像を直接ビジョントランスフォーマーでエンコードすることは、計算コストが大幅に増加するためです。また、高解像度の画像を処理するために、大型言語モデルが視覚トークンの大量を処理する必要があり、モデルの全体的な効率が低下します。これらの課題に対処するために、LLaVA-UHDは、高解像度と任意のアスペクト比の画像を認識できるように設計されています。LLaVA-UHDフレームワークは、3つの重要なコンポーネントで構成されています。まず、ネイティブ解像度の画像を小さな可変サイズのスライスに分割する画像モジュール化戦略があります。次に、視覚エンコーダーによって生成された画像トークンをさらに凝縮する圧縮モジュールがあります。最後に、大型言語モデルにスライス トークンを整理する空間スキーマがあります。

上記の画像は、GPT-4Vが画像内のオブジェクトの数を識別する実験結果を反映しています。LLaVA-UHDフレームワークの核心には、3つのコンポーネントがあります。まず、ネイティブ解像度の画像を小さな可変サイズのスライスに分割する画像モジュール化戦略があります。これは、最近の大型言語モデルが画像を固定解像度とアスペクト比で処理するのとは対照的に、LLaVA-UHDフレームワークは画像のネイティブ解像度に完全に適応できるようにします。次に、視覚エンコーダーによって生成された画像トークンをさらに凝縮する圧縮モジュールがあります。これにより、大型言語モデルの計算コストが大幅に低減されます。最後に、空間スキーマによって、スライス トークンが大型言語モデルに整理されます。

LLaVA-UHD: 方法論とアーキテクチャ

GPT-4VやLLaVA-1.5などの既存のフレームワークに関するパイロット実験の知見に基づいて、LLaVA-UHDフレームワークは3つのコンポーネントで構成されるアーキテクチャを実装しています。これは、以下の画像に示されています。

まず、ネイティブ解像度の画像を小さな可変サイズのスライスに分割する画像モジュール化戦略があります。次に、視覚エンコーダーによって生成された画像トークンをさらに凝縮する圧縮モジュールがあります。最後に、大型言語モデルにスライス トークンを整理する空間スキーマがあります。これらのコンポーネントについて詳しく見てみましょう。

モジュール化された視覚エンコーディング

高解像度と異なるアスペクト比の画像を扱う一般的なアプローチは、ビジョントランスフォーマーまたはViTの位置埋めをターゲット形状に補間することです。ただし、このアプローチの実装は、計算コストが高く、分布外の問題が発生し、パフォーマンスが低下することがあります。LLaVA-UHDフレームワークは、モジュール化された視覚エンコーディング戦略を提案します。これは、ネイティブ解像度の画像を小さな可変サイズのスライスに分割することを目的としています。各スライスの形状は、ビジョントランスフォーマーの標準的な事前訓練設定に近いものになります。可変サイズのスライスを使用することで、LLaVA-UHDフレームワークは、ネイティブ解像度の画像に完全に適応できるようになります。さらに、画像スライシング戦略の主な目的は、各スライスの解像度の変更を最小限に抑えることです。特定の解像度(w、h)とビジョントランスフォーマーの事前訓練解像度が与えられた場合、LLaVA-UHDフレームワークは、画像を処理するために必要なスライスの数を決定します。次に、スライスの数をm列とn行に因数分解します。さらに、ビジョントランスフォーマーの標準的な事前訓練設定からの偏差を測定するスコア関数を定義します。理論的には、LLaVA-UHDフレームワークは、パーティショニング戦略で実装されたアーキテクチャが、各スライスに対して標準的な事前訓練解像度からの小さな期待変化と適度な最悪変化を保証することを示しています。

さらに、多くの既存のLLMは、静的な解像度で画像スライスをエンコードします。これは、モデルがネイティブ解像度に完全に適応できないため、静的なスライス解像度は、必然的に形状の歪みをもたらすリサイズまたはパディングを招きます。LLaVA-UHDフレームワークは、画像スライスをパーティショニング戦略で定義されたアスペクト比でエンコードすることを提案します。具体的には、LLaVA-UHDフレームワークは、元の画像をアスペクト比に応じて比例してリサイズし、パッチの数がビジョントランスフォーマーの事前訓練予算内に収まるようにします。次に、LLaVA-UHDモデルは、ビジョントランスフォーマーの事前訓練された1D位置埋めを2D形式に変換します。

圧縮レイヤー

LLMが高解像度の画像を処理するときに直面する一般的な問題は、処理する視覚トークンの数が大幅に増加することです(例:LLaVA-1.5フレームワークは、解像度672×1008の単一の画像で約3500の視覚トークンを生成します)。これは、計算リソースとコストの主要な部分を占めます。LLaVA-UHDモデルは、画像スライスの視覚トークンを圧縮するために、共有パーシーバー リサンプラー レイヤーを実装します。モデルは、視覚エンコーダーの出力の視覚トークンを、クロスアテンションを介してクエリベクトルを使用して、より低い数にリサンプリングします。一般的なマルチレイヤー パーセプトロン ベースの視覚プロジェクション戦略と比較して、LLaVA-UHDによって実装されたパーシーバー サンプル アプローチは、画像の解像度に関係なく、固定数の視覚トークンを維持することができます。これにより、LLaVA-UHDフレームワークは、高解像度画像処理と理解タスクとの互換性が向上します。具体的には、LLaVA-UHDフレームワークは、672×1008解像度の画像をエンコードするときに、LLaVA-1.5フレームワークが336×336解像度の画像をエンコードするときと同じ数のトークンを生成します。これは、競合他社よりも約6倍効率が高いです。

画像スライスの空間スキーマ

画像のパーティショニングが動的であるため、大型言語モデルに画像スライスの空間配置を通知することは必要です。LLaVA-UHDフレームワークは、2つの特殊トークンを使用して、LLMにスライスの相対的な位置を通知する空間スキーマを設計および実装しています。この空間スキーマでは、LLaVA-UHDフレームワークは、行内のスライス表現を区切るために「、」を使用し、行を区切るために「n」を使用します。

LLaVA-UDH: 実験と結果

LLaVA-UHDフレームワークは、9つの一般的なベンチマーク、光学文字ベースの視覚質問回答ベンチマーク、幻覚ベンチマーク、および包括的なベンチマークに対して評価されます。さらに、LLaVA-UHDフレームワークは、LLaVA-1.5、MiniGPT-v2、InstructBLIP、BLIP-2などの強力なベースラインと比較されます。

LLaVA-UHDフレームワークの9つの一般的なベンチマークでのパフォーマンスは、以下の表にまとめられています。

上記の結果に基づいて、LLaVA-UHDフレームワークは、強力なベースライン モデルを含む一般的なベンチマークで最先端のモデルを上回ることが示されています。さらに、結果は、LLaVA-UHDフレームワークが、LLaVA-1.5アーキテクチャよりも大幅に優れた結果を達成していることも示しています。一方で、LLaVA-1.5は固定336×336解像度をサポートしますが、LLaVA-UHDフレームワークは、任意のアスペクト比と同じ数の視覚トークンで672×1088解像度の画像をサポートします。

最終的な考え

この記事では、LLaVA-UHDという新しいアプローチについて説明しました。LLaVA-UHDは、LLaVA-1.5とGPT-4Vフレームワークを代表的な例として取り、視覚エンコーディング戦略の根底にある体系的な欠陥を暴くことを試みています。LLaVA-UHDフレームワークは、高解像度と任意のアスペクト比の画像を認識できるように設計されています。LLaVA-UHDフレームワークは、3つの重要なコンポーネントで構成されています。まず、ネイティブ解像度の画像を小さな可変サイズのスライスに分割する画像モジュール化戦略があります。次に、視覚エンコーダーによって生成された画像トークンをさらに凝縮する圧縮モジュールがあります。最後に、大型言語モデルにスライス トークンを整理する空間スキーマがあります。包括的な実験により、LLaVA-UHDフレームワークは9つのベンチマークで最先端の大型言語モデルを上回ることが示されています。さらに、LLaVA-UHDフレームワークは、推論計算の94%しか使用せずに、6倍大きな解像度(672×1088)の画像をサポートできることが示されています。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。