AIモデルとプラットフォーム
フェレット:任意の粒度での参照とグラウンド化のための優れたパフォーマンス
空間的な理解をビジョン言語学習モデルに実装することは、依然として重要な研究課題です。この理解は、2つの重要な機能を支えています。グラウンド化と参照です。参照は、モデルが特定の領域のセマンティクスを正確に解釈できるようにします。一方、グラウンド化は、セマンティックな説明を使用してこれらの領域をローカライズすることを可能にします。
開発者は、フェレットと呼ばれる新しいマルチモーダル・ラージ・ランゲージ・モデル(MLLM)を導入しました。フェレットは、画像内の任意の粒度または形状の空間参照を理解し、オープン・ボキャブラリーの説明を正確にグラウンド化することができます。フェレットは、連続的な特徴と離散的な座標を組み合わせた新しいハイブリッド表現を使用して、画像の領域を表現します。空間認識可能なビジュアル・サンプラーは、さまざまな形状の変化する疎密度を処理して、自由形状、バウンディング・ボックス、ポイントなどのさまざまな領域入力を処理できます。
フェレットのアプローチにより、クラシカルなグラウンド化と参照タスクで優れたパフォーマンスを発揮し、ローカリゼーションを要求するマルチモーダル・コミュニケーションで他のMLLMを超えることができます。この記事では、フェレットのアーキテクチャと方法論を詳しく説明し、さまざまなマルチモーダル言語タスクでの印象的なパフォーマンスを紹介します。フェレットを詳しく見てみましょう。
フェレット:参照とグラウンド化タスクでの優れたパフォーマンス
モデルにおける参照は、モデルが特定の領域のセマンティクスを正確に理解できるようにする機能です。一方、グラウンド化は、モデルがセマンティックな説明を使用して領域をローカライズすることを可能にします。グラウンド化と参照は、空間セマンティクスと情報の整列という同じ基本概念を共有しています。しかし、既存のモデルはグラウンド化と参照を個別に学習します。フェレット・フレームワークは、既存のMLLMフレームワークのこのギャップから着想を得て、3つの主要な質問を研究します。
- グラウンド化と参照の機能をフレームワークで統一する方法は何ですか?どのようにして互いに利益をもたらすことができますか?
- 人間は、参照のためにさまざまなタイプの領域(ボックス、ポイント、スクリブル、自由形状など)を使用します。これらの多様な領域をどのように表現できますか?
- グラウンド化と参照の指示を実行可能、ロバスト、オープン・ボキャブラリーにする方法は何ですか?これらは実用的かつリアルタイムのアプリケーションに不可欠です。
フェレット・フレームワークは、これらの質問に答えるために、グラウンド化と参照のための新しいマルチモーダル・ラージ・ランゲージ・モデルです。フェレット・フレームワークは、グラウンド化と参照の機能を統一するために、領域の座標を自然言語の数値形式で表現します。ただし、実践では、ボックスの座標や単一のポイントを使用して、スクリブルやストロークなどの自由形状の領域を表現することは非効率的です。フェレット・フレームワークは、さまざまな形状の変化する疎密度に対処するために、空間認識可能なビジュアル・サンプラーを使用します。
この問題を解決し、すべての形式にわたって一般化するために、フェレット・フレームワークは、連続的なビジュアル特徴と離散的な座標を組み合わせたハイブリッド領域表現を提案します。

連続的なビジュアル特徴については、フェレット・フレームワークは、指定された領域と同じサイズの2Dバイナリ・マスクを最初に構築し、ターゲット領域内では1を、領域外では0を割り当てます。モデルは、バイナリ・マスクと抽出された画像特徴マップを抽出し、空間認識可能なビジュアル・サンプラーに送信します。
フェレット:方法論とアーキテクチャ
ハイブリッド領域表現
ポイント、ボックス、自由形状は、言語モデルが特定の領域を参照するときに使用する3つの主要な形式です。一方で、ポイントとボックスの形式は座標で正確に表現できますが、自由形状をマッピングすることは少し挑戦的です。自由形状は多様で、マスク、ポリゴン、スクリブルなど、幅広い領域を包含できます。自由形状を座標で表現することは、モデルが領域と対応する座標の間の相関関係を学習することを妨げる複雑で計算コストの高いタスクです。
この問題を解決し、すべての形式にわたって一般化するために、フェレット・フレームワークは、連続的なビジュアル特徴と離散的な座標を組み合わせたハイブリッド領域表現を提案します。

フェレット・モデルのアーキテクチャは、3つの主要なコンポーネントで構成されます
- 画像エンコーダを使用して画像埋め込みを抽出します。
- 空間認識可能なビジュアル・サンプルを使用して地域の連続的な特徴を抽出します。
- 大規模言語モデルを使用して、テキスト、画像、地域の特徴を共同でモデル化します。
画像は、事前にトレーニングされたビジュアル・エンコーダに最初にフィードされ、画像埋め込みが抽出されます。テキスト入力の場合、フレームワークは事前にトレーニングされたLLMトークナイザを使用してテキストシーケンスをトークナイズし、次にこれらのトークンをテキスト埋め込みに投影します。参照された領域の場合、フェレットは、連続的な特徴のプレースホルダーとして、領域名の後に特殊なトークンと座標を追加します。領域の名前が不明または複雑な場合は、フレームワークは領域名またはエリア名のみを使用します。
参照された領域を扱う際の主な課題は、その形状が非常に変化する可能性があることです。つまり、領域は長方形のボックスやポイントに限定されず、さまざまな形状になる可能性があります。従来の方法(グリッドベースの処理、パッチ・アテンション、畳み込みテクニックなど)では、不規則な形状の参照された領域を処理することはできません。フェレット・フレームワークは、空間認識可能なビジュアル・サンプラーを提案してこの問題に対処します。
空間認識可能なビジュアル・サンプラーでは、抽出された特徴マップとバイナリ・地域マスクが与えられた場合、フェレット・モデルは、バイナリ・地域マスク内でN個のポイントをランダムにサンプリングします。各ポイントについて、モデルは、双線形補間を実行してその特徴を取得します。N個のポイントは、サンプリング、収集、プーリングの3つのステージを通過する一連のブロックにフィードされます。サンプリング段階では、FPS(Farthest Point Sampling)アルゴリズムを使用して、N個のポイントから一定数のポイントをサンプリングし、適切なカバレッジを保証します。2番目のステップでは、各サンプル・ポイントについて、モデルはN個の利用可能なポイント・プールからk個の最も近い隣接ポイントを検索します。各グループについて、モデルはサンプル・ポイントの特徴と隣接ポイントの特徴を融合します。最終段階では、フェレット・フレームワークは、k個の隣接特徴を1つの特徴に融合するために、最大プーリングを実行します。サンプルされたポイントの表現として機能します。3つのステップを実行することで、フェレット・フレームワークは、ポイントの数は少なくなりますが、特徴空間の密度は高くなります。モデルは、隣接ポイントの特徴だけでなく、隣接ポイントの相対的な位置も組み込むからです。
GPTアシスト・ビジュアル・データ・ジェネレーション
マルチモーダル・ラージ・ランゲージ・モデルにとって、ダイアログ・インストラクション・チューニング・データは非常に重要です。これらは、既存のデータセットをテンプレートで変換するのを助け、モデルが人間の意図を理解し、適切な応答を生成するのを助けます。多くのMLLMは、ビジュアル・インストラクション・チューニング・データを取得するために、幾何学的な説明を提供することなく、画像の全体的な説明と人間が注釈付けたダイアログを使用する、数ショット・プロンプティング方法を使用します。ただし、既存のインストラクション・チューニング方法は、空間関連情報を明示的に指定せずに、画像全体を説明することに重点を置いています。フェレット・フレームワークは、地域ベースの知識を使用して、3つのステップで参照とグラウンド化のインストラクション・チューニング・データを収集します。
- グローバル・キャプションとオブジェクトに加えて、フレームワークは、地域のキャプションとオブジェクトの物理的な関係を記述し、さらにその座標を提供する、シンボリックなシーンの説明を提供します。
- 人間が注釈付けたダイアログについては、フレームワークは、入力または出力の両方、またはその両方で、グラウンド可能なオブジェクトまたは地域の後に座標を追加します。ダイアログは、特定の地域に焦点を当てて、言語モデルが新しいダイアログの生成に同じパターンを使用するように促します。
- フレームワークによって生成されたダイアログが、幾つかのショットの例とシステムのプロンプトによって示されたルールやパターンに従わない可能性があります。モデルによって生成されたダイアログを改良するために、フレームワークは、言語モデルをもう一度使用します。
空間ネガティブ・マイニング
以前の研究では、マルチモーダル・ラージ・ランゲージ・モデルが、はい/いいえの質問に答える際に妄想する可能性が高いことを実証しています。フェレット・モデルが同様の状況で妄想しないようにするために、フレームワークは、画像条件付きカテゴリ・ローカリゼーションとセマンティクス条件付きカテゴリ・ローカリゼーションを使用する、空間ネガティブ・マイニング・アプローチを採用しています。これらの方法では、モデルは、画像内の特定のオブジェクト・カテゴリをローカライズする必要があり、これにより、モデルは画像内の特定のオブジェクトの不存在を認識することができます。
フェレット:結果と実験
フェレット・フレームワークのパフォーマンスを分析するために、従来のグラウンド化と参照ベンチマークで評価され、さらに複雑なマルチモーダル・チャット・タスクで評価され、参照とグラウンド化の機能がテストされます。

モデルの参照の理解能力は、画像または質問で参照された領域が与えられたときに、モデルが参照された領域のセマンティクスをどの程度正確に理解できるかで評価されます。モデルの精度を測定するために、最も基本的で定義しやすいセマンティクスであるオブジェクトから始めます。人間のような多様性を模倣するために、フレームワークは、オブジェクトの位置を画像内で自由形状、ボックス、ポイントと交換します。自由形状の場合、モデルはグラウンド・トゥルース・オブジェクト内でランダムにストロークを生成してシミュレートします。ボックスの場合、フェレット・フレームワークは、LVISコンポーネントによって提供されたグラウンド・トゥルース・バウンディング・ボックスを使用します。最後に、ポイントの場合、モデルはグラウンド・トゥルース・オブジェクト内で、グラウンド・トゥルース・オブジェクトの境界線に近いポイントをランダムにサンプリングします。3つのタイプの参照の結果は、次の画像に示されています。

フェレット・フレームワークは、参照ダイアログ・タスクで優れたパフォーマンスを発揮し、グラウンド化の出力を持つさまざまなビジュアル・ラーニング・タスクとの統合を可能にします。グラウンド化の機能を評価するために、フェレット・フレームワークは、生成的なパラダイムでビジュアル・グラウンド化・タスクに最初に参加し、次にグラウンド化されたキャプション・タスクで、その領域と単語の間の整列を測定するために評価されます。
ビジュアル・グラウンド化・タスクでは、フレームワークは、画像の整列された領域に言語のクエリをグラウンド化することを目的とし、次の画像のように、すべてのベンチマークで優れたパフォーマンスを発揮します。パフォーマンスは、特化したファイン・チューニング方法によって達成されたものと比較できます。

グラウンド化されたキャプション・タスクについては、モデルは、グラウンド化の整列とともに、キャプションを生成する必要があります。モデルの最終的な予測は、3つのコンポーネントで構成されます。ビジュアル・リージョン(ボックスとして)、テキスト・キャプション、ボックスと単語の間のグラウンド化の整列です。結果は、次の画像に示されています。フェレット・フレームワークは、最先端の方法と比較して、優れたパフォーマンスを発揮します。

最後に、マルチモーダル・チャットは、MLLMの中で最も望ましい機能の1つです。既存のMLLMは、詳細な説明、会話、言語モデルをジャッジとして使用する複雑な推論を評価します。ただし、マルチモーダル・チャットをグラウンド化または参照アクションで評価するデータセットがないため、ギャップが残ります。フェレット・フレームワークは、このギャップを埋めるために、参照とグラウンド化の機能を評価するために、3つの地域ベースの質問をカバーします。結果は、次の画像に示されています。

最後に、フェレット・フレームワークは、最先端のGPTフレームワークと直接比較され、結果は以下に示されています。

最終的な考え
この記事では、グラウンド化と参照の機能を示す、マルチモーダル・ラージ・ランゲージ・モデルであるフェレットについて説明しました。フェレット・フレームワークは、画像の領域を参照でき、モデルが予測したテキストを自動的にグラウンド化できます。フェレットは、さまざまな形状の変化する疎密度を処理できる空間認識可能なビジュアル・サンプラーを使用します。したがって、フェレット・フレームワークは、自由形状、バウンディング・ボックス、ポイントなどのさまざまな領域入力を処理できます。












