Andersonの視点

AIに視覚的アナロジーをもたらす

mm
Unite.AI を Google の優先ソースに追加
AI-generated image: comparative cross-sections of a peach and the planet Earth. GPT-image-1, Firefly 3.

現在のAIモデルは、地球の層と桃の類似性などの「関係性」画像の類似性を認識できません。これは、人間が画像を認識する方法の重要な側面を欠いています。

 

コンピュータビジョンモデルは多数存在し、画像を比較して類似性を検出することができます。しかし、現在の比較システムは、想像力のある能力がほとんどありません。1960年代のクラシックソング「Windmills of Your Mind」の歌詞を考えてみましょう:

回るメリーゴーランドのように、月の周りを走り回る
時計の針が時計の面を通過するように
世界は静かに空間を回転しています

このような比較は、人間にとって意味のある詩的な暗示のドメインを表し、芸術的な表現を超えて、私たちが認識システムを開発する方法と結びついています。私たちが「物体」ドメインを作成するにつれて、視覚的な類似性の能力を開発し、例えば桃と地球の断面、またはコーヒーの渦巻きと銀河の枝のようなフラクタル再帰が、私たちにとって類似性を持ちます。

このように、私たちは明らかに関連のない物体や物体の種類間のつながりを推測し、重力、運動量、表面凝集などのシステムを推論することができます。これらのシステムは、さまざまなドメインやスケールで適用できます。

物を見る

最新の画像比較AIシステム、たとえば、LPIPSDINOは、人間のフィードバックに基づいていますが、表面的な比較のみを実行します。

人間の顔が存在しない場所で顔を見つける能力、つまりパレドリアは、人間が開発する視覚的な類似性メカニズムを表すものではなく、顔検出アルゴリズムが低レベルの顔構造特徴を使用することによって発生します。これらの特徴は、時折ランダムな物体と一致します:

「Faces with Things」データセットの顔認識の誤検知の例。

「Faces with Things」データセットの顔認識の誤検知の例。 出典

アメリカの研究者は、関係性視覚的類似性についての研究を実施し、新しいデータセットをキュレーションしてトレーニングしました。このデータセットは、抽象的な関係を形成するように設計されています。

最もAIモデルは、画像が表面的な特徴を共有する場合にのみ類似性を認識します。これは、グループB(上)のみを参照画像にリンクする理由です。人間は、グループAも類似性があると見なします。なぜなら、画像は同じ根本的な論理を共有しているからです。新しい研究は、人間の認識に近いこの種の構造的または関係性の類似性を再現することを目指しています。

最もAIモデルは、画像が表面的な特徴を共有する場合にのみ類似性を認識します。これは、グループB(上)のみを参照画像にリンクする理由です。人間は、グループAも類似性があると見なします。なぜなら、画像は同じ根本的な論理を共有しているからです。新しい研究は、人間の認識に近いこの種の構造的または関係性の類似性を再現することを目指しています。 出典

キャプションシステムは、通常のデータセットとは異なり、抽象的な注釈を可能にします。

著者が提案した「relsim」メトリックに寄与する予測された「匿名」キャプション。

著者が提案した「relsim」メトリックに寄与する予測された「匿名」キャプション。

この新しいアプローチは、認知科学、特にDedre Gentnerの構造マッピング理論とAmos Tverskyの関係性の類似性と属性の類似性の定義に基づいています。

典型的なデータセットのキャプションスタイルとrelsimアプローチの比較。relsimアプローチは関係性の類似性を強調しています。

典型的なデータセットのキャプションスタイルとrelsimアプローチの比較。relsimアプローチは関係性の類似性を強調しています。

著者は次のように述べています:

「人間は、属性の類似性を感覚的に処理しますが、関係性の類似性は概念的な抽象化を必要とし、言語や事前の知識によって支えられることが多い。」

「これは、関係性の類似性を認識するには、画像を理解し、知識を利用し、根本的な構造を抽象化する必要があることを示唆しています。」

方法

研究者は、LAION-2Bという有名なデータセットを使用して、独自のコレクションを作成しました。

LAION-2Bコレクションのエントリのメタデータ。

LAION-2Bコレクションのエントリのメタデータ。 出典

LAION-2Bから、114,000枚の画像が抽出され、関係的な構造を含む画像をフィルタリングするために使用されました。

Qwen2.5-VL-7Bを使用して、1,300の正例と11,000の負例の人間によるラベル付けされた例を利用して、選択プロセスのパイプラインを作成しました。

relsimシステムは3つのステージでトレーニングされます。LAION-2Bからの関係的なコンテンツの画像のフィルタリング、各グループに共有の匿名キャプションを割り当て、キャプションへの画像のマッチングのための対比損失の使用。

relsimシステムは3つのステージでトレーニングされます。LAION-2Bからの関係的なコンテンツの画像のフィルタリング、各グループに共有の匿名キャプションを割り当て、キャプションへの画像のマッチングのための対比損失の使用。

論文では次のように述べられています:

「アノテーターは次のように指示されました。『この画像に、他の画像を作成またはリンクするために役立つ関係的なパターン、論理、または構造を見つけることができますか?』」

「ファインチューンされたモデルは、人間の判断と93%の一致を達成し、LAION-2Bに適用すると、N = 114kの画像が関係的に興味深いものとして識別されました。」

結果として得られたグループレベルのキャプションは、特定のオブジェクトではなく、「{主題}」「{動作の種類}」などのプレイスホルダーに置き換えられ、広く適用可能なものとなりました。

データとテスト

Qwen2.5-VL-7Bを使用して関係的な特徴を抽出してから、LoRAを使用して15,000ステップでモデルをファインチューンしました。テキスト側では、relsimメトリックを埋め込むために、Sentence-Transformersライブラリのall-MiniLM-L6-v2を使用しました。

114,000枚の画像のデータセットを100,000枚のトレーニングセットと14,000枚の評価セットに分割しました。システムをテストするために、リトリーバル設定を使用しました。クエリ画像が与えられたとき、モデルは28,000アイテムのプールから同じ関係的なアイデアを表す別の画像を見つける必要がありました。

リトリーバルの品質を評価するために、GPT-4oを使用して、クエリとリトリーブされた画像の関係的な類似性を0から10のスケールでスコア付けしました。また、ユーザーの好みを測るために別の人間による研究も実施しました。

各参加者は匿名化されたクエリ画像と2つの候補(1つは提案された方法でリトリーブされたもの、もう1つはベースラインでリトリーブされたもの)を提示され、どの画像がクエリにrelationally類似であるか、またはどちらも等しく類似であるかを判断するように求められました。

relsimアプローチは、LPIPS、DINO、dreamsim、CLIP-Iなどの既存の画像間の類似性を計算するベースラインと比較されました。また、Qwenを使用して各画像の匿名または抽象的なキャプションを生成するキャプションベースの方法もテストされました。

既存のメトリックと関係性の類似性

著者は、既存のメトリックが関係性の類似性を捉えることができるかどうかをテストしました。

GPT-4oによって判断されたリトリーバル性能の比較。各方法の平均関係的な類似性スコアを示しています。従来の類似性メトリックであるLPIPS、DINO、CLIP-Iは、調整されていても低スコアでした。キャプションベースのベースラインであるQwen-TとCLIP-Tも低性能でした。最高スコアは、relsim(6.77、右端の青い列)によって達成され、グループベースの関係的なパターンにファインチューンすることで、GPT-4oの評価との整合性が向上したことを示しています。

GPT-4oによって判断されたリトリーバル性能の比較。各方法の平均関係的な類似性スコアを示しています。従来の類似性メトリックであるLPIPS、DINO、CLIP-Iは、調整されていても低スコアでした。キャプションベースのベースラインであるQwen-TとCLIP-Tも低性能でした。最高スコアは、relsim(6.77、右端の青い列)によって達成され、グループベースの関係的なパターンにファインチューンすることで、GPT-4oの評価との整合性が向上したことを示しています。

著者は次のように述べています:

「LPIPSは、純粋に感覚的な類似性に焦点を当てているため、最も低いスコア(4.56)を達成します。DINOは、自己教師ありで画像データのみを使用してトレーニングされているため、わずかに良いスコア(5.14)を達成します。CLIP-Iは、ベースラインの中で最も強い結果(5.91)を達成します。画像のキャプションに抽象化が時々含まれているためです。」

「しかし、CLIP-Iはまだ私たちの方法に劣っています。より良いスコアを達成するには、匿名キャプションにあるようなより高い抽象化が必要である可能性があります。」

ユースケース

この論文では、関係性の類似性のいくつかの潜在的なユースケースも探索されています。関係性の画像検索を可能にする関係性の画像検索が含まれます。

関係性の検索では、クエリ画像と同じ根本的な構造を共有する画像が返されます。たとえば、顔のように見える食事は、他の擬人化された食事を返し、切断された物体は他の切断された形状を返し、親子間のやり取りのシーンは、種や構成が異なっていても、同じ関係的な役割を持つ画像を返します。

関係性の検索では、クエリ画像と同じ根本的な構造を共有する画像が返されます。たとえば、顔のように見える食事は、他の擬人化された食事を返し、切断された物体は他の切断された形状を返し、親子間のやり取りのシーンは、種や構成が異なっていても、同じ関係的な役割を持つ画像を返します。

別の可能性は、アナロジー画像生成です。これにより、関係的な構造を使用してクエリを合成することができます。

入力画像と関係的なプロンプトが与えられたとき、モデルは同じ根本的な概念を表す新しい画像を生成する必要がありました。独自のモデルは、構造的な論理を大きな形式の変化を超えて保存する、より忠実なアナロジーを生成しました。一方、オープンソースのモデルは、より具体的またはスタイリスティックな一致に戻り、より深いアイデアを伝えることに失敗しました。

入力画像と関係的なプロンプトが与えられたとき、モデルは同じ根本的な概念を表す新しい画像を生成する必要がありました。独自のモデルは、構造的な論理を大きな形式の変化を超えて保存する、より忠実なアナロジーを生成しました。一方、オープンソースのモデルは、より具体的またはスタイリスティックな一致に戻り、より深いアイデアを伝えることに失敗しました。

結論

生成的なAIシステムは、抽象的な表現を概念化に組み込む能力を持つことで、著しく強化されるようです。現在、概念ベースの画像、たとえば「怒り」や「幸せ」などの画像を要求すると、最も人気のある画像やデータセットに含まれる画像が返されます。これは、抽象化ではなく、記憶化です。

この原則は、生成的な書き込み、特に分析的な、推測的な、または小説的な出力に適用される場合に、さらに有益である可能性があります。

再生するにはクリックしてください。 出典

 

 

* A100には、40Gbまたは80GBのVRAMが搭載できますが、論文では指定されていません。

** 著者の引用は冗長で除外されています。

2025年12月16日初めて公開されました。

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]