Andersonの視点
ジグソーパズルはAIの視覚的推論を高める

新しい研究によると、ジグソーパズルを解くことで、AIモデルは視覚的な推論能力を高めることができる。画像、ビデオ、3Dシーンを再配置することで、モデルは視覚的なスキルを磨き、追加のデータ、ラベル、ツールが不要になる。 現在、Multimodal Large
Language Models( MLLMs )を先行するために、簡単な勝利や無料のランチは存在しない。 2025年の中国のオープンソースリリースの多くは、 研究文献では、AIアーキテクチャの進化に対するほとんどの「無料」のアプローチは、わずかな改善しかもたらさないか、最も重要な分野で改善が見られない。 開発コストと実行コストが低い と報告されているが、西側のリリースは問題に対してより多くのリソースを投入する傾向にある:より多くのデータ、より多くの計算リソース、より多くの電力(ただし、 最近の記事 のように、実際の人間のアノテーターは不要であることが多い)。
ピースを集める
中国の機関間の新しい学術的共同研究では、VLMsにジグソーパズルを解かせることで、パフォーマンスが著しく改善されることがわかった。このアプローチは、 強化学習 に基づいており、以前はこの分野であまり成功していなかった。 Visual Jigsawは、多様な大規模言語モデルに視覚中心のスキルを向上させる自己教師ありのポストトレーニングフレームワークです。画像、ビデオ、3Dデータのジグソーパズルタスクをトレーニングすることで、モデルは画像の微細な、空間的、構成的な認識を強化し、ビデオの時間的推論を向上させ、3Dシーンの幾何学的認識を高めることができます。画像上のレーダーチャートは、ベースのQwen2.5-VLに対する一貫した改善を示しています。


MLLMsは視覚的なタスクに広く取り組むが、 のアーキテクチャであり、画像、ビデオ、3Dメッシュの生成には設計されていない。 言語ベース 画像ジグソーパズルの例。各行はシャッフルされたパッチを示し、モデルはオリジナルのレイアウトを予測する必要がある。正しい配置は右側に示されている。 この種のトレーニングは、モデルが これは、ある程度の画像認識能力を前提として行われます。 2017年のスイスの論文 では、強化学習アプローチが、Convolutional Neural Networks(CNNs)であまり成功していなかった。 Unsupervised

Representations by

Puzzles 2017年の論文「Unsupervised Learning of Visual Representations

Post-Training Improves MLLMs プロジェクトサイト
とともに公開され、ライブデモ(および画像ベースのジグソーパズルデモに独自の画像をロードする機能)が提供されている。プロジェクトのコードと 重み は、 一般に公開 されている。
方法
情報を3つのモダリティに分割する方法を見てみる前に、新しいシステムの報酬設計を考えてみましょう。 Visual Jigsawアプローチは、モデル応答を 無効な答え、たとえば同じ数字を繰り返して「チート」することは、スコア0を与えられます。整合性のあるフォーマットを促進するために、モデルは推論を で評価し、単純なパスまたは失敗ではありません。如果モデルがジグソーパズルの正しい順序を予測すると、完全な報酬が得られます。如果答えがほとんど正しいが完全ではない場合、モデルは 段階的な報酬 タグ内に、最終的な答えを によってスケールされた部分的なクレジットを得ます(これにより、モデルが部分的に正しい推測を繰り返してシステムを操作することを防ぎます)。 割引係数 <think> タグ内に配置する必要があります。如果このフォーマットが正しく使用されている場合、モデルは小さなボーナスを獲得します。 <answer>
画像
画像モダリティのパズ ステム ルを作成するには、画像を等しいサイズのブロックに分割することから始めます。 シ

ージの読み取り順序と同様に、左上から右下に固定の順序で配置され、ランダムにシャッフルされます。モデルはこのシャッフルされたパッチのセットにさらされ、オリジナルの順序を予測することで、正しい順序を復元する必要があります。 トレーニングでは、COCOデータセットの118,000枚の画像が使用され 、各画像 は9つのパッチ(「パズルのピース」)を生成しました。システムに提示されるプロンプトは、この記事の先頭に示されています(「新しい論文の補足資料から …」というキャプションの画像)。の
ビデオ
ビデオジグソーパズルタスクでは、ビデオを時間的に均等にクリップに分割し、クリップをシャッフルします。モデルはこのシャッフルされたシーケンスにさらされ、オリジナルの時間的順序を復元する必要があります。 ビデオパズルの課題の例(論文の補足資料より)。

このモダリティのトレーニングでは、LLaVA-Videoデータセットの100,000ビデオが使用され、各ビデオは6つのクリップに分割されました。クリップ境界での明らかなフレームマッチングのヒントをモデルが利用できないように、各クリップの開始と終了の5%のフレームがトリミングされました。 クリップには最大12フレームが含まれ、各フレームの最大解像度は128x28x28ピクセルでした。24秒未満のビデオは除外されました。 このタスクのプロンプトは以下のとおりです。

3Dデータ
3Dジグソーパズルの完全なタスクでは、3D空間(ボクセルブ ロッ クまた は点群断 片など)を小さなチャンクに分割し、モデルにオリジナルの空間レイアウトを再構築するようにトレーニングする必要があります。 しかし、平均的なMLLMは生の3Dデータを直接処理することができず、代わりに画像やビデオの意味的な解釈に頼っているため、現在のMLLMと互換性のあるタスクを作成するために、RGB-D画像(各ピクセルに深度情報を含む2D画像)を使用することによって、3D推論を維持し

、モデルは深度の順序を予測するために、元々異なる深度を持っていた点のシャッフルされたリストが与えられます。 3DジグソーパズルのRLプロンプト。 各点は画像にマークされ(上の

ていない)、モデルは最も近い点、2番目に近い点などを予測することで、元の深度シーケンスを再構築する必要があります。 3Dジグソーパズルタスクは、ScanNetデータセットのRGB-D画像から300,000サンプルを使用してトレーニングされ、各画像から6つの深度点をランダムに 選択しました。 3Dジグソーパズルで使用されるScanNetデータセットの点群

テスト
初期テストでは、 Qwen2.5-VL-7 B-Instruct を ベースの多様な大規模言語モデルとして使用しました。トレーニングには、 GRPO アルゴリズムを使用し、 KL正則化 と エ ントロピー損失 を 除去 しました。 部分的な予測では、0.2の割引係数が適用されました。画像ジグソーパズルのトレーニングでは、バッチサイズは256で、ビデオと 3Dジグソ ーパズルでは128でした。学習率は1×10⁻⁶に設定さ れました。 各 プロンプトに対して、モデルは16の応答を生成し、デコーディング温度は1.0に設定されました。 画像とビデオ のジグソーパズルタスクはそれぞれ1,000ステップでトレーニングされ、3Dジグソーパズルタスクは800ステップでトレーニングされました。
画像ジグソーパズル
画像ジグソーパズルモデルは、3つのカテゴリの視覚中心のベンチマークでテストされました:微細な認識と理解のために、 MMVP 、 MMStarの微細な認識サブセット、 MMBench 、 HR-Bench、 V*、 MME-RealWorld (Lite)、 LISA-Grounding 、 OVD-Eval 。 単眼の空間理解のために、ベンチマークは VSR 、

と SugerCrepe++
が使用されました。 3つのベースラインがテストされ、すべてQwen2.5-VL-7Bから派生したものでした: ThinkLite-VL は多様な推論のために、 VL-Cogito は一般的な視覚と科学的タスクのために、 LLaVA-Critic-R1 は画像認識のために使用されました。
すべてのモデルは、短い答えのみを使用して評価されました。なぜなら、 思考の連鎖(CoT) 推論は、時々パフォーマンスを低下させることがあったからです。 画像ベンチマークの評価結果。画像ジグソーパズルは、すべてのタスクカテゴリ(微細な認識と理解、単眼の空間理解、構成的な視覚的推論)でQwen2.5-VL-7Bベースモデルを上回り、以前にポストトレーニングされたベースラインを上回りました。 画像ジグソーパズルの結果について、著者は次のように述べています。 「上の画像は、我々の方法が3つのタイプのベンチマークで視覚中心の能力を一貫して改善することを示しています。これらの結果は、画像ジグソーパズルのポストトレーニングがMLLMの知覚的根拠付けと微細な視覚理解を大きく向上させることを確認しています。」 「我々は、これらの改善が、モデルがローカルパッチの詳細に注目し、グローバルな空間レイアウトを推測し、パッチ間の関係について推論することを必要とする画像ジグソーパズルを解くことによるものであると考えています。」
ビデオジグソーパズル
ビデオジグソーパズルでは、 AoTBench 、 Vin ogroun d 、 TOMATO 、 FA VOR-Be nch 、 TUNA -Bench 、 Vi deo-M ME 、 Te mpCo
mpas s 、 TVBench 、 MotionBench 、 LVB ench 、 VSI- Bench 、 Video-TT 、 CVBench で評価されました。 Video-R1 は、コールドスタートの教師ありファインチューニングとビデオ理解および推論の強化学習を使用してトレーニングされたベースラインとして使用されました。この場合、評価には完全な推論プロセスが含まれていました。なぜなら、それが直接的な答えよりも一貫

した。 ビデオベンチマークの評価結果。ビデオジグソーパズルは、すべてのタスクとフレーム設定で一貫してベースラインを上回りました。 ビデオジグソーパズルは、すべてのビデオ理解ベンチマークとフレーム設定で一貫した改善をもたらし、特に時間的推論と方向性が必要なタスク(AoTBenchなど)やビデオ間の
推論が必要なタスク(CVBenchなど)で顕著でした。 「これらの結果は、ビデオジグソーパズルタスクを解くことで、モデルが時間的連続性をよりよく捉え、ビデオ間の関係を理解し、方向性の連続性について推論し、全体的なビデオ理解シナリオに一般化する能力が向上することを確認しています。」
3Dデータ

、
All-Angles 、先ほど述べたOmniSpatial、 VSI-Bench 、 SPARBench (tiny)、および先ほど述べたDA-2Kで評価されました。 3Dベンチマークの評価結果:3Dジグソーパズルは、DA-2Kなどの深度比較タスクと、単眼、多眼、エゴセントリックビデオ入力の3D認識ベンチマークで一貫した改善を示しました。
ここで、著者は次のように述べています。 「(3D)ジグソーパズルは、すべてのベンチマークで著しい改善を示しています。当然ながら、深度推定ベンチマークであるDA-2Kで最も大きな改善が見られます。さらに重要なのは、単眼(3DSRBench、OmniSpatialなど)、多眼(ViewSpatial、All-Anglesなど)、エゴセントリックビデオ入力(VSI-Benchなど)を含む、より広範なタスクでも一貫した改善が見られることです。」 「これらの結果は、我々のアプローチが深度の順序付けという特定のスキルを教えるだけでなく、モデルの3D空間構造の一般的な認識と推論能力を強化することを示しています。」
結論
この論文から明らかではないのは、画像と説明の関係が、MLLMのパフォーマンスの改善をどのように促しているかという点です。 一見すると、パズルを解くことで学習するプロセスは、私たちが発達する初期の段階と非常に似ているようです。しかし、論文を詳しく見ると、言語がMLLMにとって視覚的および意味的な現実の間の橋渡しとしてどのように機能しているかが明らかになります。 * 著者は、Multimodal Large Language Modelsの用語を好み、MLLMsと略します。この用語は、まだ一般的ではないものの、 空間的に画像を広範に分析および推論できる が、画像を生成しないモデルに適用されます。新しいパラダイムやモデルが登場するにつれて、この用語は不断に改訂されています。 初版は2025年10月2日に公開されました。












