Andersonの視点
ジグソーパズルはAIの視覚的推論を高める

新しい研究によると、ジグソーパズルを解くことで、AIモデルは視覚的な推論能力を高めることができる。画像、ビデオ、3Dシーンを再配置することで、モデルは視覚的なスキルを磨き、追加のデータ、ラベル、ツールが不要になる。
現在、Multimodal Large Language Models(MLLMs)を先行するために、簡単な勝利や無料のランチは存在しない。
2025年の中国のオープンソースリリースの多くは、開発コストと実行コストが低いと報告されているが、西側のリリースは問題に対してより多くのリソースを投入する傾向にある:より多くのデータ、より多くの計算リソース、より多くの電力(ただし、最近の記事のように、実際の人間のアノテーターは不要であることが多い)。
研究文献では、AIアーキテクチャの進化に対するほとんどの「無料」のアプローチは、わずかな改善しかもたらさないか、最も重要な分野で改善が見られない。
ピースを集める
中国の機関間の新しい学術的共同研究では、VLMsにジグソーパズルを解かせることで、パフォーマンスが著しく改善されることがわかった。このアプローチは、強化学習に基づいており、以前はこの分野であまり成功していなかった。

Visual Jigsawは、多様な大規模言語モデルに視覚中心のスキルを向上させる自己教師ありのポストトレーニングフレームワークです。画像、ビデオ、3Dデータのジグソーパズルタスクをトレーニングすることで、モデルは画像の微細な、空間的、構成的な認識を強化し、ビデオの時間的推論を向上させ、3Dシーンの幾何学的認識を高めることができます。画像上のレーダーチャートは、ベースのQwen2.5-VLに対する一貫した改善を示しています。 ソース:https://arxiv.org/pdf/2509.25190
研究者によって開発されたシステムは、Visual Jigsawと呼ばれ、画像、ビデオ、3Dデータを断片化してランダムに配置し、モデルにオリジナルのレイアウトを予測させるという3つのモダリティで構成される。
[caption id="attachment_223796" align="alignnone" width="934"]
Visual Jigsawのトレーニング方法は、モデルが画像、ビデオ、3Dデータの断片を再配置することで、視覚的な情報を理解する能力を高める。
このプロセスは、画像ではなく言葉に基づいており、モデルが画像やビデオを生成する必要がない。強化学習から検証可能な報酬(RLVR)というシステムに基づいており、モデルは正しい答えに基づいて報酬を得る。したがって、人間のラベル付けは不要である。
この重要な事実は、実際には新しい論文から明らかではないが、システムは意味的に、説明を通じて、人間がパズルを解く方法とは異なり、パズルを組み立てている。

新しい論文の補足資料から、テキストベースの学習プロセスを示すRLタスクの例。画像に表示されるべき画像はここには示されていません。
MLLMsは視覚的なタスクに広く取り組むが、言語ベースのアーキテクチャであり、画像、ビデオ、3Dメッシュの生成には設計されていない。

画像ジグソーパズルの例。各行はシャッフルされたパッチを示し、モデルはオリジナルのレイアウトを予測する必要がある。正しい配置は右側に示されている。
この種のトレーニングは、モデルが 이미지를理解する能力をある程度持っている後に実行される。
2017年のスイスの論文Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzlesでは、強化学習アプローチが、Convolutional Neural Networks(CNNs)であまり成功していなかった。

2017年の論文「Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles」から、ニューラルシステムに課せられる報酬ベースの課題の初期の例。 ソース:https://arxiv.org/pdf/1603.09246
テストでは、Visual Jigsawは、ベンチマークの広い範囲で一貫した改善をもたらした:画像ジグソーパズルタスクは、微細な認識、空間的レイアウトの理解、構成的な推論を向上させた。ビデオジグソーパズルタスクは、時間的シーケンスの追跡とイベントの順序に関する推論を強化した。3Dジグソーパズルタスクは、深度ベースの理解と空間的推論を強化した。
新しい論文は、Visual Jigsaw Post-Training Improves MLLMsと題され、南陽理工大学、リンショーピング大学、SenseTime Researchの6人の研究者によって執筆された。この論文は、プロジェクトサイトとともに公開され、ライブデモ(および画像ベースのジグソーパズルデモに独自の画像をロードする機能)が提供されている。プロジェクトのコードと重みは、一般に公開されている。
方法
情報を3つのモダリティに分割する方法を見てみる前に、新しいシステムの報酬設計を考えてみましょう。
Visual Jigsawアプローチは、モデル応答を段階的な報酬で評価し、単純なパスまたは失敗ではありません。如果モデルがジグソーパズルの正しい順序を予測すると、完全な報酬が得られます。如果答えがほとんど正しいが完全ではない場合、モデルは割引係数によってスケールされた部分的なクレジットを得ます(これにより、モデルが部分的に正しい推測を繰り返してシステムを操作することを防ぎます)。
無効な答え、たとえば同じ数字を繰り返して「チート」することは、スコア0を与えられます。整合性のあるフォーマットを促進するために、モデルは推論を<think>タグ内に、最終的な答えを<answer>タグ内に配置する必要があります。如果このフォーマットが正しく使用されている場合、モデルは小さなボーナスを獲得します。
画像
画像モダリティのパズルを作成するには、画像を等しいサイズのブロックに分割することから始めます。

システムが解く画像ベースのパッチの例。
パッチは、ページの読み取り順序と同様に、左上から右下に固定の順序で配置され、ランダムにシャッフルされます。モデルはこのシャッフルされたパッチのセットにさらされ、オリジナルの順序を予測することで、正しい順序を復元する必要があります。
トレーニングでは、COCOデータセットの118,000枚の画像が使用され、各画像は9つのパッチ(「パズルのピース」)を生成しました。システムに提示されるプロンプトは、この記事の先頭に示されています(「新しい論文の補足資料からの…」というキャプションの画像)。
ビデオ
ビデオジグソーパズルタスクでは、ビデオを時間的に均等にクリップに分割し、クリップをシャッフルします。モデルはこのシャッフルされたシーケンスにさらされ、オリジナルの時間的順序を復元する必要があります。

ビデオパズルの課題の例(論文の補足資料より)。
このモダリティのトレーニングでは、LLaVA-Videoデータセットの100,000ビデオが使用され、各ビデオは6つのクリップに分割されました。クリップ境界での明らかなフレームマッチングのヒントをモデルが利用できないように、各クリップの開始と終了の5%のフレームがトリミングされました。
クリップには最大12フレームが含まれ、各フレームの最大解像度は128x28x28ピクセルでした。24秒未満のビデオは除外されました。
このタスクのプロンプトは以下のとおりです。

ビデオタスクのRLプロンプト。MLLMに提示されるクリップはここには示されていません。
3Dデータ
3Dジグソーパズルの完全なタスクでは、3D空間(ボクセルブロックまたは点群断片など)を小さなチャンクに分割し、モデルにオリジナルの空間レイアウトを再構築するようにトレーニングする必要があります。
しかし、平均的なMLLMは生の3Dデータを直接処理することができず、代わりに画像やビデオの意味的な解釈に頼っているため、現在のMLLMと互換性のあるタスクを作成するために、RGB-D画像(各ピクセルに深度情報を含む2D画像)を使用することによって、3D推論を維持しながらより扱いやすいバリアントが導入されました。

3D空間理解ベンチマークを使用した評価の例。3Dジグソーパズルモデルは、シーンの空間関係とカメラの回転方向を正しく推測し、Qwen2.5-VL-7Bベースラインを上回ります。
各RGB-D画像から、モデルは深度の順序を予測するために、元々異なる深度を持っていた点のシャッフルされたリストが与えられます。

3DジグソーパズルのRLプロンプト。
各点は画像にマークされ(上の画像のプロンプト例に示されていない)、モデルは最も近い点、2番目に近い点などを予測することで、元の深度シーケンスを再構築する必要があります。
3Dジグソーパズルタスクは、ScanNetデータセットのRGB-D画像から300,000サンプルを使用してトレーニングされ、各画像から6つの深度点をランダムに選択しました。

3Dジグソーパズルで使用されるScanNetデータセットの点群の例。 ソース:https://arxiv.org/pdf/1702.04405
各点は、0.1から10メートルの深度範囲内にあり、多様性を促進するために、セット内の2点間の距離は画像平面上で40ピクセル、深度上で0.2メートル以上離れる必要がありました。
テスト
初期テストでは、Qwen2.5-VL-7B-Instructをベースの多様な大規模言語モデルとして使用しました。トレーニングには、GRPOアルゴリズムを使用し、KL正則化とエントロピー損失を除去しました。
部分的な予測では、0.2の割引係数が適用されました。画像ジグソーパズルのトレーニングでは、バッチサイズは256で、ビデオと3Dジグソーパズルでは128でした。学習率は1×10⁻⁶に設定されました。
各プロンプトに対して、モデルは16の応答を生成し、デコーディング温度は1.0に設定されました。画像とビデオのジグソーパズルタスクはそれぞれ1,000ステップでトレーニングされ、3Dジグソーパズルタスクは800ステップでトレーニングされました。
画像ジグソーパズル
画像ジグソーパズルモデルは、3つのカテゴリの視覚中心のベンチマークでテストされました:微細な認識と理解のために、MMVP、MMStarの微細な認識サブセット、MMBench、HR-Bench、V*、MME-RealWorld(Lite)、LISA-Grounding、OVD-Eval。
単眼の空間理解のために、ベンチマークはVSR、OmniSpatial、Depth Anything V2(DA-2K)でした。構成的な視覚的理解のために、WinogroundとSugerCrepe++が使用されました。
3つのベースラインがテストされ、すべてQwen2.5-VL-7Bから派生したものでした:ThinkLite-VLは多様な推論のために、VL-Cogitoは一般的な視覚と科学的タスクのために、LLaVA-Critic-R1は画像認識のために使用されました。
すべてのモデルは、短い答えのみを使用して評価されました。なぜなら、思考の連鎖(CoT)推論は、時々パフォーマンスを低下させることがあったからです。

画像ベンチマークの評価結果。画像ジグソーパズルは、すべてのタスクカテゴリ(微細な認識と理解、単眼の空間理解、構成的な視覚的推論)でQwen2.5-VL-7Bベースモデルを上回り、以前にポストトレーニングされたベースラインを上回りました。
画像ジグソーパズルの結果について、著者は次のように述べています。
「上の画像は、我々の方法が3つのタイプのベンチマークで視覚中心の能力を一貫して改善することを示しています。これらの結果は、画像ジグソーパズルのポストトレーニングがMLLMの知覚的根拠付けと微細な視覚理解を大きく向上させることを確認しています。」
「我々は、これらの改善が、モデルがローカルパッチの詳細に注目し、グローバルな空間レイアウトを推測し、パッチ間の関係について推論することを必要とする画像ジグソーパズルを解くことによるものであると考えています。」
ビデオジグソーパズル
ビデオジグソーパズルでは、AoTBench、Vinoground、TOMATO、FAVOR-Bench、TUNA-Bench、Video-MME、TempCompass、TVBench、MotionBench、LVBench、VSI-Bench、Video-TT、CVBenchで評価されました。
Video-R1は、コールドスタートの教師ありファインチューニングとビデオ理解および推論の強化学習を使用してトレーニングされたベースラインとして使用されました。この場合、評価には完全な推論プロセスが含まれていました。なぜなら、それが直接的な答えよりも一貫して良い結果をもたらしたからです。
すべてのモデルは256x28x28ピクセルに制限され、16、32、64の3つのフレーム設定でテストされました。

ビデオベンチマークの評価結果。ビデオジグソーパズルは、すべてのタスクとフレーム設定で一貫してベースラインを上回りました。
ビデオジグソーパズルは、すべてのビデオ理解ベンチマークとフレーム設定で一貫した改善をもたらし、特に時間的推論と方向性が必要なタスク(AoTBenchなど)やビデオ間の推論が必要なタスク(CVBenchなど)で顕著でした。
「これらの結果は、ビデオジグソーパズルタスクを解くことで、モデルが時間的連続性をよりよく捉え、ビデオ間の関係を理解し、方向性の連続性について推論し、全体的なビデオ理解シナリオに一般化する能力が向上することを確認しています。」
3Dデータ
3Dモダリティでは、モデルはSAT-Real、3DSRBench、ViewSpatial、All-Angles、先ほど述べたOmniSpatial、VSI-Bench、SPARBench(tiny)、および先ほど述べたDA-2Kで評価されました。

3Dベンチマークの評価結果:3Dジグソーパズルは、DA-2Kなどの深度比較タスクと、単眼、多眼、エゴセントリックビデオ入力の3D認識ベンチマークで一貫した改善を示しました。
ここで、著者は次のように述べています。
「[3D]ジグソーパズルは、すべてのベンチマークで著しい改善を示しています。当然ながら、深度推定ベンチマークであるDA-2Kで最も大きな改善が見られます。さらに重要なのは、単眼(3DSRBench、OmniSpatialなど)、多眼(ViewSpatial、All-Anglesなど)、エゴセントリックビデオ入力(VSI-Benchなど)を含む、より広範なタスクでも一貫した改善が見られることです。」
「これらの結果は、我々のアプローチが深度の順序付けという特定のスキルを教えるだけでなく、モデルの3D空間構造の一般的な認識と推論能力を強化することを示しています。」
結論
この論文から明らかではないのは、画像と説明の関係が、MLLMのパフォーマンスの改善をどのように促しているかという点です。
一見すると、パズルを解くことで学習するプロセスは、私たちが発達する初期の段階と非常に似ているようです。しかし、論文を詳しく見ると、言語がMLLMにとって視覚的および意味的な現実の間の橋渡しとしてどのように機能しているかが明らかになります。
* 著者は、Multimodal Large Language Modelsの用語を好み、MLLMsと略します。この用語は、まだ一般的ではないものの、空間的に画像を広範に分析および推論できるが、画像を生成しないモデルに適用されます。新しいパラダイムやモデルが登場するにつれて、この用語は不断に改訂されています。
初版は2025年10月2日に公開されました。












