Andersonův úhel

Jigsaw Puzzles Zlepšují Vizuální Rozumění AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

Nový výzkum ukazuje, že modely AI mohou být chytřejší při vnímání díky řešení jigsaw puzzle. Přeskládání rozložených obrazů, videí a 3D scén jim pomáhá zlepšit jejich vizuální dovednosti bez potřeby dalších dat, značek nebo nástrojů.

 

V současné době, kdy se Multimodální Velké Jazykové Modely (MLLMs*) snaží být lepší než ostatní, nejsou žádné snadné výhry a žádné bezplatné obědy.

Přestože mnoho z čínských open-source verzí z roku 2025 má nižší vývojové a provozní náklady, západní verze se obvykle snaží vyřešit problém přidáním více dat, více výpočetního výkonu, více elektřiny (i když, jak jsme nedávno poznamenali, ne více skutečných lidských anotátorů, protože to je příliš drahé i pro $trillion+ škálou gen-AI revoluci).

Ve výzkumné literatuře, většina údajně “bezplatných” přístupů k vývoji architektur AI nabízí pouze malé zlepšení; nebo zlepšení v oblastech, které nejsou nejvíce sledovány. Přesto, hledání dosud neobjevených “základních principů”, které by mohly urychlit tempo vývoje, je příliš lákavé, aby se vzdalo.

Sběr kusů

Zatímco to není přesně v té kategorii, nová akademická spolupráce mezi čínskými institucemi tvrdí, že zjistila, že když se VLMs řeší jigsaw puzzle, jejich výkon se výrazně zlepšuje, a to i přesto, že tento reinforcement learning přístup previously neměl velký úspěch v této oblasti, a přestože nevyžaduje žádné další systémy, pomocné modely nebo jiné “přidávací” procesy:

Visual Jigsaw je samo-instruktážní post-tréninkový rámec, který zlepšuje vizuální dovednosti v multimodálních velkých jazykových modelech. Školením na jigsaw úkolech přes obrázky, videa a 3D data, modely získávají ostřejší jemné, prostorové a kompoziční vnímání v obrazech, silnější časové usuzování ve videích a vylepšené geometricky-vědomé chápání ve 3D scénách. Radarové grafy v obrázku výše ukazují konzistentní zlepšení oproti základnímu Qwen2.5-VL, s hodnotami měřítek upravenými pro každou benchmarck pro jasnost. Zdroj: https://arxiv.org/pdf/2509.25190

Visual Jigsaw je samo-instruktážní post-tréninkový rámec, který zlepšuje vizuální dovednosti v multimodálních velkých jazykových modelech. Školením na jigsaw úkolech přes obrázky, videa a 3D data, modely získávají ostřejší jemné, prostorové a kompoziční vnímání v obrazech, silnější časové usuzování ve videích a vylepšené geometricky-vědomé chápání ve 3D scénách. Radarové grafy v obrázku výše ukazují konzistentní zlepšení oproti základnímu Qwen2.5-VL, s hodnotami měřítek upravenými pro každou benchmarck pro jasnost. Zdroj: https://arxiv.org/pdf/2509.25190

Systém vytvořený výzkumníky se nazývá Visual Jigsaw a spočívá ve školení existujících MLLMů na materiálu, který byl rozložen a náhodně rozptýlen, jako jigsaw. Autoři vyvinuli tři modality pro tento přístup: obraz, video a 3D (tj. CGI-styl mřížky), a zjistili, že mírná adaptace stejného procesu prospěla všem třem doménám:

Reprezentace tří Visual Jigsaw úkolů. V Image Jigsaw je obraz rozdělen na kusy, promíchán a model předpovídá správnou dispozici; ve Video Jigsaw jsou klipy promíchány a model obnovuje jejich původní časový pořadí; v 3D Jigsaw jsou body s různými hloubkami promíchány a model řadí podle vzdálenosti od nejbližšího po nejvzdálenější. Výstupy modelu jsou hodnoceny proti skutečnému stavu, s částečným kreditem pro částečně správná řešení.

Reprezentace tří Visual Jigsaw úkolů. V Image Jigsaw je obraz rozdělen na kusy, promíchán a model předpovídá správnou dispozici; ve Video Jigsaw jsou klipy promíchány a model obnovuje jejich původní časový pořadí; v 3D Jigsaw jsou body s různými hloubkami promíchány a model řadí podle vzdálenosti od nejbližšího po nejvzdálenější. Výstupy modelu jsou hodnoceny proti skutečnému stavu, s částečným kreditem pro částečně správná řešení.

Visual Jigsawova tréninková metoda pomáhá AI modelům zlepšit porozumění vizuální informace tím, že je nutí znovu sestavit tyto rozložené obrázky, video klipy nebo 3D data.

Proces je založen na slovech, nikoli na obrazech, a proto není potřeba, aby model generoval obrázky nebo používal jakékoli další vizuální komponenty. Tato metoda se nazývá Reinforcement Learning from Verifiable Rewards (RLVR), kde model dostává odměnu za správné odpovědi na základě jasných, automatických pravidel; a kde, tudíž, není potřeba žádná lidská anotace.

Tato důležitá skutečnost je vlastně těžké vyčíst z nové práce: že systém sestavuje puzzle semanticky, prostřednictvím popisů, a ne způsobem, jakým lidé učí se řešit takové puzzle:

Z nové práce, příklad RL úkolu ilustrující textový charakter tohoto doplňkového učení.

Z nové práce, příklad RL úkolu ilustrující textový charakter tohoto doplňkového učení. Obrázky, které by byly ukázány MLLM, nejsou zde znázorněny.

Přestože MLLMů se zabývají rozsáhlými vizuálními úkoly, jsou jazykově-založené architektury, nikoli navržené pro generování obrázků, videí nebo tvarových reprezentací, jako jsou 3D mřížky.

Příklady z image jigsaw úkolu. Každý řádek ukazuje promíchané kusy, které model musí seřadit do původní dispozice, s správnou dispozicí ukázána vpravo.

Příklady z image jigsaw úkolu. Každý řádek ukazuje promíchané kusy, které model musí seřadit do původní dispozice, s správnou dispozicí ukázána vpravo.

V každém případě, tento typ tréninku se provádí po hlavní fázi učení, kdy model již má nějakou schopnost porozumět obrázkům.

Předchozí přístupy, jako například švýcarská práce Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles z roku 2017, používaly tento typ posílení s méně úspěchem, na konvolučních neuronových sítích (CNN), což je značně odlišná architektura ve srovnání s moderním MLLM.

Z roku 2017, raný příklad použití fragmentace jako odměny-založeného výzvy pro neuronový systém. Zdroj: https://arxiv.org/pdf/1603.09246

Z roku 2017, raný příklad použití fragmentace jako odměny-založeného výzvy pro neuronový systém. Zdroj: https://arxiv.org/pdf/1603.09246

V testech, Visual Jigsaw vedl k tomu, co autoři tvrdí, že jsou konzistentní a měřitelná zlepšení napříč širokým spektrem benchmarcků: image jigsaw úkol zlepšil jemné vnímání, prostorové uspořádání a kompoziční usuzování; video jigsaw úkol vylepšil modelovu schopnost sledovat časové sekvence a usuzovat o pořadí událostí; a 3D jigsaw úkol posílil hloubkově-založené usuzování a prostorové usuzování pomocí pouze RGB-D vstupů.

Celkem, napříč všemi třemi modality, práce opakuje, že nová metoda překonala několik konkurenčních benchmarcků, přestože nevyžadovala žádné architektonické změny, další vizuální moduly nebo další supervizní data:

‘Rozsáhlé experimenty prokázaly podstatná zlepšení jemného vnímání, časového usuzování a 3D prostorového chápání. Naše výsledky zdůrazňují potenciál samo-instruktážních vizuálních úkolů v post-tréninku MLLMů a mají za cíl inspirovat další výzkum vizuálních pretextů.’

Nová práce se nazývá Visual Jigsaw Post-Training Improves MLLMs a pochází od šesti výzkumníků z Nanyang Technological University, Linköping University a SenseTime Research. Práce je doprovázena projektovou stránkou s živými demonstracemi (a můžete dokonce nahrát vlastní obrázek do image-založené jigsaw demonstrace). Kód a váhy pro projekt byly veřejně zpřístupněny,

Metoda

Přestože se podíváme na to, jak je informace rozdělena pro přizpůsobení tří testovaných modalit, měli bychom nejdříve zvážit odměnový design pro nový systém.

Visual Jigsaw přístup ohodnocuje modelové odpovědi pomocí stupňovitých odměn, nikoli pouze jednoduchého pass nebo fail. Pokud model předpovídá přesně správný pořadí jigsaw kusů, dostává plnou odměnu; pokud odpověď je většinou správná, ale ne dokonalá, model dostává částečný kredit, škálován slevovým faktorem pro zabránění nadhodnocení near-miss (to brání modelu v tom, aby hrál systém opakujícími se odhady, které jsou pouze částečně správné).

Neplatné odpovědi, jako například “podvod” použití stejného čísla opakovaně, dostávají skóre nula. Pro podporu konzistentního formátování, model musí umístit své usuzování uvnitř <think> značek a své konečné odpovědi uvnitř <answer> značek. Dostává malou bonus, pokud je tento formát použit správně.

Obrázky

Pro vytvoření puzzle pro obrázky modality, je obraz nejprve rozdělen na mřížku kusů rozřezáním na stejné velikosti bloky:

Příklady image-založených kusů pro systém k řešení.

Příklady image-založených kusů pro systém k řešení.

Kusy jsou rozloženy v pevném pořadí zleva doprava, stejně jako čtení pořadí na stránce, předtím, než jsou promíchány náhodnýmuffle. Model je pak vystaven tomuto promíchanému sadě kusů a musí zjistit původní pořadí předpovězením správné permutace, která obnoví původní dispozici.

Během tréninku, 118 000 obrázků z COCO datasetu bylo použito, s každým obrázkem poskytujícím devět kusů (tj. “puzzle kusy”). Prompt daný systému je uveden výše v tomto článku (obrázek s popiskem začínajícím ‘Z nové práce’).

Video

Pro video jigsaw úkol, je video rozřezáno na sekvenci klipů rozřezáním rovnoměrně přes čas, a poté promícháním klipů. Model je pak ukázán tomuto promíchanému sekvenci, a musí zjistit jejich správný, původní chronologický pořadí.

Zkrácené příklady video puzzle výzvy, z paperové přílohy.

Zkrácené příklady video puzzle výzvy, z paperové přílohy.

Trénink pro tuto modalitu použil 100 000 videí z LLaVA-Video datasetu, s každým videem rozděleným na šest klipů. Pro zabránění modelu v tom, aby využíval zřejmé frame-matching signály na klip hranicích, 5% rámců na začátku a konci každého klipu bylo odstraněno.

Klipy neobsahovaly více než 12 rámců, každý s maximální rozlišením 128x28x28 pixelů. Videí kratších než 24 sekund byla vyloučena.

Prompt pro tuto úlohu je uveden níže:

Posílení učení prompt prezentovaný MLLMům pro video úkol, bez klipů, které by byly prezentovány MLLM.

Posílení učení prompt prezentovaný MLLMům pro video úkol, bez klipů, které by byly prezentovány MLLM.

3D Data

Plný 3D jigsaw úkol by obvykle zahrnoval rozdělení 3D prostoru (jako voxel bloky nebo point cloud fragmenty) na menší kusy a trénink modelu k rekonstrukci jejich původní prostorové dispozice.

Avšak, průměrný MLLM není vybaven pro zpracování surových 3D dat přímo, místo toho spoléhá na semanticky interpretované image nebo video vstupy. Proto, aby byl vytvořen úkol, který stále využívá 3D usuzování, zatímco zůstává kompatibilní se současnými MLLM, autoři představili více zpracovatelnou variantu pomocí výše zmíněných RGB-D obrázků (tj. 2D obrázků, které zahrnují hloubkovou informaci pro každý pixel).

Příklady otázek z 3D Spatial Understanding Benchmarku používaného pro hodnocení výkonu relativního pohledu a kamery pohybu usuzování. 3D Jigsaw model správně odhaduje obě prostorové relace mezi dvěma pohledy scény a pravděpodobný směr kamery rotace, překonávající Qwen2.5-VL-7B benchmarck.

Příklady otázek z 3D Spatial Understanding Benchmarku používaného pro hodnocení výkonu relativního pohledu a kamery pohybu usuzování. 3D Jigsaw model správně odhaduje obě prostorové relace mezi dvěma pohledy scény a pravděpodobný směr kamery rotace, překonávající Qwen2.5-VL-7B benchmarck.

Z každého RGB-D obrázku, model dostává promíchaný seznam bodů, které původně měly rozdílné hloubky, sahající od nejbližšího po nejvzdálenější, cílem je obnovit jejich správnou hloubkově-založenou pořadí pomocí pouze 2D obrázku jako referenci:

RL prompt pro 3D jigsaw.

RL prompt pro 3D jigsaw.

Každý bod je označen na obrázku (který je ukázán modelu, ale není vizualizován v promptu příkladu přímo výše), a model musí předpovědět, který byl nejbližší, druhý nejbližší a tak dále, efektivní obnovující původní hloubkovou sekvenci bez přístupu k surovým hloubkovým hodnotám.

3D jigsaw úkol je trénován na RGB-D obrázcích z ScanNet datasetu, používající 300 000 vzorků vytvořených výběrem náhodných sad šesti hloubkových bodů na obrázek.

Příklady point cloudů z ScanNet datasetu používaného v 3D jigsaw. Zdroj: https://arxiv.org/pdf/1702.04405

Příklady point cloudů z ScanNet datasetu používaného v 3D jigsaw. Zdroj: https://arxiv.org/pdf/1702.04405

Každý bod musel ležet v hloubkovém rozmezí 0,1 až 10 metrů, a pro podporu rozmanitosti, žádná dvě body v sadě nebyly bližší než 40 pixelů v obrazové rovině, nebo méně než 0,2 metrů od sebe v hloubce.

Testy

Pro počáteční testy, systém využíval Qwen2.5-VL-7B-Instruct jako základní multimodální model. Trénink používal Group Relative Policy Optimization (GRPO) algoritmus, s oběma KL regularizací a entropií ztráty odstraněnými.

Pro částečné předpovědi, byl použit slevový faktor 0,2. Image jigsaw trénink používal globální batch velikost 256, zatímco video a 3D jigsaws používaly 128. Učení sazba byla nastavena na 1×10⁻⁶.

Pro každou prompt, model generoval 16 odpovědí při dekódování teplotě 1,0. Obě image a video jigsaw úkoly byly trénovány po 1 000 krocích, zatímco 3D jigsaw úkol byl trénován po 800 krocích.

Image Jigsaw

Image jigsaw model byl testován napříč třemi kategoriemi vizuálních benchmarcků: pro jemné vnímání a porozumění, MMVP, jemné vnímání podmnožina MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; a OVD-Eval.

Pro monokulární prostorové porozumění, benchmarcky byly VSR; OmniSpatial; a Depth Anything V2 (DA-2K). Pro kompoziční vizuální porozumění, testy využívaly Winoground a SugerCrepe++.

Tři benchmarckové modely byly testovány, všechny odvozené z Qwen2.5-VL-7B: ThinkLite-VL pro multimodální usuzování; VL-Cogito pro obecné vizuální a vědecké úkoly; a LLaVA-Critic-R1 pro image vnímání.

Všechny byly vyhodnoceny pomocí krátkých odpovědí pouze, protože řetězec myšlenek (CoT) usuzování někdy snižovalo výkon.

Hodnotící výsledky na image benchmarckách. Image Jigsaw zlepšil výkon na Qwen2.5-VL-7B základní model napříč všemi úkolovými kategoriemi (tj. jemné vnímání a porozumění; monokulární prostorové porozumění; a kompoziční vizuální usuzování), překonávající předchozí post-tréninkové benchmarckové modely.

Hodnotící výsledky na image benchmarckách. Image Jigsaw zlepšil výkon na Qwen2.5-VL-7B základní model napříč všemi úkolovými kategoriemi (tj. jemné vnímání a porozumění; monokulární prostorové porozumění; a kompoziční vizuální usuzování), překonávající předchozí post-tréninkové benchmarckové modely.

Z výsledků pro image jigsaw, uvedených výše, autoři uvádějí:

‘[Obrázek výše] ukazuje, že naše metoda konzistentně zlepšuje vizuálně-založené schopnosti na třech typech benchmarcků. Tyto výsledky potvrzují, že začlenění image jigsaw post-tréninku významně zlepšuje MLLMů vnímání a jemné vizuální porozumění nad usuzováním-založenými post-tréninkovými strategiemi.

‘Připisujeme tato zlepšení skutečnosti, že řešení image jigsaw vyžaduje, aby model se soustředil na místní kus detaily, odvodil globální prostorové uspořádání a usuzoval o mezikusových vztazích, které přímo prospívají jemnému, prostorovému a kompozičnímu porozumění.’

Video Jigsaw

Pro video jigsaw, hodnocení bylo provedeno na AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; a CVBench.

Video-R1 byl použit jako benchmarckový model, který byl trénován s cold-start supervizním jemným tréninkem následovaným posílením učení pro video porozumění a usuzování. V tomto případě, hodnocení zahrnovalo plný proces usuzování, protože to konzistentně produkovalo lepší výsledky než přímé odpovědi.

Všechny modely byly omezeny na 256x28x28 pixelů, a testovány napříč třemi frame nastaveními – 16, 32 a 64:

Hodnotící výsledky na video benchmarckách, s Video Jigsaw překonávajícím benchmarckový model konzistentně napříč všemi úkoly a frame nastaveními.

Hodnotící výsledky na video benchmarckách, s Video Jigsaw překonávajícím benchmarckový model konzistentně napříč všemi úkoly a frame nastaveními.

Video Jigsaw produkoval konzistentní zlepšení napříč všemi video porozumění benchmarckami a frame nastaveními, s zisky obzvláště silnými na úkolech vyžadujících časové usuzování a směrovost, jako jsou ty v AoTBench, a také v cross-video usuzování benchmarckách, jako je CVBench:

‘Tyto výsledky potvrzují, že řešení video jigsaw úkolů nutí model lépe zachytit časovou kontinuitu, pochopit vztahy napříč videi, usuzovat o směrovost a generalizovat na holistické a generalizovatelné video porozumění scénáře.’

3D Data

Pro 3D modalitu, model byl hodnocen na SAT-Real; 3DSRBench; ViewSpatial; All-Angles; výše zmíněný OmniSpatial; VSI-Bench; SPARBench (tiny); a výše zmíněný DA-2K.

Hodnotící výsledky na 3D benchmarckách: 3D Jigsaw zlepšil výkon napříč hloubkovými srovnávacími úkoly, jako je DA-2K, a také na širších 3D porozumění benchmarckách pokrývajících single-view, multi-view a egocentric video vstupy.

Hodnotící výsledky na 3D benchmarckách: 3D Jigsaw zlepšil výkon napříč hloubkovými srovnávacími úkoly, jako je DA-2K, a také na širších 3D porozumění benchmarckách pokrývajících single-view, multi-view a egocentric video vstupy.

Zde autoři uvádějí:

‘[3D] Jigsaw dosahuje významných zlepšení napříč všemi benchmarckami. Nečekaně, největší zisk je na DA-2K, hloubkové odhadovací benchmarck, který je přímo spojen s naším hloubkově-řazením pre-tréninkovým úkolem. Více důležité, pozorujeme konzistentní zlepšení na širokém spektru dalších úkolů, včetně těch s single-view (např. 3DSRBench, [OmniSpatial]), multi-view (např. ViewSpatial, All-Angles), a egocentric video vstupy (např. VSI-Bench).

‘Tyto výsledky demonstrují, že náš přístup nejen učí specifickou dovednost hloubkové řazení, ale také efektivní posiluje modelovu obecnou schopnost vnímat a usuzovat o 3D prostorové struktuře.’

Závěr

Co není zcela jasné z této práce, je přesná souvislost mezi obrázky a popisy, která pohání toto zlepšení MLLM výkonu.

Na první pohled, proces učení prostřednictvím puzzle řešení se zdá velmi analogický k našim vlastním raným pokusům a vývojem. Avšak, náš vlastní prostorový výklad světa instinktivně cítíme méně semanticky a související s jazykem, a hlubší pohled na práci odhaluje rozsah, v jakém jazyk slouží MLLM jako fascinující most mezi vizuální a semantickou realitou.

 

* Poznámka: Autoři práce preferují méně běžný termín ‘Multimodální Velké Jazykové Modely’, zkrácený na ‘MLLMs’. Tento termín se vztahuje k modelům, které mohou extenzivně usuzovat a analyzovat obrázky prostorově, ale které negenerují obrázky. Jak nové paradigmy a modely vznikají, tento lexikon je pod stálou revizí.

První publikováno ve čtvrtek, 2. října 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai