Unghiul lui Anderson
Puzzles de Jigsaw Îmbunătățesc Raționamentul Vizual al Inteligenței Artificiale

Cercetările recente arată că modelele de inteligență artificială pot deveni mai inteligente în ceea ce privește vederea, rezolvând puzzle-uri de jigsaw. Reorganizarea imaginilor, videourilor și scenelor 3D îi ajută să-și ascuțe abilitățile vizuale fără a necesita date suplimentare, etichete sau instrumente.
În actuala goană de a împinge Modelele Mari de Limbaj Multimodal (MLLM) înainte, există puține victorii ușoare și niciun prânz gratuit.
Deși multe dintre lansările chinezești de software gratuit din 2025 au costuri de dezvoltare și funcționare mai mici, lansările occidentale tind să arunce mai mult în problema: mai mult volum de date, mai multă putere de inferență, mai multă electricitate (deși, așa cum am remarcat recent, nu mai mulți annotatori umani reali, deoarece acest lucru este prea scump chiar și pentru revoluția gen-AI cu o scară de trilioane de dolari).
În literatura de specialitate, majoritatea abordărilor presupus “gratuite” pentru evoluția arhitecturilor de inteligență artificială oferă doar îmbunătățiri incrementale minore; sau îmbunătățiri în domenii care nu sunt cele mai critic urmărite. Cu toate acestea, căutarea unor “principii fundamentale” nedescoperite care ar putea accelera ritmul dezvoltării este prea tentantă pentru a fi abandonată.
Ridicarea Puzzelor
În timp ce nu se află exact în această categorie, o nouă colaborare academică între instituții chineze pretinde că a determinat că făcând ca Modelele de Limbaj Multimodal (VLM) să rezolve puzzle-uri de jigsaw îmbunătățește semnificativ performanța lor, chiar dacă această abordare de învățare prin întărire a funcționat anterior cu mai puțin succes în acest domeniu și chiar dacă nu necesită sisteme suplimentare, modele auxiliare sau alte procese “atașate”:

Visual Jigsaw este un cadru de post-antrenare auto-supervizat care îmbunătățește abilitățile vizuale în modelele de limbaj multimodal. Prin antrenarea pe sarcini de jigsaw pe imagini, videouri și date 3D, modelele capătă o percepție mai ascuțită, spațială și compozițională în imagini, o raționare temporală mai puternică în videouri și o înțelegere mai bună a geometriei în scene 3D. Graficele radar din imaginea de mai sus arată câștiguri constante față de modelul de bază Qwen2.5-VL, cu scări de valori ajustate pentru fiecare benchmark pentru claritate. Sursă: https://arxiv.org/pdf/2509.25190
Sistemul conceput de cercetători se numește Visual Jigsaw și implică antrenarea modelelor de limbaj multimodal existente pe materiale care au fost fragmentate și dispersate aleatoriu, ca un puzzle de jigsaw. Autorii au dezvoltat trei modalități pentru această abordare: imagine, video și 3D (adică, rețele), și au constatat că o adaptare moderată a aceluiași proces a beneficiat toate cele trei domenii:

O reprezentare a celor trei sarcini Visual Jigsaw. În puzzle-ul de imagine, o imagine este împărțită în bucăți, amestecate și modelul prezice layout-ul corect; în puzzle-ul de video, clipurile sunt amestecate și modelul restaurează ordinea lor cronologică; în puzzle-ul 3D, punctele cu adâncimi diferite sunt amestecate și modelul le ordonează de la cel mai apropiat la cel mai îndepărtat. Ieșirile modelului sunt evaluate împotriva adevărului, cu credit parțial acordat pentru soluții parțial corecte.
Metoda de antrenare Visual Jigsaw ajută modelele de inteligență artificială să îmbunătățească înțelegerea informațiilor vizuale, făcându-le să reasambleze aceste imagini, clipuri video sau date 3D fragmentate.
Procesul se bazează pe cuvinte, nu pe imagini, și prin urmare, nu există nevoia ca modelul să genereze imagini sau să utilizeze componente vizuale suplimentare. Această metodă se încadrează într-un sistem numit Învățare prin Întărire din Recompense Verificabile (RLVR), unde modelul primește recompense pentru răspunsuri corecte bazate pe reguli clare și automate; și unde, prin urmare, nu este necesară etichetarea umană.
Acest fapt crucial este de fapt greu de înțeles din noua lucrare: că sistemul asamblează puzzle-ul semantic, prin descrieri, și nu în modul reprezentativ în care oamenii învață să rezolve astfel de puzzle-uri:

Din materialul suplimentar al noii lucrări, un exemplu de sarcină de învățare prin întărire care ilustrează natura textului acestei procesului de învățare auxiliar. Imaginile care ar fi fost prezentate modelului MLLM nu sunt afișate aici.
Deși Modelele de Limbaj Multimodal se ocupă în mod extensiv de sarcini vizuale, ele sunt arhitecturi bazate pe limbaj, nu proiectate pentru a genera imagini, videouri sau reprezentări spațiale, cum ar fi rețelele 3D.

Exemple din sarcina de puzzle de imagine. Fiecare rând arată bucăți amestecate pe care modelul trebuie să le reordoneze în layout-ul original, cu aranjamentul corect afișat în dreapta.
În orice caz, acest tip de antrenare se face după faza principală de învățare, când modelul are deja o anumită capacitate de a înțelege imagini.
Abordări anterioare, cum ar fi lucrarea elvețiană din 2017 Învățarea Nesupervizată a Reprezentărilor Vizuale prin Rezolvarea de Puzzle-uri de Jigsaw au utilizat acest tip de abordare de întărire cu mai puțin succes, pe rețele neuronale convolutive (CNN), o arhitectură notabil diferită în comparație cu un model MLLM modern.

Din lansarea din 2017 ‘Învățarea Nesupervizată a Reprezentărilor Vizuale prin Rezolvarea de Puzzle-uri de Jigsaw’, un exemplu timpuriu al utilizării fragmentării ca o provocare bazată pe recompense pentru un sistem neural. Sursă: https://arxiv.org/pdf/1603.09246
În teste, Visual Jigsaw a condus la ceea ce autorii afirmă a fi îmbunătățiri consistente și măsurabile pe o gamă largă de benchmark-uri: sarcina de puzzle de imagine a îmbunătățit percepția fină, înțelegerea layout-ului spațial și raționamentul compozițional; sarcina de puzzle de video a îmbunătățit capacitatea modelului de a urmări secvențe temporale și de a raționa despre ordinea evenimentelor; și sarcina de puzzle 3D a consolidat înțelegerea bazată pe adâncime și raționamentul spațial folosind doar intrări RGB-D.
Pe toate cele trei modalități, lucrarea reiterează, noua metodă a depășit mai multe linii de bază competitive, fără a necesita modificări arhitecturale, module vizuale suplimentare sau date suplimentare supervizate:
‘Experiențele extinse demonstrează îmbunătățiri substanțiale în percepția fină, raționamentul temporal și înțelegerea spațială 3D. Rezultatele noastre subliniază potențialul sarcinilor auto-supervizate, centrate pe viziune, în post-antrenarea modelelor MLLM și își propun să inspire cercetări suplimentare pe proiectarea pre-textului vizual.’
Noua lucrare se numește Visual Jigsaw Post-Antrenare Îmbunătățește Modelele MLLM și provine de la șase cercetători de la Universitatea Tehnică Nanyang, Universitatea Linköping și SenseTime Research. Lucrarea este însoțită de un site de proiect cu demonstrații live (și puteți încărca chiar și o imagine proprie în demo-ul de puzzle de imagine). Codul și greutățile pentru proiect au fost făcute disponibile în general,
Metodă
Deși vom examina modul în care informația este divizată pentru a se potrivi cu cele trei modalități testate, ar trebui să considerăm mai întâi proiectarea recompensei pentru noul sistem.
Abordarea Visual Jigsaw acordă răspunsurilor modelului o recompensă gradată, nu doar un simplu “trecut” sau “eșuat”. Dacă modelul prezice ordinea exactă a pieselor puzzle-ului, primește o recompensă completă; dacă răspunsul este în mare parte corect, dar nu perfect, modelul primește credit parțial, scalat printr-un factor de discount pentru a evita supraevaluarea aproape-răspunsurilor (acest lucru împiedică modelul să exploateze ghicirile care sunt doar parțial corecte).
Răspunsurile invalide, cum ar fi “înșelăciunea” de a utiliza același număr de repetare, primesc un scor de zero. Pentru a încuraja formatarea consistentă, modelul trebuie să-și plaseze raționamentul în interiorul <think> și răspunsul final în interiorul <answer>, și primește un mic bonus dacă acest format este utilizat corect.
Imagini
Pentru a crea un puzzle pentru imagini, o imagine este mai întâi divizată într-o grilă de bucăți prin tăierea ei în blocuri de dimensiuni egale:

Exemple de bucăți de imagine pentru sistemul de a rezolva.
Bucățile sunt aranjate într-o ordine fixă de la stânga sus la dreapta jos, ca și ordinea de citire a unei pagini, înainte de a fi amestecate cu un amestec aleatoriu. Modelul este apoi expus la acest set amestecat de bucăți și trebuie să descopere ordinea originală, prezicând permutarea corectă care restaurează layout-ul original.
În antrenament, 118.000 de imagini din setul de date COCO au fost utilizate, cu fiecare imagine oferind nouă bucăți (adică “piese de puzzle”). Promptul prezentat sistemului este afișat mai devreme în acest articol (imaginea de mai sus cu legendă începând cu ‘Din materialul suplimentar al noii lucrări’).
Video
Pentru sarcina de puzzle de video, un video este tăiat într-o secvență de clipuri prin tăierea lui uniform în timp, și apoi amestecate. Modelul este apoi prezentat cu această secvență amestecată și trebuie să determine ordinea lor cronologică corectă.

Exemple trunchiate ale provocării de puzzle de video, din materialul suplimentar al lucrării.
Antrenamentul pentru această modalitate a utilizat 100.000 de videouri din setul de date LLaVA-Video, cu fiecare video împărțit în șase clipuri. Pentru a preveni ca modelul să exploateze indicii evidente de potrivire a cadrelor la limitele de clip, 5% din cadrele de la începutul și sfârșitul fiecărui clip au fost tăiate.
Clipurile nu conțineau mai mult de 12 cadre, fiecare cu o rezoluție maximă de 128x28x28 pixeli. Videourile mai scurte de 24 de secunde au fost excluse.
Promptul pentru această sarcină este afișat mai jos:

Promptul de învățare prin întărire prezentat modelului MLLM pentru sarcina de video, fără clipurile care ar fi fost prezentate modelului MLLM..
Date 3D
O sarcină de puzzle 3D completă ar implica de obicei divizarea unui spațiu 3D (cum ar fi voxel sau fragment de nor de puncte) în bucăți mai mici și antrenarea unui model pentru a reconstitui layout-ul spațial original.
Cu toate acestea, modelul MLLM obișnuit nu este echipat pentru a gestiona date 3D brute direct, în schimb se bazează pe intrări de imagine sau video interpretate semantic. Prin urmare, pentru a crea o sarcină care să exploateze încă raționamentul 3D, dar să rămână compatibil cu modelele MLLM actuale, autorii au introdus o variantă mai tractabilă utilizând imaginile RGB-D (adică, imagini 2D care includ informații de adâncime pentru fiecare pixel).

Exemple de întrebări din Benchmark-ul de Înțelegere Spațială 3D utilizat pentru a evalua performanța în ceea ce privește punctul de vedere relativ și mișcarea camerei. Modelul 3D Jigsaw inferă corect atât relația spațială dintre două vederi ale unei scene, cât și direcția probabilă de rotație a camerei, depășind modelul de bază Qwen2.5-VL-7B.
De la fiecare imagine RGB-D, modelul primește o listă amestecată de puncte care aveau adâncimi distincte, variind de la aproape la departe, scopul fiind de a recupera ordinea lor corectă de adâncime utilizând doar imaginea 2D ca referință:

Promptul de învățare prin întărire pentru puzzle-ul 3D.
Fiecare punct este marcat pe imagine (care este afișată modelului, dar nu este visualizată în exemplul de prompt de mai sus), și modelul trebuie să prezică care a fost cel mai apropiat, al doilea cel mai apropiat și așa mai departe, reconstruind în esență secvența de adâncime originală fără a avea acces la valorile brute de adâncime.
Sarcina de puzzle 3D a fost antrenată pe imagini RGB-D din setul de date ScanNet, utilizând 300.000 de exemple create prin selectarea unor seturi aleatorii de șase puncte de adâncime pe imagine.

Exemple de nori de puncte din setul de date ScanNet utilizat în puzzle-ul 3D. Sursă: https://arxiv.org/pdf/1702.04405
Fiecare punct a fost necesar să se afle într-un interval de adâncime de 0,1 la 10 metri și, pentru a promova diversitatea, niciun punct dintr-un set nu a fost permis să fie mai aproape de 40 de pixeli în planul imaginii sau mai puțin de 0,2 metri departe în adâncime.
Teste
Pentru testele inițiale, sistemul a utilizat Qwen2.5-VL-7B-Instruct ca model multimodal de bază. Antrenamentul a utilizat algoritmul de Optimizare a Politicii Relative de Grup (GRPO), cu atât regularizarea KL, cât și pierderea de entropie eliminate.
Pentru predicții parțiale, un factor de discount de 0,2 a fost aplicat. Antrenamentul pentru puzzle-ul de imagine a utilizat un dimensiune de lot globală de 256, în timp ce puzzle-urile de video și 3D au utilizat 128. Rata de învățare a fost setată la 1×10⁻⁶.
Pentru fiecare prompt, modelul a generat 16 răspunsuri la o temperatură de decodare de 1,0. Atât puzzle-urile de imagine, cât și cele de video au fost antrenate pentru 1.000 de pași, în timp ce puzzle-ul 3D a fost antrenat pentru 800 de pași.
Puzzle de Imagine
Modelul de puzzle de imagine a fost testat pe trei categorii de benchmark-uri vizuale: pentru percepția fină și înțelegerea, MMVP, submulțimea de percepție fină a MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; și OVD-Eval.
Pentru înțelegerea spațială monoculară, benchmark-urile au fost VSR; OmniSpatial; și Depth Anything V2 (DA-2K). Pentru înțelegerea vizuală compozițională, testele au utilizat Winoground și SugerCrepe++.
Trei linii de bază au fost testate, toate derivate din Qwen2.5-VL-7B: ThinkLite-VL pentru raționament multimodal; VL-Cogito pentru sarcini vizuale și științifice generale; și LLaVA-Critic-R1 pentru percepția de imagine.
Toate au fost evaluate utilizând doar răspunsuri scurte, deoarece raționamentul lanțului de gândire (CoT) a redus uneori performanța.

Rezultatele evaluării pe benchmark-urile de imagine. Puzzle-ul de imagine a îmbunătățit modelul de bază Qwen2.5-VL-7B pe toate categoriile de sarcini (adică, percepția fină și înțelegerea; înțelegerea spațială monoculară; și raționamentul vizual compozițional), depășind liniile de bază post-antrenate anterioare.
Dintre rezultatele puzzle-ului de imagine, afișate mai sus, autorii afirmă:
‘[Imaginea de mai sus] arată că metoda noastră îmbunătățește constant capacitățile vizuale pe cele trei tipuri de benchmark-uri. Aceste rezultate confirmă că încorporarea puzzle-ului de imagine în post-antrenare îmbunătățește semnificativ fundația perceptivă și înțelegerea vizuală fină a modelelor MLLM, dincolo de strategiile de post-antrenare centrate pe raționament.
‘Atribuim aceste îmbunătățiri faptului că rezolvarea puzzle-ului de imagine necesită ca modelul să se concentreze pe detalii locale de patch, să inferă layout-uri spațiale globale și să raționeze despre relații inter-patch, ceea ce beneficiază direct de înțelegerea fină, spațială și compozițională.’
Puzzle de Video
Pentru puzzle-ul de video, evaluarea a fost efectuată pe AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; și CVBench.
Video-R1 a fost utilizat ca linie de bază, care a fost antrenat cu fine-tuning supervizat “rece” urmat de învățare prin întărire pentru înțelegerea și raționamentul video. În acest caz, evaluările au inclus procesul complet de raționament, deoarece acesta a produs în mod constant rezultate mai bune decât răspunsurile directe.
Toate modelele au fost limitate la 256x28x28 pixeli și testate pe trei setări de cadre – 16, 32 și 64:

Rezultatele evaluării pe benchmark-urile de video, cu puzzle-ul de video depășind liniile de bază în mod constant pe toate sarcinile și setările de cadre.
Puzzle-ul de video a produs îmbunătățiri constante pe toate benchmark-urile de înțelegere a videourilor și setările de cadre, cu câștiguri deosebit de puternice pe sarcini care necesită raționament temporal și direcționalitate, cum ar fi cele din AoTBench, și de asemenea în benchmark-urile de raționament cross-video, cum ar fi CVBench:
‘Aceste rezultate confirmă că rezolvarea puzzle-ului de video încurajează modelul să capteze mai bine continuitatea temporală, să înțeleagă relațiile dintre videouri, să raționeze despre consistența direcțională și să generalizeze la scenarii de înțelegere a videourilor holistice și generalizabile.’
Date 3D
Pentru modalitatea 3D, modelul a fost evaluat pe SAT-Real; 3DSRBench; ViewSpatial; All-Angles; benchmark-ul menționat anterior OmniSpatial; VSI-Bench; SPARBench (mic); și benchmark-ul menționat anterior DA-2K.

Rezultatele evaluării pe benchmark-urile 3D: puzzle-ul 3D a îmbunătățit performanța pe sarcinile de comparare a adâncimii, cum ar fi DA-2K, precum și pe benchmark-urile mai largi de percepție 3D care acoperă intrări de vedere unică, multi-vedere și video egocentric.
Aici, autorii afirmă:
‘Puzzle-ul 3D obține îmbunătățiri semnificative pe toate benchmark-urile. Nu este de mirare că cel mai mare câștig este pe DA-2K, un benchmark de estimare a adâncimii care este direct legat de sarcina noastră de ordonare a adâncimii. Mai important, observăm îmbunătățiri constante pe o gamă largă de alte sarcini, inclusiv cele cu intrări de vedere unică (de exemplu, 3DSRBench, [OmniSpatial]), multi-vedere (de exemplu, ViewSpatial, All-Angles) și video egocentric (de exemplu, VSI-Bench).
‘Aceste rezultate demonstrează că abordarea noastră nu numai că învață abilitatea specifică a ordonării adâncimii, dar îmbunătățește și capacitatea generală a modelului de a percepe și raționa despre structura spațială 3D.’
Concluzie
Ce nu este pe deplin clar din această lucrare este relația exactă dintre imagini și descrieri care alimentează această îmbunătățire a performanței modelelor MLLM.
La prima vedere, procesul de învățare prin puzzle-uri pare foarte analog cu propriile noastre încercări și dezvoltare timpurie. Cu toate acestea, o privire mai atentă asupra lucrării revelează măsura în care limbajul servește ca o punte fascinantă între realitățile vizuale și semantice pentru modelele MLLM.
* Vă rugăm să rețineți că autorii lucrării preferă termenul mai puțin obișnuit ‘Modele de Limbaj Multimodal Mari’, prescurtat ‘MLLM’. Acesta este un termen emergent sau utilizat în mod neobișnuit și se aplică modelelor care pot raționa și analiza imagini spațial în mod extins, dar care nu generează imagini. Pe măsură ce apar noi paradigme și modele, acest lexicon este în revizuire constantă. Publicat pentru prima dată joi, 2 octombrie 2025
Publicat pentru prima dată joi, 2 octombrie 2025












