Andersons vinkel

Jigsaw-pussler kan forbedre AI-modellers visuelle resonnering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
'An industrial robot attempting to solve a jigsaw puzzle. Besides one robotic arm with which it assembles the puzzle, the robot is not anthropomorphic , and views the jigsaw puzzle with a single camera similar to a surveillance camera UHQ, stock'. SDXL and Adobe Firefly V3.

Nye studier viser at AI-modeller kan bli smartere på å se ved å løse jigsaw-pussler. Å reorganisere forvirrede bilder, videoer og 3D-scener hjelper dem å skjerpe sine visuelle ferdigheter uten behov for ekstra data, merker eller verktøy.

 

I den nåværende kampen for å skyve Multimodal Large Language Models (MLLMs*) fremover, er det få enkle seirer og ingen gratis måltider.

Til tross for at mange av 2025s rekke av imponerende kinesiske FOSS-utgaver rapporteres å ha lavere utviklings- og driftskostnader, tenderer okkidentale utgaver å kaste mer på problemet: mer data-volum, mer inferens-kraft, mer strøm (selv om ikke, som vi nylig noterte, mer faktiske menneskelige annotatorer, siden det er for dyrt selv for $trillion+ skala gen-AI-revolusjon).

I forskningslitteraturen tenderer de fleste såkalte ‘frie’ tilnærminger til utviklingen av AI-arkitekturer å tilby bare mindre inkrementelle forbedringer; eller også forbedringer i områder som ikke er de mest kritisk fulgte. Likevel er søket etter hittil ukjente ‘grunnleggende prinsipper’ som kunne akselerere utviklingstakten for godt til å gi opp.

Å plukke opp brikker

Mens det ikke er helt i den kategorien, hevder en ny akademisk samarbeid mellom kinesiske institusjoner å ha fastslått at å få VLMs å løse jigsaw-pussler forbedrer deres ytelse betydelig, selv om denne reinforcement learning-tilnærming tidligere har hatt dårligere resultater i dette området, og selv om det ikke krever ekstra systemer, hjelpemodeller eller andre ‘bolt-on’-prosesser:

Visual Jigsaw er en selv-koordinert post-trening-ramme som forbedrer visuell-sentrerte ferdigheter i multimodale store språkmodeller. Ved å trene på jigsaw-oppdrag over bilder, videoer og 3D-data, får modellene skarpere fine-grained, romlige og komposisjonelle persepsjon i bilder, sterkere tidsmessig resonnering i videoer og forbedret geometri-bevisst forståelse i 3D-scener. Radar-diagrammene i bildet over viser konsistente gevinster over basis Qwen2.5-VL, med verdi-skalaer justert for hver benchmark for tydelighet. Kilde: https://arxiv.org/pdf/2509.25190

Visual Jigsaw er en selv-koordinert post-trening-ramme som forbedrer visuell-sentrerte ferdigheter i multimodale store språkmodeller. Ved å trene på jigsaw-oppdrag over bilder, videoer og 3D-data, får modellene skarpere fine-grained, romlige og komposisjonelle persepsjon i bilder, sterkere tidsmessig resonnering i videoer og forbedret geometri-bevisst forståelse i 3D-scener. Radar-diagrammene i bildet over viser konsistente gevinster over basis Qwen2.5-VL, med verdi-skalaer justert for hver benchmark for tydelighet. Kilde: https://arxiv.org/pdf/2509.25190

Systemet utviklet av forskerne heter Visual Jigsaw, og innebærer å trene eksisterende MLLMs på materiale som har blitt fragmentert og tilfeldig spredt, som en jigsaw-pussel. Forfatterne utviklet tre modaliteter for denne tilnærmingen: bilde, video og 3D (dvs. CGI-stil mesh), og fant at en moderat tilpasning av samme prosess gav fordeler i alle tre domener:

En representasjon av de tre Visual Jigsaw-oppdragene. I Image Jigsaw, deles et bilde inn i fliser, blandes og modellen forutsier den korrekte layouten; i Video Jigsaw, blandes klippene og modellen gjenoppretter deres opprinnelige rekkefølge i tid; i 3D Jigsaw, blandes punkter med forskjellige dybder og modellen rangerer dem fra nærmest til fjernest. Modell-utdata sammenlignes med bakgrunns-sannhet, med delvis kredit gitt for delvis korrekte løsninger.

En representasjon av de tre Visual Jigsaw-oppdragene. I Image Jigsaw, deles et bilde inn i fliser, blandes og modellen forutsier den korrekte layouten; i Video Jigsaw, blandes klippene og modellen gjenoppretter deres opprinnelige rekkefølge i tid; i 3D Jigsaw, blandes punkter med forskjellige dybder og modellen rangerer dem fra nærmest til fjernest. Modell-utdata sammenlignes med bakgrunns-sannhet, med delvis kredit gitt for delvis korrekte løsninger.

Visual Jigsaw-metoden hjelper AI-modeller å forbedre seg på å forstå visuell informasjon ved å få dem til å gjenopprette disse forvirrede bildene, video-klippene eller 3D-data-punktene.

Prosessen er basert på ord fremfor bilder, og derfor er det ingen behov for modellen å generere bilder eller bruke ekstra visuelle komponenter. Denne metoden passer inn i et system kalt Reinforcement Learning from Verifiable Rewards (RLVR), hvor modellen får belønning for korrekte svar basert på klare, automatiske regler; og hvor, derfor, ingen menneskelig merking er nødvendig.

Dette kritiske faktum er faktisk vanskelig å få øye på fra den nye artikkelen: at systemet samler puslespillet semantisk, gjennom beskrivelser, og ikke på måten mennesker lærer å løse slike puslespill:

Fra den nye artikkelen sin supplerende materiale, et eksempel på RL-oppdrag som illustrerer den tekst-baserte naturen til denne læreprosessen.

Fra den nye artikkelen sin supplerende materiale, et eksempel på RL-oppdrag som illustrerer den tekst-baserte naturen til denne læreprosessen. Bildene som ville vært vist til MLLM er ikke avbildet her.

Til tross for at MLLMs omfattende behandler visuell-sentrerte oppdrag, er de språk-baserte arkitekturer, ikke designet til å generere bilder, videoer eller form-representasjoner som 3D-mesh.

Eksempler fra image-jigsaw-oppdraget. Hver rad viser blandede fliser som modellen må gjenopprette til deres opprinnelige layout, med den korrekte rekkefølgen vist til høyre.

Eksempler fra image-jigsaw-oppdraget. Hver rad viser blandede fliser som modellen må gjenopprette til deres opprinnelige layout, med den korrekte rekkefølgen vist til høyre.

Uansett, denne type trening gjøres etter hovedlæring-fasen, når modellen allerede har noen evne til å forstå bilder.

Tidligere tilnærminger som den sveitsiske artikkelen Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles brukte denne type forsterkning-tilnærming med mindre suksess, på konvolusjonelle neurale nettverk (CNN), en merkbart annen type arkitektur i sammenligning med en moderne MLLM.

Fra 2017-utgaven 'Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles ', et tidlig eksempel på bruk av fragmentering som en belønning-utfordring for et neuralt system. Kilde: https://arxiv.org/pdf/1603.09246

Fra 2017-utgaven ‘Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles ‘, et tidlig eksempel på bruk av fragmentering som en belønning-utfordring for et neuralt system. Kilde: https://arxiv.org/pdf/1603.09246

I tester, ledet Visual Jigsaw til hva forfatterne hevder å være konsistente og målbare forbedringer over en rekke benchmarks: image-jigsaw-oppdraget forbedret fine-grained persepsjon, romlig layout-forståelse og komposisjonell resonnering; video-jigsaw-oppdraget forbedret modellens evne til å spore tidsmessige sekvenser og resonere om hendelses-rekkefølge; og 3D-jigsaw-oppdraget styrket dybde-basert forståelse og romlig resonnering ved å bruke bare RGB-D-inndata.

Over alle tre modaliteter, gjentok artikkelen at den nye metoden overgikk flere konkurranse-baselines, til tross for at den ikke krevde arkitektoniske endringer, ekstra visuelle moduler eller ekstra overvåket data:

‘Omfattende eksperimenter viser betydelige forbedringer i fine-grained persepsjon, tidsmessig resonnering og 3D-romlig forståelse. Våre funn fremhever potensialet for selv-koordinerte visuell-sentrerte oppdrag i post-trening MLLMs og har som mål å inspirere videre forskning på visuell-sentrerte pretext-designs.’

Den nye artikkelen heter Visual Jigsaw Post-Training Improves MLLMs, og kommer fra seks forskere over Nanyang Technological University, Linköping University og SenseTime Research. Artikkelen følges av en prosjekt-side med live-demonstrasjoner (og du kan sogar laste inn ditt eget bilde i bilde-basert jigsaw-demonstrasjon). Koden og vektene for prosjektet har blitt gjort generelt tilgjengelige,

Metode

Til tross for at vi skal se på måten informasjon deles opp for å tilpasse de tre testede modalitetene, bør vi først vurdere belønning-designet for det nye systemet.

Visual Jigsaw-tilnærmingen scorer modell-respons ved hjelp av en gradert belønning, ikke bare en enkel pass eller feil. Hvis modellen forutsier den eksakte korrekte rekkefølgen av jigsaw-brikker, mottar den en full belønning; hvis svaret er mest korrekt, men ikke perfekt, mottar modellen delvis kredit, skalert av en diskonteringsfaktor for å unngå å overvurdere nær-misser (dette forhindrer modellen fra å spille systemet ved å gjenta gjetninger som bare er delvis korrekte).

Ugyldige svar, som ‘juks‘ ved å bruke samme nummer gjentatte ganger, mottar en score på null. For å oppmuntre konsistent formatering, må modellen plassere sin resonnering innen <think>-tagger og sin endelige svar innen <answer>-tagger. Den mottar en liten bonus hvis denne formaten brukes korrekt.

Bilder

For å lage en puslespill for bilder-modaliteten, deles et bilde først inn i en grid av fliser ved å skjære det inn i like store blokker:

Eksempler på bilde-baserte fliser for systemet å løse.

Eksempler på bilde-baserte fliser for systemet å løse.

Flisene legges ut i en fast rekkefølge fra topp-venstre til bunnen-høyre, som med leserekkefølgen på en side, før de blandes med en tilfeldig blandingssekvens. Modellen blir deretter eksponert for denne blandede mengden fliser, og må finne ut den opprinnelige rekkefølgen ved å forutsi den korrekte permutasjon som gjenoppretter den opprinnelige layouten.

I trening, ble 118 000 bilder fra COCO-datasettet brukt, med hver bilde som ga ni fliser (dvs. ‘puslespill-brikker’). Promten gitt til systemet vises tidligere i denne artikkelen (bildet over med underteksten som begynner ‘Fra den nye artikkelen sin supplerende materiale’).

Video

For video-jigsaw-oppdraget, deles en video inn i en sekvens av klipp ved å skjære den jevnt over tid, og deretter blandes klipp-sekvensene. Modellen blir deretter vist denne blandede sekvensen, og må finne ut deres korrekte, opprinnelige kronologiske rekkefølge.

Trunkerte eksempler på video-puslespill-utfordringen, fra artikkelen sin supplerende materiale.

Trunkerte eksempler på video-puslespill-utfordringen, fra artikkelen sin supplerende materiale.

Treningen for denne modaliteten brukte 100 000 videoer fra LLaVA-Video-datasettet, med hver video delt inn i seks klipp. For å forhindre at modellen utnytter åpenbare ramme-matching-koder ved klipp-grenser, ble 5% av rammer på starten og slutten av hver klipp trimmet.

Klippene inneholdt ikke mer enn 12 ramer, hver med en maksimal oppløsning på 128x28x28 piksler. Videoer kortere enn 24 sekunder ble ekskludert.

Promten for dette oppdraget vises nedenfor:

Reinforcement learning-promten presentert til MLLMs for video-oppdraget.

Reinforcement learning-promten presentert til MLLMs for video-oppdraget, uten klippene som ville vært presentert til MLLM.

3D-data

Et fullstendig 3D-jigsaw-oppdrag ville vanligvis innebære å bryte opp en 3D-rom (slik som voxel-blokker eller punkt-skyer-fragmenter) inn i mindre biter og trene en modell til å gjenopprette deres opprinnelige romlige layout.

Men den gjennomsnittlige MLLM er ikke utstyrt til å håndtere rå 3D-data direkte, men avhenger av semantisk-interpretede bilde- eller video-inndata. Derfor, for å lage en oppgave som fortsatt tapper inn i 3D-resonnering mens den forblir kompatibel med nåværende MLLMs, introduserte forfatterne en mer håndterbar variant som bruker ovennevnte RGB-D-bilder (dvs. 2D-bilder som inkluderer dybde-informasjon for hver piksel).

Eksempler på spørsmål fra 3D Spatial Understanding Benchmark brukt til å evaluere ytelse på relativt viewpoint og kamera-bevegelse-resonnering. 3D Jigsaw-modellen korrekt antar både den romlige relasjonen mellom to visninger av en scene og den sannsynlige retningen av kamera-rotasjon, og overgår Qwen2.5-VL-7B-baselinjen.

Eksempler på spørsmål fra 3D Spatial Understanding Benchmark brukt til å evaluere ytelse på relativt viewpoint og kamera-bevegelse-resonnering. 3D Jigsaw-modellen korrekt antar både den romlige relasjonen mellom to visninger av en scene og den sannsynlige retningen av kamera-rotasjon, og overgår Qwen2.5-VL-7B-baselinjen.

Fra hver RGB-D-bilde, får modellen en blandet liste over punkter som opprinnelig hadde forskjellige dybder, fra nærmest til fjernest, med målet å gjenopprette deres korrekte dybde-baserte rekkefølge ved å bruke bare 2D-bildet som referanse:

RL-promten for 3D-jigsaw.

RL-promten for 3D-jigsaw.

Hvert punkt er merket på bildet (som vises til modellen, men ikke visualisert i promten-eksempelet over), og modellen må forutsi hvilket var nærmest, nest nærmest, og så videre, effektivt gjenoppretter den opprinnelige dybde-sekvensen uten å ha tilgang til de rå dybde-verdiene.

3D-jigsaw-oppdraget blir trent på RGB-D-bilder fra ScanNet-datasettet, ved å bruke 300 000 eksempler skapt ved å velge tilfeldige sett av seks dybde-punkter per bilde.

Eksempler på punkt-skyer fra ScanNet-datasettet brukt i 3D-jigsaw. Kilde: https://arxiv.org/pdf/1702.04405

Eksempler på punkt-skyer fra ScanNet-datasettet brukt i 3D-jigsaw. Kilde: https://arxiv.org/pdf/1702.04405

Hvert punkt måtte ligge innen en dybde-rekke på 0,1 til 10 meter, og for å fremme diversitet, var det ikke tillatt at to punkter i et sett lå nærmere enn 40 piksler i bildets plan, eller mindre enn 0,2 meter fra hverandre i dybde.

Tester

For initial tester, brukte systemet Qwen2.5-VL-7B-Instruct som basis multimodal modell. Trening brukte Group Relative Policy Optimization (GRPO)-algoritmen, med både KL-regularisering og entropi-tap fjernet.

For delvis forutsigelser, ble en diskonteringsfaktor på 0,2 brukt. Bilde-jigsaw-trening brukte en global batch-størrelse på 256, mens video- og 3D-jigsaw brukte 128. Læringsraten ble satt til 1×10⁻⁶.

For hver prompt, genererte modellen 16 svar ved en avkodning temperatur på 1,0. Begge bilde- og video-jigsaw-oppdrag ble trenet i 1 000 skritt, mens 3D-jigsaw-oppdraget ble trenet i 800 skritt.

Bilde-jigsaw

Bilde-jigsaw-modellen ble testet over tre kategorier av visuell-sentrerte benchmarks: for fine-grained persepsjon og forståelse, MMVP, fine-grained persepsjon-undergruppen av MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; og OVD-Eval.

For monokulær romlig forståelse, var benchmarkene VSR; OmniSpatial; og Depth Anything V2 (DA-2K). For komposisjonell visuell forståelse, ble testene utført med Winoground og SugerCrepe++.

Tre baselines ble testet, alle avledet fra Qwen2.5-VL-7B: ThinkLite-VL for multimodal resonnering; VL-Cogito for generell visuell og vitenskapelige oppdrag; og LLaVA-Critic-R1 for bilde-persepsjon.

Alle ble evaluert ved å bruke korte svar bare, siden kjede-av-tenkning (CoT) resonnering noen ganger reduserte ytelsen.

Evaluering-resultater på bilde-benchmark. Bilde-jigsaw forbedret på Qwen2.5-VL-7B-basismodellen over alle oppdrags-kategorier (dvs. fine-grained persepsjon og forståelse; monokulær romlig forståelse; og komposisjonell visuell resonnering), og overgikk tidligere post-trente baselines.

Evaluering-resultater på bilde-benchmark. Bilde-jigsaw forbedret på Qwen2.5-VL-7B-basismodellen over alle oppdrags-kategorier (dvs. fine-grained persepsjon og forståelse; monokulær romlig forståelse; og komposisjonell visuell resonnering), og overgikk tidligere post-trente baselines.

Av resultater for bilde-jigsaw, viser ovenstående, forfatterne hevder:

‘[Bildet over] viser at vår metode konsistent forbedrer visuell-sentrerte evner på de tre typer benchmark. Disse resultater bekrefter at å inkorporere bilde-jigsaw post-trening betydelig forbedrer MLLMs’ perseptuelle grunnlag og fine-grained visuell forståelse utover resonnering-sentrerte post-trening-strategier.

‘Vi tilskriver disse forbedringene det faktum at å løse bilde-jigsaw-oppdrag krever at modellen må fokusere på lokale flis-detaljer, anta globale romlige layout, og resonere om inter-flis-relasjoner, som direkte forbedrer fine-grained, romlig og komposisjonell forståelse.’

Video-jigsaw

For video-jigsaw, ble evaluering utført på AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; og CVBench.

Video-R1 ble brukt som en baseline, som hadde blitt trenet med kald-start overvåket fin-justering fulgt av forsterkning-læring for video-forståelse og resonnering. I dette tilfelle, inkluderte evalueringene hele resonnerings-prosessen, siden dette konsistent produserte bedre resultater enn direkte svar.

Alle modeller ble begrenset til 256x28x28 piksler, og testet over tre rammeverk-innstillinger – 16, 32 og 64:

Evaluering-resultater på video-benchmark, med Video-jigsaw som overgår baselinjen konsistent over alle oppdrag og rammeverk-innstillinger.

Evaluering-resultater på video-benchmark, med Video-jigsaw som overgår baselinjen konsistent over alle oppdrag og rammeverk-innstillinger.

Video-jigsaw produserte konsistente forbedringer over alle video-forståelse-benchmark og rammeverk-innstillinger, med gevinster spesielt sterke på oppdrag som krever tidsmessig resonnering og retning, som de i AoTBench, og også i cross-video resonnering-benchmark, som CVBench:

‘Disse resultater bekrefter at å løse video-jigsaw-oppdrag oppmuntret modellen til å bedre fange tidsmessig kontinuitet, forstå relasjoner over videoer, resonere om retning-konsistens, og generalisere til helhetlige og generaliserbare video-forståelse-scenarier.’

3D-data

For 3D-modaliteten, ble modellen evaluert på SAT-Real; 3DSRBench; ViewSpatial; All-Angles; ovennevnte OmniSpatial; VSI-Bench; SPARBench (tiny); og ovennevnte DA-2K.

Evaluering-resultater på 3D-benchmark: 3D-jigsaw forbedret ytelse over dybde-sammenlignings-oppdrag som DA-2K, samt bredere 3D-persepsjon-benchmark som dekker enkelt-visning, multi-visning og egosentrisk video-inndata.

Evaluering-resultater på 3D-benchmark: 3D-jigsaw forbedret ytelse over dybde-sammenlignings-oppdrag som DA-2K, samt bredere 3D-persepsjon-benchmark som dekker enkelt-visning, multi-visning og egosentrisk video-inndata.

Her sier forfatterne:

‘[3D] Jigsaw oppnår betydelige forbedringer over alle benchmark. Uventet, er den største gevinsten på DA-2K, en dybde-estimering-benchmark som er direkte relatert til vårt dybde-orden-pre-trening-oppdrag. Mer viktig, observerer vi konsistente forbedringer på en rekke andre oppdrag, inkludert de med enkelt-visning (f.eks. 3DSRBench, [OmniSpatial]), multi-visning (f.eks. ViewSpatial, All-Angles), og egosentrisk video-inndata (f.eks. VSI-Bench).

‘Disse resultater demonstrerer at vår tilnærming ikke bare lærer den spesifikke ferdigheten til dybde-orden, men også effektivt styrker modellens generelle evne til å persevere og resonere om 3D-romlig struktur.’

Konklusjon

Hva som ikke er fullstendig klart fra denne artikkelen er den eksakte relasjonen mellom bilde og beskrivelser som driver denne forbedringen i MLLM-ytelse.

Til å begynne med, ser prosessen med å lære gjennom puslespill ut til å være svært analog til våre egne tidlige forsøk og utvikling. Men en nærmere titt på artikkelen avslører omfanget av hvordan språk tjener MLLM som en intrigerende bro mellom visuell og semantisk realitet.

 

* Vær oppmerksom på at artikkelen sin forfattere foretrekker den mindre vanlige betegnelsen ‘Multimodal Large Language Models’, forkortet til ‘MLLMs’. Dette er en ny eller sjelden brukt betegnelse, og gjelder for modeller som kan omfattende resonere og analysere bilder romlig, men som ikke genererer bilder. Ettersom nye paradigmer og modeller oppstår, er denne leksikonen under konstant revisjon.

Først publisert torsdag, 2. oktober 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]