Andersonin kulma
Palapeli parantaa tekoälyjen visuaalista päättelyä

Uusi tutkimus osoittaa, että tekoälymallit voivat tulla älymmiksi näkemisen suhteen ratkaisemalla palapelejä. Sekaannetuilla kuvilla, videoilla ja 3D-kohteilla toimiminen auttaa niitä teroittamaan visuaalista taituruuttaan ilman ylimääräistä dataa, merkintöjä tai työkaluja.
Nykyisessä kiireessä Multimodaalisten suurten kielen mallien (MLLM) kehittämisessä eteenpäin on vain muutamia helppoja voittoja ja ei ilmaisia lounaita.
Vaikka monet vuoden 2025 kiinalaisten avoimen lähdekoodin julkaisujen on raportoitu olevan alhaisemmat kehitys- ja ajokustannukset, länsimaiset julkaisut taas usein heittävät enemmän ongelmaan: enemmän dataa, enemmän inference-voimaa, enemmän sähköä (vaikka ei, kuten me viimeksi huomasimme, enemmän todellisia ihmisiä, jotka merkitsevät dataa, koska se on liian kallista jopa yli 1 biljoonan dollarin mittakaavan gen-AI-vallankumoukselle).
Tutkimuskirjallisuudessa useimmat niin sanotut “ilmaiset” lähestymistavat tekoälyarkkitehtuurien kehittymiseen tarjoavat vain vähäisiä, askelmainen parannuksia; tai sitten parannuksia, jotka eivät ole kaikista tärkeimpiä. Kuitenkin muiden, vielä tuntemattomien “perusperiaatteiden” etsintä, joilla voitaisiin kiihdyttää kehityksen vauhtia, on liian houkutteleva luopumaan.
Kokoamalla paloja
Vaikka se ei ole ihan sama luokka, uusi akateeminen yhteistyö kiinalaisten instituutioiden välillä väittää löytäneensä, että tekemällä VLM:istä palapeliä parantaa heidän suorituskykyään merkittävästi, vaikka tämä vahvistusoppimisen lähestymistapa on aiemmin suorittanut heikosti tässä alueessa, ja vaikka se ei vaadi ylimääräisiä järjestelmiä, apumalleja tai muita “kiinni” -prosesseja;

Visual Jigsaw on itseoppi post-koulutuskehys, joka parantaa visuaalisia taitoja multimodaalisissa suurissa kielen malleissa. Kouluttamalla jigsaw-tehtävillä kuvien, videoiden ja 3D-kohteiden yli mallit saavat terävöityneen hienojakoinen, spatiaalisen ja kompositionaalisen havainnon kuvissa, vahvemman ajallisen päättelyn videossa ja parannetun geometrian tiedostamisen 3D-kohteissa. Radar-kaaviot yllä olevassa kuvassa osoittavat johdonmukaiset voitot perus Qwen2.5-VL: n yli, arvoasteikot on säätetty kunkin benchmarkin selkeyden vuoksi. Lähde: https://arxiv.org/pdf/2509.25190
Tutkijoiden kehittämä järjestelmä on nimeltään Visual Jigsaw, ja se käsittää kouluttamista olemassa olevilla MLLM:illä aineistolla, joka on fragmentoitu ja satunnaisesti hajotettu, kuin palapeli. He kehittivät kolme modaalista tähän lähestymistapaan: kuva, video ja 3D (ts. CGI-tyyliset verkkomallit), ja totesivat, että kohtuullinen sovittaminen samaa prosessia hyödytti kaikkia kolmea aluetta:

Kuva kolmesta Visual Jigsaw -tehtävästä. Kuva-Jigsaw’ssa kuva on jaettu paloiksi, sekoitettu ja malli ennustaa oikean asettelun; Video-Jigsaw’ssa video on jaettu klippeihin, sekoitetaan ja malli palauttaa niiden aikajärjestyksen; 3D-Jigsaw’ssa pisteet, joilla on eri syvyydet, sekoitetaan ja malli järjestää ne lähimmästä etäisimpään. Mallin tulokset verrataan totuuteen, ja osittainen luotettavuus myönnetään osittain oikein ratkaistuille ratkaisuille.
Visual Jigsaw -koulutusmenetelmä auttaa tekoälymalleja parantamaan visuaalista tietoa järjestämällä nämä sekaisin olevat kuvat, videoklipit tai 3D-kohteet uudelleen.
Prosessi perustuu sanoihin eikä kuviihin, ja siksi mallille ei ole tarpeen luoda kuvia tai käyttää mitään ylimääräisiä visuaalisia komponentteja. Tämä menetelmä sopii järjestelmään, jota kutsutaan Vahvistusoppiminen verifioiduista palkkioista (RLVR), jossa malli saa palkkion oikeista vastauksista perustuen selkeisiin, automaattisiin sääntöihin; ja jossa, siksi, ei tarvita ihmisen merkintöjä.
Tämä olennainen tosiasia on itse asiassa vaikea havaita uudesta tutkimuksesta: että järjestelmä kokoaa palapelit semanttisesti, kuvausten kautta, eikä tavalla, jolla ihmiset oppivat ratkaisemaan palapelejä:

Uuden tutkimuksen liitteestä, esimerkki RL-tehtävästä, joka havainnollistaa tämän apuoppimisprosessin tekstipohjaisen luonteen. Kuvat, jotka olisivat näytetty MLLM:lle, eivät ole kuvassa.
Vaikka MLLM:t käsittelevät laajasti visuaalisia tehtäviä, ne ovat kielipohjaisia arkkitehtuureja, eivätkä suunniteltu luomaan kuvia, videoita tai muotoiluun liittyviä esityksiä, kuten 3D-verkkomalleja.

Esimerkkejä kuva-palapelitehtävästä. Jokainen rivi näyttää sekoitetut palat, jotka mallin on ennustettava oikeaan järjestykseen, oikea asettelu näytetään oikealla.
Milloin tahansa, tämäntyyppinen koulutus tehdään pääasiallisen oppimisvaiheen jälkeen, kun malli jo osaa ymmärtää kuvia.
Aikaisemmat lähestymistavat, kuten vuoden 2017 Sveitsin tutkimus Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles käyttivät tätä lähestymistapaa vähemmän menestyksekkäästi, konvoluutio-neuroverkoilla (CNN), joka on merkittävästi erilainen arkkitehtuuri verrattuna moderniin MLLM:ään.

Vuoden 2017 julkaisusta ‘Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles ‘, varhainen esimerkki fragmentaation käytöstä palkkiohaasteena neuroverkkotutkimuksessa. Lähde: https://arxiv.org/pdf/1603.09246
Kokeissa Visual Jigsaw johti siihen, mitä kirjoittajat väittävät olevan johdonmukaisia ja mitattavissa olevia parannuksia laajalla valikoimalla benchmarkkeja: kuva-palapelitehtävä paransi hienojakoinen havainnon, spatiaalisen asettelun ymmärtämisen ja kompositionaalisen päättelyn; video-palapelitehtävä paransi mallin kykyä seurata ajallisia järjestyksiä ja päätteli tapahtumien järjestyksestä; ja 3D-palapelitehtävä vahvisti syvyyden perusteella tapahtuvan päättelyn ja spatiaalisen päättelyn käytön vain RGB-D -syötteillä.
Kaikissa kolmessa modaalissa tutkimus toistaa, uusi menetelmä ylitti useat kilpailevat vertailukohteet, vaikka se ei vaadi arkkitehtonisia muutoksia, ylimääräisiä visuaalisisia moduuleja tai lisättyä valvottua dataa:
‘Laajat kokeet osoittavat merkittäviä parannuksia hienojakoisessa havainnossa, ajallisessa päättelyssä ja 3D-avaruudellisessa ymmärtämisessä. Tutkimuksemme korostaa itseoppien visuaalisten tehtävien potentiaalia MLLM:ien jälkikoulutuksessa ja pyrkii inspiroimaan lisää tutkimusta visuaalisten esitehtävien suunnittelussa.’
Uusi tutkimus on nimeltään Visual Jigsaw Post-Training Improves MLLMs, ja se tulee kuudesta tutkijasta Nanyangin teknillisestä yliopistosta, Linköpingin yliopistosta ja SenseTime Researchista. Tutkimus on saatavilla projektisivulla live-esimerkeillä (ja voit jopa ladata oman kuvan kuva-palapeliin). Koodi ja painot ovat yleisesti saatavilla,
Menetelmä
Vaikka tarkastelemme tietojen jakoa mukautumaan kolmeen testattuun modaalissa, meidän on ensin tarkasteltava palkkion suunnittelua uudessa järjestelmässä.
Visual Jigsaw -lähestymistapa pisteyttää mallin vastauksia asteittaisella palkkiolla, ei vain yksinkertaisella läpäisee tai epäonnistuu. Jos malli ennustaa täsmällisesti oikean järjestyksen palapalasten, se saa täyden palkkion; jos vastaus on pääosin oikein, mutta ei täysin täydellinen, malli saa osittaisen luotettavuuden, joka on mitattu alennuskerrointa välttääkseen yliarvostamasta lähes oikein olevia vastauksia (tämä estää mallia pelkästään toistamasta vastauksia, jotka ovat vain osittain oikein).
Virheelliset vastaukset, kuten “huijaus” käyttämällä samaa numeroa toistuvasti, saavat pisteitä nolla. Jotta malli saisi johdonmukaisen muodon, se on asetettava päättelynsä <think> -merkkeihin ja lopullisen vastauksensa <answer> -merkkeihin. Se saa pienen bonuksen, jos tämä muoto on käytetty oikein.
Kuvat
Luoaksesi palapelin kuvien modaalille, kuva jaetaan ensin ruudukkoon paloiksi jakamalla sen yhdenmukaisiin, samankokoisiin lohkoihin:

Esimerkkejä kuva-paloista, joita järjestelmä ratkaisee.
Palat asetetaan kiinteään järjestykseen ylävasemman kulman ja alhaisen oikean kulman välillä, kuten lukemisjärjestys sivulla, ennen kuin ne sekoitetaan satunnaisella sekoituksella. Malli esitetään sille tämä sekoitettu joukko paloja, ja se on selvittävä alkuperäisen järjestyksen ennustamalla oikean järjestyksen, joka palauttaa alkuperäisen asettelun.
Koulutuksessa käytettiin 118 000 kuvaa COCO-tietokannasta, ja kustakin kuvasta saatiin yhdeksän palaa (ts. “palapalasia”). Kysymys, joka esitettiin järjestelmälle, on näytetty aiemmin tässä artikkelissa (kuva, jonka kuvateksti alkaa ‘Uuden tutkimuksen liitteestä’).
Video
Video-palapelitehtävää varten video jaetaan klippeihin ajan yli, ja sitten sekoitetaan klipit. Malli esitetään sille tämä sekoitettu järjestys, ja se on selvittävä niiden alkuperäinen aikajärjestys:

Katkennut esimerkki video-palapelihästä, tutkimuksen liitteestä.
Koulutus tässä modaalissa käytti 100 000 videota LLaVA-Video-tietokannasta, ja kustakin videosta saatiin kuusi klippiä. Estääkseen mallin hyödyntämisen ilmeisiä kehyksen rajauksia klipien rajauksissa, 5 % kehyksistä klipin alussa ja lopussa leikattiin pois.
Klipit eivät sisältäneet enempää kuin 12 kehystä, ja kunkin kehys oli enintään 128x28x28 pikseliä. Videot, jotka kestivät vähemmän kuin 24 sekuntia, poistettiin.
Kysymys tälle tehtävälle on näytetty alla:

Vahvistusoppimisen kysymys, joka esitetään MLLM:ille video-tehtävälle, ilman klippejä, jotka esitettiin MLLM:lle..
3D-tiedot
Täydellinen 3D-palapelitehtävä vaatisi 3D-avaruuden (kuten vokseli -lohkot tai pilvipalasten fragmentteja) jakamista pienempiin osiin ja kouluttamista mallia rakentamaan niiden alkuperäisen spatiaalisen asettelun uudelleen.
Kuitenkin keskimääräinen MLLM ei ole varustettu käsittelyyn suoraan 3D-tietoa, vaan sen sijaan se riippuu semanttisesti tulkittuja kuvia tai videoita. Siksi, luodakseen tehtävän, joka edelleen hyödyntää 3D-päättelyä olemassa olevien MLLM:ien kanssa, tutkijat esittivät helpomman version, joka käyttää edellä mainittuja RGB-D-kuvia (ts. 2D-kuvia, jotka sisältävät syvyystietoa jokaiselle pikselille).

Esimerkki 3D-avaruudellisen ymmärtämisen benchmarkista, jolla arvioidaan suhteellisen näkökulman ja kameraliikkeen päättelyä. 3D-Jigsaw-malli arvioi oikein sekä spatiaalisen suhteen kahden näkymän välillä että kameran todennäköisen liikkeen suunnan, ylittäen Qwen2.5-VL-7B-pohjalinjan.
Kunkin RGB-D-kuvan kohdalla malli saa sekoitetun listan pisteitä, joilla on eri syvyydet, vaihdellen lähimmästä etäisimpään, tavoitteena palauttaa niiden alkuperäinen syvyyden perusteella järjestys käyttäen ainoastaan 2D-kuvaa viittauksena:

Vahvistusoppimisen kysymys 3D-palapelille.
Kunkin pisteen on merkittävä kuva (joka näytetään mallille, mutta ei visualisoida kysymys-esimerkissä yllä), ja mallin on ennustettava, kuka on lähinnä, toiseksi lähinnä jne., tehden niin alkuperäisen syvyyden järjestyksen uudelleen ilman suoraa pääsyä raakoihin syvyyden arvoihin.
3D-palapelitehtävä koulutetaan RGB-D-kuvilla ScanNet-tietokannasta, käyttäen 300 000 näytettä, jotka on luotu valitsemalla satunnaisia joukkoja kuudesta syvyyden pisteestä per kuva.

Pilvipalasten esimerkkejä ScanNet-tietokannasta, joita käytetään 3D-palapelissä. Lähde: https://arxiv.org/pdf/1702.04405
Kunkin pisteen on oltava 0,1 ja 10 metrin syvyyden välillä, ja edistääkseen monimuotoisuutta, ei kaksi pistettä joukossa saa olla lähempänä kuin 40 pikseliä kuvataulurilla tai vähintään 0,2 metriä syvyyssuunnassa.
Kokeet
Alkuvaiheen kokeissa käytettiin Qwen2.5-VL-7B-Instruct perusmultimodaalisena mallina. Koulutus käytti Ryhmän suhteellisen politiikkaoptimointi (GRPO) -algoritmiä, josta poistettiin sekä KL-sääntöistys että entropiahäviö.
Osittaisille ennusteille sovellettiin 0,2 alennuskerrointa. Kuva-palapeli koulutus käytti globaalia eräkoko 256, kun taas video- ja 3D-palapelit käyttivät 128. Oppimisnopeus asetettiin 1×10⁻⁶.
Kunkin kysymyksen kohdalla malli tuotti 16 vastausta dekoodauslämpötilassa 1,0. Sekä kuva- että video-palapelit koulutettiin 1 000 askelta, kun taas 3D-palapeli koulutettiin 800 askelta.
Kuva-palapeli
Kuva-palapeli malli testattiin kolmessa visuaalisen keskittyneiden benchmark-luokassa: hienojakoinen havainto ja ymmärtäminen, MMVP, hienojakoinen havainnon alijoukko MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; ja OVD-Eval.
Monokulaarisen spatiaalisen ymmärtämisen osalta benchmarkit olivat VSR; OmniSpatial; ja Depth Anything V2 (DA-2K). Kompositionaalisen visuaalisen ymmärtämisen osalta kokeet käyttivät Winoground ja SugerCrepe++.
Kolme vertailukohtaa testattiin, kaikki peräisin Qwen2.5-VL-7B:stä: ThinkLite-VL multimodaaliselle päättelylle; VL-Cogito yleisille visuaalisille ja tieteellisille tehtäville; ja LLaVA-Critic-R1 kuvahavainnolle.
Kaikki ne arvioitiin lyhyillä vastauksilla, koska ketjuajattelupäättely (CoT) -päättely joskus vähensi suorituskykyä.

Arviointitulokset kuva-benchmarkkeissa: Kuva-palapeli paransi Qwen2.5-VL-7B-pohjalinjaa kaikissa tehtävänluokissa (ts. hienojakoinen havainto ja ymmärtäminen; monokulaarinen spatiaalinen ymmärtäminen; ja kompositionaalinen visuaalinen päättely), ylittäen aiemmat jälkikoulutusvertailukohteet.
Kuva-palapelin tuloksista, jotka on näytetty yllä, kirjoittajat toteavat:
‘[Yllä oleva kuva] osoittaa, että menetelmämme parantaa johdonmukaisesti visuaalisia kykyjä kolmessa benchmark-luokassa. Nämä tulokset vahvistavat, että kuva-palapelin jälkikoulutus parantaa merkittävästi MLLM:ien havainnollista perustaa ja hienojakoinen visuaalista ymmärtämistä jälkikoulutusstrategioiden ulottumattomissa.’
‘Meidän näkemys on, että nämä parannukset johtuvat siitä, että kuva-palapelin ratkaiseminen vaatii mallilta paikallisten palojen yksityiskohtien huomioimista, globaalin spatiaalisen asettelun johtamista ja palojen välisen suhteen päättelyä, mikä suoraan hyödyttää hienojakoinen, spatiaalista ja kompositionaalisista ymmärtämistä.’
Video-palapeli
Video-palapelin arvioinnissa käytettiin AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; ja CVBench.
Video-R1 käytettiin vertailukohtana, joka oli koulutettu kylmällä käynnistyksellä valvotulla hienosäätöllä videojen ymmärtämisen ja päättelyn vahvistusoppimisella. Tässä tapauksessa arvioinnit sisälsivät koko päättelyprosessin, koska se tuotti johdonmukaisesti parempia tuloksia kuin suorat vastaukset.
Kaikki mallit rajoitettiin 256x28x28 pikseliin, ja ne testattiin kolmessa eri kehysasetuksessa – 16, 32 ja 64:

Arviointitulokset video-benchmarkkeissa, joissa Video-palapeli ylitti vertailukohdan johdonmukaisesti kaikissa tehtävissä ja kehysasetuksissa.
Video-palapeli tuotti johdonmukaisia parannuksia kaikissa videoymmärtämisen benchmarkkeissa ja kehysasetuksissa, erityisesti vahvoja parannuksia tehtävissä, jotka vaativat ajallista päättelyä ja suunnan määritystä, kuten AoTBenchissä, ja myös videojen välisten suhteiden ymmärtämistä, kuten CVBenchissä:
‘Nämä tulokset vahvistavat, että video-palapelin ratkaiseminen auttaa mallia ymmärtämään paremmin ajallista jatkuvuutta, ymmärtämään suhteita videoiden välillä, päättämään suunnan jatkuvuudesta ja yleistämään holistisiin ja yleispäteviin videoymmärtämisen tilanteisiin.’
3D-tiedot
3D-modaalissa malli arvioitiin SAT-Real; 3DSRBench; ViewSpatial; All-Angles; edellä mainittu OmniSpatial; VSI-Bench; SPARBench (tiny); ja edellä mainittu DA-2K.

Arviointitulokset 3D-benchmarkkeissa: 3D-palapeli paransi suorituskykyä syvyyden vertailutehtävissä, kuten DA-2K, sekä laajemmissa 3D-havainnointibenchmarkkeissa, jotka kattavat yksinäisen näkymän, moninäkymän ja egosentrisen videon syötteet.
Tässä kirjoittajat toteavat:
‘[3D] -palapeli saavuttaa merkittäviä parannuksia kaikissa benchmarkkeissa. Odottamattomasti, suurin voitto on DA-2K: ssä, syvyyden arviointibenchmarkissa, joka on suoraan liitetty meidän syvyyden järjestyksen esikoulutustehtävään. Lisäksi havaitsemme johdonmukaisia parannuksia laajalla valikoimalla muita tehtäviä, mukaan lukien ne, joissa on yksinäinen näkymä (esim. 3DSRBench, [OmniSpatial]), moninäkymä (esim. ViewSpatial, All-Angles) ja egosentriset videon syötteet (esim. VSI-Bench).
‘Nämä tulokset osoittavat, että lähestymistapamme opettaa mallille ei vain tietyn taidon, syvyyden järjestyksen, vaan myös vahvistaa yleisesti mallin kykyä havainnoida ja päättää 3D-avaruudellisesta rakenteesta.’
Johtopäätös
Mitä ei ole täysin selvää tästä tutkimuksesta, on tarkka suhde kuvien ja kuvausten välillä, joka mahdollistaa tämän parannuksen MLLM:ien suorituskyvyssä.
Ensimmäisellä silmäyksellä palapelien ratkaisemisen prosessi näyttää hyvin vastaavan omaa varhaiskauden kehitystämme. Kuitenkin lähempi tarkastelu tutkimuksesta paljastaa, kuinka kieli toimii MLLM:ille siltaa visuaalisen ja semanttisen todellisuuden välillä.
* Huomaa, että tutkimuksen kirjoittajat suosittelevat vähemmän yleistä termiä ‘Multimodaalinen suuri kielen malli’, jota lyhennetään ‘MLLM’. Tämä on kehittyvä tai harvoin käytetty termi, joka koskee malleja, jotka voivat laajasti päättää ja analysoida kuvia spatiaalisesti, mutta eivät luo kuvia. Koska uudet paradigmat ja mallit kehittyvät, tämä sanasto on jatkuvasti revisioitavana.
Julkaistu torstaina, 2. lokakuuta 2025












