Andersonin kulma
Palapeli parantaa tekoÃĪlyjen visuaalista pÃĪÃĪttelyÃĪ

Uusi tutkimus osoittaa, ettÃĪ tekoÃĪlymallit voivat tulla ÃĪlymmiksi nÃĪkemisen suhteen ratkaisemalla palapelejÃĪ. Sekaannetuilla kuvilla, videoilla ja 3D-kohteilla toimiminen auttaa niitÃĪ teroittamaan visuaalista taituruuttaan ilman ylimÃĪÃĪrÃĪistÃĪ dataa, merkintÃķjÃĪ tai tyÃķkaluja.
Â
NykyisessÃĪ kiireessÃĪ Multimodaalisten suurten kielen mallien (MLLM) kehittÃĪmisessÃĪ eteenpÃĪin on vain muutamia helppoja voittoja ja ei ilmaisia lounaita.
Vaikka monet vuoden 2025 kiinalaisten avoimen lÃĪhdekoodin julkaisujen on raportoitu olevan alhaisemmat kehitys- ja ajokustannukset, lÃĪnsimaiset julkaisut taas usein heittÃĪvÃĪt enemmÃĪn ongelmaan: enemmÃĪn dataa, enemmÃĪn inference-voimaa, enemmÃĪn sÃĪhkÃķÃĪ (vaikka ei, kuten me viimeksi huomasimme, enemmÃĪn todellisia ihmisiÃĪ, jotka merkitsevÃĪt dataa, koska se on liian kallista jopa yli 1 biljoonan dollarin mittakaavan gen-AI-vallankumoukselle).
Tutkimuskirjallisuudessa useimmat niin sanotut âilmaisetâ lÃĪhestymistavat tekoÃĪlyarkkitehtuurien kehittymiseen tarjoavat vain vÃĪhÃĪisiÃĪ, askelmainen parannuksia; tai sitten parannuksia, jotka eivÃĪt ole kaikista tÃĪrkeimpiÃĪ. Kuitenkin muiden, vielÃĪ tuntemattomien âperusperiaatteidenâ etsintÃĪ, joilla voitaisiin kiihdyttÃĪÃĪ kehityksen vauhtia, on liian houkutteleva luopumaan.
Kokoamalla paloja
Vaikka se ei ole ihan sama luokka, uusi akateeminen yhteistyÃķ kiinalaisten instituutioiden vÃĪlillÃĪ vÃĪittÃĪÃĪ lÃķytÃĪneensÃĪ, ettÃĪ tekemÃĪllÃĪ VLM:istÃĪ palapeliÃĪ parantaa heidÃĪn suorituskykyÃĪÃĪn merkittÃĪvÃĪsti, vaikka tÃĪmÃĪ vahvistusoppimisen lÃĪhestymistapa on aiemmin suorittanut heikosti tÃĪssÃĪ alueessa, ja vaikka se ei vaadi ylimÃĪÃĪrÃĪisiÃĪ jÃĪrjestelmiÃĪ, apumalleja tai muita âkiinniâ -prosesseja;

Visual Jigsaw on itseoppi post-koulutuskehys, joka parantaa visuaalisia taitoja multimodaalisissa suurissa kielen malleissa. Kouluttamalla jigsaw-tehtÃĪvillÃĪ kuvien, videoiden ja 3D-kohteiden yli mallit saavat terÃĪvÃķityneen hienojakoinen, spatiaalisen ja kompositionaalisen havainnon kuvissa, vahvemman ajallisen pÃĪÃĪttelyn videossa ja parannetun geometrian tiedostamisen 3D-kohteissa. Radar-kaaviot yllÃĪ olevassa kuvassa osoittavat johdonmukaiset voitot perus Qwen2.5-VL: n yli, arvoasteikot on sÃĪÃĪtetty kunkin benchmarkin selkeyden vuoksi. LÃĪhde: https://arxiv.org/pdf/2509.25190
Tutkijoiden kehittÃĪmÃĪ jÃĪrjestelmÃĪ on nimeltÃĪÃĪn Visual Jigsaw, ja se kÃĪsittÃĪÃĪ kouluttamista olemassa olevilla MLLM:illÃĪ aineistolla, joka on fragmentoitu ja satunnaisesti hajotettu, kuin palapeli. He kehittivÃĪt kolme modaalista tÃĪhÃĪn lÃĪhestymistapaan: kuva, video ja 3D (ts. CGI-tyyliset verkkomallit), ja totesivat, ettÃĪ kohtuullinen sovittaminen samaa prosessia hyÃķdytti kaikkia kolmea aluetta:

Kuva kolmesta Visual Jigsaw -tehtÃĪvÃĪstÃĪ. Kuva-Jigsawâssa kuva on jaettu paloiksi, sekoitettu ja malli ennustaa oikean asettelun; Video-Jigsawâssa video on jaettu klippeihin, sekoitetaan ja malli palauttaa niiden aikajÃĪrjestyksen; 3D-Jigsawâssa pisteet, joilla on eri syvyydet, sekoitetaan ja malli jÃĪrjestÃĪÃĪ ne lÃĪhimmÃĪstÃĪ etÃĪisimpÃĪÃĪn. Mallin tulokset verrataan totuuteen, ja osittainen luotettavuus myÃķnnetÃĪÃĪn osittain oikein ratkaistuille ratkaisuille.
Visual Jigsaw -koulutusmenetelmÃĪ auttaa tekoÃĪlymalleja parantamaan visuaalista tietoa jÃĪrjestÃĪmÃĪllÃĪ nÃĪmÃĪ sekaisin olevat kuvat, videoklipit tai 3D-kohteet uudelleen.
Prosessi perustuu sanoihin eikÃĪ kuviihin, ja siksi mallille ei ole tarpeen luoda kuvia tai kÃĪyttÃĪÃĪ mitÃĪÃĪn ylimÃĪÃĪrÃĪisiÃĪ visuaalisia komponentteja. TÃĪmÃĪ menetelmÃĪ sopii jÃĪrjestelmÃĪÃĪn, jota kutsutaan Vahvistusoppiminen verifioiduista palkkioista (RLVR), jossa malli saa palkkion oikeista vastauksista perustuen selkeisiin, automaattisiin sÃĪÃĪntÃķihin; ja jossa, siksi, ei tarvita ihmisen merkintÃķjÃĪ.
TÃĪmÃĪ olennainen tosiasia on itse asiassa vaikea havaita uudesta tutkimuksesta: ettÃĪ jÃĪrjestelmÃĪ kokoaa palapelit semanttisesti, kuvausten kautta, eikÃĪ tavalla, jolla ihmiset oppivat ratkaisemaan palapelejÃĪ:

Uuden tutkimuksen liitteestÃĪ, esimerkki RL-tehtÃĪvÃĪstÃĪ, joka havainnollistaa tÃĪmÃĪn apuoppimisprosessin tekstipohjaisen luonteen. Kuvat, jotka olisivat nÃĪytetty MLLM:lle, eivÃĪt ole kuvassa.
Vaikka MLLM:t kÃĪsittelevÃĪt laajasti visuaalisia tehtÃĪviÃĪ, ne ovat kielipohjaisia arkkitehtuureja, eivÃĪtkÃĪ suunniteltu luomaan kuvia, videoita tai muotoiluun liittyviÃĪ esityksiÃĪ, kuten 3D-verkkomalleja.

EsimerkkejÃĪ kuva-palapelitehtÃĪvÃĪstÃĪ. Jokainen rivi nÃĪyttÃĪÃĪ sekoitetut palat, jotka mallin on ennustettava oikeaan jÃĪrjestykseen, oikea asettelu nÃĪytetÃĪÃĪn oikealla.
Milloin tahansa, tÃĪmÃĪntyyppinen koulutus tehdÃĪÃĪn pÃĪÃĪasiallisen oppimisvaiheen jÃĪlkeen, kun malli jo osaa ymmÃĪrtÃĪÃĪ kuvia.
Aikaisemmat lÃĪhestymistavat, kuten vuoden 2017 Sveitsin tutkimus Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles kÃĪyttivÃĪt tÃĪtÃĪ lÃĪhestymistapaa vÃĪhemmÃĪn menestyksekkÃĪÃĪsti, konvoluutio-neuroverkoilla (CNN), joka on merkittÃĪvÃĪsti erilainen arkkitehtuuri verrattuna moderniin MLLM:ÃĪÃĪn.

Vuoden 2017 julkaisusta âUnsupervised Learning of Visual Representations by Solving Jigsaw Puzzles â, varhainen esimerkki fragmentaation kÃĪytÃķstÃĪ palkkiohaasteena neuroverkkotutkimuksessa. LÃĪhde: https://arxiv.org/pdf/1603.09246
Kokeissa Visual Jigsaw johti siihen, mitÃĪ kirjoittajat vÃĪittÃĪvÃĪt olevan johdonmukaisia ja mitattavissa olevia parannuksia laajalla valikoimalla benchmarkkeja: kuva-palapelitehtÃĪvÃĪ paransi hienojakoinen havainnon, spatiaalisen asettelun ymmÃĪrtÃĪmisen ja kompositionaalisen pÃĪÃĪttelyn; video-palapelitehtÃĪvÃĪ paransi mallin kykyÃĪ seurata ajallisia jÃĪrjestyksiÃĪ ja pÃĪÃĪtteli tapahtumien jÃĪrjestyksestÃĪ; ja 3D-palapelitehtÃĪvÃĪ vahvisti syvyyden perusteella tapahtuvan pÃĪÃĪttelyn ja spatiaalisen pÃĪÃĪttelyn kÃĪytÃķn vain RGB-D -syÃķtteillÃĪ.
Kaikissa kolmessa modaalissa tutkimus toistaa, uusi menetelmÃĪ ylitti useat kilpailevat vertailukohteet, vaikka se ei vaadi arkkitehtonisia muutoksia, ylimÃĪÃĪrÃĪisiÃĪ visuaalisisia moduuleja tai lisÃĪttyÃĪ valvottua dataa:
âLaajat kokeet osoittavat merkittÃĪviÃĪ parannuksia hienojakoisessa havainnossa, ajallisessa pÃĪÃĪttelyssÃĪ ja 3D-avaruudellisessa ymmÃĪrtÃĪmisessÃĪ. Tutkimuksemme korostaa itseoppien visuaalisten tehtÃĪvien potentiaalia MLLM:ien jÃĪlkikoulutuksessa ja pyrkii inspiroimaan lisÃĪÃĪ tutkimusta visuaalisten esitehtÃĪvien suunnittelussa.â
Uusi tutkimus on nimeltÃĪÃĪn Visual Jigsaw Post-Training Improves MLLMs, ja se tulee kuudesta tutkijasta Nanyangin teknillisestÃĪ yliopistosta, LinkÃķpingin yliopistosta ja SenseTime Researchista. Tutkimus on saatavilla projektisivulla live-esimerkeillÃĪ (ja voit jopa ladata oman kuvan kuva-palapeliin). Koodi ja painot ovat yleisesti saatavilla,
MenetelmÃĪ
Vaikka tarkastelemme tietojen jakoa mukautumaan kolmeen testattuun modaalissa, meidÃĪn on ensin tarkasteltava palkkion suunnittelua uudessa jÃĪrjestelmÃĪssÃĪ.
Visual Jigsaw -lÃĪhestymistapa pisteyttÃĪÃĪ mallin vastauksia asteittaisella palkkiolla, ei vain yksinkertaisella lÃĪpÃĪisee tai epÃĪonnistuu. Jos malli ennustaa tÃĪsmÃĪllisesti oikean jÃĪrjestyksen palapalasten, se saa tÃĪyden palkkion; jos vastaus on pÃĪÃĪosin oikein, mutta ei tÃĪysin tÃĪydellinen, malli saa osittaisen luotettavuuden, joka on mitattu alennuskerrointa vÃĪlttÃĪÃĪkseen yliarvostamasta lÃĪhes oikein olevia vastauksia (tÃĪmÃĪ estÃĪÃĪ mallia pelkÃĪstÃĪÃĪn toistamasta vastauksia, jotka ovat vain osittain oikein).
Virheelliset vastaukset, kuten âhuijausâ kÃĪyttÃĪmÃĪllÃĪ samaa numeroa toistuvasti, saavat pisteitÃĪ nolla. Jotta malli saisi johdonmukaisen muodon, se on asetettava pÃĪÃĪttelynsÃĪ <think> -merkkeihin ja lopullisen vastauksensa <answer> -merkkeihin. Se saa pienen bonuksen, jos tÃĪmÃĪ muoto on kÃĪytetty oikein.
Kuvat
Luoaksesi palapelin kuvien modaalille, kuva jaetaan ensin ruudukkoon paloiksi jakamalla sen yhdenmukaisiin, samankokoisiin lohkoihin:

EsimerkkejÃĪ kuva-paloista, joita jÃĪrjestelmÃĪ ratkaisee.
Palat asetetaan kiinteÃĪÃĪn jÃĪrjestykseen ylÃĪvasemman kulman ja alhaisen oikean kulman vÃĪlillÃĪ, kuten lukemisjÃĪrjestys sivulla, ennen kuin ne sekoitetaan satunnaisella sekoituksella. Malli esitetÃĪÃĪn sille tÃĪmÃĪ sekoitettu joukko paloja, ja se on selvittÃĪvÃĪ alkuperÃĪisen jÃĪrjestyksen ennustamalla oikean jÃĪrjestyksen, joka palauttaa alkuperÃĪisen asettelun.
Koulutuksessa kÃĪytettiin 118 000 kuvaa COCO-tietokannasta, ja kustakin kuvasta saatiin yhdeksÃĪn palaa (ts. âpalapalasiaâ). Kysymys, joka esitettiin jÃĪrjestelmÃĪlle, on nÃĪytetty aiemmin tÃĪssÃĪ artikkelissa (kuva, jonka kuvateksti alkaa âUuden tutkimuksen liitteestÃĪâ).
Video
Video-palapelitehtÃĪvÃĪÃĪ varten video jaetaan klippeihin ajan yli, ja sitten sekoitetaan klipit. Malli esitetÃĪÃĪn sille tÃĪmÃĪ sekoitettu jÃĪrjestys, ja se on selvittÃĪvÃĪ niiden alkuperÃĪinen aikajÃĪrjestys:

Katkennut esimerkki video-palapelihÃĪstÃĪ, tutkimuksen liitteestÃĪ.
Koulutus tÃĪssÃĪ modaalissa kÃĪytti 100 000 videota LLaVA-Video-tietokannasta, ja kustakin videosta saatiin kuusi klippiÃĪ. EstÃĪÃĪkseen mallin hyÃķdyntÃĪmisen ilmeisiÃĪ kehyksen rajauksia klipien rajauksissa, 5 % kehyksistÃĪ klipin alussa ja lopussa leikattiin pois.
Klipit eivÃĪt sisÃĪltÃĪneet enempÃĪÃĪ kuin 12 kehystÃĪ, ja kunkin kehys oli enintÃĪÃĪn 128x28x28 pikseliÃĪ. Videot, jotka kestivÃĪt vÃĪhemmÃĪn kuin 24 sekuntia, poistettiin.
Kysymys tÃĪlle tehtÃĪvÃĪlle on nÃĪytetty alla:

Vahvistusoppimisen kysymys, joka esitetÃĪÃĪn MLLM:ille video-tehtÃĪvÃĪlle, ilman klippejÃĪ, jotka esitettiin MLLM:lle..
3D-tiedot
TÃĪydellinen 3D-palapelitehtÃĪvÃĪ vaatisi 3D-avaruuden (kuten vokseli -lohkot tai pilvipalasten fragmentteja) jakamista pienempiin osiin ja kouluttamista mallia rakentamaan niiden alkuperÃĪisen spatiaalisen asettelun uudelleen.
Kuitenkin keskimÃĪÃĪrÃĪinen MLLM ei ole varustettu kÃĪsittelyyn suoraan 3D-tietoa, vaan sen sijaan se riippuu semanttisesti tulkittuja kuvia tai videoita. Siksi, luodakseen tehtÃĪvÃĪn, joka edelleen hyÃķdyntÃĪÃĪ 3D-pÃĪÃĪttelyÃĪ olemassa olevien MLLM:ien kanssa, tutkijat esittivÃĪt helpomman version, joka kÃĪyttÃĪÃĪ edellÃĪ mainittuja RGB-D-kuvia (ts. 2D-kuvia, jotka sisÃĪltÃĪvÃĪt syvyystietoa jokaiselle pikselille).

Esimerkki 3D-avaruudellisen ymmÃĪrtÃĪmisen benchmarkista, jolla arvioidaan suhteellisen nÃĪkÃķkulman ja kameraliikkeen pÃĪÃĪttelyÃĪ. 3D-Jigsaw-malli arvioi oikein sekÃĪ spatiaalisen suhteen kahden nÃĪkymÃĪn vÃĪlillÃĪ ettÃĪ kameran todennÃĪkÃķisen liikkeen suunnan, ylittÃĪen Qwen2.5-VL-7B-pohjalinjan.
Kunkin RGB-D-kuvan kohdalla malli saa sekoitetun listan pisteitÃĪ, joilla on eri syvyydet, vaihdellen lÃĪhimmÃĪstÃĪ etÃĪisimpÃĪÃĪn, tavoitteena palauttaa niiden alkuperÃĪinen syvyyden perusteella jÃĪrjestys kÃĪyttÃĪen ainoastaan 2D-kuvaa viittauksena:

Vahvistusoppimisen kysymys 3D-palapelille.
Kunkin pisteen on merkittÃĪvÃĪ kuva (joka nÃĪytetÃĪÃĪn mallille, mutta ei visualisoida kysymys-esimerkissÃĪ yllÃĪ), ja mallin on ennustettava, kuka on lÃĪhinnÃĪ, toiseksi lÃĪhinnÃĪ jne., tehden niin alkuperÃĪisen syvyyden jÃĪrjestyksen uudelleen ilman suoraa pÃĪÃĪsyÃĪ raakoihin syvyyden arvoihin.
3D-palapelitehtÃĪvÃĪ koulutetaan RGB-D-kuvilla ScanNet-tietokannasta, kÃĪyttÃĪen 300 000 nÃĪytettÃĪ, jotka on luotu valitsemalla satunnaisia joukkoja kuudesta syvyyden pisteestÃĪ per kuva.

Pilvipalasten esimerkkejÃĪ ScanNet-tietokannasta, joita kÃĪytetÃĪÃĪn 3D-palapelissÃĪ. LÃĪhde: https://arxiv.org/pdf/1702.04405
Kunkin pisteen on oltava 0,1 ja 10 metrin syvyyden vÃĪlillÃĪ, ja edistÃĪÃĪkseen monimuotoisuutta, ei kaksi pistettÃĪ joukossa saa olla lÃĪhempÃĪnÃĪ kuin 40 pikseliÃĪ kuvataulurilla tai vÃĪhintÃĪÃĪn 0,2 metriÃĪ syvyyssuunnassa.
Kokeet
Alkuvaiheen kokeissa kÃĪytettiin Qwen2.5-VL-7B-Instruct perusmultimodaalisena mallina. Koulutus kÃĪytti RyhmÃĪn suhteellisen politiikkaoptimointi (GRPO) -algoritmiÃĪ, josta poistettiin sekÃĪ KL-sÃĪÃĪntÃķistys ettÃĪ entropiahÃĪviÃķ.
Osittaisille ennusteille sovellettiin 0,2 alennuskerrointa. Kuva-palapeli koulutus kÃĪytti globaalia erÃĪkoko 256, kun taas video- ja 3D-palapelit kÃĪyttivÃĪt 128. Oppimisnopeus asetettiin 1Ã10âŧâķ.
Kunkin kysymyksen kohdalla malli tuotti 16 vastausta dekoodauslÃĪmpÃķtilassa 1,0. SekÃĪ kuva- ettÃĪ video-palapelit koulutettiin 1 000 askelta, kun taas 3D-palapeli koulutettiin 800 askelta.
Kuva-palapeli
Kuva-palapeli malli testattiin kolmessa visuaalisen keskittyneiden benchmark-luokassa: hienojakoinen havainto ja ymmÃĪrtÃĪminen, MMVP, hienojakoinen havainnon alijoukko MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; ja OVD-Eval.
Monokulaarisen spatiaalisen ymmÃĪrtÃĪmisen osalta benchmarkit olivat VSR; OmniSpatial; ja Depth Anything V2 (DA-2K). Kompositionaalisen visuaalisen ymmÃĪrtÃĪmisen osalta kokeet kÃĪyttivÃĪt Winoground ja SugerCrepe++.
Kolme vertailukohtaa testattiin, kaikki perÃĪisin Qwen2.5-VL-7B:stÃĪ: ThinkLite-VL multimodaaliselle pÃĪÃĪttelylle; VL-Cogito yleisille visuaalisille ja tieteellisille tehtÃĪville; ja LLaVA-Critic-R1 kuvahavainnolle.
Kaikki ne arvioitiin lyhyillÃĪ vastauksilla, koska ketjuajattelupÃĪÃĪttely (CoT) -pÃĪÃĪttely joskus vÃĪhensi suorituskykyÃĪ.

Arviointitulokset kuva-benchmarkkeissa: Kuva-palapeli paransi Qwen2.5-VL-7B-pohjalinjaa kaikissa tehtÃĪvÃĪnluokissa (ts. hienojakoinen havainto ja ymmÃĪrtÃĪminen; monokulaarinen spatiaalinen ymmÃĪrtÃĪminen; ja kompositionaalinen visuaalinen pÃĪÃĪttely), ylittÃĪen aiemmat jÃĪlkikoulutusvertailukohteet.
Kuva-palapelin tuloksista, jotka on nÃĪytetty yllÃĪ, kirjoittajat toteavat:
â[YllÃĪ oleva kuva] osoittaa, ettÃĪ menetelmÃĪmme parantaa johdonmukaisesti visuaalisia kykyjÃĪ kolmessa benchmark-luokassa. NÃĪmÃĪ tulokset vahvistavat, ettÃĪ kuva-palapelin jÃĪlkikoulutus parantaa merkittÃĪvÃĪsti MLLM:ien havainnollista perustaa ja hienojakoinen visuaalista ymmÃĪrtÃĪmistÃĪ jÃĪlkikoulutusstrategioiden ulottumattomissa.â
âMeidÃĪn nÃĪkemys on, ettÃĪ nÃĪmÃĪ parannukset johtuvat siitÃĪ, ettÃĪ kuva-palapelin ratkaiseminen vaatii mallilta paikallisten palojen yksityiskohtien huomioimista, globaalin spatiaalisen asettelun johtamista ja palojen vÃĪlisen suhteen pÃĪÃĪttelyÃĪ, mikÃĪ suoraan hyÃķdyttÃĪÃĪ hienojakoinen, spatiaalista ja kompositionaalisista ymmÃĪrtÃĪmistÃĪ.â
Video-palapeli
Video-palapelin arvioinnissa kÃĪytettiin AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; ja CVBench.
Video-R1 kÃĪytettiin vertailukohtana, joka oli koulutettu kylmÃĪllÃĪ kÃĪynnistyksellÃĪ valvotulla hienosÃĪÃĪtÃķllÃĪ videojen ymmÃĪrtÃĪmisen ja pÃĪÃĪttelyn vahvistusoppimisella. TÃĪssÃĪ tapauksessa arvioinnit sisÃĪlsivÃĪt koko pÃĪÃĪttelyprosessin, koska se tuotti johdonmukaisesti parempia tuloksia kuin suorat vastaukset.
Kaikki mallit rajoitettiin 256x28x28 pikseliin, ja ne testattiin kolmessa eri kehysasetuksessa â 16, 32 ja 64:

Arviointitulokset video-benchmarkkeissa, joissa Video-palapeli ylitti vertailukohdan johdonmukaisesti kaikissa tehtÃĪvissÃĪ ja kehysasetuksissa.
Video-palapeli tuotti johdonmukaisia parannuksia kaikissa videoymmÃĪrtÃĪmisen benchmarkkeissa ja kehysasetuksissa, erityisesti vahvoja parannuksia tehtÃĪvissÃĪ, jotka vaativat ajallista pÃĪÃĪttelyÃĪ ja suunnan mÃĪÃĪritystÃĪ, kuten AoTBenchissÃĪ, ja myÃķs videojen vÃĪlisten suhteiden ymmÃĪrtÃĪmistÃĪ, kuten CVBenchissÃĪ:
âNÃĪmÃĪ tulokset vahvistavat, ettÃĪ video-palapelin ratkaiseminen auttaa mallia ymmÃĪrtÃĪmÃĪÃĪn paremmin ajallista jatkuvuutta, ymmÃĪrtÃĪmÃĪÃĪn suhteita videoiden vÃĪlillÃĪ, pÃĪÃĪttÃĪmÃĪÃĪn suunnan jatkuvuudesta ja yleistÃĪmÃĪÃĪn holistisiin ja yleispÃĪteviin videoymmÃĪrtÃĪmisen tilanteisiin.â
3D-tiedot
3D-modaalissa malli arvioitiin SAT-Real; 3DSRBench; ViewSpatial; All-Angles; edellÃĪ mainittu OmniSpatial; VSI-Bench; SPARBench (tiny); ja edellÃĪ mainittu DA-2K.

Arviointitulokset 3D-benchmarkkeissa: 3D-palapeli paransi suorituskykyÃĪ syvyyden vertailutehtÃĪvissÃĪ, kuten DA-2K, sekÃĪ laajemmissa 3D-havainnointibenchmarkkeissa, jotka kattavat yksinÃĪisen nÃĪkymÃĪn, moninÃĪkymÃĪn ja egosentrisen videon syÃķtteet.
TÃĪssÃĪ kirjoittajat toteavat:
â[3D] -palapeli saavuttaa merkittÃĪviÃĪ parannuksia kaikissa benchmarkkeissa. Odottamattomasti, suurin voitto on DA-2K: ssÃĪ, syvyyden arviointibenchmarkissa, joka on suoraan liitetty meidÃĪn syvyyden jÃĪrjestyksen esikoulutustehtÃĪvÃĪÃĪn. LisÃĪksi havaitsemme johdonmukaisia parannuksia laajalla valikoimalla muita tehtÃĪviÃĪ, mukaan lukien ne, joissa on yksinÃĪinen nÃĪkymÃĪ (esim. 3DSRBench, [OmniSpatial]), moninÃĪkymÃĪ (esim. ViewSpatial, All-Angles) ja egosentriset videon syÃķtteet (esim. VSI-Bench).
âNÃĪmÃĪ tulokset osoittavat, ettÃĪ lÃĪhestymistapamme opettaa mallille ei vain tietyn taidon, syvyyden jÃĪrjestyksen, vaan myÃķs vahvistaa yleisesti mallin kykyÃĪ havainnoida ja pÃĪÃĪttÃĪÃĪ 3D-avaruudellisesta rakenteesta.â
JohtopÃĪÃĪtÃķs
MitÃĪ ei ole tÃĪysin selvÃĪÃĪ tÃĪstÃĪ tutkimuksesta, on tarkka suhde kuvien ja kuvausten vÃĪlillÃĪ, joka mahdollistaa tÃĪmÃĪn parannuksen MLLM:ien suorituskyvyssÃĪ.
EnsimmÃĪisellÃĪ silmÃĪyksellÃĪ palapelien ratkaisemisen prosessi nÃĪyttÃĪÃĪ hyvin vastaavan omaa varhaiskauden kehitystÃĪmme. Kuitenkin lÃĪhempi tarkastelu tutkimuksesta paljastaa, kuinka kieli toimii MLLM:ille siltaa visuaalisen ja semanttisen todellisuuden vÃĪlillÃĪ.
Â
* Huomaa, ettÃĪ tutkimuksen kirjoittajat suosittelevat vÃĪhemmÃĪn yleistÃĪ termiÃĪ âMultimodaalinen suuri kielen malliâ, jota lyhennetÃĪÃĪn âMLLMâ. TÃĪmÃĪ on kehittyvÃĪ tai harvoin kÃĪytetty termi, joka koskee malleja, jotka voivat laajasti pÃĪÃĪttÃĪÃĪ ja analysoida kuvia spatiaalisesti, mutta eivÃĪt luo kuvia. Koska uudet paradigmat ja mallit kehittyvÃĪt, tÃĪmÃĪ sanasto on jatkuvasti revisioitavana.
Julkaistu torstaina, 2. lokakuuta 2025












