Andersonin kulma
Tekoäly, joka käyttää kuvia Chain-of-Thought-päättelyssä (CoT)

Ajattelemme usein kuvina – ainakin useimmat meistä: ihmisillä heikentynyt kyky visuaaliseen kuvitteluun on tutkimuksissa yhdistetty heikompaan koulumenestykseen. Muistamisen kannalta – siis tarpeemme muistaa asioita, ei tekoälyn pelättyä ongelmaa – vahvojen tai elävien mielikuvien huomattavaa semanttista voimaa on käytetty vuosituhansien ajan oppimisen tukena:

Emma Willardin ”Temple of Time” (1846), opetuksellinen visualisointi, joka muuttaa kronologian fyysiseksi tilaksi ja järjestää historialliset ajanjaksot ja henkilöt syvyyteen vetäytyvään arkkitehtoniseen perspektiiviin. Willard suunnitteli tällaisia kuvia visuaalisiksi muistituiksi, sillä hän uskoi graafisten esitysten auttavan oppilaita muodostamaan historiasta johdonmukaisen mielikuvan. Lähde
Muistitekniikat koskevat kuitenkin tiedon omaksumista eivätkä sen käsittelyä tai tulkintaa, joissa ihmisten käyttämät ajattelutyylit vaihtelevat huomattavasti.
Itse ajattelen muotoina ja olen tehnyt niin niin kauan kuin olen ajatellut: vuosikymmenet, vuodet, ideat ja ihmiset näyttäytyvät minulle jollakin tavoin suhteellisena geometriana ja dynaamisina tilavuuslohkoina. Toiset ajattelevat ensisijaisesti numeroina, toiset taas hajuina tai makuina.
Tekoälyn mahdollinen synestesiamentelmien kirjo on rajallisempi. Suuri kielimalli (LLM) voi luonnollisesti ajatella tekstinä, sillä se on sen luontainen koodaustyyppi upotusten tason yläpuolella. LLM-mallien on myös osoitettu koodaavan numerot käsitteinä eikä pelkkinä muuttuja-arvoina, mikä osoittaa taipumusta ”ajatella numeroina”.
Mutta missä määrin LLM:n voidaan sanoa ”ajattelevan muotoina” tai ”ajattelevan kuvina” ihmisten tapaan?
Se, että LLM antaa samaan eri kielillä esitettyyn kysymykseen erilaisia vastauksia, osoittaa näiden suhteiden voivan olla hyvin täsmällisiä ja hauraita sekä kovakoodattuja tiettyyn tekstiin kielialueen – esimerkiksi ”espanjan” – sisällä sen sijaan, että ne koskisivat ylempää aluetta, joka ylittää kielen mutta samalla sisältää sen.*
Siksi multimodaalisella LLM:llä eli näkö- ja kielimallilla (VLM), joka pystyy luomaan kuvia ainoastaan omaa sisäistä ajatusketjuaan varten (Chain of Thought, CoT), voisi loogisesti olla etu tai ainakin kirjaimellisesti vaihtoehtoinen näkökulma.
Uusia näkökulmia
Tätä silmällä pitäen saksalainen tutkimusyhteistyö on esitellyt kuviin keskittyvän ReImaGin-nimisen VLM:n, joka hyödyntää kuvien tuottamista muovautuvana päättelymekanismina.
Vaikka aiemmissa töissä kuvaan perustuvia osia on ”pultattu” järjestelmään, nämä toiminnot eivät olleet luontaisia eivätkä välttämättömiä keskeiselle työnkululle. Tekijöiden uusi järjestelmä on sen sijaan suunniteltu hyödyntämään VLM-mallien aivan viimeisimpiä kykyjä ja korvaamaan erikoistuneiden työkalujen ja menetelmien, kuten syvyyden havaitsemisen, toimintoja.
Alla olevassa esimerkissä, joka on peräisin uudesta tutkimusartikkelista nimeltä Reasoning with Image Generation, tekoälyn täytyy tulkita kahta näkymää – vasemmanpuoleisia kuvia – joista kumpikaan ei sisällä kaikkea tehtävän ratkaisemiseen tarvittavaa tietoa. Malli voi siksi käyttää käytettävissään olevia tietoja rakentaakseen laajemman ja täydellisemmän kuvan tilanteesta: alla kolmantena vasemmalta näkyvän kartan, jonka alaotsikko on ”Generated Visualization”.

Esimerkki uudesta artikkelista: ReImaGin luo kahdesta epätäydellisestä näkymästä ylhäältä katsotun kartan ja antaa mallille yhtenäisen visuaalisen esityksen päättelyn pohjaksi. Lähde
ReImaGin ei ole sidottu yhteen visuaalisen muunnoksen tyyppiin. Se voi täydentää puuttuvia palapelialueita, poistaa peittymiä esineiden laskemiseksi, piirtää liikeratoja törmäysten ennustamista varten, yhdistää useita näkymiä tilakartoiksi, muuttaa katkoviivat yhtenäisiksi seurattaviksi viivoiksi ja luoda syvyyskarttoja syvyyspäättelyyn.
Vielä tärkeämpää on, että järjestelmä voi säädellä tämän sisäisen työkalusarjan käyttöä itse. Tämä vastaa VLM-mallien viimeaikaista kykyä ratkaista tiettyjä haasteita automaattisesti tarkoituksenmukaisilla työkaluilla, kuten syvyyden arvioinnilla. Suurin osa ReImaGinin kuvatuista toiminnoista kutsutaan käyttöön generate_image-työkalulla, joka voi puuttua tilanteeseen visuaalisesti tarvittaessa ilman ihmisen valvontaa tai käynnistystä.
Tekijät toteavat:
”Koska generate_image hyväksyy vapaamuotoisia luonnollisen kielen ohjeita, agentti voi tehdä valtavan määrän muunnoksia. Kysymys on siitä, mikä muunnos todella auttaa tietyssä tehtävässä.”
”[Tavanomainen] käytäntö on määrittää muunnos käsin laadituilla kontekstiesimerkeillä, jotka havainnollistavat haluttua strategiaa – esimerkiksi luoda syvyyskartta syvyyspäättelyä varten. Tämä vaatii käsityötä jokaiseen tehtävään ja rajoittaa yleistymistä uusiin tehtäviin.”
”[Kysymme], voidaanko tällaiset strategiat löytää automaattisesti. Koska strategia välitetään agentille sen kehotteen kautta, strategian löytäminen voidaan palauttaa kehotteen optimointiin: toteutamme iteratiivisen silmukan, jossa ehdotusmalli luo ehdokkaita kehotteiksi, arvioi niitä pienellä kehitysjoukolla ja tarkentaa niitä havaittujen onnistumisten ja epäonnistumisten perusteella.”
Kolmella VLM:llä ja kuudella visuaalisen päättelyn tehtävällä testattu ReImaGin suoriutui yleisesti paremmin kuin sekä ilman apua tehty päättely että erikoistuneet konenäkötyökalut, vaikka käytössä oli vain yksi työkalu.
Lähestymistapa
ReImaGin toimii silmukkana: Jokaisessa vaiheessa VLM tarkastelee kysymystä, alkuperäisiä kuvia ja kaikkea jo tuottamaansa sekä päättää, mitä seuraavaksi tehdään. Tämä voi tarkoittaa tavallista kuvankäsittelyä, kuten rajaamista tai päällekkäin asettamista, tai generate_image-kutsua, joka luo uuden kuvan nimenomaan helpottamaan ongelman päättelyä:

Vaiheittainen kuvaus siitä, miten ReImaGin päättelee tilaongelmia ja visuaalisia pulmia. Molemmissa esimerkeissä malli luo päättelyn aikana uuden kuvan ja käyttää sitä sitten lisäsyötteenä vastaukseen johtavissa seuraavissa vaiheissa.
Luotu kuva syötetään takaisin VLM:lle, jolloin siitä tulee osa seuraavassa päättelyvaiheessa käytettävää aineistoa, ja prosessi voi toistua. Yllä olevassa kuvassa nämä vaiheet näkyvät tilatehtävässä: Malli yhdistää ensin kaksi valokuvaa yhdeksi näkymäksi ja muuntaa tuloksen sitten ylhäältä katsotuksi kartaksi ennen kysymykseen vastaamista.
Palapelitehtävässä se luo muunnellun version palapelistä, joka eristää puuttuvan alueen, ja tunnistaa sitten vastauksen tavanomaisella kuvien vähennyslaskulla.
Näin kuvien tuottamisesta tulee osa itse päättelyprosessia eikä käyttäjälle tarkoitettu lopputuote. Nämä välikuvat onkin tarkoitettu yksinomaan tekoälyn CoT-prosesseihin eikä loppukäyttäjän suoraan tarkasteltaviksi.
Jokaisella kierroksella VLM valitsee itse seuraavan toimintonsa siihen mennessä kertyneen kontekstin perusteella. Toiminto voi olla uusi päättelyvaihe, tavallinen kuvatoiminto tai luonnollisen kielen ohje generate_image-työkalulle. Valitun työkalun palauttama tulos lisätään kontekstiin, jolloin malli voi tarkastaa sen ja päättää, muuntaako se sitä uudelleen, käyttääkö se toista työkalua vai siirtyykö se lopulliseen vastaukseen.
Lisää toimijuutta
Keskeinen ongelma on päättää, millainen kuva todella helpottaisi tiettyä tehtävää. ReImaGin ratkaisee tämän kokeilemalla agentille erilaisia ohjeita, testaamalla ehdokaskehotteita esimerkeillä, joiden vastaukset tunnetaan, ja käyttämällä sekä onnistuneita että epäonnistuneita yrityksiä parempien kehotteiden tuottamiseen. Silmukan lisäkierrokset tuottavat lopulta parhaiten toimivat strategiat.
Päättelymallia ja kuvageneraattoria ei kouluteta prosessin aikana uudelleen. Ainoastaan ohjeita, jotka säätelevät agentin työkalujen käyttöä, optimoidaan. Tutkijat kuvaavat prosessia siksi visuaalisten päättelystrategioiden ”automaattiseksi löytämiseksi”, ilman että he itse tarjoavat tehtäväkohtaisia strategioita tai päättelyesimerkkejä.
Kokoonpano ja testit
ReImaGinia arvioitiin kuudessa visuaalisen päättelyn tehtävässä: syvyyspäättely (Blink – sen tunnistaminen, kumpi kahdesta pisteestä on lähempänä kameraa); palapelin täydentäminen (Mira – oikean palan valitseminen puuttuvalle kuva-alueelle); peittyneiden kohteiden laskeminen (CAPTURe – kohteiden laskeminen piilossa olevat mukaan lukien); törmäyksen ennustaminen (Spatial457 – sen ennustaminen, mihin kohteeseen liikkuva objekti osuu); tilapäättely (MMSI – eri näkymissä olevien kohteiden suhteiden määrittäminen); sekä reitin jäljittäminen, uusi vertailutesti, jossa mallien on seurattava numeroita ja kirjaimia yhdistäviä katkoviivoja.

Huomiota herättäviä esimerkkejä visuaalisista kuvista ajatusketjuprosesseissa artikkelista ”MIRA, a Benchmark for Visual Chain-of-Thought”. Lähde
Testatut VLM-perusmallit olivat Gemini-3.1-Pro, GPT-5 ja avoimien painojen Qwen-3.5-27B. Kuvien tuottamisesta vastasi ensisijaisesti Nano-Banana-Pro, minkä lisäksi testattiin avoimien painojen malleja FLUX.2 [dev] ja Qwen-Image-Edit-2511. Gemini-3.1-Pro toimi valitsijana kuvien tuottamisen testiaikaisessa skaalauksessa.
Kahdesta vertailumenetelmästä tavallinen VLM, jota artikkelin tekijät kutsuivat nimellä ”No Tools”, vastasi suoraan kysymyksen ja kuvien perusteella ilman työkaluja tai koodin suorittamista. Vuonna 2024 esitelty Visual Sketchpad puolestaan tarjosi tässä tapauksessa kiinteän joukon erikoistuneita konenäkö- ja kuvankäsittelytyökaluja, mutta ei avointa kuvien tuottamista.
MMSI-tilatehtävässä molemmille vertailumenetelmille annettiin suunnilleen yhtä paljon laskentatehoa kuin ReImaGinille: Kummastakin tuotettiin 20 vastausta, ja useimmin esiintynyt vastaus valittiin.
Suorituskykyä mitattiin monivalintatarkkuudella kaikissa muissa tehtävissä paitsi peittyneiden kohteiden laskemisessa, jota arvioitiin symmetrisellä keskimääräisellä absoluuttisella prosenttivirheellä vertaamalla ennustettua ja todellista kohteiden määrää. Tulokset laskettiin kolmen ajon keskiarvona, ja myös keskivirhe raportoitiin.

Testitulokset, joissa ReImaGinia verrataan No Toolsiin ja Visual Sketchpadiin kolmella VLM:llä ja kuudessa visuaalisen päättelyn tehtävässä. Suurempi pistemäärä on parempi, paitsi peittyneiden kohteiden laskemisessa, jossa pienempi virhe on parempi. ReImaGin sai parhaan tuloksen useimmissa malli–tehtävä-yhdistelmissä.
Kaikissa kolmessa mallissa käytettiin samoja ihmisten määrittelemiä strategiaesimerkkejä. ReImaGin saavutti useimmissa tehtävissä molempia vertailumenetelmiä paremmat tulokset. Parannukset olivat erityisen selviä palapelin täydentämisessä, peittyneiden kohteiden laskemisessa ja reitin jäljittämisessä.
Esimerkiksi GPT-5:llä palapelitarkkuus nousi No Toolsin 29,5 prosentista ja Visual Sketchpadin 16,7 prosentista 44,9 prosenttiin ReImaGinilla. Ablaatiotestit vahvistivat, että generatiivinen kuvakomponentti on järjestelmän suorituskyvylle välttämätön.
Nano-Banana-Pron tilalla testattiin myös avoimien painojen kuvageneraattoreita. FLUX.2 [dev] ja Qwen-Image-Edit-2511 tuottivat vertailukelpoisia tuloksia joissakin yksinkertaisemmissa tehtävissä, erityisesti inpaintingissa, mutta niiden tulokset vaihtelivat enemmän vaativissa muunnoksissa, kuten syvyyden arvioinnissa ja reitin jäljittämisessä. Samanlaisia tuloksia saatiin, kun VLM:nä käytettiin Qwen-3.5-27B:tä:
![Testitulokset, joissa kuvageneraattoreita verrataan Qwen-3.5-27B:n toimiessa VLM:nä. Nano-Banana-Pro saavutti parhaan tuloksen viidessä tehtävässä kuudesta, kun taas FLUX.2 [dev] ja Qwen-Image-Edit-2511 paransivat tuloksia No Toolsiin verrattuna useissa tehtävissä.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Testitulokset, joissa kuvageneraattoreita verrataan Qwen-3.5-27B:n toimiessa VLM:nä. Nano-Banana-Pro saavutti parhaan tuloksen viidessä tehtävässä kuudesta, kun taas FLUX.2 [dev] ja Qwen-Image-Edit-2511 paransivat tuloksia No Toolsiin verrattuna useissa tehtävissä.
Tekijät tekivät myös laadullisia testejä neljässä tehtävässä:

Neljän tehtävän laadulliset esimerkit osoittavat, miten ReImaGinia käytettiin Gemini-3.1-Pron päättelyn laajentamiseen. Kussakin tapauksessa tuotettuja visuaalisia esityksiä sisällytettiin päättelyprosessiin tehtävän ratkaisemisen tueksi.
ReImaGin ei ollut kaikissa tapauksissa luotettava. Joissakin tilanteissa kuvageneraattori tuotti virheellisen muunnoksen, kuten pohjapiirroksen, jossa kohteet olivat väärissä paikoissa. Toisissa tilanteissa VLM tulkitsi myöhemmin virheellisesti oikein tuotetun kuvan.
120 tuotetun kuvan manuaalisessa tarkastuksessa havaittiin, että 75% oli tehnyt pyydetyn muunnoksen uskollisesti. Kun tämä onnistui, lopullinen vastaus oli oikein 87%:ssa tapauksista, kun taas virheellisen tuotetun kuvan tapauksessa osuus oli 43%.
Tekijät päättelevät:
”Tuloksemme viittaavat kahteen laajempaan päätelmään. Ensinnäkin kuvien tuottaminen voi toimia yleisenä visuaalisen mielikuvituksen mekanismina multimodaalisessa päättelyssä, mikä vähentää tarvetta suunnitella erillinen työkalu jokaista uutta muunnosta varten.”
”Toiseksi tämän lähestymistavan tehokkuus ei riipu vain taustalla olevista malleista vaan myös päättelystrategiasta, jolla päätetään, mitä visualisoidaan ja miten tulosta käytetään.”
”Automaattisen strategian löytämisen tuomat parannukset osoittavat, että mallit voivat hyödyntää visuaalisten muunnosten ymmärrystään löytääkseen olennaisia strategioita ilman ihmisten kirjoittamia tehtäväkohtaisia strategioita tai päättelyesimerkkejä.”
Johtopäätös
Tässä tutkimuksessa tarkastellut itsenäiset päätökset työkalujen käytöstä ovat kiehtova kehitysaskel, etenkin koska VLM-kehitys näyttää muutenkin kulkevan luontevasti tähän suuntaan. On kiinnostavaa nähdä, yltävätkö tällaiset yleiskäyttöiset VLM:t lopulta yhtä hyviin tuloksiin kuin tarkoitukseen suunnitellut työkalut ja kehykset, kuten Segment-ekosysteemi, ja päätyvätkö yksinomaan näitä ”sivutehtäviä” hoitavat käyttämään moukaria pähkinän särkemiseen.
On kuitenkin melko vaikea uskoa, että VLM:t voisivat kehittää tarvittavan kurinalaisuuden ohittaakseen ja säilyttääkseen etumatkan tarkoitukseen suunniteltuihin ratkaisuihin, kuten paikalliseen hienosäätöön, jossa kokonainen malli omistetaan yhdelle tehtävälle ja jää prosessin aikana usein käyttökelvottomaksi muihin tarkoituksiin. Aika näyttää.
* Yksi perusteltavissa oleva määritelmä kuvallisuuden alueelle, jonka opimme kauan ennen minkään kielitaidon omaksumista.
Julkaistu ensimmäisen kerran maanantaina 28. syyskuuta 2026












