Andersonin kulma
Jopa uusimmat kielen mallit kärsivät vaikeuksista ymmärtäessään aikalogiikkaa

Tulevaisuuden tilojen ennustaminen on tärkeä tehtävä tietokoneen näköalalla – etenkin robotiikassa, jossa on otettava huomioon todelliset maailman tilanteet. Konenäöjärjestelmiin, joille on annettu kriittisiä tehtäviä, tarvitaan riittävä ymmärrys fyysisestä maailmasta.
Kuitenkin joissakin tapauksissa näennäisesti vaikuttava tietämys aikarealiudesta voi olla petollinen: Yhdistyneiden arabiemiirikuntien uusi tutkimus on osoittanut, että jopa uusimmat monimodaaliset suurkielen mallit (MLLM), mukaan lukien alan johtajat GPT-4o ja Google Gemini, epäonnistuvat ajan esittämisessä kuvissa.
Esimerkiksi järjestetyt parit (ks. kuva alla), jotka olisivat ihmisille haasteettomia, vaikka ne olisivat väärässä järjestyksessä, voivat hämätä edistyneitä MLLM: iä, kun ne esitetään odottamattomissa yhteyksissä tai kokoonpanoissa (kuten toisen kuva ensin, yhdistetty yhteen kuvaan, useita peräkkäisiä kuvia, jotka saattavat tai eivät voi edustaa oikeaa aikajärjestystä jne.).

Yhdestä uudesta tutkimuksesta kokoitetuista tietojoukoista, jotka esittävät peräkkäisiä tapahtumia muodossa “ennen ja jälkeen” -kuvia. Tutkijat ovat tehneet tämän datan saataville osoitteessa https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer
Tutkijat antoivat mallien suorittaa perustason aikalogisen päättelyn haasteita, kuten määrätä tapahtumien järjestys tai arvioida aikavälejä, ja totesivat, että seitsemän testattua MLLM: ää suorittivat huomattavasti huonommin kuin ihmiset:
’Yleisesti ottaen tulokset osoittavat, että kaikki nykyiset MLLM: t, mukaan lukien GPT-4o – johtava malli arviointissamme – kärsivät ehdotetusta vertailuarviosta. Vaikka GPT-4o: n suorituskyky on muita malleja parempi, se ei kykene johdonmukaisesti osoittamaan tarkkaa aikalogista päättelyä eri asetelmissa.’
’Mallien johdonmukaiset oikeat lukemat ovat huomattavasti alhaiset, osoittaen merkittäviä rajoituksia niiden kyvyssä ymmärtää ja tulkita aikajärjestyksiä visuaalisista syötteistä. Nämä puutteet ovat ilmeisiä jopa silloin, kun malleille annetaan monikuvasyöte tai optimoidut ohjeet, mikä viittaa siihen, että nykyiset arkkitehtuurit ja koulutusmenetelmät eivät ole riittäviä vankkaan aikajärjestyksen ymmärtämiseen.’
Konenäköjärjestelmien on suunniteltu optimoimaan tarkimmat, mutta myös tehokkaimmat ja ihmisten mieltä miellyttävät tulokset*. Koska ne eivät paljasta päätöksentekoaan selvästi, voi olla vaikea sanoa, milloin ne pettävät tai käyttävät ’lyhyitä polkuja’.
Joskus MLLM saattaa saada oikean vastauksen väärän menetelmän avulla. Se, että vastaus voi olla oikein, saattaa inspiroida väärää luottamusta malliin, joka voi tuottaa virheellisiä tuloksia samalla menetelmällä myöhemmissä tehtävissä.
Pahimmassa tapauksessa tämä harha voi muodostua entistä syvemmmäksi kehitysketjuun, jos ihmiset ovat vaikuttuneita siitä ja antavat positiivista palautetta kokeissa ja annotaatioistunnissa, jotka voivat vaikuttaa siihen, mihin suuntaan data ja / tai malli voivat mennä.
Tässä tapauksessa ehdotetaan, että MLLM: t ’tekevät näytön’ aikajärjestyksen todellisesta ymmärtämisestä ja aikafenomenologisista ilmiöistä havainnoimalla ja ankkuroimalla toissijaisiin osoittimiin (kuten esimerkiksi aikaleimoihin videodataa, kuvien järjestykseen tai jopa – potentiaalisesti – peräkkäin numeroituihin tiedostonimiin).
Se osoittaa myös, että MLLM: t eivät tyydytä minkään todellisen aikafenomenologisen käsitteen yleistymisen määritelmälle – ainakin siinä määrin kuin ihmiset voivat.
Uusi tutkimus tutkimus on nimeltään Voivatko monimodaaliset MLLM: t tehdä visuaalista aikalogista ymmärtämistä ja päättelyä? Vastaus on ei!, ja se tulee kolmelta tutkijalta Mohamed bin Zayedin yliopistosta ja Alibaba International Digital Commercesta.
Data ja testit
Tutkijat huomauttavat, että aiemmat vertailuarviot ja tutkimukset, kuten MMMU ja TemporalBench, keskittyvät yksittäisiin kuvasyötteisiin tai muotoilevat kysymyksiä MLLM: lle, jotka saattavat olla liian helppoja vastata, eivätkä ne välttämättä paljasta taipumusta ’lyhyiden polkujen’ käyttöön.
Siksi tutkijat tarjoavat kaksi päivitettyä lähestymistapaa: Aikajärjestyksen ymmärtäminen (TOU) ja Aikavälin arviointi (TLE). TOU-lähestymistapa testaa mallien kykyä määrätä oikea tapahtumien järjestys videoframe-pareista; TLE-menetelmä arvioi MLLM: n kykyä arvioida aikaväliä kahden kuvan välillä, vaihdellen sekunteista vuosiin.

Tutkimuksesta, TemporalVQA-benchmarkin kaksi päätehtävää: aikajärjestyksen ymmärtämisessä malli päättää, kumpi kahdesta kuvasta esittää ensin tapahtuneen tapahtuman; aikavälin arvioinnissa malli arvioi, kuinka paljon aikaa on kulunut kahden kuvan välillä, valitsemalla vaihtoehtoja, mukaan lukien sekunnit, minuutit, päivät tai vuodet. Nämä tehtävät pyrkivät testaamaan, miten hyvin MLLM: t voivat päättää ajan ja visuaalisten tapahtumien järjestyksestä. Lähde: https://arxiv.org/pdf/2501.10674
Tutkijat keräsivät 360 kuvaparia TOU-benchmarkille käyttäen avoimia lähteitä Pixabaysta ja Pexelsista, jotta datasetin voisi tehdä saataville GUI: n kautta.
Videot kattoivat laajan aihealueen, alkaen ihmisistä arkipäivän toimissa ja päättyen ei-ihmisperäisiin sisältöihin, kuten eläimiin ja kasveihin. Niistä valittiin kuvapareja, jotka esittivät tapahtumien järjestystä tarpeeksi suurella vaihtelulla, jotta alkuperäinen kehyksen voitiin tehdä ’selkeäksi’.
Ihmisten valinta käytettiin varmistamaan, että kehykset voitiin määrätä selkeästi. Esimerkiksi yksi kokoamista kuvaparista esittää osittain täytetyn teekupin yhdessä kehyksessä ja saman kupin täysin täytetyn teellä seuraavassa kehyksessä, mikä tekee järjestyslogiikan helppoonäköiseksi.

Aikalogiikkaa näissä kahdessa kuvassa ei voida välttää, koska teetä ei voi imeskellä takaisin suuttimen kautta.
Tällä tavoin saatiin 360 kuvaparia.
TLE-lähestymistavalle valittiin tekijänoikeuksitta kuvia Googlesta ja Flickrista sekä valittuja kehyksiä tekijänoikeuksittomista videoista YouTubesta. Videoiden aiheina olivat kohtauksia tai esineitä, joiden muutoksen väliaika vaihteli sekunneista päiviin ja vuodesta toiseen – esimerkiksi kypsyvää hedelmää tai vuodenaikojen muutosta maisemissa.
Näin ollen 125 kuvaparia kokoamista TLE-menetelmälle.
Kaikki testatut MLLM: t eivät pystyneet käsittelemään useita kuvia; siksi testit erosivat jokaisen mallin kykyjen mukaan.
Useita versioita kokoamista tietojoukoista luotiin, joissa joitakin kuvapareja yhdistettiin pystysuoraan ja toisia vaakasuoraan. Lisäksi joitakin muunnelmia, joissa oikea aikajärjestys kuvapareissa vaihdettiin.
Kaksi ohjeiden tyyppiä kehitettiin. Ensimmäinen seurasi tätä kaavaa:
Kumpi tapahtuma (vasen / ylä / ensimmäinen) kuvassa tapahtui ennen tapahtumaa (oikea / ala / toinen) kuvassa? Vastaa tosi tai epätosi ja perustelut.
Toinen seurasi tätä kaavaa:
Kumpi kuva esittää tapahtuman, joka tapahtui ensin? Vastaa (vasen tai oikea / ylä tai ala / ensimmäinen tai toinen) ja perustelut.
TLE: ssä kysymykset olivat monivalintaisia, joissa mallien tuli arvioida aikaväliä kahden esitetyn kuvan välillä, ja sekunnit, tunnit, minuutit, päivät, kuukaudet ja vuodet olivat saatavilla aikayksikköinä. Tässä konfiguraatiossa uusin kuva esitettiin oikealla.
Ohje, jota käytettiin tässä, oli:
Arvioi aika, joka on kulunut ensimmäisen (vasen) ja toisen (oikea) kuvan välillä.
Valitse yksi seuraavista vaihtoehdoista:
-
Alle 15 sekuntia
B. 2-15 minuuttia
C. 1-12 tuntia
D. 2-30 päivää
E. 4-12 kuukautta
F. Yli 3 vuotta
Testatuista MLLM: stä olivat ChatGPT-4o; Gemini1.5-Pro; LlaVa-NeXT; InternVL; Qwen-VL; Llama-3-vision; ja LLaVA-CoT.
Aikajärjestyksen ymmärtäminen: Tulokset

Aikajärjestyksen ymmärtämisen tulokset eri malleille ja kuvakokoonpanoille, osoittaa tarkin ja johdonmukaisen suorituskyvyn eri asetelmissa ja ohjeissa.
Koska tulokset yllä mainituissa, tutkijat totesivat, että kaikki testatut MLLM: t, mukaan lukien GPT-4o (joka osoitti parhaimman yleissuorituskyvyn), kärsivät merkittävästi TemporalVQA-benchmarkista – ja jopa GPT-4o epäonnistui johdonmukaisesti osoittamasta luotettavaa aikalogista päättelyä eri asetelmissa.
Tutkijat väittävät, että MLLM:ien johdonmukainen alhainen tarkkuus osoittaa merkittäviä puutteita niiden kyvyssä tulkitsemaan ja ymmärtämään aikajärjestyksiä visuaalisista syötteistä. Tutkijat huomauttavat, että nämä haasteet jatkuvat jopa silloin, kun malleille annetaan monikuvasyöte tai optimoidut ohjeet, mikä viittaa siihen, että nykyiset arkkitehtuurit ja koulutusmenetelmät eivät ole riittäviä vankkaan aikajärjestyksen ymmärtämiseen.
Testit osoittivat merkittäviä eroja suorituskyvyssä eri ohjeiden strategioiden välillä. Vaikka GPT-4o paransi optimoiduilla ohjeilla (saavuttaen 4 % yksittäisissä kuvissa ja 65,3 % monikuvaisissa asetelmissa), suorituskyky säilyi hyväksytyn tason alapuolella.
Mallit, kuten LLaVA-NeXT ja Qwen-VL, olivat vielä herkempiä, ja niiden suorituskyky laski, kun vaihtoehtoisia ohjeita käytettiin, mikä viittaa siihen, että ohjeiden suunnittelun parantaminen yksin ei voi ylittää MLLM:ien perustavanlaatuisia rajoituksia aikalogisen päättelyn suhteen.
Testit osoittivat myös, että kuvien asettelu (ts. pysty- tai vaakasuora) vaikuttaa merkittävästi mallien suorituskykyyn. GPT-4o paransi johdonmukaisuuttaan pystysuorilla asetuksilla, nouseva 39,2 %: sta 52,8 %: een; toisaalta jotkut muut mallit, mukaan lukien LLaVA-NeXT, osoittivat vahvoja suunnan suoria taipumuksia, menestyen yhdessä suunnassa, mutta epäonnistuen toisessa.
Tutkimus osoittaa, että nämä epäjohdonmukaisuudet viittaavat riippuvuuteen avaruudellisista vihjeistä, eikä niiden todellisesta aikalogisesta päättelystä tai ymmärtämisestä tapahtumien järjestyksestä tai ajan kulumisesta. Sen sijaan ne näyttävät luottavan kuvien asettelun mukaisiin malleihin tai visuaalisiin piirteisiin, kuten niiden sijaintiin tai suuntautumiseen, tehdäkseen päätöksiä.

Laadulliset testit korostavat GPT-4o: n ennusteita, kun se kohtaa eri syötteen järjestyksiä. Ensimmäisessä järjestyksessä kuvaparit esitetään alkuperäisessä järjestyksessä, kun taas toisessa järjestyksessä järjestys on käänteinen. Oikeat luokittelut on merkitty vihreällä, puhdas virheluokittelu punaisella, harhauttava päättely oranssilla ja illogical tai ’epävalidi’ päättely ruskealla, paljastaen mallin epäjohdonmukaisuudet eri syötteen konfiguraatioissa.
Vertailutestit yksittäisen ja monikuvan syötteen välillä osoittivat rajatun yleisen parannuksen, GPT-4o suorittaen hieman paremmin monikuvaisessa syötteessä, nouseva 31,0 %: sta 43,6 %: een (P1: llä) ja 46,0 %: sta 65,3 %: een (P2: llä).
Muut mallit, kuten InternVL, osoittivat vakaan mutta alhaisen tarkin, kun taas Qwen-VL näki vähäisiä voittoja. Tutkijat päättelevät, että nämä tulokset osoittavat, että lisävisuaalinen konteksti ei paranna merkittävästi aikalogista päättelykykyä, koska mallit kamppailevat integroitumaan aikaiset tiedot tehokkaasti.
Ihmistutkimus
Ihmistutkimuksessa kolme kyselyä tehtiin arvioidakseen, miten lähellä parhaiten suoriutunut monimodaalinen MLLM suoriutui verrattuna ihmisten arvioihin.
Ihmiset saavuttivat 90,3 %: n tarkin, ylittäen GPT-4o: n 65,3 %: n tuloksen 25 %: lla. Dataset osoittautui luotettavaksi, vähäisillä ihmisten virheillä ja yhdenmukaisella sopimuksella oikeista vastauksista.

Ihmiskäyttäjien tutkimuksen tulokset ensimmäisestä kierroksesta.
Aikavälin arviointi: Tulokset

TLE: n tulokset: aikavälin arviointi arvioi mallien tarkin aikaväleissä kuvaparien välillä, aikaskaalassa sekunteista vuosiin. Tehtävä arvioi kunkin mallin kykyä valita oikea aikaskaala aikavälille.
Näissä testeissä MLLM: t suoriutuivat aikavälin arvioinnissa vain kohtalaisesti: GPT-4o saavutti 70 %: n tarkin, mutta muut mallit suoriutuivat selvästi heikommin (ks. yllä oleva taulukko), ja suorituskyky vaihteli myös merkittävästi eri aikaskaaloissa.
Tutkijat kommentoivat:
’Aikavälin arviointitehtävä testaa MLLM:ien kykyä päätellä aikaväliä kuvaparien välillä. Kaikki MLLM: t, mukaan lukien johtavat suorittajat kuten GPT-4o ja Gemini1.5-Pro, kärsivät tästä tehtävästä, saavuttaen vain kohtalaisen 60-70 %: n tarkin. GPT-4o osoittaa epäjohdonmukaisen suorituskyvyn, vahvaa suorituskykyä sekunneissa ja vuosissa, mutta heikkoa suorituskykyä tunteina.’
’Vastaavasti LLaVA-CoT osoittaa poikkeuksellista suorituskykyä sekunneissa ja päivinä, mutta huonon suorituskyvyn muissa aikaväleissä.’
Ihmistutkimus
Ihmistutkimuksessa aikavälin arvioinnissa keskimääräinen ihmisen suorituskyky ylitti GPT-4o: n (parhaimman suoriutuneen mallin) 12,3 %: lla.
Tutkijat huomauttavat, että jotkut haasteista olivat erityisen haastavia, ja yhdessä tapauksessa kaikki ihmiset antoivat väärän vastauksen, kuten myös kaikki AI-osallistujat.
Tutkijat päättelevät, että GPT-4o osoittaa ’kohtalaisen vankkaa päättelykykyä, huolimatta siitä, mihin järjestykseen kuvat esitetään.
Johtopäätös
Jos MLLM: t lopulta kokoavat ja omaksuvat riittävästi ’lyhyiden polkujen’ tietoja, jopa haastavimpien haasteiden käsittelyyn, jota tämän tutkimuksen tekijät esittävät, voi tulla kyseenalaiseksi, kehittävätkö ne lopulta inhimillistä yleistymiskykyä tässä alueessa.
Ei myöskään ole tiedossa, miten saamme itse kykymme aikalogiseen päättelyyn – ’huijaamme’ko mekin, kunnes oppimamme kokemus paljastaa mallin, joka toimii ’vaiston’ kaltaisena tämänkaltaisten testien suhteen?
* Tutkijoiden näkökulmasta, jossa mallit ovat yhä enenevissä määrin optimoituja menetelmillä, joihin on vaikuttanut ihmisten palautetta, ja jotka on tehokkaasti optimoitu ihmiskokeilla ja seuranneella triagella.
Julkaistu ensimmäisen kerran maanantaina, 27. tammikuuta 2025












