Andersons vinkel

Selv de mest avanserte språkmodellene har vanskeligheter med å forstå temporale logiske sammenhenger

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Variation on ChatGPT-4o prompt: ‘1792px x 1024px photorealistic HQ image of a robot looking at a computer screen. On the screen is a picture of a chicken and an egg. The image should not be cartoon-ish, or illustration-like, but should look like a still from a high-budget Hollywood movie’

Å forutsi fremtidige tilstander er en kritisk oppgave i datavisjonsforskning – ikke minst i robotikk, der virkelige situasjoner må tas i betraktning. Maskinlæringsystemer som er betrodd med kritiske oppgaver, må derfor ha en tilstrekkelig forståelse av den fysiske verden.

Men i noen tilfeller kan en tilsynelatende imponerende kunnskap om temporale realiteter være bedragelig: en ny rapport fra De forente arabiske emirater har funnet at selv de mest avanserte multimodale språkmodellene (MLLMs), inkludert bransjeledere som GPT-4o og Google Gemini, har vanskeligheter med å tolke hvordan tid representeres i bilder.

Eksempler på sekvensielle par (se bildet under), som ville være enkle for mennesker selv når de er i feil rekkefølge, kan forvirre avanserte MLLMs når de presenteres i uventede sammenhenger eller konfigurasjoner (slik som andre-bilde-først, konkatenerer til enkeltbilder, sekvensielle multiple bilder som kan eller ikke kan representere den korrekte temporale rekkefølgen, og så videre).

Eksempler fra en av datasettene som er samlet inn for den nye studien, som viser sekvensielle hendelser. Forskerne har gjort denne data tilgjengelig på https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Eksempler fra en av datasettene som er samlet inn for den nye studien, som viser sekvensielle hendelser i form av ‘før og etter’ bilder. Forskerne har gjort denne data tilgjengelig på https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Forskerne ga modellene enkle temporale resonneringsutfordringer, som å bestemme hendelsesrekkefølge eller estimere tidsintervaller, og fant at de syv MLLMs som ble testet, hadde en betydelig lavere nøyaktighet enn mennesker:

‘Samlet sett viser resultatene at alle nåværende MLLMs, inkludert GPT-4o – den mest avanserte modellen i vår evaluering – har vanskeligheter med den foreslåtte benchmarken. Til tross for GPT-4os overlegen ytelse i forhold til andre modeller, klarer den ikke å konsistent demonstrere nøyaktig temporalt resonnering over forskjellige innstillinger.’

‘De konsistente nøyaktighetspoengene er betydelig lave for alle modeller, og indikerer betydelige begrensninger i deres evne til å forstå og tolke temporale sekvenser fra visuelle innputt. Disse svakhetene er åpenbare selv når modellene får multi-bilde innputt eller optimaliserte promter, og antyder at nåværende arkitekturer og treningsmetoder er utilstrekkelige for robust temporalt rekkefølgeforståelse.’

Maskinlæringsystemer er designet for å optimalisere til de mest nøyaktige, men også de mest effektive og menneskevennlige resultater*. Ettersom de ikke avslører deres resonnering eksplisitt, kan det være vanskelig å si når de jukser eller bruker ‘gjennomskår’.

I et slikt tilfelle kan MLLM nå det rette svaret ved feil metode. Det faktum at et slikt svar kan være korrekt, kan inspirere feil tryggheit i modellen, som kan produsere feil resultater med samme metode i senere oppgaver som presenteres for den.

Verre enn det, denne feilretningen kan bli enda mer dypt innarbeidet i utviklingskjeden hvis mennesker er imponert over det, og gir positiv tilbakemelding i prøver og annoteringssesjoner som kan bidra til retningen som dataene og/eller modellen måtte ta.

I dette tilfelle antyder det at MLLMs ‘fører’ en sann forståelse av kronologi og temporale fenomener, ved å observere og feste på sekundære indikatorer (slik som tidsstempel, for eksempel, i video data, rekkefølgen av bilder i en layout, eller selv – potensielt – sekvensnummererte filnavn).

Dette antyder videre at MLLMs for tiden ikke tilfredsstiller noen reell definisjon av å ha generalisert et konsept for temporale fenomener – i det minste, i den grad mennesker kan.

Den nye rapporten heter Kan multimodale MLLMs gjøre visuell temporalt forståelse og resonnering? Svaret er nei!, og kommer fra tre forskere ved Mohamed bin Zayed University of Artificial Intelligence og Alibaba International Digital Commerce.

Data og tester

Forskerne bemerker at tidligere benchmark og studier, som MMMU og TemporalBench, konsentrerer seg om enkeltbilde innputt eller formulerer spørsmål for MLLMs som kan være for enkle å svare, og kan ikke avdekke en tendens mot gjennomskår-atferd.

Forskerne tilbyr derfor to oppdaterte tilnærminger: Temporalt rekkefølgeforståelse (TOU) og Tidsintervall-estimering (TLE). TOU-tilnærmingen tester modellene på deres evne til å bestemme den korrekte sekvensen av hendelser fra par av video-rammer; TLE-metoden evaluerer MLLMs evne til å estimere tidsintervallet mellom to bilder, fra sekunder til år.

Fra rapporten, de to hovedoppgavene i TemporalVQA-benchmarken: i Temporalt rekkefølgeforståelse bestemmer modellen hvilket av to bilder som viser en hendelse som skjedde først; i Tidsintervall-estimering estimerer modellen hvor mye tid som har gått mellom to bilder, og velger fra alternativer inkludert sekunder, minutter, dager eller år. Disse oppgavene har til hensikt å teste hvor godt MLLMs kan resonere om tid og sekvens av visuelle hendelser. Kilde: https://arxiv.org/pdf/2501.10674

Fra rapporten, de to hovedoppgavene i TemporalVQA-benchmarken: i Temporalt rekkefølgeforståelse bestemmer modellen hvilket av to bilder som viser en hendelse som skjedde først; i Tidsintervall-estimering estimerer modellen hvor mye tid som har gått mellom to bilder, og velger fra alternativer inkludert sekunder, minutter, dager eller år. Disse oppgavene har til hensikt å teste hvor godt MLLMs kan resonere om tid og sekvens av visuelle hendelser. Kilde: https://arxiv.org/pdf/2501.10674

Forskerne kuraterte 360 bildepar for TOU-benchmarken, ved å bruke åpne kildevideoer fra Pixabay og Pexels, slik at det ville være mulig å gjøre datasettet tilgjengelig via en GUI.

Videoene dekket et bredt spekter av emner, fra mennesker i hverdagsaktiviteter til ikke-menneskelige innhold som dyr og planter. Fra disse ble par av rammer valgt ut for å vise en sekvens av hendelser med tilstrekkelig variasjon til å gjøre start-rammen ‘åpenbar’.

Den temporale logikken i disse to bildene kan ikke unngås, siden teet ikke kan suges tilbake opp i spouten.

Den temporale logikken i disse to bildene kan ikke unngås, siden teet ikke kan suges tilbake opp i spouten.

På denne måten ble 360 bildepar oppnådd.

For TLE-tilnærmingen ble opphavsrettsfrie bilder valgt fra Google og Flickr, samt utvalgte rammer fra opphavsrettsfrie videoer på YouTube. Emnet i disse videoene viste scener eller objekter hvis endringsintervall varierte fra sekunder til dager til år – for eksempel, modning av frukt, eller endring av årstider i landskap.

Således ble 125 bildepar kuratert for TLE-metoden.

Ikke alle MLLMs som ble testet, kunne prosessere multiple bilder; derfor varierte testene for å tilpasse hver modells evner.

Flere versjoner av de kuraterte datasettene ble generert, hvor noen av bildene var konkatenerer vertikalt, og andre horisontalt. Ytterligere variasjoner byttet den sanne og korrekte temporale sekvensen av bildene.

To prompt-typer ble utviklet. Den første fulgte denne malen:

Skjedde hendelsen i (venstre / topp / først) bildet før hendelsen i (høyre / bunn / andre) bildet? Angi sant eller usant med begrunnelse.

Den andre fulgte denne skjema:

Mellom disse to bildene, hvilket ett viser hendelsen som skjedde først? Angi (venstre eller høyre / topp eller bunn / først eller andre) med begrunnelse.

For TLE var spørsmålene flervalg, og spurte modellene om å evaluere tidsintervallet mellom de to presenterte bildene, med sekunder, minutter, timer, dager, måneder og år som tilgjengelige tidsenheter. I denne konfigurasjonen ble det siste bildet presentert på høyre side.

Prompten som ble brukt her, var:

Estimer tiden som har gått mellom det første bildet (venstre) og det andre bildet (høyre).

Velg en av følgende alternativer:

    1. Mindre enn 15 sekunder
      B. Mellom 2 minutter og 15 minutter
      C. Mellom 1 time og 12 timer
      D. Mellom 2 dager og 30 dager
      E. Mellom 4 måneder og 12 måneder
      F. Mer enn 3 år

MLLMs som ble testet, var ChatGPT-4o; Gemini1.5-Pro; LlaVa-NeXT; InternVL; Qwen-VL; Llama-3-vision; og LLaVA-CoT.

Temporalt rekkefølgeforståelse: Resultater

Resultater fra Temporalt rekkefølgeforståelse over forskjellige modeller og innputt-layout, som viser nøyaktighet og konsistens for forskjellige innstillinger og promter.

Resultater fra Temporalt rekkefølgeforståelse over forskjellige modeller og innputt-layout, som viser nøyaktighet og konsistens for forskjellige innstillinger og promter.

Med hensyn til resultatene ovenfor, fant forfatterne at alle testede MLLMs, inkludert GPT-4o (som viste den beste samlede ytelsen), hadde betydelige vanskeligheter med TemporalVQA-benchmarken – og selv GPT-4o klarte ikke å konsistent vise pålitelig temporalt resonnering over forskjellige konfigurasjoner.

Forfatterne hevder at de konsistente lavt nøyaktighetspoengene over MLLMs understreker betydelige svakheter i modellenes evne til å tolke og resonere om temporale sekvenser fra visuelle data. Forskerne bemerker at disse utfordringene består selv med bruk av multi-bilde innputt og optimaliserte promter, og peker på fundamentale begrensninger i nåværende modellarkitekturer og treningsmetoder.

Testene viste betydelige variasjoner i ytelse over prompt-strategier. Mens GPT-4o forbedret seg med optimaliserte promter (nådde 4% i enkeltbilde og 65,3% i multi-bilde innstillinger), forblev ytelsen under akseptable nivåer.

Modeller som LLaVA-NeXT og Qwen-VL var enda mer følsomme, med ytelse som sank når alternative promter ble brukt, og antyder at prompt-ingeniørkunst alene ikke kan overvinne MLLMs fundamentale begrensninger i forhold til temporalt resonnering.

Testene indikerte også at bilde-layout (dvs. vertikal vs. horisontal) hadde en betydelig innvirkning på modell-ytelse. GPT-4o forbedret seg med konsistens med vertikale arrangementer, og steg fra 39,2% til 52,8%; imidlertid viste andre modeller, inkludert LLaVA-variantene, sterke retningsskjevheter, og utmerket seg i en retning, men feilet i en annen.

Rapporten indikerer at disse inkonsistensene antyder avhengighet av romlige hint, fremfor ekte temporalt resonnering, og at MLLMs ikke analyserer sekvensen av hendelser eller forstår fremdriften over tid. I stedet ser det ut til at de har avhengighet av mønster eller visuelle egenskaper relatert til bildets layout, som posisjon eller justering, for å fatte beslutninger.

Kvalitative tester fremhever GPT-4os forutsigelser når de møter forskjellige innputt-rekkefølger. I den første rekkefølgen presenteres bildeparet i deres opprinnelige sekvens, mens i den andre rekkefølgen er sekvensen reversert. Riktige klassifiseringer er merket i grønt, rene mis klassifiseringer i rødt, hallucinerte begrunnelser i oransje, og illogiske eller ‘ugyldige’ begrunnelser i brunt, og avslører modellens inkonsistens over forskjellige innputt-konfigurasjoner.

Kvalitative tester fremhever GPT-4os forutsigelser når de møter forskjellige innputt-rekkefølger. I den første rekkefølgen presenteres bildeparet i deres opprinnelige sekvens, mens i den andre rekkefølgen er sekvensen reversert. Riktige klassifiseringer er merket i grønt, rene mis klassifiseringer i rødt, hallucinerte begrunnelser i oransje, og illogiske eller ‘ugyldige’ begrunnelser i brunt, og avslører modellens inkonsistens over forskjellige innputt-konfigurasjoner.

Sammenligningstester mellom enkeltbilde og multi-bilde innputt viste begrensede forbedringer, med GPT-4o som utførte litt bedre på multi-bilde innputt, og steg fra 31,0% til 43,6% (med P1) og 46,0% til 65,3% (med P2).

Andre modeller, som InternVL, viste stabile, men lave nøyaktighetspoeng. Qwen-VL så mindre gevinster. Forfatterne konkluderer at disse resultater indikerer at ekstra visuell kontekst ikke vesentlig forbedrer modellenes evne til å integrere temporale informasjon effektivt.

Menneskelig studie

I en menneskelig studie ble tre undersøkelser gjennomført for å vurdere hvor nært den beste MLLM (GPT-4o) utførte seg i forhold til menneskelig estimat.

Mennesker oppnådde 90,3% nøyaktighet, og overgikk GPT-4os 65,3% med 25%. Datasettet viste seg å være pålitelig, med minimale menneskelige feil og konsistent enighet om riktige svar.

Resultater fra den menneskelige brukerstudien for den første runden av tester.

Resultater fra den menneskelige brukerstudien for den første runden av tester.

Tidsintervall-estimering: Resultater

Resultater for TLE: tidsintervall-estimering evaluerer modellens nøyaktighet i å identifisere intervaller mellom bildepar, over skalaer fra sekunder til år. Oppgaven evaluerer hver modells evne til å velge riktig tids-skala for det temporale gapet.

Resultater for TLE: tidsintervall-estimering evaluerer modellens nøyaktighet i å identifisere intervaller mellom bildepar, over skalaer fra sekunder til år. Oppgaven evaluerer hver modells evne til å velge riktig tids-skala for det temporale gapet.

I disse testene utførte MLLMs bare tilfredsstillende på tidsintervall-estimering: GPT-4o oppnådde 70% nøyaktighet, men de andre modellene utførte betydelig dårligere (se tabell over), og ytelse varierte også betydelig over forskjellige tids-skalaer.

Forfatterne kommenterer:

‘Oppgaven med tidsintervall-estimering tester MLLMs evne til å inferere temporale intervaller mellom bildepar. [Alle] MLLMs, inkludert topp-utførere som GPT-4o og Gemini1.5-Pro, har vanskeligheter med denne oppgaven, og oppnår bare moderate nøyaktighetsnivåer på 60-70%. GPT-4o viser inkonsistent ytelse, med sterk ytelse på Sekunder og År, men underpresterer på Timer.’

‘Lignende viser LLaVA-CoT eksepsjonell ytelse på tidsintervaller på Sekunder og Dager, mens den viser betydelig dårlig ytelse på andre tidsintervaller.’

Menneskelig studie

I den menneskelige studien for TLE, forbedret den gjennomsnittlige menneskelige ytelsen seg over GPT-4o (den beste MLLM i denne kategorien også) med 12,3%.

Forfatterne bemerker at noen av utfordringene var spesielt krevende, og at i ett tilfelle returnerte alle menneskelige deltakere feil svar, sammen med alle AI-deltakerne.

Forfatterne konkluderer at GPT-4o viser ‘rimelig robust resonneringsevne, til tross for rekkefølgen av bildene som presenteres for den.

Konklusjon

Hvis MLLMs til slutt samler inn og absorberer tilstrekkelig med ‘gjennomskår’-data for å dekke selv de mest utfordrende utfordringene som presenteres i denne studien, kan det bli et punkt hvor det ikke lenger er relevant å diskutere om de har utviklet menneske-lignende generaliserings-evner i dette domenet.

Det er heller ikke kjent nøyaktig hvordan vi selv tilegner oss evnen til temporalt resonnering – gjør vi også ‘jukser’ til vi har lært oss nok erfaring som avslører et mønster som fungerer som ‘instinkt’ i forhold til denne type test?

 

* Fra synspunktet at modeller blir stadig optimert med tap-funksjoner som menneskelig tilbakemelding har bidratt til, og effektivt optimert av menneskelige prøver og påfølgende triage.

Først publisert mandag, 27. januar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai