AI-modeller og plattformer

AI-modeller snubler over grunnleggende klokkelesing mens mennesker excellerer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En omfattende studie som testet 11 ledende AI-modeller mot mennesker i å lese analoge klokker, har avdekket en overraskende svakhet i nåværende kunstig intelligenssystemer. Mens mennesker oppnådde 89,1% nøyaktighet i å fortelle tid, klarte Googles beste modell bare 13,3% nøyaktighet på samme test.

ClockBench-studien, utført av forsker Alek Safar, demonstrerer at selv de mest avanserte AI-systemene sliter med visuelle oppgaver som de fleste mennesker behersker som barn. Benchmarket testet systemer fra Google (GOOGL ), OpenAI, Anthropic og andre større AI-laboratorier ved hjelp av 180 spesialdesignede analoge klokker.

Dette går langt utenfor klokker. Resultatene understreker fundamentale begrensninger i hvordan AI-systemer prosesserer og resonerer om visuell informasjon. “Å lese analoge klokker setter en høy standard for å gjøre resonnement innen visuelt rom,” merker Safar i forskningsrapporten. Oppgaven krever at modellene identifiserer klokkehender, forstår deres relasjoner og oversetter visuell posisjonering til numerisk tid.

Forskjellen i ytelse blir enda mer slående når man undersøker feilmønster. Når mennesker gjorde feil, var medianfeilen bare tre minutter. AI-modellene, på den andre siden, gikk glipp av målet med en til tre timer – omtrent ekvivalent med tilfeldig gjettning på en 12-timers klokke.

Spesifikke svakheter avdekket

AI-systemer hadde spesielt vanskeligheter med:

  • Romerske tall (3,2% nøyaktighet)
  • Speilvendte eller bakovervendte klokkeansikter
  • Fargerike bakgrunner eller komplekse design
  • Klokker med sekundvisere som krever nøyaktige lesninger

Interessant nok, når AI-modellene lyktes i å lese en klokke, utførte de godt på oppfølgingsoppgaver som å legge til tid eller konvertere tidszoner. Dette tyder på at den grundleggende utfordringen ligger i den innledende visuelle gjenkjenningen, snarere enn matematisk resonnement.

Bransjens ytelsesoppdeling

Googles modeller ledet pakken, med Gemini 2.5 Pro som oppnådde 13,3% nøyaktighet og Gemini 2.5 Flash som nådde 10,5%. OpenAI’s GPT-5 scoret 8,4%, mens Anthropics Claude-modeller utførte lavere, med Claude 4 Sonnet på 4,2% og Claude 4.1 Opus på 5,6%.

xAI’s Grok 4 viste overraskende dårlige resultater med 0,7% nøyaktighet, selv om dette skyldtes at modellen feilaktig markerte 63% av alle klokker som viste umulige tider, når bare 20,6% faktisk gjorde det.

Kilde: Alek Safar

VIDERE Implikasjoner for AI-utvikling

Studien bygger på “lett for mennesker, vanskelig for AI”-benchmark-tilnærmingen som ses i tester som ARC-AGI og SimpleBench. Mens AI-systemer raskt har erobret kunnskapsintensive oppgaver og sogar overgått menneskelig ytelse på mange standardiserte tester, forblir grunnleggende visuelt resonnement problematisk.

Forskningen tyder på at nåværende skaleringsmetoder kanskje ikke løser visuelt resonnementutfordringer. Safar hypotetiserer at analoge klokker kan være underrepresentert i treningsdata og at oversettelse av visuelle klokkepresentasjoner til tekst for resonnement skaper ytterligere komplikasjoner.

ClockBench slutter seg til en voksende samling av benchmark-tester designet for å identifisere AI-begrensninger som ikke er umiddelbart åpenbare fra ytelse på tradisjonelle tester. Den fullstendige datasetten forblir privat for å forhindre forurensning av fremtidig AI-trening, med bare små prøver offentliggjort for testing.

Resultatene reiser spørsmål om hvorvidt eksisterende AI-utviklingsparadigmer kan håndtere disse visuelle resonnementsgapene eller om helt nye tilnærminger vil være nødvendige – lik hvordan test-tid-komputering låste fremgang i andre domener.

For nå står den enkle analoge klokken som en uventet festning mot kunstig intelligens, lesbar av nesten alle mennesker, men forvirrende for verdens mest avanserte AI-systemer.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.