AI-modeller och plattformar

AI-modeller har svÃĨrt att lÃĪsa analog klocka medan mÃĪnniskor excellerar

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

En omfattande studie som testar 11 ledande AI-modeller mot mÃĪnniskor i att lÃĪsa analog klocka har avslÃķjat en Ãķverraskande svaghet i nuvarande artificiella intelligenssystem. Medan mÃĪnniskor uppnÃĨdde 89,1% noggrannhet i att ange tid, lyckades Googles bÃĪst presterande modell bara med 13,3% noggrannhet i samma test.

ClockBench-studien, som utfÃķrdes av forskaren Alek Safar, visar att ÃĪven de mest avancerade AI-systemen kÃĪmpar med visuella uppgifter som de flesta mÃĪnniskor behÃĪrskar som barn. Benchmark-testet testade system frÃĨn Google (GOOGL ), OpenAI, Anthropic och andra stora AI-laboratorier med 180 anpassade analog klockor.

Detta gÃĨr utÃķver klockor. Resultaten belyser grundlÃĪggande begrÃĪnsningar i hur AI-system bearbetar och resonerar om visuell information. “Att lÃĪsa analog klocka sÃĪtter en hÃķg standard fÃķr att utfÃķra resonemang inom det visuella utrymmet”, sÃĪger Safar i forskningsrapporten. Uppgiften krÃĪver att modellerna identifierar klockhand, fÃķrstÃĨr deras relationer och ÃķversÃĪtter visuell position till numerisk tid.

Prestandagapet blir ÃĪnnu mer slÃĨende nÃĪr man undersÃķker felmÃķnster. NÃĪr mÃĪnniskor gjorde misstag var det medianfel bara tre minuter. AI-modeller, ÃĨ andra sidan, missade mÃĪrket med en till tre timmar – ungefÃĪr motsvarande slumpmÃĪssigt gissande pÃĨ en 12-timmarsklocka.

Specifika svagheter avslÃķjade

AI-system hade sÃĪrskilt svÃĨrt med:

  • Romerska siffror (3,2% noggrannhet)
  • SpegelvÃĪnda eller bakvÃĪnda klockansikten
  • FÃĪrgglada bakgrunder eller komplexa design
  • Klockor med sekundvisare som krÃĪver exakta avlÃĪsningar

Intressant nog, nÃĪr AI-modeller lyckades lÃĪsa en klocka, presterade de bra pÃĨ uppfÃķljande uppgifter som att lÃĪgga till tid eller konvertera tidszoner. Detta tyder pÃĨ att den grundlÃĪggande utmaningen ligger i den initiala visuella igenkÃĪnningen snarare ÃĪn i matematiskt resonemang.

Branschprestanda genomgÃĨng

Googles modeller ledde pakten, med Gemini 2.5 Pro som uppnÃĨdde 13,3% noggrannhet och Gemini 2.5 Flash som nÃĨdde 10,5%. OpenAI:s GPT-5 fick 8,4%, medan Anthropics Claude-modeller presterade sÃĪmre, med Claude 4 Sonnet pÃĨ 4,2% och Claude 4.1 Opus pÃĨ 5,6%.

xAI:s Grok 4 visade Ãķverraskande dÃĨliga resultat med 0,7% noggrannhet, ÃĪven om detta berodde pÃĨ att modellen felaktigt flaggade 63% av alla klockor som visande omÃķjliga tider nÃĪr bara 20,6% faktiskt gjorde det.

KÃĪlla: Alek Safar

StÃķrre implikationer fÃķr AI-utveckling

Studien bygger pÃĨ “lÃĪtt fÃķr mÃĪnniskor, svÃĨrt fÃķr AI”-benchmark-ansatsen som ses i tester som ARC-AGI och SimpleBench. Medan AI-system snabbt har erÃķvrat kunskapsintensiva uppgifter och till och med ÃķvertrÃĪffat mÃĪnsklig prestanda pÃĨ mÃĨnga standardtester, kvarstÃĨr grundlÃĪggande visuellt resonemang som problematiskt.

Forskningen tyder pÃĨ att nuvarande skalningsmetoder kanske inte lÃķser visuellt resonemangsutmaningar. Safar hypoteserar att analog klocka kan vara underrepresenterad i trÃĪningsdata och att ÃķversÃĪttning av visuella klockrepresentationer till text fÃķr resonemang skapar ytterligare komplicerade situationer.

ClockBench ansluter sig till en vÃĪxande samling benchmark-tester som ÃĪr utformade fÃķr att identifiera AI-begrÃĪnsningar som inte ÃĪr omedelbart uppenbara frÃĨn prestanda pÃĨ traditionella tester. Den fullstÃĪndiga datamÃĪngden fÃķrblir privat fÃķr att fÃķrhindra fÃķrorening av framtida AI-trÃĪning, med endast smÃĨ prover som gÃķrs offentliga fÃķr testning.

Resultaten vÃĪcker frÃĨgor om huruvida befintliga AI-utvecklingsparadigm kan hantera dessa visuella resonemangsgap eller om helt nya tillvÃĪgagÃĨngssÃĪtt kommer att behÃķvas – liknande hur test-tid datorkraft lÃĨste upp framsteg i andra domÃĪner.

FÃķr nÃĪrvarande stÃĨr den enkla analoga klockan som en ovÃĪntad fÃĪstning mot artificiell intelligens, lÃĪsbar av praktiskt taget alla mÃĪnniskor men fÃķrvirrande fÃķr vÃĪrldens mest avancerade AI-system.

Alex McFarland ÃĪr en AI-journalist och fÃķrfattare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med mÃĨnga AI-startups och publikationer Ãķver hela vÃĪrlden.