AI-modeller och plattformar
AI-modeller har svårt att läsa analog klocka medan människor excellerar

En omfattande studie som testar 11 ledande AI-modeller mot människor i att läsa analog klocka har avslöjat en överraskande svaghet i nuvarande artificiella intelligenssystem. Medan människor uppnådde 89,1% noggrannhet i att ange tid, lyckades Googles bäst presterande modell bara med 13,3% noggrannhet i samma test.
ClockBench-studien, som utfördes av forskaren Alek Safar, visar att även de mest avancerade AI-systemen kämpar med visuella uppgifter som de flesta människor behärskar som barn. Benchmark-testet testade system från Google (GOOGL ), OpenAI, Anthropic och andra stora AI-laboratorier med 180 anpassade analog klockor.
Detta går utöver klockor. Resultaten belyser grundläggande begränsningar i hur AI-system bearbetar och resonerar om visuell information. “Att läsa analog klocka sätter en hög standard för att utföra resonemang inom det visuella utrymmet”, säger Safar i forskningsrapporten. Uppgiften kräver att modellerna identifierar klockhand, förstår deras relationer och översätter visuell position till numerisk tid.
Prestandagapet blir ännu mer slående när man undersöker felmönster. När människor gjorde misstag var det medianfel bara tre minuter. AI-modeller, å andra sidan, missade märket med en till tre timmar – ungefär motsvarande slumpmässigt gissande på en 12-timmarsklocka.
Specifika svagheter avslöjade
AI-system hade särskilt svårt med:
- Romerska siffror (3,2% noggrannhet)
- Spegelvända eller bakvända klockansikten
- Färgglada bakgrunder eller komplexa design
- Klockor med sekundvisare som kräver exakta avläsningar
Intressant nog, när AI-modeller lyckades läsa en klocka, presterade de bra på uppföljande uppgifter som att lägga till tid eller konvertera tidszoner. Detta tyder på att den grundläggande utmaningen ligger i den initiala visuella igenkänningen snarare än i matematiskt resonemang.
Branschprestanda genomgång
Googles modeller ledde pakten, med Gemini 2.5 Pro som uppnådde 13,3% noggrannhet och Gemini 2.5 Flash som nådde 10,5%. OpenAI:s GPT-5 fick 8,4%, medan Anthropics Claude-modeller presterade sämre, med Claude 4 Sonnet på 4,2% och Claude 4.1 Opus på 5,6%.
xAI:s Grok 4 visade överraskande dåliga resultat med 0,7% noggrannhet, även om detta berodde på att modellen felaktigt flaggade 63% av alla klockor som visande omöjliga tider när bara 20,6% faktiskt gjorde det.

Källa: Alek Safar
Större implikationer för AI-utveckling
Studien bygger på “lätt för människor, svårt för AI”-benchmark-ansatsen som ses i tester som ARC-AGI och SimpleBench. Medan AI-system snabbt har erövrat kunskapsintensiva uppgifter och till och med överträffat mänsklig prestanda på många standardtester, kvarstår grundläggande visuellt resonemang som problematiskt.
Forskningen tyder på att nuvarande skalningsmetoder kanske inte löser visuellt resonemangsutmaningar. Safar hypoteserar att analog klocka kan vara underrepresenterad i träningsdata och att översättning av visuella klockrepresentationer till text för resonemang skapar ytterligare komplicerade situationer.
ClockBench ansluter sig till en växande samling benchmark-tester som är utformade för att identifiera AI-begränsningar som inte är omedelbart uppenbara från prestanda på traditionella tester. Den fullständiga datamängden förblir privat för att förhindra förorening av framtida AI-träning, med endast små prover som görs offentliga för testning.
Resultaten väcker frågor om huruvida befintliga AI-utvecklingsparadigm kan hantera dessa visuella resonemangsgap eller om helt nya tillvägagångssätt kommer att behövas – liknande hur test-tid datorkraft låste upp framsteg i andra domäner.
För närvarande står den enkla analoga klockan som en oväntad fästning mot artificiell intelligens, läsbar av praktiskt taget alla människor men förvirrande för världens mest avancerade AI-system.












