Modely a platformy AI
Modely AI selhávají při základní čtení hodin, zatímco lidé vynikají

Komplexní studie testující 11 předních modelů AI proti lidem v čtení analogových hodin odhalila překvapivou slabost v současných systémech umělé inteligence. Zatímco lidé dosáhli 89,1% přesnosti při určování času, nejlepší model Google (GOOGL ) dosáhl pouze 13,3% přesnosti ve stejném testu.
Studie ClockBench, kterou provedl výzkumník Alek Safar, ukazuje, že i nej pokročilejší systémy AI mají potíže s vizuálními úkoly, které většina lidí zvládne již v dětství. Benchmark testoval systémy od Google, OpenAI, Anthropic a dalších významných laboratoří AI pomocí 180 vlastních analogových hodin.
Tento problém sahá za hranice hodin. Výsledky poukazují na fundamentální limity v tom, jak systémy AI zpracovávají a rozumí vizuální informace. “Čtení analogových hodin nastavuje vysokou laťku pro rozumění ve vizuálním prostoru,” uvádí Safar ve výzkumné práci. Tento úkol vyžaduje, aby modely identifikovaly ručičky hodin, rozuměly jejich vztahům a překládaly vizuální polohu do numerického času.
Mezera ve výkonu se stává ještě více zřetelnou při zkoumání vzorců chyb. Když lidé dělali chyby, median chyby byl pouze tři minuty. Modely AI, na druhé straně, minuly cíle o jednu až tři hodiny – což je přibližně ekvivalentní náhodnému odhadu na 12hodinových hodinách.
Konkrétní slabiny odhaleny
Systémy AI se zejména potýkaly s:
- Římskými číslicemi (3,2% přesnost)
- Zrcadlovými nebo obrácenými hodinovými ciferníky
- Barevnými pozadími nebo složitými designy
- Hodinami se sekundovými ručičkami vyžadujícími přesné čtení
Zajímavé je, že když modely AI úspěšně četly hodiny, vykonaly se dobře i na následných úkolech, jako je přidání času nebo převod časových zón. To naznačuje, že hlavní výzvou je počáteční vizuální rozpoznání spíše než matematické myšlení.
Průmyslová výkonnost – rozbor
Modely Google vedly skupinu, s Gemini 2.5 Pro, které dosáhly 13,3% přesnosti, a Gemini 2.5 Flash, které dosáhly 10,5%. OpenAI GPT-5 skóroval 8,4%, zatímco modely Claude od Anthropic dosáhly nižších výsledků, s Claude 4 Sonnet na 4,2% a Claude 4.1 Opus na 5,6%.
xAI Grok 4 vykázal překvapivě špatné výsledky s 0,7% přesností, ačkoli to bylo způsobeno tím, že model nesprávně označil 63% všech hodin jako zobrazující nemožné časy, zatímco ve skutečnosti jich bylo pouze 20,6%.

Zdroj: Alek Safar
Širší důsledky pro vývoj AI
Studie navazuje na “lehké pro lidi, těžké pro AI” benchmarkový přístup, viditelný v testech jako ARC-AGI a SimpleBench. Zatímco systémy AI rychle ovládly úkoly náročné na znalosti a dokonce překonaly lidské výkony v mnoha standardizovaných testech, základní vizuální myšlení zůstává problematické.
Výzkum naznačuje, že současné přístupy ke škálování nemusí vyřešit výzvy vizuálního myšlení. Safar hypotetizuje, že analogové hodiny mohou být podreprzentovány v trénovacích datech a že překlad vizuálních hodinových reprezentací do textu pro myšlení vytváří další komplikace.
_clockBench se připojuje k rostoucí kolekci benchmarků navržených k identifikaci limitů AI, které nejsou okamžitě zřejmé z výkonu v tradičních testech. Plný dataset zůstává soukromý, aby se zabránilo kontaminaci budoucích trénovacích dat AI, s pouze malými vzorky zveřejněnými pro testování.
Výsledky vyvolávají otázky, zda stávající paradigmy vývoje AI mohou řešit tyto mezery ve vizuálním myšlení, nebo zda budou zapotřebí zcela nové přístupy – podobně jako tomu bylo u výpočetního testování, které odemklo pokrok v jiných oblastech.
Prozatím stojí skromné analogové hodiny jako nečekaná pevnost proti umělé inteligenci, čitelné prakticky pro každého člověka, ale matoucí nejsofistikovanější systémy AI.












