Модели и платформы ИИ
Модели ИИ спотыкаются о чтение часов, в то время как люди отлично справляются

Комплексное исследование, проверяющее 11 ведущих моделей ИИ на чтение аналоговых часов по сравнению с людьми, показало удивительную слабость в текущих системах искусственного интеллекта. В то время как люди достигли 89,1% точности в определении времени, лучшая модель Google (GOOGL ) показала всего 13,3% точности в том же тесте.
Исследование ClockBench, проведенное исследователем Alek Safar, демонстрирует, что даже самые продвинутые системы ИИ испытывают трудности с визуальными задачами, которые большинство людей осваивают в детстве. Тест проверял системы от Google, OpenAI, Anthropic и других крупных лабораторий ИИ с помощью 180 специально разработанных аналоговых часов.
Это выходит за рамки часов. Результаты подчеркивают фундаментальные ограничения в том, как системы ИИ обрабатывают и рассуждают о визуальной информации. “Чтение аналоговых часов устанавливает высокую планку для рассуждений в визуальном пространстве”, – отмечает Safar в исследовательской работе. Эта задача требует от моделей определить часовые стрелки, понять их взаимосвязи и перевести визуальное положение в числовое время.
Разрыв в производительности становится еще более заметным при изучении моделей ошибок. Когда люди совершали ошибки, медианная ошибка составляла всего три минуты. Модели ИИ, напротив, промахивались на один-два часа – примерно эквивалентно случайным угадыванием на 12-часовых часах.
Конкретные слабости, выявленные
Системы ИИ особенно испытывали трудности с:
- Римскими цифрами (3,2% точности)
- Зеркальными или обратными часовыми лицами
- Цветными фонами или сложными дизайнами
- Часами со стрелками секунд, требующими точных показаний
Интересно, что когда модели ИИ успешно читали часы, они хорошо справлялись с последующими задачами, такими как добавление времени или конвертация часовых поясов. Это говорит о том, что основная задача заключается в начальном визуальном распознавании, а не в математическом рассуждении.
Анализ производительности отрасли
Модели Google лидировали, с Gemini 2.5 Pro, достигшей 13,3% точности, и Gemini 2.5 Flash, достигшей 10,5%. OpenAI’s GPT-5 набрала 8,4%, в то время как модели Anthropic Claude показали более низкие результаты, с Claude 4 Sonnet на уровне 4,2% и Claude 4.1 Opus на уровне 5,6%.
xAI’s Grok 4 показал удивительно плохие результаты на уровне 0,7% точности, хотя это было вызвано тем, что модель неправильно помечала 63% всех часов как показывающие невозможное время, когда на самом деле только 20,6% часов показывали невозможное время.

Источник: Alek Safar
Более широкие последствия для развития ИИ
Исследование основано на подходе “легко для людей, трудно для ИИ”, наблюдаемом в тестах, таких как ARC-AGI и SimpleBench. Хотя системы ИИ быстро завоевали задачи, требующие знаний, и даже превзошли производительность человека во многих стандартизированных тестах, базовое визуальное рассуждение остается проблематичным.
Исследование предполагает, что текущие подходы к масштабированию могут не решить проблемы визуального рассуждения. Safar гипотетически предполагает, что аналоговые часы могут быть недопредставлены в обучающих данных и что перевод визуальных представлений часов в текст для рассуждений создает дополнительные осложнения.
Исследование ClockBench присоединяется к растущей коллекции тестов, предназначенных для выявления ограничений ИИ, которые не сразу очевидны из результатов традиционных тестов. Полный набор данных остается закрытым, чтобы предотвратить загрязнение будущих обучающих данных ИИ, и только небольшие выборки сделаны публичными для тестирования.
Результаты вызывают вопросы о том, могут ли существующие парадигмы разработки ИИ решить эти проблемы визуального рассуждения или потребуются совершенно новые подходы – подобно тому, как вычисления во время тестирования открыли прогресс в других областях.
На данный момент скромные аналоговые часы стоят как неожиданная крепость против искусственного интеллекта, читаемая практически любым человеком, но озадачивающая самые совершенные системы ИИ.












