Модели и платформы ИИ

Модели ИИ спотыкаются о чтение часов, в то время как люди отлично справляются

mm
Добавьте Unite.AI в избранные источники в Google

Комплексное исследование, проверяющее 11 ведущих моделей ИИ на чтение аналоговых часов по сравнению с людьми, показало удивительную слабость в текущих системах искусственного интеллекта. В то время как люди достигли 89,1% точности в определении времени, лучшая модель Google (GOOGL ) показала всего 13,3% точности в том же тесте.

Исследование ClockBench, проведенное исследователем Alek Safar, демонстрирует, что даже самые продвинутые системы ИИ испытывают трудности с визуальными задачами, которые большинство людей осваивают в детстве. Тест проверял системы от Google, OpenAI, Anthropic и других крупных лабораторий ИИ с помощью 180 специально разработанных аналоговых часов.

Это выходит за рамки часов. Результаты подчеркивают фундаментальные ограничения в том, как системы ИИ обрабатывают и рассуждают о визуальной информации. “Чтение аналоговых часов устанавливает высокую планку для рассуждений в визуальном пространстве”, – отмечает Safar в исследовательской работе. Эта задача требует от моделей определить часовые стрелки, понять их взаимосвязи и перевести визуальное положение в числовое время.

Разрыв в производительности становится еще более заметным при изучении моделей ошибок. Когда люди совершали ошибки, медианная ошибка составляла всего три минуты. Модели ИИ, напротив, промахивались на один-два часа – примерно эквивалентно случайным угадыванием на 12-часовых часах.

Конкретные слабости, выявленные

Системы ИИ особенно испытывали трудности с:

  • Римскими цифрами (3,2% точности)
  • Зеркальными или обратными часовыми лицами
  • Цветными фонами или сложными дизайнами
  • Часами со стрелками секунд, требующими точных показаний

Интересно, что когда модели ИИ успешно читали часы, они хорошо справлялись с последующими задачами, такими как добавление времени или конвертация часовых поясов. Это говорит о том, что основная задача заключается в начальном визуальном распознавании, а не в математическом рассуждении.

Анализ производительности отрасли

Модели Google лидировали, с Gemini 2.5 Pro, достигшей 13,3% точности, и Gemini 2.5 Flash, достигшей 10,5%. OpenAI’s GPT-5 набрала 8,4%, в то время как модели Anthropic Claude показали более низкие результаты, с Claude 4 Sonnet на уровне 4,2% и Claude 4.1 Opus на уровне 5,6%.

xAI’s Grok 4 показал удивительно плохие результаты на уровне 0,7% точности, хотя это было вызвано тем, что модель неправильно помечала 63% всех часов как показывающие невозможное время, когда на самом деле только 20,6% часов показывали невозможное время.

Источник: Alek Safar

Более широкие последствия для развития ИИ

Исследование основано на подходе “легко для людей, трудно для ИИ”, наблюдаемом в тестах, таких как ARC-AGI и SimpleBench. Хотя системы ИИ быстро завоевали задачи, требующие знаний, и даже превзошли производительность человека во многих стандартизированных тестах, базовое визуальное рассуждение остается проблематичным.

Исследование предполагает, что текущие подходы к масштабированию могут не решить проблемы визуального рассуждения. Safar гипотетически предполагает, что аналоговые часы могут быть недопредставлены в обучающих данных и что перевод визуальных представлений часов в текст для рассуждений создает дополнительные осложнения.

Исследование ClockBench присоединяется к растущей коллекции тестов, предназначенных для выявления ограничений ИИ, которые не сразу очевидны из результатов традиционных тестов. Полный набор данных остается закрытым, чтобы предотвратить загрязнение будущих обучающих данных ИИ, и только небольшие выборки сделаны публичными для тестирования.

Результаты вызывают вопросы о том, могут ли существующие парадигмы разработки ИИ решить эти проблемы визуального рассуждения или потребуются совершенно новые подходы – подобно тому, как вычисления во время тестирования открыли прогресс в других областях.

На данный момент скромные аналоговые часы стоят как неожиданная крепость против искусственного интеллекта, читаемая практически любым человеком, но озадачивающая самые совершенные системы ИИ.

Alex руководит новостными операциями Unite.AI, основанными на ИИ, объединяя журналистику, исследования и автоматизацию для обеспечения своевременного и масштабируемого освещения искусственного интеллекта. Его работа помогает эффективно выявлять новые разработки в области ИИ, при этом соблюдая редакционные стандарты издания.