Взгляд Anderson
Борьба ИИ с чтением аналоговых часов может иметь более глубокое значение

Новая статья исследователей из Китая и Испании показывает, что даже передовые многомодальные модели ИИ, такие как GPT-4.1, испытывают трудности с определением времени по изображениям аналоговых часов. Небольшие визуальные изменения в часах могут вызвать значительные ошибки интерпретации, а доfine-тюнинг помогает только с знакомыми примерами. Результаты вызывают обеспокоенность по поводу надежности этих моделей при столкновении с незнакомыми изображениями в реальных задачах.
Когда люди развивают достаточно глубокое понимание области, такой как гравитация или другие основные физические принципы, мы выходим за рамки конкретных примеров и осваиваем лежащие в основе абстракции. Это позволяет нам применять это знание творчески в разных контекстах и распознавать новые экземпляры, даже те, которые мы никогда не видели раньше, определяя принцип в действии.
Когда область имеет достаточное значение, мы можем даже начать воспринимать ее там, где она не существует, как в случае с pareidolia, обусловленной высокой стоимостью не распознавания реального экземпляра. Так сильна эта механика распознавания образов, что она даже заставляет нас находить более широкий спектр образов там, где их нет.
Чем раньше и повторяющимся образом область воспитывается в нас, тем глубже ее основа и долгосрочная устойчивость; и одним из самых ранних визуальных наборов данных, с которыми мы сталкиваемся в детстве, является обучение часам, где печатный материал или интерактивные аналоговые часы используются для обучения нас чтению времени:

Учебные пособия для помощи детям в обучении чтению времени. Источник: https://www.youtube.com/watch?v=IBBQXBhSNUs
Хотя изменяющиеся моды в дизайне часов могут иногда вызывать у нас трудности, устойчивость этого раннего освоения области довольно впечатляет, позволяя нам различать аналоговые часовые лица даже перед лицом сложных или “эксцентричных” дизайнерских решений:

Некоторые сложные лица в часовой моде. Источник: https://www.ablogtowatch.com/wait-a-minute-legibility-is-the-most-important-part-of-watch-design/
Люди не нуждаются в тысячах примеров, чтобы выучить, как работают часы; как только базовая концепция освоена, мы можем распознать ее почти в любой форме, даже когда она искажена или абстрагирована.
Трудность, с которой сталкиваются модели ИИ при выполнении этой задачи, в отличие от этого, подчеркивает более глубокую проблему: их кажущаяся сила может зависеть больше от высокообъемной экспозиции, чем от понимания.
За пределами игры имитации?
Напряжение между поверхностной производительностью и настоящим “пониманием” возникло повторно в недавних исследованиях крупных моделей. В прошлом месяце Zhejiang University и Westlake University переформулировали вопрос в статье под названием Действительно ли PhD-уровневые LLMs понимают элементарное сложение? (не является предметом этой статьи), заключив:
‘Несмотря на впечатляющие тесты, модели показывают критическую зависимость от распознавания образов, а не настоящего понимания, как это подтверждается неудачами с символическими представлениями и нарушениями основных свойств.
‘Явное предоставление правил ухудшает производительность, что предполагает внутренние архитектурные ограничения. Эти идеи раскрывают пробелы в оценке и подчеркивают необходимость архитектур, способных к настоящему математическому рассуждению за пределами распознавания образов.’
На этой неделе вопрос возникает снова, теперь в сотрудничестве между Нанкинским университетом аэронавтики и астронавтики и Universidad Politécnica de Madrid в Испании. Под названием Действительно ли многомодальные крупные языковые модели (MLLMs) научились читать время на аналоговых часах?, новая статья исследует, насколько хорошо многомодальные модели понимают чтение времени.
Хотя прогресс исследования описан только в общих чертах в статье, первоначальные тесты исследователей показали, что многомодальная языковая модель GPT-4.1 от OpenAI испытывала трудности с определением времени по изображениям часов, часто давая неверные ответы даже в простых случаях.
Это указывает на возможный пробел в обучающих данных модели, что поднимает необходимость более сбалансированного набора данных, чтобы проверить, может ли модель фактически выучить лежащую в основе концепцию. Поэтому авторы создали синтетический набор данных аналоговых часов, равномерно покрывающий все возможные времена, и избегая обычных предубеждений, найденных в интернет-изображениях:

Пример из синтетического набора данных аналоговых часов исследователей, использованного для доfine-тюнинга модели GPT в новой работе. Источник: https://huggingface.co/datasets/migonsa/analog_watches_finetune
До доfine-тюнинга на новом наборе данных GPT-4.1 последовательно не смогла прочитать эти часы. После некоторого воздействия нового набора данных его производительность улучшилась – но только когда новые изображения выглядели как те, которые она уже видела.
Когда форма часов или стиль рук изменялись, точность резко падала; даже небольшие изменения, такие как более тонкие руки или стрелки (правое изображение ниже), были достаточно, чтобы сбить ее с толку; и GPT-4.1 испытывала дополнительные трудности с интерпретацией далиэских ‘расплавляющихся часов’:

Изображения часов со стандартным дизайном (слева), искаженной формой (в середине) и измененными руками (справа), вместе с временем, возвращаемым GPT-4.1 до и после доfine-тюнинга. Источник: https://arxiv.org/pdf/2505.10862
Авторы делают вывод, что текущие модели, такие как GPT-4.1, могут поэтому учиться чтению часов в основном через визуальное распознавание образов, а не через более глубокую концепцию времени, утверждая:
‘[GPT 4.1] не справляется, когда часы деформированы или когда руки изменены, чтобы быть тоньше и иметь стрелку. Средняя абсолютная ошибка (MAE) в оценке времени за 150 случайных времен была 232,48 с для начальных часов, 1380,69 с, когда форма искажена, и 3726,93 с, когда руки изменены.
‘Эти результаты предполагают, что MLLM не научилась читать время, а rather запомнила образы.’
Достаточно времени
Большинство наборов данных для обучения полагаются на изображения, соскобленные из интернета, которые склонны повторять определенные времена – особенно 10:10, популярную настройку в рекламе часов:

Из примера новой статьи, пример распространения времени ‘десять минут’ в аналоговых часовых изображениях.
В результате этого ограниченного диапазона времен, изображенных на часах, модель может видеть только узкий диапазон возможных конфигураций часов, ограничивая ее способность обобщать за пределами этих повторяющихся образов.
В отношении того, почему модели не могут правильно интерпретировать искаженные часы, статья гласит:
‘Хотя GPT-4.1 работает исключительно хорошо со стандартными часами, удивительно, что изменение часов, сделав их более тонкими и добавив стрелки, приводит к значительному падению точности.
‘Интуитивно можно было бы ожидать, что более визуально сложное изменение – искаженная циферблат – окажет более значительное влияние на производительность, но это изменение, кажется, имеет относительно меньший эффект.
‘Это вызывает вопрос: как MLLMs интерпретируют часы, и почему они не справляются? Одна из возможностей заключается в том, что более тонкие руки нарушают способность модели воспринимать направление, ослабляя ее понимание пространственной ориентации.
‘Альтернативно, могут быть другие факторы, которые вызывают путаницу, когда модель пытается объединить часовые, минутные и секундные руки в точное время.’
Авторы утверждают, что определение коренной причины этих неудач является ключом к продвижению многомодальных моделей: если проблема заключается в том, как модель воспринимает пространственное направление, доfine-тюнинг может предложить простое решение; но если проблема заключается в более широкой трудности в интеграции нескольких визуальных сигналов, это указывает на более фундаментальную слабость в том, как эти системы обрабатывают информацию.
Тесты доfine-тюнинга
Чтобы проверить, могут ли неудачи модели быть преодолены с помощью экспозиции, GPT-4.1 была доfine-тюнирована на вышеупомянутом и всестороннем синтетическом наборе данных. До доfine-тюнинга ее прогнозы были широко разбросаны, с значительными ошибками во всех типах часов. После доfine-тюнинга на коллекции точность резко улучшилась на стандартных часовых лицах и, в меньшей степени, на искаженных.
Однако часы с измененными руками, такими как более тонкие формы или стрелки, продолжали производить крупные ошибки.
Два различных режима неудач возникли: на нормальных и искаженных часах модель обычно ошибалась в направлении рук; но на часах с измененными стилями рук она часто путала функцию каждой руки, принимая час за минуту или минуту за секунду.

Сравнение, иллюстрирующее первоначальную слабость модели и частичные достижения, полученные с помощью доfine-тюнинга, показывающее предсказанное и фактическое время, в секундах, для 150 случайно выбранных часов. Слева, до доfine-тюнинга, прогнозы GPT-4.1 разбросаны и часто далеки от правильных значений, указанных красной диагональной линией. Справа, после доfine-тюнинга на сбалансированном синтетическом наборе данных, прогнозы выравниваются намного ближе с фактическими данными, хотя некоторые ошибки остаются.
Это предполагает, что модель научилась ассоциировать визуальные особенности, такие как толщина рук, с конкретными ролями, и испытывала трудности, когда эти сигналы менялись.
Ограниченный прогресс на незнакомых дизайнах вызывает дальнейшие сомнения в том, что модель такого типа учится абстрактной концепции чтения времени или просто совершенствует свое распознавание образов.
Знаки рук
Итак, хотя доfine-тюнинг улучшил производительность GPT-4.1 на обычных аналоговых часах, он оказал гораздо меньшее влияние на часы с более тонкими руками или стрелками, что вызывает возможность того, что неудачи модели были обусловлены не абстрактным рассуждением, а путаницей относительно того, какая рука является какой.
Чтобы проверить, может ли точность улучшиться, если эта путаница будет устранена, был проведен новый анализ прогнозов модели для набора данных с “измененными руками”. Выходные данные были разделены на две группы: случаи, когда GPT-4.1 правильно распознала часовые, минутные и секундные руки; и случаи, когда она не сделала этого.
Прогнозы были оценены по средней абсолютной ошибке (MAE) до и после доfine-тюнинга и сравнены с результатами для стандартных часов; также была измерена угловая ошибка для каждой руки с использованием положения циферблата в качестве базовой линии:

Сравнение ошибок для часов с и без путаницы в ролях рук в наборе данных с измененными руками до и после доfine-тюнинга.
Путаница в ролях часов привела к самым большим ошибкам. Когда GPT-4.1 путала часовые руки с минутными или наоборот, полученные оценки времени часто были далеко не точными. Напротив, ошибки, вызванные неправильным суждением о направлении правильно определенной руки, были меньше. Среди трех рук часовая рука показала самую высокую угловую ошибку до доfine-тюнинга, а секундная рука показала самую низкую.

Угловая ошибка по типу руки для прогнозов с и без путаницы в ролях рук до и после доfine-тюнинга в наборе данных с измененными руками.
Чтобы сосредоточиться только на направленных ошибках, анализ был ограничен случаями, когда модель правильно определила функцию каждой руки. Если модель внутренне освоила общую концепцию чтения времени, ее производительность на этих примерах должна была соответствовать ее точности на стандартных часах. Она не соответствовала, и точность оставалась заметно хуже.
Чтобы изучить, мешает ли форма руки чувству направления модели, был проведен второй эксперимент: были созданы два новых набора данных, каждый содержащий шестьдесят синтетических часов с только часовой рукой, указывающей на разную минутную метку. Один набор использовал оригинальный дизайн руки, а другой – измененный. Модель была попрослена назвать метку, на которую указывала рука.
Результаты показали небольшое снижение точности с измененными руками, но не достаточно, чтобы объяснить более широкие неудачи модели. Одна незнакомая визуальная особенность казалась способной нарушить общую интерпретацию модели, даже в задачах, которые она ранее выполняла хорошо.

Обзор производительности GPT-4.1 до и после доfine-тюнинга на стандартных, искаженных и измененных часах с руками, подчеркивающий неравномерные достижения и сохраняющиеся слабости.
Заключение
Хотя фокус статьи может показаться тривиальным на первый взгляд, не особенно важно, научатся ли модели ИИ читать аналоговые часы на 100% точно. Что придает работе вес – это ее фокус на более глубоком повторяющемся вопросе: может ли насыщение моделей большим (и более разнообразным) данным привести к тому типу понимания области, который люди приобретают через абстракцию и обобщение; или единственный жизнеспособный путь – это наводнение области достаточно примеров, чтобы предвидеть каждую вероятную вариацию на выводе.
Любой путь вызывает сомнения в том, что текущие архитектуры действительно способны выучить.
Опубликовано в понедельник, 19 мая 2025 года












