Взгляд Anderson
Искусственный интеллект может угадать год фотографии по возрасту людей

Новые исследования показывают, что искусственный интеллект может использовать лица людей, чтобы оценить год, когда была сделана фотография, объединяя предположения о возрасте с известными годами рождения, чтобы превзойти текущие методы, основанные на сцене.
Угадывание даты фотографии раньше было намного проще, чем сейчас, потому что мода на волосы и одежду развивалась с бешеной скоростью. По спорным причинам, эта эволюция визуального стиля закончилась около тридцати лет назад, что означает, что теперь не так легко посмотреть на прическу или предметы одежды и угадать год по этому типу визуальных подсказок.
Некоторое время было возможно также датировать изображения и фильмы на основе цвета и характеристик зерна пленки. Не нужно было быть специалистом по судебной экспертизе; если вы смотрели достаточно старых фильмов, культурные подсказки (такие как музыка, машины, мода, темы и т. д.) в конечном итоге ассоциировались с стилями пленки:
![Иллюстрация того, как улучшения в пленке постепенно расширили диапазон оттенков кожи и стилей освещения с течением времени, переходя от плоских, фронтальных установок к более натуральным и разнообразным видам. [ Источник ] https://archive.is/3ZSjN (моя собственная статья)](https://www.unite.ai/wp-content/uploads/2025/11/grain-styles.jpg)
Иллюстрация того, как улучшения в пленке постепенно расширили диапазон оттенков кожи и стилей освещения с течением времени, переходя от плоских, фронтальных установок к более натуральным и разнообразным видам. Источник (моя собственная статья)
Дополнительным “якорем” для датирования фотографии было то, сделана ли она в черно-белом цвете – экономия, которая стала ненужной после популяризации цифровой фотографии в начале этого века
Несколько коммерческих и экспериментальных систем, таких как MyHeritage PhotoDater, пытаются датировать фотографии, используя эти и другие различные критерии.
![Пример оценки возраста фотографии из сервиса MyHeritage PhotoDater. Источник [ https://www.youtube.com/watch?v=2oVyLI6tBcY ]](https://www.unite.ai/wp-content/uploads/2025/11/photodater.jpg)
Пример оценки возраста фотографии из сервиса MyHeritage PhotoDater. Источник
Отсутствие других подсказок, таких как смартфоны или другая технология, специфичная для эпохи, лучший способ определить возраст фотографии, сделанной за последние 15-25 лет, – это если вы знакомы с человеком (т. е. знаменитостью или, возможно, знакомым), и можете оценить его возраст, что дает приблизительный эквивалентный год.
Лицо как ссылка
В области компьютерного зрения и в различных других областях (т. е. судебной экспертизе, архивной обработке, журналистике, архитектуре наборов данных и т. д.) возможность определить возраст фотографии является ценной целью, поскольку многие из самых интересных цифровых и аналоговых коллекций не имеют надлежащей аннотации и метаданных или даже имеют неверные метаданные из предыдущих (неправильных) предположений.
Следовательно, было бы полезно, если бы система искусственного интеллекта могла просматривать фотографии так же, как мы, когда смотрим на наши исторические коллекции, и комментировать ‘О, да, это было тогда…’. Вопрос в том, что могло бы быть крючком, если нет обычных необходимых подсказок?
Новая исследовательская работа из Чехии предлагает первоначальную опору для этого подхода, используя системы искусственного интеллекта, основанные на распознавании возраста и распознавании лиц, связанных с общей базой данных идентификаторов (в данном случае, коллекцией, подобной IMDB, с чешскими исполнителями и кинематографистами):

Кадр из фильма ‘Joachim, Put It in the Machine’ (1974), используемый для иллюстрации процесса датирования. Модель обнаруживает известных людей на фотографии, оценивает их возраст, используя оценщик возраста лица (правый столбец), и вычитает это значение из года рождения каждого человека, чтобы сгенерировать вероятностное распределение возможных дат фотографии. Источник
Система работает, обнаруживая известных людей на фотографии, оценивая их возраст лица, используя предварительно обученную модель, и вычитая эту оценку из их задокументированного года рождения, чтобы сгенерировать вероятные даты для фотографии. Когда на фотографии присутствуют несколько лиц, оценки дат объединяются, чтобы произвести окончательный прогноз.
Метод был протестирован на изображениях, собранных из Чешско-словацкой кинобазы данных (CSFD), и в результате полученный подход, по утверждению авторов, предлагает последовательно более высокую точность, чем модели, основанные на сцене (статические модели, которые полагаются на фоновые элементы или визуальный контекст, а не на лица), обученные на тех же данных.
Схема этого метода требует центральной базы данных, содержащей знания о широкой группе людей, в данном случае чешской кинобазе данных; но любая подобная коллекция, в которой есть подтвержденные даты рождения и центральные даты-подтвержденные события, могла бы дать подобный результат.
В статье говорится:
‘Уникально, наша база данных предоставляет аннотации для нескольких людей в одном изображении, что позволяет изучать агрегацию информации из нескольких лиц. Мы предлагаем вероятностную структуру, которая формально объединяет визуальные доказательства из современных моделей распознавания лиц и оценки возраста, а также временные приоры, основанные на карьере, чтобы сделать вывод о годе съёмки фотографии.
‘Наши эксперименты показывают, что агрегация доказательств из нескольких лиц последовательно улучшает производительность, и подход значительно превосходит сильные базовые модели, основанные на сцене, особенно для изображений, содержащих несколько идентифицируемых людей.’
Новая статья озаглавлена Датирование фотографий по агрегации возраста лица и исходит от двух исследователей из Чешского технического университета в Праге, с обещанием более позднего выпуска кода и данных.
Метод
Чтобы оценить, когда была сделана фотография, новая система авторов смотрит на каждое обнаруженное лицо и пытается угадать, кто это может быть, используя упомянутую базу данных известных людей. Поскольку человек может появиться только один раз на фотографии, система проверяет все возможные комбинации возможных идентификаторов и использует их известные годы рождения, чтобы угадать, сколько лет каждому человеку.
После этого система работает в обратном направлении, чтобы оценить наиболее вероятный год, который сделал бы эти возрасты совпадающими:

Слева: система строит временную шкалу, показывающую, когда распознанные люди были наиболее активны, на основе их известных карьер. Справа: это объединяется с оценками возраста лица, чтобы произвести окончательную оценку даты, когда было сделано изображение.
Чтобы управлять большим количеством возможных комбинаций идентификаторов, система предполагает, что лица являются независимыми, и что внешний вид каждого лица зависит только от его идентификатора и даты фотографии.
Чтобы оценить, когда была сделана фотография, система сначала оценивает возраст каждого обнаруженного лица, используя модель cvut-002, которая основана на архитектуре ViT-B/16 и обучена на частной базе данных (которая, по утверждению авторов, занимает высокое место в базе данных NIST’s Face Analysis Technology Evaluation (FATE)).
Как только год рождения человека становится известен, модель преобразует оценку возраста в вероятную дату фотографии, просто добавляя возраст к году рождения, что дает вероятностное распределение возможных дат съёмки. Чтобы оценить, насколько хорошо обнаруженное лицо соответствует известному идентификатору, система сравнивает их вложения в пространстве ArcFace:
![ArcFace, основная архитектура популярной модели InsightFace, была запущена в 2015 году и стала влиятельным проектом в оценке и анализе лица. [Источник ] https://arxiv.org/pdf/1801.07698](https://www.unite.ai/wp-content/uploads/2025/11/arcface.jpg)
ArcFace, основная архитектура популярной модели InsightFace, была запущена в 2015 году и стала влиятельным проектом в оценке и анализе лица. Источник
Каждый идентификатор представлен средним вложением, построенным из его эталонных портретов. Сходство между тестовым лицом и идентификатором затем измеряется с помощью распределения Фишера-Вон Мизеса, которое моделирует, насколько плотно вложения идентификатора скластеризованы вокруг этого среднего значения. Общий параметр остроты контролирует, насколько уверена система в этих кластерах, и оценивается с помощью стратегии оставления одного из на портретах идентификатора.
Модель определяет пять типов приоров, чтобы оценить, когда распознанный человек может появиться на фотографии: униформ; десятилетие; фильм; изображение; и комбинированный приор, который объединяет сильнейшие и слабейшие варианты, чтобы проверить чувствительность к силе приора (т. е. устойчивость приоров к стрессу).
Чтобы справиться с лицами, которые не могут быть уверенно идентифицированы, модель включает в себя резервный идентификатор ‘неизвестно’ с неинформативными распределениями, в которых вероятность лица плоская в пространстве вложения, а временной приор плоский во всех годах. Это позволяет неопределенным лицам быть проигнорированными без предвзятости окончательной оценки даты:

Как производительность меняется, когда некоторые лица в изображении не могут быть идентифицированы. Каждый квадрат показывает среднюю ошибку датирования для разных количеств известных и неизвестных идентификаторов, с размером квадрата, отражающим, насколько часто эта комбинация встречается в наборе данных. Ошибка увеличивается с большим количеством неизвестных, но снижается с добавлением известных идентификаторов.
Данные и тесты
Авторы использовали упомянутую базу данных CSFD, чтобы создать новую коллекцию, которую они назвали CSFD-1.6M. Набор данных был построен из сцен, в которых участвуют несколько людей, с каждым лицом, помеченным идентификатором и годом. Эта структура была необходима, чтобы научить модель, как лица связаны друг с другом в контексте; одноличные наборы данных, такие как IMDB-WIKI, не поддерживают это, поскольку они помечают только одного человека на изображении.
Годы выпуска фильмов из Чешско-словацкой кинобазы данных использовались для оценки, когда была сделана фотография, с каждым человеком в изображении, сопоставленным с публичным профилем, содержащим его год рождения и портрет.
Затем каждое лицо в изображении было сопоставлено с одним из известных идентификаторов, сначала используя ArcFace для создания вложений лица, и вычисления среднего вложения для каждого идентификатора.
После этого алгоритм Хунгариан был использован для присвоения лиц идентификаторам, сравнивая сходство вложений, с корректировками, сделанными, когда количество обнаруженных лиц через SCRFD-10GE не совпадало с количеством известных людей.

Статистика из набора данных CSFD-1.6M, показывающая собранные изображения, обнаруженные лица, совпадения идентификаторов, окончательные помеченные образцы и доступный пул идентификаторов.
Совпадения были отклонены, если сходство было слишком низким или если оцененный возраст сильно отличался от известного возраста, с большей терпимостью, разрешенной для более старых субъектов, и лица не фильтровались по качеству или размеру.
Авторы подчеркивают превосходство своей отобранной коллекции над ближайшим сравнимым набором данных, IMDB-WIKI:
‘Наша база данных не только значительно больше, но, что критически важно, состоит из многоличных сцен, необходимых для нашей модели. Хотя ни один веб-скрейпинговый набор данных не является свободным от шума меток, наша конвейер аннотации использует явные связи между изображениями и профилями идентификаторов, предоставляемые базой данных, стремясь к более высококачественным назначениям идентификаторов.’
Их оценка сравнивает несколько версий системы датирования, чтобы понять, откуда берутся ее выгоды. Одна модель предполагала идеальное знание того, кто находится на изображении, предоставляя верхнюю границу производительности, удаляя любую неопределенность в распознавании идентификатора, с полной версией модели, оценивающей идентификаторы и даты совместно, взвешивая различные возможные назначения идентификаторов, прежде чем прийти к окончательной оценке года.
Более простая вариация выбирала наиболее вероятную конфигурацию идентификатора без маргинализации альтернатив, что оказалось почти таким же эффективным на практике.
Напротив, наиболее базовая базовая модель присваивала каждому лицу отдельно и объединяла полученные оценки года, основанные на возрасте, без учета того, что идентификаторы коллективно имели смысл.
Чтобы проверить, насколько метод выигрывает от использования лиц вообще, отдельная модель была обучена для оценки даты直接 из всей сцены. Эта сценарная модель представляет собой сильнейший альтернативный подход, используемый в настоящее время в оценке даты изображения, поскольку она может учиться эра-специфичным визуальным закономерностям на всем изображении, а не полагаться на идентификатор или возраст.
Метрики и данные
Средняя абсолютная ошибка (MAE) между предсказанным годом и известной истиной была центральной метрикой для экспериментов.
Данные были разделены на пять частей, с учетом того, чтобы все изображения из одного фильма были сохранены в одной части. Три из этих частей были использованы для обучения, одна для проверки, и одна для тестирования. Этот пятикратный поворот был применен, чтобы предотвратить переобучение.
Поскольку модели, основанные на лицах, не были обучены на этом наборе данных, никакого разделения не было необходимо, и вместо этого они были оценены直接 на полном наборе данных CSFD-1.6M.
Модель Сцена была обучена в течение 200 эпох под оптимизатором Adam, с изображениями, измененными до 384×384 кадра.
Результаты
Раздел результатов статьи необычно разделен на несколько показателей производительности, без единого выдающегося или центрального теста. Однако мы представим здесь наиболее актуальные результаты.
Самый важный результат не является отдельным числом, а закономерностью: модели агрегации лица (особенно Полная и Топ-1 варианты) последовательно превосходят сильную Сценарную базовую линию, когда на изображении присутствуют два или более известных идентификатора – даже хотя Сценарная модель обучена直接 на наборе данных, подтверждая центральное утверждение, что идентификатор-связанная датировка лица обеспечивает более прочный сигнал, чем голографическая интерпретация сцены.
Чтобы оценить влияние временных приоров, авторы сравнили несколько конфигураций своей Полной модели. Наилучшая производительность была получена с помощью Десятилетнего приора, который значительно превосходил как Наивную модель (которая не использует временной приор) и Униформный приор (который предполагает отсутствие предпочтения по годам):

Производительность падает резко для всех методов по мере увеличения количества лиц, но модели, использующие реалистичные временные приоры, такие как Десятилетний приор, затронуты гораздо меньше. Базовые линии Naive и Scene остаются плоскими или ухудшаются с большими группами, в то время как Полная модель, руководствующаяся информативными приорами, поддерживает низкую ошибку.
Чтобы продемонстрировать ценность CSFD-1.6M за пределами датирования фотографий, набор данных также был протестирован как ресурс для предварительного обучения для более широкой задачи оценки возраста лица. Следуя стандартному протоколу оценки, ResNet101 модели были предварительно обучены на CSFD-1.6M и сравнены с аналогами, предварительно обученными на IMDB-WIKI и ImageNet. Эти модели затем были дообучены и оценены на пяти популярных наборах данных: AgeDB; AFAD, MORPH; UTKFace; и CLAP2016:

Средняя абсолютная ошибка (плюс-минус стандартное отклонение) на пяти наборах данных для оценки возраста, сравнивающих модели, предварительно обученные на ImageNet, IMDB-WIKI и CSFD-1.6M. Более низкие значения указывают на лучшую производительность. CSFD-1.6M дает наилучшие результаты на всех наборах данных.
На всех пяти наборах данных предварительное обучение на CSFD-1.6M привело к наименьшим показателям ошибки, превосходя другие два источника предварительного обучения на значительную величину – разрыв в производительности, который оказался наиболее сильным на AFAD и CLAP2016, но оставался последовательным на всех наборах данных.
Мы отсылаем читателя к остальной части несколько фрагментированного раздела результатов в исходной статье, который также обширно занимается исследованиями удаления.
Заключение
Хотя новая статья быстро становится плотной и недоступной для случайного читателя, тема, затронутая в ней, является одной из наиболее интересных и актуальных в литературе компьютерного зрения – не в последнюю очередь потому, что она пересекается с антропологией и культурными исследованиями, где константы трудно определить.
* Как и эволюция музыки также замедлила свою скорость изменения.
Опубликовано в первый раз в понедельник, 10 ноября 2025 года












