Взгляд Anderson
AI-инструмент удаляет макияж, чтобы предотвратить обход проверки возраста

Внешний вид косметики на лице позволяет несовершеннолетним пользователям, в основном девочкам, обходить проверку возраста на основе селфи на платформах, таких как приложения для знакомств и электронные коммерческие сайты. Новый инструмент на основе ИИ решает эту проблему, используя дискриминативную модель, обученную удалять макияж, сохраняя при этом идентичность, что делает более трудным для несовершеннолетних обмануть автоматические системы.
Использование сторонних сервисов проверки возраста на основе селфи становится все более популярным, не в последнюю очередь из-за общей глобальной тенденции к онлайн-верификации возраста.
Например, в новом режиме реализации, который теперь требует Закон об онлайн-безопасности Великобритании, верификация возраста может проводиться различными сторонними сервисами, используя различные возможные методы, включая визуальную верификацию возраста, где ИИ используется для визуального прогнозирования возраста пользователя (обычно из видео с живой камеры мобильного устройства). Сервисы, которые используют подходы этого типа, включают Ondato, TrustStamp и Yoti.
Однако оценка возраста не является безошибочной, и традиционная тенденция подростков к предвосхищению прав взрослых означает, что молодые люди разработали различные эффективные методы для входа на сайты знакомств, форумы и другие среды, которые запрещают их возрастную группу.
Один из этих методов, наиболее часто используемый девочками*, заключается в ношении макияжа – тактику, известную как способ обмануть автоматические системы оценки возраста, которые обычно переоценивают возраст молодых людей и недооценивают возраст старших людей.
Не только девочки
Прежде чем возникнет протест против рассмотрения макияжа как “ориентированного на девочек”, мы должны отметить, что присутствие косметики на любом лице является очень ненадежным индикатором пола:

В статье ‘Влияние косметики на автоматические алгоритмы определения пола и возраста’ американские исследователи обнаружили, что системы верификации пола были обмануты макияжем, меняющим пол. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf
В 2024 году 72% американских потребителей-мужчин в возрасте от 18 до 24 лет, как оценивается, включили макияж в свою программу ухода за собой – хотя большинство используют косметические продукты для улучшения внешнего вида здоровой кожи, а не для использования перформанс-макияжа, такого как тушь, подводка для глаз и румяна, более характерного для визуальной эстетики женщин.
Итак, мы не можем не рассматривать материал, изучаемый в этой статье, в контексте наиболее распространенного сценария, исследуемого в новом исследовании – сценария, в котором несовершеннолетние девочки используют макияж, чтобы обойти автоматические визуальные системы верификации возраста.
Эффективное удаление макияжа – способ ИИ
Упомянутое выше исследование было проведено тремя участниками из Нью-Йоркского университета в виде новой статьи DiffClean: Удаление макияжа на основе диффузии для точной оценки возраста.
Целью проекта является разработка метода ИИ для удаления макияжа с изображений (потенциально включая видеоизображения), чтобы получить лучшее представление о истинном возрасте человека за макияжем.

Из новой статьи пример того, как удаление макияжа может заметно изменить прогноз возраста. Source: https://arxiv.org/pdf/2507.13292
Одной из проблем разработки такой системы является потенциальная чувствительность при сборе или курировании изображений несовершеннолетних девочек в макияже. В конечном итоге исследователи использовали стороннюю систему на основе генеративной сети противников под названием EleGANt для искусственного наложения стилей макияжа, что оказалось очень эффективным:

Система EleGANt Университета Цинхуа 2022 года использует генеративную сеть противников для аутентичного наложения косметики на исходные фотографии. Source: https://arxiv.org/pdf/2207.09840
С помощью синтетических данных, полученных таким образом, и с помощью разнообразных вспомогательных проектов и наборов данных, авторы смогли превзойти методы, являющиеся лучшими на данный момент, в оценке возраста при столкновении с перформанс-макияжем или “видимым” макияжем.
Статья гласит:
‘DiffClean [удаляет] следы макияжа с помощью текстово-управляемой диффузионной модели для защиты от атак макияжа. [Он] улучшает оценку возраста (точность определения несовершеннолетних и взрослых на 4,8%) и верификацию лица (TMR на 8,9% при FMR=0,01%) по сравнению с конкурирующими базовыми методами на цифровых и реальных изображениях с макияжем.’
Давайте посмотрим, как они подходили к этой задаче.
Метод
Чтобы избежать сбора реальных изображений несовершеннолетних в макияже, авторы использовали EleGANt для наложения синтетического макияжа на изображения из набора данных UTKFace, получив пары “до и после” для обучения.

Примеры из набора данных UTKFace. Source: https://susanqq.github.io/UTKFace/
DiffClean был затем обучен для обратного преобразования. Поскольку алгоритмы оценки возраста ошибаются больше всего при работе с более молодыми возрастными группами, исследователи сочли необходимым разработать прокси-классификатор возраста, настроенный на целевые возрастные группы (10-19 лет). Для этого они использовали архитектуру SSRNet, обученную на UTKFace, с взвешенной потерей L1.
Упрощенная версия модели диффузии OpenAI 2021 года предоставила основу для преобразования, с сохранением авторами основной архитектуры, но с модификацией ее дополнительными головками внимания на различных разрешениях, более глубокими слоями и блоками BigGAN для улучшения стадий апсемплинга и дасемплинга.
Управление направлением осуществлялось с помощью CLIP-промптов: конкретно, лицо с макияжем и лицо без макияжа, чтобы модель научилась двигаться в желаемом семантическом направлении, позволяя удалять макияж без компрометации деталей лица, сигналов возраста или идентичности.

Синтетический макияж, нанесенный с помощью EleGANt. Каждая тройка показывает исходное изображение UTKFace (слева), стиль макияжа-отсылки (в центре) и результат после переноса стиля (справа). Такой перенос макияжа часто встречается в литературе по компьютерному зрению, и такая функция также доступна в нейронных фильтрах Adobe Photoshop, которые могут аналогично наносить макияж из изображения-отсылки на целевое изображение.
Четыре ключевых функции потерь руководили удалением макияжа без влияния на идентичность лица или сигналы возраста. Кроме вышеупомянутой функции потерь на основе CLIP, идентичность сохранялась с помощью взвешенной пары потерь ArcFace, взятых из библиотеки InsightFace – потерь, которые измеряли сходство между сгенерированным лицом и как исходным чистым изображением, так и “сделанным” макияжем, обеспечивая визуальную согласованность субъекта до и после удаления макияжа.
Третьей функцией потерь был перцептуальный метрический показатель LPIPS, который использовал расстояние L1 для обеспечения реализма на уровне пикселей и сохранения общего вида исходного изображения после удаления макияжа.
Наконец, возраст контролировался с помощью настроенной сети SSRNet, обученной на UTKFace, с моделью, использующей сглаженную потерю L1 (с более тяжелыми штрафами за ошибки в возрасте 10-29 лет, где неправильная классификация наиболее распространена). Вариант модели заменил это на промпт возраста на основе CLIP, побуждая модель соответствовать внешнему виду конкретного возраста.
Для оценки возраста в время вывода (в отличие от использования SSRNet во время обучения) использовалась рамка MiVOLO 2023 года.
Данные и тесты
Настройка SSRNet на UTKFace использовала набор обучения из 15 364 изображений, против тестового набора из 6 701 изображения. Исходные 20 000 изображений были отфильтрованы, чтобы удалить всех, кому было более 70 лет, и затем аналогично разделены в соотношении 70:30.
В соответствии с предыдущим методом, установленным проектом DiffAM 2023 года, обучение затем проводилось в два этапа, с первоначальной сессией, использующей 300 реальных изображений макияжа (на этот раз 200/100 раздел между обучением и проверкой) из набора данных MT BeautyGAN.
Модель была затем усовершенствована дальше, используя 300 дополнительных изображений UTKFace, дополненных синтетическим макияжем с помощью EleGANt. Это создало окончательный набор обучения из 600 примеров, парных по пяти стилям макияжа из BeautyGAN. Поскольку удаление макияжа предполагает сопоставление многих стилей макияжа с одним чистым лицом, обучение было сосредоточено на широкой обобщаемости, а не на покрытии каждого возможного варианта косметики.
Производительность оценивалась на синтетических и реальных изображениях. Синтетическое тестирование использовало 2 556 изображений набора данных Flickr-Faces-HQ (FFHQ), равномерно отобранных по девяти возрастным группам ниже 70, и измененных с помощью EleGANt.
Обобщаемость оценивалась с помощью 3 000 изображений из BeautyFace и 355 из LADN, оба содержащие аутентичный макияж.

Примеры из набора данных BeautyFace, демонстрирующие семантическую сегментацию, определяющую различные области поверхности лица. Source: https://li-chongyi.github.io/BeautyREC_files/
Метрики и реализация
Для метрик авторы использовали среднюю абсолютную ошибку (MAE) между фактическими значениями (реальными изображениями с установленными возрастами) и предсказанными значениями возраста, где более низкие результаты лучше; точность возрастных групп использовалась для оценки того, попали ли предсказанные возрасты в правильные возрастные группы (в этом случае более низкие результаты лучше); точность определения несовершеннолетних и взрослых использовалась для оценки правильной идентификации людей старше 18 лет (в этом случае более высокий результат лучше).
Дополнительно, хотя это и не является центральной темой обсуждения, авторы также сообщают о метриках верификации идентичности в виде истинного коэффициента совпадения (TMR) и ложного коэффициента совпадения (FMR), с дальнейшим сообщением о связанных значениях кривой ROC.
SSRNet была настроена на изображениях размером 64×64 пикселя с батч-размером 50 под оптимизатором Adam с выбросом весов 1e−4, а также графиком косинусного затухания и скоростью обучения 1e−3 за 200 эпох, с ранней остановкой.
Напротив, модуль DiffClean получал входные изображения размером 256×256 пикселей и настраивался в течение пяти эпох с использованием Adam при более грубой скорости обучения 4e−3. Семплирование использовало 40 шагов инверсии DDIM и 6 шагов DDIM вперед. Все обучение проводилось на одном графическом процессоре NVIDIA A100 (не указано, имел ли он 40 ГБ или 80 ГБ видеопамяти).
Системы-соперники, протестированные в работе, включали CLIP2Protect и вышеупомянутый DiffAM. Авторы использовали “матовые” стили макияжа в рабочем процессе, поскольку, как отмечено в CLIP2Protect, это достигает более высокого успеха (предположительно, предоставляя возможность обхода этого подхода – но это тема для другого раза).
Чтобы воспроизвести DiffAM в качестве базовой модели, использовалась предварительно обученная модель из BeautyGAN, настроенная на наборе данных MT. Для атак макияжа использовалась контрольная точка из DiffAM с параметрами по умолчанию для целевой модели, изображения-отсылки и идентичности.

Производительность DiffClean по сравнению с базовыми моделями на задачах оценки возраста, используя MiVOLO. Сообщенные метрики включают точность классификации несовершеннолетних и взрослых, точность возрастных групп и среднюю абсолютную ошибку (MAE). DiffClean с потерей возраста на основе CLIP достигает лучших результатов во всех метриках.
Из этих результатов авторы заявляют:
‘Наш метод DIFFCLEAN превосходит обе базовые модели, CLIP2Protect и DiffAM, и может успешно восстановить сигналы возраста, нарушенные макияжем, снижая MAE (до 5,71) и улучшая общую точность возрастных групп (до 37%).
‘Наша цель была сосредоточена на несовершеннолетних возрастных группах, и результаты показывают, что мы достигаем лучшей классификации несовершеннолетних и взрослых в размере 88,6%.’

Результаты удаления макияжа из базовых и предложенных методов. Левый столбец показывает исходные изображения, следующий – выводы из CLIP2Protect и DiffAM. Третий столбец показывает результаты из DiffClean через SSRNet и потерю возраста на основе CLIP. Авторы утверждают, что DiffClean удаляет макияж более эффективно, избегая искажения особенностей, наблюдаемого в CLIP2Protect, и пропущенных косметических средств в DiffAM.
Авторы进一步 отмечают, что макияж не оказывает единообразного влияния на воспринимаемый возраст, а скорее может увеличить, уменьшить или не изменить воспринимаемый возраст лица. Поэтому DiffClean не применяет “бланкетное снижение” предсказанного возраста, а вместо этого пытается восстановить исходные сигналы возраста, удаляя косметические следы:

Примеры удаления макияжа из наборов данных CelebA-HQ и CACD. Каждая колонка показывает пару изображений до (слева) и после (справа) удаления макияжа. В первом столбце предсказанный возраст уменьшается после удаления макияжа; во втором он остается неизменным; и в третьем он увеличивается.
Чтобы протестировать, насколько хорошо DiffClean работает на новых данных, его запустили на наборах данных BeautyFace и LADN, содержащих аутентичный макияж, но не имеющих парных изображений одних и тех же субъектов без косметики. Сравнили прогнозы возраста до и после удаления макияжа, чтобы оценить, насколько эффективно DiffClean снижает искажение, введенное макияжем:

Результаты удаления макияжа на реальных изображениях из наборов данных LADN (левая пара) и BeautyFace (правая пара). DiffClean снижает предсказанные возрасты, удаляя косметику, сокращая разрыв между воспринимаемым и фактическим возрастом. Белые числа показывают оценки возраста до и после обработки.
Результаты показали, что DiffClean последовательно сокращает разрыв между воспринимаемым и фактическим возрастом. На обоих наборах данных он снизил ошибки переоценки и недооценки примерно на три года в среднем, что указывает на хорошую обобщаемость на реальные стили макияжа.
Вывод
Это интересно и, возможно, неизбежно, что перформанс-макияж будет использоваться враждебным образом. Учитывая, что девочки созревают с разной скоростью, но последовательно созревают быстрее как группа, задача определения границы между несовершеннолетним и взрослым статусом может быть одной из самых амбициозных, которые исследовательская область поставила перед собой.
Тем не менее, время и данные в конечном итоге могут определить постоянные возрастные признаки, которые можно использовать для закрепления визуальных систем верификации возраста.
* Поскольку эта тема вызывает споры и поскольку ‘девочки’ является исключительным термином (в то время как ‘женщины и девочки’, текущий приемлемый термин для людей с женским полом, не является точным описанием в этом случае), я выбрал ‘женский пол’ в качестве лучшего компромисса, который я мог придумать – хотя это и не отражает все демографические нюансы, за которые я извиняюсь.
† В этой статье я использую ‘перформанс’ для обозначения макияжа, предназначенного для того, чтобы быть видимым и распознаваемым как макияж, такого как тушь, подводка для глаз, румяна и основа, в отличие от средств для скрытия и других ‘скрытых’ видов косметических применений.
Опубликовано впервые в пятницу, 18 июля 2025 года












