Погляд Anderson

Інструмент AI видаляє макіяж, щоб запобігти неповнолітнім обходити перевірку віку

mm
Додайте Unite.AI до бажаних джерел у Google
Flux, SDXL, Photoshop Neural filters, Firefly, Krita et al.

Зовнішній вигляд косметики на обличчі дозволяє неповнолітнім користувачам, переважно дівчатам, обходити перевірку віку на основі селфі на платформах, таких як додатки для знайомств і електронної комерції. Новий інструмент AI усуває цю лазу, використовуючи дискримінативну модель, навчену видаляти макіяж, зберігаючи при цьому ідентичність, що робить ще складніше для неповнолітніх обманути автоматизовані системи.

 

Використання сторонніх сервісів перевірки віку на основі селфі зростає, не в останню чергу через загальний глобальний імпульс до онлайн-верифікації віку.

Наприклад, у новому режимі виконання, який тепер передбачений законом про онлайн-безпеку Великої Британії, перевірку віку можна проводити різними сторонніми послугами, які використовують різні методи, включаючи візуальну верифікацію віку, при якій AI використовується для візуального передбачення віку користувача (зазвичай з живого відеопотоку мобільної камери). Послуги, які використовують підходи цього типу, включають Ondato, TrustStamp і Yoti.

Однак же оцінка віку не є невразливою, а традиційна тенденція підлітків до того, щоб передбачити права дорослого віку, означає, що молоді люди розробили різноманітні ефективні методи для входу на сайти знайомств, форуми та інші середовища, які забороняють їхню вікову групу.

Одним із цих методів, який найчастіше використовують дівчата*, є носіння макіяжу на обличчі – тактика, відомої здатності обманути автоматизовані системи оцінки віку, які зазвичай завищують вік молодих людей і занижують вік старших людей.

Не тільки дівчата

Перед тим, як виникнуть протести щодо розгляду макіяжу як “жіноцентричного”, ми повинні звернути увагу на те, що присутність косметики на обличчі хто-небудь є дуже ненадійним індикатором статі:

У статті 'Вплив косметики на автоматичні алгоритми визначення статі та віку' американські дослідники виявили, що системи верифікації статі були обмануті макіяжем, який змінює стать. Джерело: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

У статті ‘Вплив косметики на автоматичні алгоритми визначення статі та віку’ американські дослідники виявили, що системи верифікації статі були обмануті макіяжем, який змінює стать. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

У 2024 році 72% чоловіків-споживачів у віці 18-24 років у США, як оцінюється, включили макіяж у свою звичайну процедуру догляду за собою – хоча більшість використовує косметичні продукти для покращення вигляду здорової шкіри, а не для використання видовищного макіяжу, який більш асоціюється з візуальними естетикою жінок.

Отже, ми не можемо не розглядати матеріал, досліджений у цій статті, уздовж лінії найбільш поширеної ситуації, дослідженої в нових дослідженнях – тобто використання неповнолітніми дівчатами макіяжу для обходу автоматизованих візуальних систем верифікації віку.

Ефективне видалення макіяжу – Шлях AI

Дослідження, згадане вище, походять від трьох учасників Нью-Йоркського університету у вигляді нової статті DiffClean: Дифузійне видалення макіяжу для точної оцінки віку.

Метою проекту є досягнення методу видалення макіяжу з зображень (потенційно включаючи відеоізображення) за допомогою AI, щоб отримати краще уявлення про справжній вік людини за макіяжем.

З нової статті приклад видалення макіяжу. Джерело: https://arxiv.org/pdf/2507.13292

З нової статті приклад того, як видалення макіяжу може суттєво змінити передбачення віку. Source: https://arxiv.org/pdf/2507.13292

Одним із викликів створення такої системи є потенційна чутливість щодо збору або кураторства зображень неповнолітніх дівчат у макіяжі. У підсумку дослідники використали сторонню систему генерації суперрозрішення EleGANt для штучного нанесення макіяжу на зображення, що стало дуже ефективним:

Система EleGANt Університету Цінхуа 2022 року використовує генеративні суперрозрішення (GAN) для аутентичного нанесення косметики на вихідні фотографії. Джерело: https://arxiv.org/pdf/2207.09840

Система EleGANt Університету Цінхуа 2022 року використовує генеративні суперрозрішення (GAN) для аутентичного нанесення косметики на вихідні фотографії. Source: https://arxiv.org/pdf/2207.09840

З допомогою синтетичних даних, отриманих таким чином, і з допомогою різноманітних допоміжних проектів і наборів даних, автори змогли перевершити найкращі методи оцінки віку при зустрічі з макіяжем.

У статті зазначається:

‘DiffClean [видаляє] сліди макіяжу за допомогою текстово-керованої дифузійної моделі для захисту від атак макіяжу. [Він] покращує оцінку віку (точність розрізнення неповнолітніх та дорослих на 4,8%) і верифікацію особи (TMR на 8,9% при FMR=0,01%) щодо порівняльних базових моделей на цифрових і реальних зображеннях з макіяжем.’

Давайте розглянемо, як вони підійшли до цього завдання.

Метод

Щоб уникнути використання реальних зображень неповнолітніх у макіяжі, автори використали EleGANt для нанесення синтетичних косметичних засобів на зображення з набору даних UTKFace, створюючи перед-і-після пари для навчання.

Приклади з набору даних UTKFace. Джерело: https://susanqq.github.io/UTKFace/

Приклади з набору даних UTKFace. Source: https://susanqq.github.io/UTKFace/

DiffClean був потім навчений для зворотного перетворення. Оскільки алгоритми оцінки віку найбільш помиляються при роботі з молодшими віковими групами, дослідники виявили необхідність розробити проміжний класифікатор віку, підігнаний на цільових віках (10-19 років). Для цього вони використали архітектуру SSRNet, навчену на UTKFace, з ваговим L1-потерями.

Упрощена версія дифузійної моделі OpenAI 2021 року стала основою для перетворення, при цьому автори зберегли основну архітектуру, але змінили її додатковими головками уваги на різних роздільностях, глибших шарах і блоками BigGAN для покращення стадій апсемплінгу та даунсемплінгу.

Керування напрямком здійснювалося за допомогою CLIP-промптів: конкретно, обличчя з макіяжем і обличчя без макіяжу, так що модель навчилася рухатися у бажаному семантичному напрямку, дозволяючи видаляти макіяж без компрометації деталей обличчя, вікових ознак або ідентичності.

Синтетичний макіяж, нанесений за допомогою EleGANt. Кожна трійка показує оригінальне зображення UTKFace (ліворуч), стилістичний макіяж (в центрі) і результат після переносу стилю (праворуч).

Синтетичний макіяж, нанесений за допомогою EleGANt. Кожна трійка показує оригінальне зображення UTKFace (ліворуч), стилістичний макіяж (в центрі) і результат після переносу стилю (праворуч). Перенос макіяжу такого типу поширений у комп’ютерному баченні літератури, і така можливість також доступна в нейронних фільтрах Adobe Photoshop, який може подібним чином наносити макіяж з посилочного зображення на цільове зображення.

Чотири ключові функції втрат керували видаленням макіяжу без впливу на ідентичність обличчя або вікові ознаки. Окрім вищезазначеної CLIP-основаної втрати, ідентичність зберігалася за допомогою вагової пари ArcFace-втрат, взятих з бібліотеки InsightFace – втрат, які вимірювали схожість між згенерованим обличчям і як оригінальним чистим зображенням, так і “зробленим” з макіяжем, забезпечуючи візуальну узгодженість суб’єкта до та після видалення макіяжу.

Третій, перцептуальна втрата Навчені перцептуальні подібності (LPIPS) використовувала L1-відстань для забезпечення піксельного реалізму та збереження загального вигляду оригінального зображення після видалення макіяжу.

Нарешті, вік контролювався за допомогою підігнаного SSRNet, навченого на UTKFace, при цьому модель використовувала згладжену L1-втрату (із більшими штрафами за помилки у віковому діапазоні 10-29 років, де неправильна класифікація найпоширеніша). Варіант моделі замінив це на CLIP-оснований вік-промпт, який спонукав модель до відповідності вигляду конкретного віку.

Для оцінки віку під час інференсу (на відміну від використання SSRNet під час навчання) використовувалася рамка MiVOLO 2023 року.

Дані та тести

Підігнаний UTKFace використовував набір даних для навчання з 15 364 зображень, проти тестового набору з 6 701 зображень. Оригінальні 20 000 зображень були фільтровані для видалення осіб старше 70 років, а потім розділені у співвідношенні 70:30.

У відповідності з попереднім методом, встановленим проектом DiffAM 2023 року, навчання проходило у два етапи, з початковою сесією, яка використовувала 300 реальних зображень з макіяжем (цей раз 200/100 розділення між навчанням і валідацією) з набору даних MT BeautyGAN.

Модель була потім доопрацьована за допомогою 300 додаткових зображень UTKFace, доповнених синтетичним макіяжем за допомогою EleGANt. Це створило остаточний навчальний набір з 600 прикладів, спарених по п’ятьма стилістичними посиланнями з BeautyGAN. Оскільки видалення макіяжу включає відображення багатьох стилістичних макіяжів на одну чисту особу, навчання зосередилося на широкій генералізації замість покриття кожного можливого варіанту косметики.

Профіцит оцінювався на синтетичних і реальних зображеннях. Синтетичне тестування використовувало 2 556 зображень з Flickr-Faces-HQ (FFHQ), рівномірно вибраних з дев’яти вікових груп до 70 років, і змінених за допомогою EleGANt.

Генералізація оцінювалася за допомогою 3 000 зображень з BeautyFace і 355 з LADN, які містять справжній макіяж.

Приклади з набору даних BeautyFace, які демонструють семантичну сегментацію, що визначає різні ділянки обличчя, що піддаються впливу. Джерело: https://li-chongyi.github.io/BeautyREC_files/

Приклади з набору даних BeautyFace, які демонструють семантичну сегментацію, що визначає різні ділянки обличчя, що піддаються впливу. Source: https://li-chongyi.github.io/BeautyREC_files/

Метрики та реалізації

Для метрик автори використовували середню абсолютну похибку (MAE) між фактичним віком (реальними зображеннями з встановленим віком) і передбачуваним віком, де нижчі результати кращі; точність вікової групи використовувалася для оцінки того, чи передбачені віки потрапляють у правильні вікові групи (у цьому випадку нижчі результати кращі); точність розрізнення неповнолітніх та дорослих використовувалася для оцінки правильної ідентифікації осіб старше 18 років (у цьому випадку вищі результати кращі).

Додатково, хоча це не є центральним для розглянутого питання, автори також повідомляють про метрики верифікації особи у вигляді справжньої частоти збігів (TMR) і помилкової частоти збігів (FMR), а також додаткову інформацію про пов’язані хαραктеристику операторного прийняття-помилки (ROC) значення.

SSRNet був підігнаний на зображеннях розміром 64×64 пікселів з ваговим розміром 50 під оптимізатором Adam з ваговим衰減ем 1e−4, а також графіком анелінгу косинуса і швидкістю навчання 1e−3 протягом 200 епох, з ранньою зупинкою, через 200 епох.

Натомість модуль DiffClean отримував вхідні зображення розміром 256×256 пікселів і підігнався протягом п’яти епох за допомогою Adam, зі швидкістю навчання 4e−3. Зразкування використовувало 40 DDIM-інверсійних кроків і 6 DDIM-прямих кроків. Усі навчання проводилися на одному графічному процесорі NVIDIA A100 (чи з 40 ГБ, чи з 80 ГБ відеопам’яті не було вказано).

Системи-суперники, які проходили тестування, були CLIP2Protect і вищезгаданий DiffAM. Автори використовували ‘матові’ стилі макіяжу у робочому процесі, оскільки це було відзначено у CLIP2Protect як досягнення вищого успіху (причому це, очевидно, дає можливість тим, хто намагається обійти цей підхід – але це питання для іншого разу).

Щоб повторити DiffAM як базовий рівень, попередньо навчена модель з BeautyGAN була підігнана на наборі даних MT. Для суперника макіяжу використовувався чекпойнт з DiffAM з параметрами за замовчуванням для цільової моделі, посилочного зображення та ідентичності.

Профіцит DiffClean у порівнянні з базовими моделями на завданнях оцінки віку, використовуючи MiVOLO. Метрики, які повідомляються, включають точність розрізнення неповнолітніх та дорослих, точність вікової групи та середню абсолютну похибку (MAE). DiffClean з CLIP-віком втрат досягає найкращих результатів у всіх метриках.

Профіцит DiffClean у порівнянні з базовими моделями на завданнях оцінки віку, використовуючи MiVOLO. Метрики, які повідомляються, включають точність розрізнення неповнолітніх та дорослих, точність вікової групи та середню абсолютну похибку (MAE). DiffClean з CLIP-віком втрат досягає найкращих результатів у всіх метриках.

З цих результатів автори зазначають:

‘Наш метод DIFFCLEAN перевершує обидві базові моделі, CLIP2Protect і DiffAM, і може успішно відновити вікові ознаки, порушені макіяжем, знижуючи MAE (до 5,71) і покращуючи загальну точність вікової групи (до 37%).

‘Наша мета була зосереджена на неповнолітніх вікових групах, і результати показують, що ми досягли вищої точності розрізнення неповнолітніх та дорослих у 88,6%.’

Результати видалення макіяжу з базових і запропонованих методів. Лівий стовпець показує вихідні зображення, наступні – виходи з CLIP2Protect і DiffAM. Третій стовпець показує результати з DiffClean через SSRNet і CLIP-вікові втрати. Автори стверджують, що DiffClean видаляє макіяж більш ефективно, уникнувши спотворення ознак у CLIP2Protect і пропущених косметичних засобів у DiffAM.

Результати видалення макіяжу з базових і запропонованих методів. Лівий стовпець показує вихідні зображення, наступні – виходи з CLIP2Protect і DiffAM. Третій стовпець показує результати з DiffClean через SSRNet і CLIP-вікові втрати. Автори стверджують, що DiffClean видаляє макіяж більш ефективно, уникнувши спотворення ознак у CLIP2Protect і пропущених косметичних засобів у DiffAM.

Автори далі зазначають, що макіяж не має однорідного впливу на сприйняття віку, а радше може збільшити, зменшити або залишити без змін сприйняття віку обличчя. Тому DiffClean не застосовує ‘бланкетне зниження’ передбачуваного віку, а радше намагається відновити оригінальні вікові ознаки, видаливши сліди косметики:

Приклади видалення макіяжу з наборів даних CelebA-HQ і CACD. Кожен стовпець показує пару зображень до (ліворуч) і після (праворуч) видалення макіяжу. У першому стовпці передбачуваний вік зменшується після видалення макіяжу; у другому – залишається незмінним; і в третьому – збільшується.

Приклади видалення макіяжу з наборів даних CelebA-HQ і CACD. Кожен стовпець показує пару зображень до (ліворуч) і після (праворуч) видалення макіяжу. У першому стовпці передбачуваний вік зменшується після видалення макіяжу; у другому – залишається незмінним; і в третьому – збільшується.

Щоб протестувати, як добре DiffClean працює на нових даних, його запустили на наборах даних BeautyFace і LADN, які містять справжній макіяж, але не мають парних зображень тих самих осіб без косметики. Оцінки віку, зроблені до та після видалення макіяжу, порівнювалися для оцінки того, наскільки ефективно DiffClean зменшує спотворення, введене макіяжем:

Результати видалення макіяжу на реальних зображеннях з наборів даних LADN (ліворуч) і BeautyFace (праворуч). DiffClean зменшує передбачуваний вік, видаливши косметику, зменшуючи розрив між очевидним і фактичним віком. Білі цифри показують оцінки віку до та після обробки.

Результати видалення макіяжу на реальних зображеннях з наборів даних LADN (ліворуч) і BeautyFace (праворуч). DiffClean зменшує передбачуваний вік, видаливши косметику, зменшуючи розрив між очевидним і фактичним віком. Білі цифри показують оцінки віку до та після обробки.

Результати показали, що DiffClean послідовно зменшує розрив між очевидним і фактичним віком. У обох наборах даних він зменшував завищення та заниження похибок приблизно на три роки в середньому, що свідчить про те, що система добре узагальнюється на реальні стилі макіяжу.

Висновок

Цікаво, і, можливо, неминуче, що макіяж буде використовуватися у вороговому ключі. Враховуючи, що дівчата дозрівають з різною швидкістю, але послідовно дозрівають швидше як група, завдання визначення межі між неповнолітнім і дорослим статусом жінок може бути одним із найамбітніших, які дослідження ще не поставило перед собою.

Незважаючи на це, час і дані можуть врешті-решт визначити постійні вікові ознаки, які можна буде використовувати для закріплення візуальних систем верифікації віку.

 

* Оскільки ця тема спонукає до використання зарядженої мови, і оскільки ‘дівчата’ є виключним (а ‘жінки та дівчата’, поточний прийнятий термін для людей жіночої статі, не є точним описом у цьому випадку), я вибрав ‘жінки’ як найкращий компроміс, який міг би бути придуманий – хоча це не охоплює всі демографічні нюанси, за які я вибачаюся.

У цій статті я використовую термін ‘performative’, щоб позначити макіяж, який призначений для того, щоб бути поміченим і визнаним як макіяж, такий як маскара, підводка для очей, рум’яна і фон, на відміну від приховувальних кремів та інших ‘таємних’ видів косметичних застосувань.

Перша публікація: п’ятниця, 18 липня 2025 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai