Взгляд Anderson

Система ИИ, которая может сделать изображения людей более ‘красивыми’

mm
Добавьте Unite.AI в избранные источники в Google
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

Исследователи из Китая разработали новую систему улучшения изображений на основе ИИ, которая способна сделать изображения человека более ‘красивыми’, основанную на новом подходе к обучению с подкреплением.

Новый подход использует 'сеть предсказания красоты лица' для итерации через вариации изображения на основе ряда факторов, среди которых 'освещение' и положение глаз могут быть критическими факторами. Здесь исходные источники (слева в каждом столбце) взяты из системы EigenGAN, с новыми результатами справа от них. Источник: https://arxiv.org/pdf/2208.04517.pdf

Новый подход использует ‘сеть предсказания красоты лица’ для итерации через вариации изображения на основе ряда факторов, среди которых ‘освещение’ и положение глаз могут быть критическими факторами. Здесь исходные источники (слева в каждом столбце) взяты из системы EigenGAN, с новыми результатами справа от них. Источник: https://arxiv.org/pdf/2208.04517.pdf

Техника основана на инновациях, открытых для генератора EigenGAN, другого китайского проекта, из 2021 года, который сделал заметные шаги в выявлении и получении некоторого контроля над разнообразными семантическими атрибутами в латентном пространстве сети GAN.

Генератор EigenGAN 2021 года смог индивидуализировать высокоуровневые понятия, такие как 'цвет волос', в латентном пространстве сети GAN. Новая работа строится на этом инновационном инструменте, чтобы предоставить систему, которая может 'украсить' исходные изображения, но без изменения узнаваемой идентичности – проблема в предыдущих подходах. Источник: https://arxiv.org/pdf/2104.12476.pdf

Генератор EigenGAN 2021 года смог индивидуализировать высокоуровневые понятия, такие как ‘цвет волос’, в латентном пространстве сети GAN. Новая работа строится на этом инновационном инструменте, чтобы предоставить систему, которая может ‘украсить’ исходные изображения, но без изменения узнаваемой идентичности – проблема в предыдущих подходах. Источник: https://arxiv.org/pdf/2104.12476.pdf

Система использует ‘сеть оценки эстетики’ на основе SCUT-FBP5500 (SCUT), набора данных для предсказания красоты лица 2018 года из Южного китайского университета технологий в Гуанчжоу.

Из статьи 2018 года 'SCUT-FBP5500: Разнообразный набор данных для многопарадигмального предсказания красоты лица', который предложил 'сеть предсказания красоты лица' (FBP), способную ранжировать лица по степени воспринимаемой привлекательности, но которая не могла фактически преобразовать или 'улучшить' лица. Источник: https://arxiv.org/pdf/1801.06345.pdf

Из статьи 2018 года ‘SCUT-FBP5500: Разнообразный набор данных для многопарадигмального предсказания красоты лица’, который предложил ‘сеть предсказания красоты лица’ (FBP), способную ранжировать лица по степени воспринимаемой привлекательности, но которая не могла фактически преобразовать или ‘улучшить’ лица. Источник: https://arxiv.org/pdf/1801.06345.pdf

В отличие от новой работы, проект 2018 года не может фактически выполнять преобразования, но содержит алгоритмические суждения для 5 500 лиц, предоставленные 60 смешанными маркерами (50/50 раздел). Эти были включены в новую систему как эффективный дискриминатор, чтобы проинформировать преобразования, которые, вероятно, улучшат ‘привлекательность’ изображения.

Интересно, что новая статья озаглавлена Генерация красивого лица кавказoidной расы с помощью эстетически обусловленного обучения с подкреплением. Причина, по которой все расы, кроме кавказской, исключены из системы (рассмотрите также, что сами исследователи китайцы), заключается в том, что исходные данные для SCUT сильно смещены к азиатским источникам (4000 равномерно разделенных азиатских женщин/мужчин, 1500 равномерно разделенных кавказских женщин/мужчин), что делает ‘среднего человека’ в этом наборе данных коричневоволосым и кареглазым.

Следовательно, чтобы приспособиться к вариациям цвета хотя бы в одной расе, было необходимо исключить азиатскую компоненту из исходных данных или пойти на значительные расходы на реконструкцию данных, чтобы разработать метод, который может не оправдать ожиданий. Кроме того, вариации в культурных представлениях о красоте неизбежно означают, что такие системы будут нуждаться в некоторой степени географической конфигурации в отношении того, что составляет ‘привлекательность’.

Важные атрибуты

Чтобы определить основные факторы, способствующие ‘привлекательному’ фото человека, исследователи также протестировали эффект различных изменений изображений в отношении того, насколько хорошо такие дополнения повысили алгоритмическое восприятие ‘красоты’. Они обнаружили, что хотя бы один из аспектов более важен для хорошей фотографии, чем для хорошей генетики:

Помимо освещения, аспекты, которые имели наибольшее влияние на оценку красоты, были челки (которые, в случае мужчин, могут часто быть эквивалентны полной голове волос), поза тела и расположение глаз (где взаимодействие с точкой зрения камеры является стимулом для привлекательности).

(Что касается ‘цвета помады’, новая система, которая может работать эффективно как на мужских, так и на женских представлениях гендера, не индивидуализирует гендерное появление, а скорее полагается на новую систему дискриминации как на ‘фильтр’ в этом отношении)

Метод

Функция вознаграждения в механизме обучения с подкреплением в новой системе работает на простой регрессии над данными SCUT, которая выводит предсказания красоты лица.

Система обучения итеративно проходит через входные изображения (внизу слева на схеме ниже). Первоначально предварительно обученная модель ResNet18 (обученная на ImageNet) извлекает признаки из пяти идентичных (‘y’) изображений. Далее, потенциальное преобразовательное действие выводится из скрытого состояния полностью связанного слоя (GRUCell, на изображении ниже), и преобразования применяются, что приводит к пяти измененным изображениям, которые вводятся в сеть оценки эстетики, чьи рейтинги, в стиле Дарвина, будут определять, какие вариации будут разработаны и какие отбрасываются.

Общая иллюстрация рабочего процесса новой системы.

Иллюстрация рабочего процесса новой системы.

Сеть оценки эстетики использует модуль эффективного канального внимания (ECA), а адаптация предварительно обученной модели EfficientNet-B4 задача извлечения 1792 признаков из каждого изображения.

После нормализации через функцию активации ReLU получается 4-мерный вектор, который затем упрощается до одномерного вектора после активации и адаптивного усреднего пулинга. Наконец, результаты вводятся в сеть регрессии, которая извлекает оценку эстетики.

Качественное сравнение выхода системы. В нижнем ряду мы видим сумму всех индивидуализированных аспектов, которые были выявлены методом EigenGAN и затем улучшены. Средние значения FID для изображений находятся слева от рядов изображений (больше лучше).

Качественное сравнение выхода системы. В нижнем ряду мы видим сумму всех индивидуализированных аспектов, которые были выявлены методом EigenGAN и затем улучшены. Средние значения FID для изображений находятся слева от рядов изображений (больше лучше).

Тесты и пользовательское исследование

Пять вариантов предложенного метода были оценены алгоритмически (см. изображение выше), с использованием метрики Fréchet inception distance (FID, спорной в некоторых кварталах) для 1000 изображений, прошедших через систему.

Исследователи отмечают, что улучшение освещения достигло лучшего балла привлекательности для объектов на фотографиях, чем несколько других более ‘очевидных’ возможных изменений (т. е. фактического вида человека).

До определенной степени тестирование системы таким образом ограничено эксцентричностями данных SCUT, которые не содержат многих ‘ярких улыбок’, и авторы утверждают, что это может чрезмерно переоценить более типичный ‘загадочный’ вид в данных по сравнению с вероятными предпочтениями потенциальных конечных пользователей (предположительно, в данном случае, западного рынка).

Однако, поскольку вся система основана на средних мнениях только 60 человек (в статье EigenGAN), и поскольку качество, которое изучается, далеко не эмпирическое, можно утверждать, что процедура более звучна, чем сам набор данных.

Хотя это очень кратко рассматривается в статье, изображения из EigenGAN и пяти вариантов системы также были показаны в ограниченном пользовательском исследовании (восемь участников), которым было предложено выбрать ‘лучшее изображение’ (слово ‘привлекательное’ было избегнуто).

Выше, интерфейс, представленный небольшой группе исследования; ниже, результаты.

Выше, интерфейс, представленный небольшой группе исследования; ниже, результаты.

Результаты показывают, что выход новой системы достиг最高 уровня выбора среди участников (‘MAES’ на изображении выше).

Бесцельное преследование красоты

Полезность такой системы трудна для установления, несмотря на то, что кажется заметным локусом усилий в Китае для достижения этих целей. Ни один из них не изложен в новой публикации.

Предыдущая статья EigenGAN предполагает*, что система распознавания красоты может быть использована в системах рекомендации синтеза макияжа для лица, эстетической хирургии, украшения лица, или контент-ориентированном извлечении изображений.

Предположительно, такой подход также может быть использован на сайтах знакомств, пользователями, чтобы ‘улучшить’ свои собственные профильные фотографии в гарантированный ‘удачный снимок’, как альтернативу использованию устаревших фотографий или фотографий других людей.

Аналогично, сайты знакомств сами могут ‘оценить’ своих клиентов, чтобы создать рейтинги и даже ограниченные уровни доступа, хотя это, вероятно, будет работать только через аутентификацию на основе активности, а не через отправленные фотографии (которые также могут быть ‘улучшены’ клиентами, если подход станет популярным).

В рекламе алгоритмический метод оценки красоты (технология, предсказанная покойным научным фантастом Майклом Крайтоном в его кинопроизведении 1982 года Looker) может быть использован для выбора неулучшенного творческого выхода, наиболее вероятного для вовлечения целевой аудитории, в то время как возможность фактически максимизировать эстетическое воздействие изображений лица без фактического переписывания их в стиле глубоких фейков может повысить уже эффективные изображения, предназначенные для привлечения общественного внимания.

Новая работа поддерживается Национальным природным научным фондом Китая, открытым фондом проекта Государственного ключевого лаборатории управления и контроля сложных систем, и проектом философских и социальных научных исследований Министерства образования Китая, среди других сторонников.

 

* Многие рекомендации статьи EigenGAN указывают на коммерчески доступную книгу 2016 года под названием ‘Компьютерные модели анализа красоты лица’, а не на академические ресурсы.

Опубликовано 11 августа 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai