Взгляд Anderson
Оценка предсказания привлекательности лица для прямых трансляций

На данный момент Facial Attractiveness Prediction (FAP) в основном изучалась в контексте психологических исследований, в индустрии красоты и косметики, а также в контексте пластической хирургии. Это сложная область исследования, поскольку стандарты красоты склонны быть национальными, а не глобальными.
Это означает, что нет единой эффективной модели, основанной на ИИ, которая была бы жизнеспособна, поскольку средние значения, полученные путем выборки лиц/рейтингов из всех культур, будут сильно смещены (где более населенные страны получат дополнительную поддержку), или же применимы к никакой культуре (где среднее значение нескольких рас/рейтингов будет равным ни одной реальной расе).
Вместо этого задача состоит в том, чтобы разработать концептуальные методологии и рабочие процессы, в которые можно было бы включить данные, специфичные для страны или культуры, чтобы обеспечить разработку эффективных моделей FAP для каждого региона.
Случаи использования FAP в области красоты и психологических исследований довольно маргинальны, либо специфичны для отрасли; поэтому большинство наборов данных, созданных до сих пор, содержат только ограниченные данные или не были опубликованы вовсе.
Легкая доступность онлайн-предсказателей привлекательности, в основном ориентированных на западную аудиторию, не обязательно представляют собой состояние дел в области FAP, которое в настоящее время, по-видимому, доминируется восточно-азиатскими исследованиями (в основном Китаем) и соответствующими восточно-азиатскими наборами данных.

Примеры набора данных из статьи ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Источник: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30
Более широкие коммерческие применения оценки красоты включают онлайн-приложения для знакомств и системы генерации ИИ, предназначенные для ‘улучшения’ реальных аватаров людей (поскольку такие приложения требуют количественного стандарта красоты в качестве метрики эффективности).
Рисование лиц
Привлекательные люди продолжают быть ценным активом в рекламе и построении влияния, что делает финансовые стимулы в этих секторах ясной возможностью для продвижения передовых наборов данных и рамок FAP.
Например, модель ИИ, обученная реальным данным для оценки и рейтинга красоты лица, потенциально могла бы выявить события или людей с высоким потенциалом для рекламного воздействия. Эта способность была бы особенно актуальна в контексте прямых видеотрансляций, где метрики, такие как ‘подписчики’ и ‘лайки’, в настоящее время служат только неявными индикаторами способности человека (или даже типа лица) привлекать аудиторию.
Это, конечно, поверхностный показатель, и голос, презентация и точка зрения также играют значительную роль в привлечении аудитории. Поэтому создание наборов данных FAP требует человеческого надзора, а также способности различать лицевую привлекательность и ‘спекулятивную’ привлекательность (без которой влиятельные лица, такие как Алекс Джонс, могли бы повлиять на среднюю кривую FAP для коллекции, предназначенной исключительно для оценки красоты лица).
LiveBeauty
Чтобы решить проблему нехватки наборов данных FAP, исследователи из Китая предлагают первый крупномасштабный набор данных FAP, содержащий 100 000 изображений лиц, вместе с 200 000 человеческими аннотациями, оценивающими красоту лица.

Примеры из нового набора данных LiveBeauty. Источник: https://arxiv.org/pdf/2501.02509
Набор данных, озаглавленный LiveBeauty, включает 10 000 разных идентификаторов, все из которых были получены из (неуказанных) платформ прямой трансляции в марте 2024 года.
Авторы также представляют FPEM, новый многомодальный метод FAP. FPEM интегрирует целостные знания о лице и многомодальные эстетические семантические функции через модуль персонализированной привлекательности (PAPM), модуль многомодальной привлекательности (MAEM) и модуль слияния модальностей (CMFM).
Статья утверждает, что FPEM достигает передового уровня производительности на новом наборе данных LiveBeauty и других наборах данных FAP. Авторы отмечают, что исследования имеют потенциальные применения для улучшения качества видео, рекомендаций контента и ретуширования лица в прямых трансляциях.
Авторы также обещают сделать набор данных доступным ‘скоро’ – хотя, конечно, необходимо признать, что любые ограничения лицензирования, присущие исходному домену, вероятно, перейдут к большинству проектов, которые могут использовать эту работу.
Новая статья озаглавлена Прогнозирование привлекательности лица в прямых трансляциях: новый эталон и многомодальный метод и исходит от десяти исследователей из Alibaba Group и Шанхайского университета Цзяо Тун.
Метод и данные
Из каждой 10-часовой трансляции с платформ прямой трансляции исследователи отобрали одно изображение в час за первые три часа. Трансляции с наибольшим количеством просмотров были выбраны.
Собранные данные затем подверглись нескольким стадиям предварительной обработки. Первая из них – измерение размера области лица, которое использует модель обнаружения лиц FaceBoxes 2018 года для генерации ограничивающей рамки вокруг лицевых черт. Pipeline обеспечивает, чтобы более короткая сторона ограничивающей рамки превышала 90 пикселей, избегая небольших или нечетких областей лица.
Второй шаг – обнаружение размытия, которое применяется к области лица с помощью дисперсии оператора Лапласа в канале высоты (Y) лицевого кадра. Эта дисперсия должна быть больше 10, что помогает фильтровать размытые изображения.
Третий шаг – оценка позы лица, которая использует модель оценки позы 3DDFA-V2 2021 года:

Примеры из модели оценки позы 3DDFA-V2. Источник: https://arxiv.org/pdf/2009.09960
Здесь pipeline обеспечивает, чтобы угол наклона обрезанного лица не превышал 20 градусов, а угол поворота не превышал 15 градусов, что исключает лица с экстремальными позами.
Четвертый шаг – оценка пропорций лица, которая также использует возможности сегментации модели 3DDFA-V2, обеспечивая, чтобы пропорция области лица была больше 60% изображения, исключая изображения, где лицо не является заметным. т.е. небольшое в общем изображении.
Наконец, пятый шаг – удаление дубликатов, которое использует (неатрибутированную) модель распознавания лиц передового уровня, для случаев, когда одна и та же идентификация появляется более чем в одном из трех изображений, собранных для 10-часового видео.
Оценка и аннотация человека
Были набраны 20 аннотаторов, состоящие из шести мужчин и 14 женщин, отражающих демографию используемой платформы прямой трансляции*. Лица отображались на 6,7-дюймовом экране iPhone 14 Pro Max в условиях постоянной лабораторной среды.
Оценка была разделена на 200 сессий, каждая из которых использовала 50 изображений. Испытуемым было предложено оценить привлекательность образцов по шкале от 1 до 5, с пятиминутным перерывом между каждой сессией, и все испытуемые участвовали во всех сессиях.
Следовательно, все 10 000 изображений были оценены двадцатью людьми, в результате чего получилось 200 000 аннотаций.
Анализ и предварительная обработка
Сначала была проведена пост-экранизация с помощью коэффициента ранговой корреляции Спирмена (SROCC) и аутлиер-коэффициента. Испытуемые, чьи рейтинги имели SROCC меньше 0,75 или аутлиер-коэффициент больше 2%, считались ненадежными и были удалены, в результате чего было получено 20 испытуемых..
Затем был рассчитан средний балл мнений (MOS) для каждого изображения лица, путем усреднения баллов, полученных действительными испытуемыми. MOS служит эталонным баллом привлекательности для каждого изображения, и балл рассчитывается путем усреднения всех индивидуальных баллов от каждого действительного испытуемого.
Наконец, анализ распределений MOS для всех образцов, а также для женских и мужских образцов, показал, что они имеют гауссовидную форму, что соответствует реальным распределениям привлекательности лица:

Примеры распределений MOS LiveBeauty.
Большинство людей склонны иметь среднюю привлекательность лица, с меньшим количеством людей на экстремальных уровнях очень низкой или очень высокой привлекательности.
Дальнейший анализ асимметрии и эксцесса показал, что распределения характеризовались тонкими хвостами и были сконцентрированы вокруг среднего балла, и что высокая привлекательность была более распространена среди женских образцов в собранных видео прямой трансляции.
Архитектура
Была использована двухэтапная стратегия обучения для модели FPEM и фазы гибридного слияния в LiveBeauty, разделенная на четыре модуля: модуль персонализированной привлекательности (PAPM), модуль многомодальной привлекательности (MAEM), модуль слияния модальностей (CMFM) и модуль решающего слияния (DFM).

Концептуальная схема обучающего pipeline LiveBeauty.
Модуль PAPM принимает изображение в качестве входных данных и извлекает много масштабных визуальных функций с помощью Swin Transformer, и также извлекает функции, осведомленные о лице, с помощью предварительно обученной модели FaceNet. Эти функции затем объединяются с помощью блока взаимного внимания для создания персонализированной ‘привлекательности’ функции.
Также на предварительной фазе обучения MAEM использует изображение и текстовые описания привлекательности, используя CLIP для извлечения многомодальных эстетических семантических функций.
Шаблонные текстовые описания имеют форму ‘фотография человека с {a} привлекательностью’ (где {a} может быть плохой, слабой, средней, хорошей или идеальной). Процесс оценивает косинусную подобие между текстовыми и визуальными вложениями, чтобы получить вероятность привлекательности.
На фазе гибридного слияния CMFM уточняет текстовые вложения, используя персонализированную функцию привлекательности, сгенерированную PAPM, тем самым генерируя персонализированные текстовые вложения. Затем он использует стратегию регрессии подобия для прогнозирования.
Наконец, DFM объединяет индивидуальные прогнозы из PAPM, MAEM и CMFM, чтобы произвести единственный, окончательный балл привлекательности, с целью достижения прочного консенсуса.
Функции потерь
Для метрик потерь PAPM обучается с помощью потери L1, которая является мерой абсолютной разницы между прогнозируемым баллом привлекательности и фактическим (эталонным) баллом привлекательности.
Модуль MAEM использует более сложную функцию потерь, которая объединяет функцию потерь ранжирования (LR) с функцией потерь балла (LS). Функция потерь ранжирования (LR) состоит из функции потерь верности (LR1) и двухсторонней функции потерь ранжирования (LR2).
LR1 сравнивает относительную привлекательность пар изображений, в то время как LR2 обеспечивает, что прогнозируемое распределение вероятностей уровней привлекательности имеет один пик и уменьшается в обоих направлениях. Этот объединенный подход направлен на оптимизацию как точного балла, так и правильного ранжирования изображений по привлекательности.
CMFM и DFM обучаются с помощью простой функции потерь L1.
Тесты
В тестах исследователи противопоставили LiveBeauty девяти предыдущим подходам: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (представленный в REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; и EAT.
Базовые методы, соответствующие протоколу оценки эстетики изображений (IAA), также были протестированы. Это были ViT-B; ResNeXt-50; и Inception-V3.
Помимо LiveBeauty, другие протестированные наборы данных были SCUT-FBP5000 и MEBeauty. Ниже представлены распределения MOS этих наборов данных:

Распределения MOS наборов данных.
Соответственно, эти гостевые наборы данных были разделены на 60%-40% и 80%-20% для обучения и тестирования, отдельно, чтобы сохранить последовательность с их исходными протоколами. LiveBeauty был разделен на 90%-10% основе.
Для инициализации модели в MAEM использовались VT-B/16 и GPT-2 в качестве кодировщиков изображений и текста, соответственно, инициализированные настройками из CLIP. Для PAPM использовался Swin-T в качестве обучаемого кодировщика изображений, в соответствии с SwinFace.
Был использован оптимизатор AdamW, и планировщик скорости обучения был установлен с линейным разогревом под косинусной схемой затухания. Скорости обучения различались на разных фазах обучения, но каждая имела размер партии 32, за 50 эпох.

Результаты тестов
Результаты тестов на трех наборах данных FAP представлены выше. Из этих результатов статья гласит:
‘Наш предложенный метод занимает первое место и превосходит второе место примерно на 0,012, 0,081, 0,021 по значениям SROCC на LiveBeauty, MEBeauty и SCUT-FBP5500 соответственно, что демонстрирует превосходство нашего предложенного метода.
‘Методы IAA хуже, чем методы FAP, что показывает, что общие методы оценки эстетики игнорируют лицевые черты, участвующие в субъективной природе привлекательности лица, что приводит к плохой производительности на задачах FAP.
‘Производительность всех методов значительно снижается на MEBeauty. Это связано с тем, что обучающие образцы ограничены, а лица разнообразны по этническому признаку в MEBeauty, что указывает на большое разнообразие привлекательности лица.
‘Все эти факторы делают прогнозирование привлекательности лица в MEBeauty более сложной задачей.’
Этические соображения
Исследования привлекательности являются потенциально спорной областью, поскольку установление якобы эмпирических стандартов красоты может привести к подкреплению предубеждений по возрасту, расе и многим другим разделам компьютерного зрения, связанным с людьми.
Можно утверждать, что система FAP предрасположена к подкреплению и распространению предвзятых и односторонних взглядов на привлекательность. Эти суждения могут возникнуть из человеческих аннотаций – часто проводимых на масштабах, слишком ограниченных для эффективной обобщенности области – или из анализа закономерностей внимания в онлайн-средах, таких как платформы прямой трансляции, которые, по мнению некоторых, далеки от меритократии.
* Статья ссылается на неуказанные источники/домен(а) как в единственном, так и во множественном числе.
Опубликовано в среду, 8 января 2025 года.












