Погляд Anderson
Оцінка передбачення привабливості обличчя для прямої трансляції

До цього часу дослідження передбачення привабливості обличчя (FAP) проводилися переважно в контексті психологічних досліджень, у сфері краси та косметики, а також у контексті пластичної хірургії. Це складна галузь дослідження, оскільки стандарти краси tend to бути національними, а не глобальними.
Це означає, що жодна ефективна AI-орієнтована база даних не є життєздатною, оскільки середні значення, отримані шляхом вибірки обличчя/рейтингів з усіх культур, будуть дуже упередженими (де більш густонаселені країни отримають додатковий імпульс), або застосовні до жодної культури (де середнє значення кількох рас/рейтингів буде дорівнювати жодній фактичній расі).
Натомість, завданням є розробка концептуальних методологій і робочих процесів, у які можна обробляти країно- або культурно-специфічні дані, щоб забезпечити розробку ефективних моделей FAP для кожного регіону.
Використання випадків FAP у сфері краси та психологічних досліджень досить маргінальне, або ж галузеве; тому більшість наборів даних, створених до цього часу, містять лише обмежені дані, або не були опубліковані взагалі.
Легка доступність онлайн-пredictорів привабливості, переважно орієнтованих на західну аудиторію, не обов’язково представляють стан справ у FAP, який зараз домінує східно-азійськими дослідженнями (переважно Китаєм), і відповідними східно-азійськими наборами даних.

Приклади набору даних з 2020 року ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Джерело: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30
Ширші комерційні застосування оцінки краси включають онлайн-дати та системи генерації AI, призначені для ‘відточування’ реальних аватарних зображень людей (оскільки такі застосування вимагають кванталізованого стандарту краси як метрики ефективності).
Малювання облич
Привабливі особи продовжують бути цінним активом у сфері реклами та впливу, роблячи фінансові стимули в цих секторах ясною можливістю для розвитку сучасних наборів даних і рамок FAP.
Наприклад, модель AI, навчена на реальних даних для оцінки і рейтингу краси обличчя, потенційно могла б ідентифікувати події або осіб з високим потенціалом для рекламного впливу. Ця здатність була б особливо актуальною у контексті прямої відеотрансляції, де метрики, такі як “підписчики” і “лайки”, зараз служать лише імпліцитними індикаторами здатності особи (або навіть типу обличчя) приваблювати аудиторію.
Це, звичайно, поверхневий показник, і голос, презентація та точка зору також відіграють значну роль у збиранні аудиторії. Тому кураторство наборів даних FAP вимагає людського нагляду, а також здатності розрізняти обличчя від “спекулятивної” привабливості (без чого впливові особи, такі як Алекс Джонс, могли б вплинути на середню криву FAP для колекції, призначеної виключно для оцінки краси обличчя).
LiveBeauty
Для вирішення нестачі наборів даних FAP дослідники з Китаю пропонують перший великомасштабний набір даних FAP, що містить 100 000 зображень облич, разом з 200 000 людськими анотаціями, що оцінюють красу обличчя.

Зразки нового набору даних LiveBeauty. Джерело: https://arxiv.org/pdf/2501.02509
Названий LiveBeauty, набір даних містить 10 000 різних ідентифікаторів, усіх знятих з (не вказаних) платформ прямої трансляції у березні 2024 року.
Автори також представляють FPEM, новий багатомодальний метод FAP. FPEM інтегрує голістичні знання про обличчя та багатомодальні естетичні семантичні ознаки через персоналізований модуль привабливості (PAPM), багатомодальний модуль кодування привабливості (MAEM) і модуль злиття модальностей (CMFM).
Стаття стверджує, що FPEM досягає найкращої продуктивності на новому наборі даних LiveBeauty та інших наборах даних FAP. Автори зазначають, що дослідження має потенційні застосування для покращення якості відео, рекомендацій контенту та ретушування обличчя у прямій трансляції.
Автори також обіцяють зробити набір даних доступним “скоро” – хоча повинно бути визнано, що будь-які ліцензійні обмеження, властиві джерельній області, ймовірно, перейдуть до більшості проектів, які можуть використовувати цю роботу.
Нова стаття називається Прогнозування привабливості обличчя у прямій трансляції: новий бенчмарк і багатомодальний метод, і походить від десяти дослідників з Alibaba Group і Шанхайського університету Цзяо Тун.
Метод і дані
З кожної 10-годинної трансляції з платформ прямої трансляції дослідники зібрали одне зображення на годину за перші три години. Трансляції з найбільшою кількістю переглядів сторінок були обрані.
Зібрані дані були потім піддані кільком стадіям попередньої обробки. Перша з них – вимірювання розміру області обличчя, яке використовує модель виявлення облич FaceBoxes 2018 року для генерації обмежувального рамки навколо ліній обличчя. Потік даних забезпечує, щоб коротша сторона обмежувальної рамки перевищувала 90 пікселів, уникнувши малих або нечітких областей обличчя.
Другий крок – виявлення розмитості, яке застосовується до області обличчя за допомогою варіансу оператора Лапласа у каналі висоти (Y) обрізки обличчя. Цей варіанс повинен бути більшим за 10, що допомагає фільтрувати розмиті зображення.
Третій крок – оцінка пози обличчя, яка використовує модель оцінки пози 3DDFA-V2 2021 року:

Приклади з моделі оцінки пози 3DDFA-V2. Джерело: https://arxiv.org/pdf/2009.09960
Тут потік даних забезпечує, щоб кут нахилу обрізки обличчя не перевищував 20 градусів, а кут повороту не перевищував 15 градусів, що виключає обличчя з екстремальними позами.
Четвертий крок – оцінка пропорцій обличчя, яке також використовує можливості сегментації моделі 3DDFA-V2, забезпечуючи, щоб область обличчя була більша за 60% зображення, виключивши зображення, де обличчя не домінує. тобто, мале в загальному зображенні.
Нарешті, п’ятий крок – видалення дублікатів, яке використовує (неатрибутований) сучасний модель розпізнавання облич, для випадків, коли одна й та сама особа з’являється в більш ніж одному з трьох зображень, зібраних для 10-годинного відео.
Оцінка людини і анотація
Було набрано двадцять анотаторів, шість чоловіків і чотирнадцять жінок, що відображають демографію платформи прямої трансляції*. Обличчя відображалися на 6,7-дюймовому екрані iPhone 14 Pro Max у лабораторних умовах.
Оцінка була розділена на 200 сесій, кожна з яких використовувала 50 зображень. Піддані були просені оцінити привабливість зразків за балом від 1 до 5, з п’ятихвилинною перервою між кожною сесією, і всі піддані брали участь у всіх сесіях.
Отже, вся сукупність із 10 000 зображень була оцінена двадцятьма людьми, що дало 200 000 анотацій.
Аналіз і попередня обробка
Спочатку була проведена пост-екранування суб’єктів за допомогою відношення аутлієрів і коєфіцієнта рангової кореляції Спірмена (SROCC). Суб’єкти, чий рейтинг мав SROCC менше 0,75 або відношення аутлієрів більше 2%, вважалися ненадійними і були видалені, залишиивши двадцять суб’єктів..
Потім був обчислений середній бал оцінки (MOS) для кожного зображення обличчя, шляхом усереднення балів, отриманих від валідних суб’єктів. MOS служить еталонним ярликом привабливості для кожного зображення, і бал обчислюється шляхом усереднення всіх індивідуальних балів від кожного валідного суб’єкта.
Нарешті, аналіз розподілу MOS для всіх зразків, а також для жіночих і чоловічих зразків, показав, що вони мали гауссоподібну форму, яка є характерною для реальних розподілів привабливості обличчя:

Приклади розподілу MOS LiveBeauty.
Більшість осіб мають середню привабливість обличчя, з меншою кількістю осіб на екстремальних рівнях привабливості.
Крім того, аналіз асиметрії і крутості показав, що розподіли характеризувалися тонкими хвостами і були зосереджені навколо середнього балу, і що висока привабливість була більш поширена серед жіночих зразків у зібраних відео прямої трансляції.
Архітектура
Була використана двостадійна стратегія навчання для моделі FPEM і фази гібридного злиття в LiveBeauty, розділеної на чотири модулі: персоналізований модуль привабливості (PAPM), багатомодальний модуль кодування привабливості (MAEM), модуль злиття модальностей (CMFM) і модуль рішення (DFM).

Концептуальна схема тренувального потоку LiveBeauty.
Модуль PAPM приймає зображення як вхідні дані і витягує багатомасштабні візуальні ознаки за допомогою трансформера Swin, і також витягує ознаки, чутливі до обличчя, за допомогою попередньо навченої моделі FaceNet. Ці ознаки потім поєднуються за допомогою блоку уваги, щоб створити персоналізовану ознаку привабливості.
Також у попередній фазі навчання MAEM використовує зображення і текстові описи привабливості, використовуючи CLIP для витягування багатомодальних естетичних семантичних ознак.
Шаблонні текстові описи мають вигляд ‘фотографія особи з {a} привабливістю’ (де {a} може бути поганою, слабкою, середньою, доброю або ідеальною). Процес оцінює косинусну подібність між текстовими і візуальними вкладеннями, щоб отримати ймовірність рівня привабливості.
У фазі гібридного злиття CMFM уточнює текстові вкладення, використовуючи персоналізовану ознаку привабливості, згенеровану PAPM, тим самим генеруючи персоналізовані текстові вкладення. Потім він використовує стратегію регресії схожості, щоб зробити передбачення.
Нарешті, DFM поєднує індивідуальні передбачення з PAPM, MAEM і CMFM, щоб отримати єдиний, остаточний бал привабливості, з метою досягнення міцного консенсусу
Функції втрат
Для метрик втрат модуль PAPM навчається за допомогою втрат L1, які є мірою абсолютної різниці між передбаченим балом привабливості і фактичним (еталонним) балом привабливості.
Модуль MAEM використовує складнішу функцію втрат, яка поєднує втрати рейтингу (LS) з об’єднаною втратою ранжування (LR). Втрати ранжування (LR) складаються з втрат вірності (LR1) і двонаправленої втрати ранжування (LR2).
LR1 порівнює відносну привабливість пар зображень, тоді як LR2 забезпечує, щоб передбачена ймовірність розподілу рівнів привабливості мала один пік і зменшувалася в обидві сторони. Цей комбінований підхід спрямований на оптимізацію як точного рейтингу, так і правильного ранжування зображень за привабливістю.
Модулі CMFM і DFM навчаються за допомогою простої втрати L1.
Тести
У тестах дослідники протиставили LiveBeauty дев’яти попереднім підходам: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (в складі REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; і EAT.
Базові методи, що відповідають протоколу оцінки естетики зображень (IAA), також були протестовані. Це були ViT-B; ResNeXt-50; і Inception-V3.
Окрім LiveBeauty, інші протестовані набори даних були SCUT-FBP5000 і MEBeauty. Нижче порівнюються розподіли MOS цих наборів даних:

Розподіли MOS наборів даних для порівняння.
Відповідно, ці гостьові набори даних були розділені на 60%-40% і 80%-20% для навчання і тестування, окремо, щоб зберегти відповідність їхнім оригінальним протоколам. LiveBeauty був розділений у співвідношенні 90%-10%.
Для ініціалізації моделі MAEM використовувалися VT-B/16 і GPT-2 як кодувальники зображень і тексту відповідно, ініціалізовані налаштуваннями з CLIP. Для PAPM використовувався Swin-T як навчальний кодувальник зображень, у відповідності з SwinFace.
Використовувався оптимізатор AdamW, і розклад швидкості навчання був встановлений з лінійним розігрівом під схемою косинусного анелінгу. Швидкості навчання відрізнялися під час фаз навчання, але кожна мала розмір партії 32, за 50 епох.

Результати тестів
Результати тестів на трьох наборах даних FAP показані вище. З цих результатів стаття стверджує:
‘Наш запропонований метод займає перше місце і перевершує друге місце приблизно на 0,012, 0,081, 0,021 за значеннями SROCC на LiveBeauty, MEBeauty і SCUT-FBP5500 відповідно, що демонструє перевагу нашого запропонованого методу.
‘Методи IAA є гіршими за методи FAP, що свідчить про те, що загальні методи оцінки естетики зображень не враховують особливості обличчя, залучені до суб’єктивної природи привабливості обличчя, що призводить до поганої продуктивності на завданнях FAP.
‘Продуктивність усіх методів значно знижується на MEBeauty. Це відбувається через те, що навчальні зразки обмежені, а обличчя етнічно різноманітні в MEBeauty, що вказує на велику різноманітність привабливості обличчя.
‘Всі ці фактори роблять передбачення привабливості обличчя в MEBeauty ще більш складним.’
Етичні розгляди
Дослідження привабливості є потенційно роздільним заняттям, оскільки встановлення певних емпіричних стандартів краси може змусити такі системи підтримувати упередження щодо віку, раси та багатьох інших розділів комп’ютерного бачення, пов’язаного з людьми.
Можна стверджувати, що система FAP є внутрішньо налаштованою на підтримку і зміцнення часткових і упереджених поглядів на привабливість. Ці судження можуть виникнути з людських анотацій – часто проводяться за шкалами, які є занадто обмеженими для ефективної генерації домену – або з аналізу моделей уваги в онлайн- середовищах, таких як платформи прямої трансляції, які, можна вважати, далеко не є меритократичними.
* Стаття посилається на неназвані джерельні області як у однині, так і у множині.
Перша публікація – середа, 8 січня 2025 року












