Погляд Anderson
Погоня штучного інтелекту за красою

Нова система оцінки краси, керована штучним інтелектом, оцінює, наскільки привабливі обличчя, навчаючись швидше, ніж типові моделі глибокого навчання, потенційно роблячи більш практичною великомасштабну автоматизовану оцінку краси.
Прогнозування краси обличчя (FBP) – це великий бізнес, і досить сильна галузь у дослідницькій літературі. Хоча це порушує майже всі засади боротьби з упередженнями в штучному інтелекті та методах машинного навчання, і хоча це підтримує об’єктивацію та редукціонізм в алгоритмічних сприйняттях жінок, воно все ж таки приваблює інтерес декількох багатミльярдних доларових галузей, більшість з яких спрямована безпосередньо на жінок, таких як косметика, косметична хірургія обличчя, прямі трансляції, і мода, серед інших:

Жінки, оцінені від 1 до 5, з роботи ‘Прогнозування краси азійських жінок за допомогою глибоких нейронних мереж через перенос навчання та мультиканального злиття ознак’. Джерело
Поза цими очевидними жіноцентричними бізнес-гаванями, реклама та інші галузі, включаючи розваги та видавництво, мають значні ставки в розумінні того, що обидва чоловіки та жінки вважають ‘привабливим’, необхідним на культурній основі.
Факт того, що сукупні сприйняття краси варіюються за регіонами, означає, що жодних визначених глобально-застосовних наборів даних не можна отримати, і що нові дослідження повинні або залишатися парохіяльними, або зосереджуватися на ‘високорівневих’ методах, які можна застосовувати до різних культурних даних.

Інтерфейс системи оцінки краси обличчя для проекту SCUT-FBP 2015 року. Джерело
Часто географічна місцевість не єдина обмеження, оскільки набори даних, орієнтовані на привабливість, можуть мати труднощі з забезпеченням рівної ефективності для обох статей, або можуть бути підібрані з певною метою, і це може обмежити використання колекції в інших областях.
Наприклад, у 2025 році я повідомив про розробку відносно великомасштабного (100 000+ ідентифікаторів) набору даних для оцінки привабливості у прямому ефірі, чия стандартизація може потребувати помітної адаптації для більш широких проєктів, незважаючи на величезну роботу, яку було проведено за ініціативою.
Відтворення обличчя
Як можна побачити з посилань і зображень вище, азійські дослідницькі організації часто не діють під тими ж культурними обмеженнями, що і їхні західні колеги, які були б під тиском публікувати наукову ілюстрацію, що оцінює п’ять західних жінок від найменш привабливої до найбільш привабливої, як ми бачимо в вищезгаданій роботі.
Можна сказати, що де азійські системи цього типу довели свою ефективність у публічному середовищі, без страху місцевої критики, західні інтереси можуть використовувати або адаптувати такі дослідження у приватні реалізації. Завдання ‘оцінки жінок’ у цьому сценарії передається до місця, де його можна проводити без критики.
Хоча це може бути поширеним чи менш публізованим західним еквівалентним системам, які тенденціюють до розробки поза відкритою співпрацею та публічним наглядом, можна припустити, що цільовий результат має глобальний інтерес через велику кількість професійних секторів, які можуть або могли б виграти від точних оцінок привабливості.
Виживання найкращих
Може здатися, що величезні веб-корпуси, такі як Tik Tok, Instagram та YouTube, будуть чудовими арбітрами краси, корелюючи підписників, лайки та трафік з привабливістю, оскільки це звичайна та розумна асоціація (хоча з деякими винятками).
Аналогічно, існуючі колекції – такі як ImageNet та LAION – що містять акторів та моделей, які ‘виступили на вершину’ – зазвичай містять привабливих осіб (хоча часто з надто багатьма даними про небагато людей), що дозволяє ширшим культурним механізмам діяти як проксі для привабливості.
Однак, це не враховує змінювані смаки в тому, що люди вважають привабливим за час (не кажучи вже про географічні місця). Тому знову ж таки потрібні високорівневі та дані-агностичні системи, а не окремі та спекулярні колекції чи кураторські колекції, які не зможуть відобразити зміни смаків.
Комбінаційна шкіра
Останній академічний внесок у справу цих викликів походять з Китаю, де перенос навчання та Система широкого навчання (BLS) поєднуються для вирішення довготривалого торгового відношення між точністю та обчислювальною вартістю.
Традиційні нейронні мережі tend до досягнення сильних результатів лише з важким тренуванням, тоді як легші системи, такі як BLS, тренуються швидко, але зазвичай втрачають деталі візуальної інформації. Нова робота мостить цей розрив, використовуючи попередньо натренований візуальний модель для витягування ознак обличчя, які потім передаються до BLS для оцінки, дозволяючи ознакам бути повторно використаними замість навчання з нуля, при цьому зберігючи ефективне тренування:

Зразкові зображення з набору даних LSAFBD, що показують жіночі обличчя, згруповані за людьми, призначеними оцінками краси від 1 до 5. Оцінки були отримані від декількох анотаторів, і використовувалися як нагляді за навчання та оцінкою моделей прогнозування краси обличчя через варіації в позі, освітленні та зовнішності. Джерело
Перша з двох варіантів, введених у роботі (E-BLS, див. нижче), передає витягнуті ознаки безпосередньо до легкої системи, тоді як друга, ER-BLS (також див. нижче), додає простий проміжний етап, який стандартизує та уточнює ці ознаки перед оцінкою, допомагаючи покращити узгодженість без сповільнення процесу.
Тести, проведені авторами, доводять, вони стверджують, що їхній підхід є кращим, ніж будь-який окремий метод, і кращим, ніж інші порівнювані методи.
Нова робота називається Прогнозування краси обличчя шляхом злиття переносу навчання та системи широкого навчання, і походять від шести дослідників з Університету Вуюй, Цзянмень.
Метод
Вище згадана Система широкого навчання є легкою альтернативою глибоким нейронним мережам, яка пропускає накладення декількох шарів, і натомість розподіляє навчання по широкому набору простіших з’єднань, дозволяючи моделям тренуватися швидко – але зазвичай втрачаючи деталі візуальної інформації.
Перший із двох варіантів, E-BLS, поєднує Ефективне навчання-перенос навчання з BLS, витягуючи детальні візуальні ознаки з обличчя, і потім передаючи їх до BLS, що призводить до остаточної оцінки, яка уникає необхідності тренувати повну глибоку нейронну мережу з нуля:

Схема архітектури моделі E-BLS.
Ефективне навчання, попередньо натреноване на ImageNet-1k, і в основному залишається незмінним, перетворює кожне вхідне зображення на компактний набір значень ознак, які описують обличчя структурованим чином, тоді як BLS бере ці значення і обробляє їх через мережу простих, випадково з’єднаних вузлів, які перетворюють і поєднують інформацію, перш ніж отримати остаточну оцінку привабливості.
Оскільки BLS не залежить від глибоких шарових структур, E-BLS можна оновити, додавши більше вузлів замість повторного тренування всієї системи. Це зберігає швидке тренування і полегшує покращення моделі при введенні нових даних.
Другий із двох варіантів, ER-BLS, будується на основі E-BLS, вставляючи додатковий етап обробки між витягувачем ознак EfficientNet і BLS, з метою покращення підготовки витягнутих ознак перед оцінкою:

Архітектура моделі ER-BLS.
Замість передачі сирих ознак EfficientNet безпосередньо до BLS, ER-BLS спочатку передається через етап уточнення, який стандартизує та переробляє дані, допомагаючи зменшити шум і зробити ознаки більш узгодженими для різних зображень. Цей етап призначений для покращення узгодженості системи, особливо коли обличчя варіюються за освітленням, позою або іншими візуальними умовами, які можуть інакше введати нестабільність у оцінки.
Уточнені ознаки потім передаються до тієї ж структури BLS, використовуваної в E-BLS, де вузли ознак і вузли посилення перетворюють і поєднують інформацію для отримання остаточної оцінки привабливості.
Дані та тести
Для тестування свого підходу автори використали набір даних SCUT-FBP5500, колекцію прогнозування краси обличчя з Південнокитайського університету, що містить 5 500 фронтальних зображень обличчя розміром 350×350 пікселів, що представляють різні раси, статі та вікові групи:

Зразкові зображення з набору даних SCUT-FBP5500, оцінені від найменш привабливої (1) до найбільш привабливої (5).
Кожне зображення було оцінено оцінкою краси 60 волонтерами за шкалою від 1 до 5, що варіюється від екстремально непривабливої (1) до екстремально привабливої (5):

Поділ пропорцій зображень за оцінками краси.
Інший використаний набір даних був Набором великомасштабної азійської жіночої краси (LSAFBD), колекцією, кураторами якої були самі автори.

Зразкові зображення з набору даних LSAFBD, оцінені від найменш привабливої (1) до найбільш привабливої (5).
Колекція складається з 80 000 неозначених зображень розміром 144×144 пікселів, з варіаціями в позі та фоні, а також віком. Ці зображення були оцінені 75 волонтерами за ті ж критерії, що і попередній набір даних, цього разу за шкалою від 0 до 4:

Поділ для набору даних LSAFBD.
Кожен набір даних був розділений на тренувальні та тестові сегменти у співвідношенні 8/20, і перехресна валідация була використана для стабілізації результатів через запуски. Компонент BLS був сконфігурований через кількість вікон ознак; кількість вузлів на вікно; і кількість вузлів посилення, з Hyperopt, використаним для пошуку ефективних комбінацій.
Для встановлення базової лінії стандартна модель BLS була натренована в тих же умовах, після чого серія моделей переносу навчання була введена, включаючи ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, і Xception – всі ініціалізовані з вагами ImageNet-1k, і натреновані з їхніми останніми шарами розмороженими.
Тренування використовувало швидкість навчання 0,001 (знижено, коли прогрес зупинився), і розмір партиї 16, протягом 50 епох, з регуляризацією і прямою лінійною активацією (ReLU) застосовані протягом усього процесу.
Виконання було оцінено за допомогою точності та кореляції Пірсона, поряд з загальним часом тренування, з результатами, усередненими по п’яти запусках.
Автори повідомляють про налаштування тренування як процесор Intel-i7 3,6 ГГц і 64 ГБ ОЗП на ‘стільниковому комп’ютері’:

Порівняння продуктивності на SCUT-FBP5500, де E-BLS і ER-BLS досягають конкурентоспроможної точності проти глибоких моделей CNN, включаючи ResNet50, EfficientNetB7, InceptionV3 і Xception, при цьому вимагаючи значно менше часу тренування – підкреслюючи вигоди з ефективності при поєднанні переносу навчання з системою широкого навчання.
Результати показали, що E-BLS покращив точність з 65,85% до 73,13%, тоді як ER-BLS досяг 74,69%, перевершивши всі порівнювані моделі. Час тренування залишався значно нижчим, ніж у глибоких моделей CNN, приблизно 1 300 секунд, проти декількох тисяч до понад 25 000 секунд.
Для тестів на LSAFBD результати показали, що E-BLS покращив точність над звичайним BLS, тоді як ER-BLS досяг найвищої точності серед усіх порівнюваних методів:

Продуктивність на LSAFBD, де ER-BLS і E-BLS забезпечують вищу точність, ніж усі базові та моделі переносу навчання, при цьому вимагаючи лише частину часу тренування, вказуючи на послідовну перевагу в ефективності без втрати прогнозної якості.
Обидва варіанти підтримували значно нижчий час тренування, ніж глибокі моделі CNN, вказуючи на більш ефективний баланс між продуктивністю та обчислювальною вартістю.
Висновок
Це певним чином ‘ретро-публікація’, як свідчить її використання до-бумових улюбленців, таких як CNN, і через використання найнижчої рівня тренувальної апаратури, яку я зустрів у новій роботі за останні роки.
Однак це займається досить стійким об’єктивом у комп’ютерному баченні; одним, який торкається людського досвіду та суб’єктивної інтерпретації, і який вимагає схеми, що перевершує естетичні тенденції моменту, і може забезпечити справді стійкий трубопровід для завдання.
Перша публікація четверга, 19 березня 2026 року












