Погляд Anderson
Пластична хірургія для облич, згенерованих GAN

Нові дослідження з Південної Кореї обіцяють покращити якість синтетичних даних про обличчя, створених Генеративними Адверсарними Моделями (GAN).
Система здатна визначати артефакти зображень, створених процесами GAN, і виправляти їх, навіть до заміни волосся, яке було закрите шапкою, заміни частин обличчя, які повністю відсутні в оригіналі, і видалення окулюючих об’єктів, таких як руки і окуляри, і також добре працює з пейзажними і архітектурними зображеннями.

Зліва для кожного стовпчика, оригінальний вивід GAN з дефектами, за яким слідують два інші підходи до артефактів, і, нарешті, метод, використаний південнокорейськими дослідниками. Джерело: https://arxiv.org/pdf/2104.06118.pdf
Більшість останніх підходів до покращення якості зображень, згенерованих GAN, зайняли позицію, що артефакти є професійним ризиком процесу, розглядаючи методологію як “силу природи”, і більш психоделічні або аберрантні результати, які вона може виробляти, як невід’ємний побічний продукт.
Натомість південнокорейські дослідження пропонують фактично “виправляти” пошкоджені зображення таким чином, що не заважає подальшому генеративному ланцюгу, ідентифікуючи аспекти, які викликають артефакти, і зменшуючи або усуваючи їхній вплив у мережі GAN на напівнагляданому рівні, який перевищує і розширює вбудовані механізми самокорекції в архітектурі GAN.
Для проекту було необхідно створити широко застосовуваний набір даних зображень, які були сильно пошкоджені артефактами GAN. Спочатку дослідники використовували Відстань Фрідета-Інсепшна (FID), метрику, яка оцінює якість виводу GAN шляхом порівняння ознак у зображеннях, як кваліфікаційну одиницю. 10 000 зображень з найбільшими оцінками FID серед 200 000 зображень були використані як окремі “одиниці артефактів”. Надалі дослідники ручним чином позначили 2 000 згенерованих зображень, класифікуючи кожне як “нормальне” або пошкоджене артефактами FID. Потім була створена модель для класифікації набору даних на артефакт, нормальне і випадкові реальні зразки.
Після цього був використаний Градієнт-зважений класифікаційний мапінг (Grad-CAM), щоб згенерувати маски для областей, пошкоджених артефактами, фактично автоматизуючи позначення дефектів.
На зображенні вище маски Grad-CAM були застосовані до виводу з набору даних LSUN-Church outdoor і набору даних CelebA-HQ.
Аналізуючи 20 найбільш пошкоджених результатів з 20 000 зображень, генеруються маски сегментації, в які можуть бути підставлені представницькі результати по поколінням (які, ймовірно, будуть більш точними або переконливими, ніж артефакти), шляхом зниження активації одиниць, що виробляють артефакти, в наступних поколіннях.
Оцінка людьми виправлених зображень показала, що 53% “відремонтованих” зображень були позначені як “нормальні”, тоді як 97% оригінальних зображень все ще демонструють значні покращення порівняно з оригіналами.
Дослідники стверджують, що цей метод, з деякими незначними змінами, також може бути адаптований для використання з StyleGAN2 від NVIDIA.
Переваги синтетичних даних
Головним чином щодо даних про обличчя, загальна нестача реальних наборів даних для комп’ютерного бачення є перешкодою для різноманітних досліджень у важливих галузях, таких як розпізнавання облич, розпізнавання емоцій, медичні дослідження та дослідження більш детальної сегментації топології обличчя, серед інших галузей.
Поточна реакція проти вільного використання даних з інтернету і ад хок збір реальних зображень облич для включення в бази даних облич є додатковою перешкодою для досліджень, оскільки все більше держав і країн посилюють контроль над веб-скрепінгом і використанням соціальних медіа-зображень для цих цілей.
За останні десять років обмежена кількість висококачественно відібраних наборів даних облич пропонували притулок від такого роду невизначеності, з різними щорічними публічними дослідницькими викликами, центрованими навколо них. Однак це, ймовірно, призвело до того, що дослідницькі проекти налаштовували свої методології конкретно на ці набори даних, з послідовними і порівнюваними результатами рік за роком, отриманими за високу ціну відсутності різноманітності у джерельному матеріалі – ситуація, яка погіршується щороку, коли нові дослідження обмежують себе цими рамками.
Крім того, деякі з цих “традиційних” наборів даних піддалися критиці за відсутність расової різноманітності, що свідчить про те, що ці бенчмарки можуть не бути розглянуті як придатні ресурси в найближчому майбутньому.
Це свідчить про необхідність високоякісних даних про обличчя, які є реалістичними, але де реальні “реальні” зображення були трансформовані далеко за межі визнання. Навіть якщо таке використання реальних даних про обличчя “на одному рівні” може самі собою викликати питання щодо проїзводження згенерованих GAN-облич, це камінь спотикання, який не з’явиться, поки не з’являться юридичні і технічні механізми для збору даних такого типу; і щодо можливих змін у правових рамках навколо цього питання, це все ще менша загроза, ніж використання зображень реальних людей.
Додаткове читання:
Покращення реалізму синтетичних зображень
Автоматична корекція внутрішніх одиниць генеративних нейронних мереж














