Взгляд Anderson
Пластическая хирургия для лиц, сгенерированных GAN

Новое исследование из Южной Кореи обещает улучшить качество синтетических данных лиц, созданных с помощью генеративных состязательных сетей (GAN).
Система способна выявлять артефакты изображений, произведенные процессами GAN, и исправлять их, даже до такой степени, что может заменять волосы, скрытые под шапкой, заменять части лица, полностью отсутствующие в оригинале, и удалять заслонения, такие как руки и солнцезащитные очки, и также хорошо работает с пейзажными и архитектурными изображениями.

Слева в каждом столбце – исходный вывод GAN с дефектами, за которым следуют два других подхода к артефактам, и, наконец, метод, используемый южнокорейскими исследователями. Источник: https://arxiv.org/pdf/2104.06118.pdf
Большинство недавних подходов к улучшению качества изображений, сгенерированных GAN, исходили из того, что артефакты являются профессиональным заболеванием процесса, рассматривая методологию как “силу природы”, и более психоделические или аномальные результаты, которые она может произвести, как неизбежный побочный продукт.
Вместо этого южнокорейское исследование предлагает фактически “исправлять” поврежденные изображения таким образом, чтобы не мешать продолжению генеративной цепочки, выявляя аспекты, вызывающие артефакты, и снижая или устраняя их влияние в сети GAN на полуприводном уровне, превышающем и расширяющем родные самоисправляющие механизмы в архитектуре GAN.
Для проекта было необходимо создать широко применимый набор данных изображений, сильно поврежденных артефактами GAN. Первоначально исследователи использовали расстояние Фрехета-Инсепшн (FID), метрику, оценивающую качество вывода GAN, сравнивая особенности в изображениях, в качестве квалифицирующей единицы. 10 000 изображений с наивысшими баллами FID среди запуска 200 000 изображений были использованы в качестве дискретных “единиц артефактов”. Затем исследователи手описали 2000 сгенерированных изображений, классифицируя каждое как “нормальное” или поврежденное артефактами FID. Затем была создана модель для классификации набора данных на артефакт, нормальные и случайные реальные образцы.
После этого был использован Gradient-weighted Class Activation Mapping (Grad-CAM), чтобы сгенерировать маски для областей, поврежденных артефактами, эффективно автоматизируя маркировку дефектов.
На изображении выше маски Grad-CAM были применены к выводу из набора данных LSUN-Church outdoor и набора данных CelebA-HQ.
Анализируя 20 наиболее пострадавших результатов из запуска 20 000 изображений, генерируются маски сегментации, в которые можно заменить представительные результаты по поколениям (которые, вероятно, будут более точными или убедительными, чем артефакты), снижая активацию единиц, производящих артефакты, в последующих поколениях.
Оценка исправлений, проведенная людьми, показала, что 53% “отремонтированных” изображений были помечены как “нормальные”, в то время как 97% исходных изображений все еще демонстрируют значительные улучшения по сравнению с оригиналами.
Исследователи утверждают, что этот метод, с некоторой незначительной переделкой, также может быть адаптирован для StyleGAN2 от NVIDIA.
Преимущества синтетических данных
Прежде всего, в отношении данных лиц, общая нехватка реальных наборов данных для компьютерного зрения является препятствием для разнообразных исследований в важных исследовательских секторах, таких как распознавание лиц, распознавание эмоций, медицинские исследования и исследования более детальной сегментации топологии лица, среди прочих областей.
Текущая реакция против бесплатного использования веб-ориентированных данных и ад hoc сбора реальных изображений лиц для включения в базы данных лиц является дополнительным препятствием для исследований, поскольку все больше государств и стран закрывают веб-скрейпинг и присвоение социальных медиа-изображений для этих целей.
За последние десять лет ограниченное количество тщательно подобранных наборов данных лиц предлагали убежище от такого рода неопределенности, с различными ежегодными публичными исследовательскими задачами, сосредоточенными на них. Однако это, по-видимому, привело к тому, что исследовательские проекты искажали свои методологии конкретно для этих наборов данных, с последовательными и сопоставимыми годовыми результатами, полученными за счет высокой цены – отсутствия разнообразия в исходном материале – ситуация, которая становится хуже каждый год, когда новые исследования ограничивают себя этими рамками.
Кроме того, некоторые из этих “традиционных” наборов данных подвергались критике за отсутствие расового разнообразия, что предполагает, что эти эталоны могут не быть рассмотрены как подходящие ресурсы в ближайшем будущем.
Это означает необходимость высококачественных данных лиц, которые являются реалистичными, но где реальные изображения были преобразованы далеко за пределы узнаваемости. Даже если такое использование реальных данных “на расстоянии” может само по себе в конечном итоге вызвать проблемы с происхождением лиц, сгенерированных GAN, это препятствие, которое вряд ли возникнет до тех пор, пока не будут установлены юридические и технические механизмы для сбора данных этого типа; и, касаясь возможных изменений в правовых рамках вокруг этой проблемы, это все еще меньший риск, чем использование изображений реальных людей.
Дополнительное чтение:
Улучшение реализма синтетических изображений
Автоматическая коррекция внутренних единиц генеративных нейронных сетей














