Взгляд Anderson
Сектор синтеза изображений принял ошибочный метрический показатель, утверждает исследование

2021 год стал годом беспрецедентного прогресса и фуршетного темпа публикаций в секторе синтеза изображений, предлагая поток новых инноваций и улучшений в технологиях, способных воспроизводить человеческие личности с помощью нейронного рендеринга, глубоких фейков и множества новых подходов.
Однако исследователи из Германии теперь утверждают, что стандарт, используемый для автоматической оценки реализма синтетических изображений, является фатально ошибочным, и что сотни, даже тысячи исследователей по всему миру, которые полагаются на него, чтобы сократить затраты на дорогостоящие результаты оценки, основанные на человеке, могут идти по слепому пути.
Чтобы продемонстрировать, как стандарт, Fréchet Inception Distance (FID), не соответствует человеческим стандартам для оценки изображений, исследователи развернули свои собственные GAN, оптимизированные для FID (теперь общий метрический показатель). Они обнаружили, что FID следует своим собственным увлечениям, основанным на базовом коде с очень khácным назначением, чем синтез изображений, и что он регулярно не достигает ‘человеческого’ стандарта различения:

FID scores (lower is better) for images generated by various models using standard datasets and architectures. The researchers of the new paper pose the question ‘Would you agree with these rankings?’. Source: https://openreview.net/pdf?id=mLG96UpmbYz
В дополнение к своему утверждению, что FID не подходит для своей задачи, статья также предполагает, что ‘очевидные’ средства, такие как замена внутреннего двигателя на конкурирующие двигатели, просто поменяют одну набор предубеждений на другой. Авторы предлагают, что теперь исследователям предстоит разработать лучшие метрики для оценки ‘аутентичности’ синтетически сгенерированных фотографий.
Статья называется Internalized Biases in Fréchet Inception Distance, и исходит от Steffen Jung в Max Planck Institute for Informatics at Saarland, и Margret Keuper, Профессора по визуальному вычислению в Университете Сигена.
Поиск системы оценки для синтеза изображений
Как отмечает новое исследование, прогресс в рамках синтеза изображений, таких как GAN и архитектуры кодирования/декодирования, обогнал методы, с помощью которых можно оценить результаты этих систем. Кроме того, оценка человека результатов этих систем не предлагает эмпирический и воспроизводимый метод оценки.
Поэтому появилось несколько метрических рамок, включая Inception Score (IS), представленный в статье 2016 года Improved Techniques for Training GANs, написанной совместно с изобретателем GAN, Иэном Гудфеллоу.
Дискредитация IS-оценки как общепринятого метрического показателя для нескольких сетей GAN в 2018 году привела к широкому внедрению FID в сообществе синтеза изображений GAN. Однако, как и Inception Score, FID основан на сети классификации изображений Google Inception v3 (IV3).
Авторы новой статьи утверждают, что Fréchet Inception Distance распространяет вредные предубеждения в IV3, что приводит к ненадежной классификации качества изображений.
Поскольку FID может быть включен в машинное обучение в качестве дискриминатора (встроенного ‘судьи’, который решает, хорошо ли работает GAN или должен ‘попробовать снова’), он должен точно представлять стандарты, которые человек применит при оценке изображений.
Fréchet Inception Distance
FID сравнивает, как функции распределены по всему обучающему набору данных, используемому для создания модели GAN (или аналогичной функциональности), и результаты этой системы.
Следовательно, если框架 GAN обучается на 10 000 изображениях (например, знаменитостей), FID сравнивает оригинальные (реальные) изображения с фальшивыми изображениями, сгенерированными GAN. Чем ниже оценка FID, тем ближе GAN приблизился к ‘фотореалистичным’ изображениям, согласно критериям FID.

Из статьи, результаты GAN, обученного на FFHQ64, подмножестве набора данных FFHQ от NVIDIA. Здесь, хотя оценка FID составляет приятно низкие 5,38, результаты не являются приятными или убедительными для среднего человека.
Проблема, по мнению авторов, заключается в том, что Inception v3, чьи предположения обеспечивают Fréchet Inception Distance, не смотрит в нужные места – по крайней мере, не когда речь идет о задаче.
Inception V3 обучается на ImageNet object recognition challenge, задаче, которая, по мнению авторов, противоречит тому, как цели синтеза изображений эволюционировали в последние годы. IV3 проверяет прочность модели, выполняя данные аугментации: она случайным образом переворачивает изображения, обрезает их до случайного масштаба между 8-100%, меняет соотношение сторон (в диапазоне от 3/4 до 4/3) и случайным образом вводит цветовые искажения, связанные с яркостью, насыщенностью и контрастом.
Исследователи из Германии обнаружили, что IV3 имеет тенденцию отдавать предпочтение извлечению краев и текстур, а не информации о цвете и интенсивности, которая была бы более осмысленным показателем аутентичности для синтетических изображений; и что его первоначальная цель обнаружения объектов была поэтому неуместно отведена для неподходящей задачи. Авторы заявляют*:
‘[Inception v3] имеет предубеждение к извлечению функций на основе краев и текстур, а не информации о цвете и интенсивности. Это соответствует его конвейеру аугментации, который вводит цветовые искажения, но сохраняет высокочастотную информацию целой (в отличие от, например, аугментации с помощью гауссовского размытия). ‘
‘Следовательно, FID наследует это предубеждение. Когда используется в качестве метрики ранжирования, генеративные модели, хорошо воспроизводящие текстуры, могут быть предпочтительнее моделей, хорошо воспроизводящих распределения цвета.’
Данные и метод
Чтобы проверить свою гипотезу, авторы обучили две архитектуры GAN, DCGAN и SNGAN, на наборе данных человеческих лиц NVIDIA FFHQ, уменьшенном до разрешения изображения 642, с полученным набором данных, называемым FFHQ64.
Были проведены три процедуры обучения GAN: GAN G+D, стандартная сеть дискриминатора; GAN FID|G+D, где FID выступает в качестве дополнительного дискриминатора; и GAN FID|G, где GAN полностью управляется текущим баллом FID.
Технически, по мнению авторов, потеря FID должна стабилизировать обучение и даже потенциально полностью заменить дискриминатор (как это делает в #3, GAN FID|G), при этом выдавая результаты, приятные для человека.
На практике результаты довольно khácны, с – авторы гипотетически – FID-помощными моделями ‘переобученными’ на неправильные метрики. Исследователи отмечают:
‘Мы гипотетически предполагаем, что генератор учится производить неподходящие функции, чтобы соответствовать распределению обучающих данных. Это наблюдение становится более серьезным в случае [GAN FID|G]. Здесь мы замечаем, что отсутствие дискриминатора приводит к пространственно несовместимым распределениям функций. Например, [SNGAN FID|G] добавляет в основном отдельные глаза и выравнивает лицевые характеристики в устрашающем виде.’
Авторы заключили*:
‘Хотя человеческие аннотаторы, вероятно, предпочтут изображения, сгенерированные SNGAN D+G, а не SNGAN FID|G (в случаях, когда предпочтительна верность данных, а не искусство), мы видим, что это не отражается FID. FID не соответствует человеческому восприятию. ‘
‘Мы утверждаем, что дискриминативные функции, предоставляемые сетями классификации изображений, не достаточны, чтобы обеспечить основу для осмысленной метрики.’
Нет легких альтернатив
Авторы также обнаружили, что замена Inception V3 на аналогичный двигатель не устраняет проблему. Заменив IV3 на ‘широкий выбор различных сетей классификации’, которые были протестированы на ImageNet-C (подмножество ImageNet, предназначенное для оценки распространенных коррупций и искажений в выходных изображениях из рамок синтеза изображений), исследователи не смогли существенно улучшить свои результаты:
‘[Предубеждения] в Inception v3 также широко распространены в других сетях классификации. Кроме того, мы видим, что разные сети будут производить разные рейтинги между типами коррупций.’
Авторы заключили статью с надеждой, что продолжающиеся исследования разработают ‘человечески-ориентированную и беспристрастную метрику’, способную обеспечить более справедливый рейтинг архитектур генераторов изображений.
* Подчеркивание авторов.
Опубликовано впервые 20 декабря 2021 года, 13:00 GMT+2.













