Погляд Anderson

Сектор синтезу зображень采用 непридатну метрику, стверджують дослідники

mm
Додайте Unite.AI до бажаних джерел у Google

2021 рік став роком безпрецедентного прогресу та фуршетного темпу публікацій у сфері синтезу зображень, пропонуючи потік нових інновацій та удосконалень технологій, які здатні відтворювати людські особистості за допомогою нейронного рендеринга, deepfakes та цілої низки нових підходів.

Однак, дослідники з Німеччини тепер стверджують, що стандарт, який використовується для автоматичної оцінки реалізму синтетичних зображень, є вадним; і що сотні, навіть тисячі дослідників по всьому світу, які покладаються на нього, щоб знизити вартість дорогої оцінки результатів людьми, можуть йти по сліпій дорозі.

Щоб продемонструвати, як стандарт, Fréchet Inception Distance (FID), не відповідає людським стандартам для оцінки зображень, дослідники розгорнули свої власні GANs, оптимізовані для FID (тепер звичайна метрика). Вони виявили, що FID слідує своїм власним одержимостям, заснованим на підлеглому коді з дуже різним завданням, ніж синтез зображень, і що він регулярно не досягає “людського” стандарту розрізнення:

FID scores (lower is better) for images generated by various models using standard datasets and architectures. The researchers of the new paper pose the question 'Would you agree with these rankings?'. Source: https://openreview.net/pdf?id=mLG96UpmbYz

FID scores (lower is better) for images generated by various models using standard datasets and architectures. The researchers of the new paper pose the question ‘Would you agree with these rankings?’. Source: https://openreview.net/pdf?id=mLG96UpmbYz

Крім того, у своїй роботі стверджується, що “очевидні” засоби, такі як заміна внутрішнього двигуна на конкуруючі двигуни, просто замінять одну сукупність упереджень на іншу. Автори стверджують, що тепер належить новим дослідницьким ініціативам розробити кращі метрики для оцінки “автентичності” у синтетичних зображеннях.

Робота стаття називається Internalized Biases in Fréchet Inception Distance, і походить від Стівена Юнга в Інституті інформатики імені Макса Планка в Саарбрюкені та Маргрет Койпер, професора візуальної інформатики в Університеті Зігена.

Пошук системи оцінювання для синтезу зображень

Як зазначено в новій роботі, прогрес у рамках синтезу зображень, таких як GANs та архітектури кодувача/декодувача, випередив методи, за допомогою яких можна оцінити результати цих систем. Крім того, що оцінка людини результатів цих систем є дорогою та не пропонує емпіричного та повторюваного методу оцінки.

Тому було розроблено кілька метричних рамках, включаючи Inception Score (IS), представлений у роботі 2016 року Improved Techniques for Training GANs, співавтором якої є винахідник GAN, Ієн Гудфеллоу.

Дискредитація оцінки IS як широко застосовуваної метрики для кількох мереж GAN у 2018 році призвела до широкого застосування FID у спільноті синтезу зображень GAN. Однак, як і Inception Score, FID заснований на мережі класифікації зображень Inception v3 Google (IV3).

Автори нової роботи стверджують, що Fréchet Inception Distance поширює шкідливі упередження в IV3, що призводить до ненадійного класифікації якості зображень.

Оскільки FID можна включити до машинного навчання як дискримінатор (вбудований “суддя”, який вирішує, чи робить GAN добре, чи повинен “спробувати знову”), йому потрібно точно представляти стандарти, які людина застосувала б при оцінці зображень.

Fréchet Inception Distance

FID порівнює, як розподілені функції по всьому тренувальному наборі даних, використаному для створення моделі GAN (або подібної функціональності), та результати цієї системи.

Отже, якщо рамка GAN тренується на 10 000 зображень (наприклад) знаменитостей, FID порівнює оригінальні (реальні) зображення з фальшивими зображеннями, згенерованими GAN. Чим нижча оцінка FID, тим ближче GAN наблизився до “фотореалістичного” зображення, згідно з критеріями FID.

З роботи, результати GAN, тренованого на FFHQ64, підмножині популярного набору даних FFHQ NVIDIA. Тут, хоча оцінка FID становить чудову низьку 5,38, результати не є привабливими чи переконливими для середньої людини.

З роботи, результати GAN, тренованого на FFHQ64, підмножині популярного набору даних FFHQ NVIDIA. Тут, хоча оцінка FID становить чудову низьку 5,38, результати не є привабливими чи переконливими для середньої людини.

Проблема, яку автори розглядають, полягає в тому, що Inception v3, чиї припущення підтримують Fréchet Inception Distance, не дивиться в правильному місці – принаймні, не при розгляді завдання.

Inception V3 тренується на ImageNet object recognition challenge, завдання, яке можна вважати суперечливим з тим, як завдання синтезу зображень еволюціонували в останні роки. IV3 перевіряє стійкість моделі, виконуючи дані аугментації: вона випадково перевертає зображення, обрізає їх до випадкової масштабу між 8-100%, змінює співвідношення сторін (у діапазоні від 3/4 до 4/3) та випадково впроваджує колірні спотворення, пов’язані з яскравістю, насиченістю та контрастом.

Дослідники з Німеччини виявили, що IV3 має тенденцію до виділення країв та текстур, а не кольору та інформації про інтенсивність, які були б більш значущими індексами автентичності для синтетичних зображень; і що його первинна мета об’єктної детекції була недоречно відібрана для непридатного завдання. Автори заявляють*:

‘[Inception v3] має упередження щодо виділення функцій на основі країв та текстур, а не кольору та інформації про інтенсивність. Це відповідає його трубопроводу аугментації, який вводить колірні спотворення, але зберігає високу частоту інформації цілою (на відміну від, наприклад, аугментації з Гауссовським розмиттям).

‘В результаті FID успадковує це упередження. Коли його використовують як метрику ранжування, генеративні моделі, які добре відтворюють текстури, можуть бути віддані перевагу над моделями, які добре відтворюють розподіли кольорів.’

Дані та метод

Щоб перевірити свою гіпотезу, автори тренували дві архітектури GAN, DCGAN та SNGAN, на наборі даних людських облич NVIDIA FFHQ, знизивши роздільну здатність до 642, з отриманим набором даних, названим FFHQ64.

Було здійснено три процедури тренування GAN: GAN G+D, стандартна дискримінаторна мережа; GAN FID|G+D, де FID виконує роль додаткового дискримінатора; і GAN FID|G, де GAN повністю керується поточним балом FID.

Технічно, автори зазначають, що втрати FID повинні стабілізувати тренування та потенційно навіть повністю замінити дискримінатор (як це робить у #3, GAN FID|G), видаючи результати, які подобаються людині.

На практиці результати є досить різними, з – автори гіпотезують – моделями FID, які “перетреновуються” на неправильних метриках. Дослідники зазначають:

‘Ми гіпотезуємо, що генератор вчиться виробляти непридатні функції для збігання з розподілом тренувальних даних. Це спостереження стає ще більш серйозним у випадку [GAN FID|G]. Тут ми помічаємо, що відсутність дискримінатора призводить до просторово неузгоджених розподілів функцій. Наприклад [SNGAN FID|G] додає в основному окремі очі та виравнює лицеві характеристики у застрашуючій манері.’

Приклади облич, згенерованих SNGAN FID|G.

Приклади облич, згенерованих SNGAN FID|G.

Автори висновують*:

‘Хоча людські анотатори, безумовно, віддали б перевагу зображенням, згенерованим SNGAN D+G над SNGAN FID|G (у випадках, коли віддається перевага вірності даних над мистецтвом), ми бачимо, що це не відображається FID. FID не узгоджується з людською сприйняттям.

‘Ми стверджуємо, що дискримінативні функції, надані мережами класифікації зображень, не достатні для надання основи для значущої метрики.’

Немає легких альтернатив

Автори також виявили, що заміна Inception V3 на подібний двигун не усунула проблему. Замінивши IV3 на “розширений вибір різних класифікаційних мереж”, які були протестовані на ImageNet-C (підмножина ImageNet, призначена для оцінки звичайних спотворень та збурень у зображеннях, згенерованих з допомогою рамок синтезу зображень), дослідники не змогли суттєво покращити свої результати:

[Упередження] присутні в Inception v3 також широко присутні в інших мережах класифікації. Крім того, ми бачимо, що різні мережі

Автори висновують роботу з надією, що триваючі дослідження розроблять “людсько-узгоджену та необізнану метрику”, здатну забезпечити справедливіший рейтинг архітектур генераторів зображень.

 

* Виділення авторів.

Перша публікація 20 грудня 2021 року, 13:00 GMT+2.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai