Моделі та платформи ШІ

Високоточна семантична редакція зображень з EditGAN

mm
Додайте Unite.AI до бажаних джерел у Google

Генеративні суперницькі мережі або GAN мають нові застосування в галузі редакції зображень. За останні кілька місяців EditGAN набуває популярності в галузі AI/ML, оскільки це новий метод високоточної та високоякісної семантичної редакції зображень.

Ми будемо говорити про модель EditGAN у деталях та розповімо, чому вона може стати важливим етапом у галузі семантичної редакції зображень.

Тож почнімо. Але перед тим, як ми дізнаємося, що таке EditGAN, важливо зрозуміти, чому EditGAN важливий і чому це суттєвий крок вперед.

Чому EditGAN?

Хоча традиційні архітектури GAN допомогли галузі редакції зображень на основі AI значно просунутися, існують деякі суттєві проблеми з побудовою архітектури GAN з нуля.

  1. Під час фази навчання архітектура GAN вимагає великої кількості помічених даних з анотаціями семантичної сегментації.
  2. Вони здатні забезпечувати тільки високий рівень контролю.
  3. І часто вони просто інтерполюють туди й назад між зображеннями.

Можна спостерігати, що хоча традиційні архітектури GAN роблять свою роботу, вони не ефективні для широкомасштабного розгортання. Низька ефективність традиційних архітектур GAN є причиною, чому EditGAN був введений компанією NVIDIA (NVDA ) у 2022 році.

EditGAN пропонується як ефективний метод високоточної та високоякісної семантичної редакції зображень з можливістю дозволити користувачам редагувати зображення, змінюючи їх детальні маски сегментації.

Модель EditGAN побудована на основі архітектури GAN, яка моделює зображення та їх семантичні сегментації спільно, і вимагає лише невеликої кількості помічених або анотованих навчальних даних.

Архітектура.framework EditGAN дозволяє моделі вивчати довільну кількість векторів редагування, які потім можна застосувати безпосередньо до інших зображень з високою швидкістю та ефективністю.

Підсумувавши, чому нам потрібен EditGAN, це перша модель редакції зображень на основі GAN, яка пропонує

  1. Дуже високоточну редакцію.
  2. Може працювати з невеликою кількістю помічених даних.
  3. Може бути розгорнута ефективно в реальних сценаріях.
  4. Дозволяє складність для декількох редагувань одночасно.
  5. Працює з зображеннями, згенерованими GAN, реальними вбудованими та навіть поза доменом зображень.

Високоточна семантична редакція зображень з EditGAN

StyleGAN2, сучасна архітектура GAN для синтезу зображень, є основним компонентом генерації зображень EditGAN.

StyleGAN2 є глибокою генеративною моделлю, яка була навчена синтезувати зображення найвищої якості можливої разом з придбанням семантичного розуміння зображень, змодельованих.

Навчання сегментації та висновок

Модель EditGAN вкладає зображення в простір GAN за допомогою оптимізації та кодувальника для виконання сегментації на новому зображенні та навчання гілки сегментації.

Результатом є те, що модель вкладає анотовані зображення з набору даних, позначені семантичною сегментацією, у простір та використовує перетин ентропії для навчання гілки сегментації генератора.

Використання редагування сегментації для пошуку семантики в латентному просторі

Основною метою EditGAN є використання спільного розподілу семантичних сегментацій та зображень для високоточної редакції зображень.

Розробники можуть використовувати будь-які інструменти маркування або цифрової живопису для зміни сегментації та редагування їх вручну згідно з вимогами.

Різні способи редагування під час висновку

Вектори редагування латентного простору, отримані за допомогою оптимізації, можна описати як семантично значущі та часто роз’єднані з різними атрибутами.

Відповідно, для редагування нового зображення модель може безпосередньо вкладати зображення в латентний простір та виконувати ті самі операції редагування, які модель вивчила раніше, без виконання оптимізації заново з нуля.

На основі наших поточних знань, фреймворк EditGAN можна використовувати для редагування зображень у трьох різних режимах.

  • Редагування в реальному часі з векторами редагування

Для зображень, які локалізовані та роз’єднані, модель редагує зображення, застосовуючи вектори редагування, вивчені раніше з різними масштабами, та маніпулює зображеннями на інтерактивних швидкостях.

  • Використання само-супервізійного уточнення для векторного редагування

Для редагування локалізованих зображень, які не роз’єднані ідеально з іншими частинами зображення, модель ініціалізує редагування зображення, використовуючи попередньо вивчені вектори редагування, та видаляє артефакти редагування, виконуючи кілька додаткових кроків оптимізації під час часу тестування.

  • Оптимізаційне редагування

Для виконання великомасштабних та зображень-специфічних редагувань модель виконує оптимізацію з самого початку, оскільки вектори редагування не можуть бути використані для виконання цих видів переносу на інші зображення.

Реалізація

Фреймворк EditGAN оцінюється на зображеннях, розподілених по чотирьох різних категоріях: Автомобілі, Птахи, Кішки та Обличчя.

Гілка сегментації моделі тренується за допомогою пар зображень-масок у 16, 30, 30, 16 як помічених навчальних даних для Автомобілів, Птахів, Кішок та Обличь відповідно.

Результати

Якість результатів

Результати в межах домену

Висше зображення демонструє продуктивність фреймворка EditGAN при застосуванні попередньо вивчених векторів редагування на нових зображеннях та уточненні зображень за допомогою 30 кроків оптимізації.

Що дивовижно, фреймворк EditGAN може виконувати дуже високоточні редагування, такі як розширення зіниць або редагування спиць у шинах автомобіля.

Результати поза доменом

Для оцінки продуктивності фреймворка EditGAN поза доменом фреймворк був протестований на наборі даних MetFaces.

Кількісні результати

Для вимірювання можливостей редагування зображень моделі EditGAN використовується тестовий бенчмарк редагування посмішок, який був вперше введений MaskGAN.

Висше таблиця порівнює продуктивність фреймворка EditGAN з іншими базовими моделями на бенчмарку редагування посмішок.

Обмеження

Оскільки EditGAN заснований на фреймворку GAN, він має ту саму обмеження, що й будь-яка інша модель GAN: він може працювати тільки з зображеннями, які можна змоделювати за допомогою GAN.

Висновок

Одна з основних причин, чому GAN не є промисловим стандартом у галузі редакції зображень, полягає в його обмеженій практичності.

EditGAN спрямований на вирішення проблем, представлених традиційними фреймворками GAN, і намагається стати ефективним методом високоякісної та високоточної семантичної редакції зображень.

Kunal Kejriwal — бекенд‑інженер, який спеціалізується на Python, PostgreSQL, Redis та хмарній інфраструктурі в GCP і AWS. Має три роки досвіду у створенні та масштабуванні виробничих систем, пише про інфраструктуру ШІ, розподілені системи та архітектуру розгортання навантажень машинного навчання.