Модели и платформы ИИ

Высокоточный семантический редактирование изображений с помощью EditGAN

mm
Добавьте Unite.AI в избранные источники в Google

Генеративные состязательные сети или GANs в последние месяцы получили новые применения в индустрии редактирования изображений. EditGAN набирает популярность в отрасли AI/ML, поскольку это новый метод высокоточного и высококачественного семантического редактирования изображений.

Мы расскажем о модели EditGAN подробнее и объясним, почему она может стать этапом в индустрии семантического редактирования изображений.

Итак, начнем. Но прежде чем мы узнаем, что такое EditGAN, важно понять, почему он важен и почему это значительный шаг вперед.

Почему EditGAN?

Хотя традиционные архитектуры GAN помогли индустрии редактирования изображений на основе AI продвинуться значительно, есть некоторые основные проблемы при построении архитектуры GAN с нуля.

  1. Во время фазы обучения архитектура GAN требует большого количества помеченных данных с аннотациями семантической сегментации.
  2. Они способны предоставлять только высокоуровневый контроль.
  3. И часто они просто интерполируют туда и обратно между изображениями.

Можно наблюдать, что хотя традиционные архитектуры GAN выполняют работу, они не эффективны для широкомасштабного развертывания. Низкая эффективность традиционной архитектуры GAN является причиной, по которой EditGAN был представлен компанией NVIDIA (NVDA ) в 2022 году.

EditGAN предлагается как эффективный метод высокоточного и высококачественного семантического редактирования изображений, позволяющий пользователям редактировать изображения, изменяя их детальные маски сегментации.

Модель EditGAN построена на основе архитектуры GAN, которая моделирует изображения и их семантические сегментации совместно и требует только небольшого количества помеченных или аннотированных данных обучения.

Архитектура EditGAN позволяет модели учиться на произвольном количестве векторов редактирования, которые затем можно применить непосредственно к другим изображениям с высокой скоростью и эффективностью.

Чтобы суммировать, почему нам нужен EditGAN, это первая в истории GAN-основанная рамка редактирования изображений, которая предлагает

  1. Очень высокоточный редактирование.
  2. Может работать с небольшим количеством помеченных данных.
  3. Может быть развернут эффективно в реальных сценариях.
  4. Позволяет составлять несколько редактирований одновременно.
  5. Работает с изображениями, сгенерированными GAN, реальными встроенными и даже вне области изображений.

Высокоточный семантический редактирование изображений с помощью EditGAN

StyleGAN2, один из лучших каркасных GAN для синтеза изображений, является основным компонентом генерации изображений EditGAN.

StyleGAN2 – это глубокая генеративная модель, которая была обучена синтезировать изображения самого высокого качества, а также приобретать семантическое понимание изображений.

Обучение и вывод сегментации

Модель EditGAN встраивает изображение в пространство GAN с помощью оптимизации и кодировщика для выполнения сегментации на новом изображении и обучения ветви сегментации.

Результатом является то, что модель встраивает аннотированные изображения из набора данных, помеченные семантической сегментацией, в пространство и использует перекрестную энтропию для обучения ветви сегментации генератора.

Использование редактирования сегментации для нахождения семантики в пространстве

Основная цель EditGAN – использовать совместное распределение семантических сегментаций и изображений для высокоточного редактирования изображений.

Чтобы отредактировать изображение, модель встраивает изображение в пространство EditGAN или использует образцы изображений из модели.

Разработчики могут затем использовать любые инструменты маркировки или цифровой живописи для изменения сегментации и редактирования их вручную.

Различные способы редактирования во время вывода

Векторы редактирования, полученные с помощью оптимизации, можно описать как семантически осмысленные и часто дезентанглированы с различными атрибутами.

Следовательно, чтобы отредактировать новое изображение, модель может直接 встроить изображение в пространство и выполнить те же операции редактирования, которые модель выучила ранее, без выполнения оптимизации заново.

На основе наших текущих знаний, каркас EditGAN можно использовать для редактирования изображений в трех разных режимах.

  • Редактирование в реальном времени с векторами редактирования

Для изображений, которые локализованы и дезентанглированы, модель редактирует изображения, применяя векторы редактирования, выученные ранее, с различными масштабами и манипулирует изображениями на интерактивных скоростях.

  • Использование самообучения для уточнения векторного редактирования

Для редактирования локализованных изображений, которые не идеально дезентанглированы с другими частями изображения, модель инициализирует редактирование изображения, используя векторы редактирования, выученные ранее, и удаляет артефакты редактирования, выполняя несколько дополнительных шагов оптимизации во время тестирования.

  • Редактирование на основе оптимизации

Чтобы выполнить крупномасштабное и специфичное для изображения редактирование, модель выполняет оптимизацию с начала, поскольку векторы редактирования не могут быть использованы для выполнения этих типов передачи на другие изображения.

Реализация

Каркас EditGAN оценивается на изображениях, распространенных по четырем различным категориям: Машины, Птицы, Кошки и Лица.

Ветвь сегментации модели обучается, используя пары изображений и масок 16, 30, 30, 16 в качестве помеченных данных обучения для Машины, Птицы, Кошки и Лица соответственно.

Результаты

Качественные результаты

Результаты в области

Изображение выше демонстрирует производительность каркаса EditGAN при применении ранее выученных векторов редактирования к новым изображениям и уточнении изображений, используя 30 шагов оптимизации.

Что удивительно, так это то, что каркас EditGAN может выполнять очень высокоточные редактирования, такие как расширение зрачков или редактирование спиц в шинах машины.

Результаты вне области

Чтобы оценить производительность EditGAN вне области, каркас был протестирован на наборе данных MetFaces.

Количественные результаты

Чтобы измерить возможности редактирования изображений EditGAN количественно, модель использует тестовую базу редактирования улыбок, который был впервые представлен MaskGAN.

Таблица выше сравнивает производительность каркаса EditGAN с другими базовыми моделями на тестовой базе редактирования улыбок.

Ограничения

Поскольку EditGAN основан на каркасе GAN, он имеет те же ограничения, что и любая другая модель GAN: он может работать только с изображениями, которые могут быть смоделированы GAN.

Заключение

Одной из основных причин, почему GAN не является отраслевым стандартом в области редактирования изображений, является его ограниченная практичность.

EditGAN направлен на решение проблем, представленных традиционными каркасами GAN, и он пытается стать эффективным методом высококачественного и высокоточного семантического редактирования изображений.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.