Взгляд Anderson
Редактирование объектов с помощью ИИ от Google’s Imagic и Runway’s ‘Erase and Replace’

На этой неделе два новых, но противоположных алгоритма графики, управляемые ИИ, предлагают новые способы для конечных пользователей вносить высокодетализированные и эффективные изменения в объекты на фотографиях.
Первый – это Imagic, от Google Research, в сотрудничестве с Израильским технологическим институтом и Институтом科学ы Вейцмана. Imagic предлагает текст-условное, тонкое редактирование объектов посредством тонкой настройки моделей диффузии.

Измените то, что вам нравится, и оставьте остальное – Imagic обещает детальное редактирование только тех частей, которые вы хотите изменить. Источник: https://arxiv.org/pdf/2210.09276.pdf
Любой, кто когда-либо пытался изменить только один элемент в Stable Diffusion, знает слишком хорошо, что для каждого успешного редактирования система изменит пять вещей, которые вам понравились именно так, как они были. Это недостаток, который в настоящее время заставляет многих талантливых энтузиастов SD постоянно переключаться между Stable Diffusion и Photoshop, чтобы исправить этот вид “побочного ущерба”. С этой точки зрения достижения Imagic кажутся заметными.
На момент написания Imagic еще не имеет даже промо-видео, и, учитывая осторожное отношение Google к выпуску неограниченных инструментов синтеза изображений, неясно, в какой степени, если вообще, мы получим возможность протестировать систему.
Второе предложение – это более доступная функция Erase and Replace от Runway ML, новая функция в разделе “AI Magic Tools” их исключительно онлайн-сuitы утилит визуальных эффектов на основе машинного обучения.

Функция Erase and Replace от Runway ML, уже виденная в предварительном просмотре для системы редактирования видео на основе текста. Источник: https://www.youtube.com/watch?v=41Qb58ZPO60
Давайте посмотрим на выход Runway сначала.
Удалить и заменить
Как и Imagic, Erase and Replace работает исключительно со статичными изображениями, хотя Runway предварительно показал ту же функциональность в системе редактирования видео на основе текста, которая еще не выпущена:

Хотя любой может протестировать новую функцию Erase and Replace на изображениях, видео-версия еще не доступна публично. Источник: https://twitter.com/runwayml/status/1568220303808991232
Хотя Runway ML не выпустил деталей о технологиях, лежащих в основе Erase and Replace, скорость, с которой можно заменить комнатное растение на разумно убедительный бюст Рональда Рейгана, предполагает, что модель диффузии, такая как Stable Diffusion (или, гораздо менее вероятно, лицензированная DALL-E 2), является двигателем, который пересоздает объект вашего выбора в Erase and Replace.

Замена комнатного растения на бюст Рональда Рейгана не такая быстрая, но довольно быстрая. Источник: https://app.runwayml.com/
Система имеет некоторые ограничения, подобные DALL-E 2 – изображения или текст, которые запускают фильтры Erase and Replace, могут вызвать предупреждение о возможной приостановке учетной записи в случае дальнейших нарушений – практически идентичную копию текущих политик OpenAI для DALL-E 2.
Многие результатов лишены характерных грубых краев Stable Diffusion. Runway ML являются инвесторами и партнерами по исследованиям в SD, и возможно, что они обучили проприетарную модель, которая превосходит открытую модель 1.4, с которой мы все сейчас боремся (как и многие другие группы разработчиков, хобби и профессионалов, которые сейчас обучают или тонко настраивают модели Stable Diffusion).

Замена домашнего стола на ‘стол из льда’ в Erase and Replace от Runway ML.
Как и в случае с Imagic (см. ниже), Erase and Replace “ориентирован на объекты” – вы не можете просто удалить “пустую” часть изображения и заполнить ее результатом вашего текстового запроса; в этом сценарии система просто отслеживает ближайший видимый объект вдоль линии зрения маски и применяет преобразование там.

Как название указывает, вы не можете ввести объекты в пустое пространство в Erase and Replace. Здесь попытка вызвать самого известного из ситхов результатом странного Вадера на телевизоре, примерно там, где была нарисована область замены.
Трудно сказать, является ли Erase and Replace осторожным в отношении использования защищенных авторским правом изображений (которые все еще в значительной степени препятствуются, хотя и с переменным успехом, в DALL-E 2), или если модель, используемая в движке рендеринга, просто не оптимизирована для этого.

Сlightly NSFW ‘Фреска Николь Кидман’ указывает на то, что (предположительно) диффузионная модель в руках лишена прежнего систематического отказа от рендеринга реалистичных лиц или откровенного контента, в то время как результаты попыток вызвать защищенные авторским правом работы варьируются от двусмысленных (‘ксеноморф’) до абсурдных (‘железный трон’).
Было бы интересно узнать, какие методы использует Erase and Replace для изоляции объектов, которые он может заменить. Предположительно изображение проходит через некоторую производную CLIP, с дискретными предметами, индивидуализированными объектным распознаванием и последующим семантическим разделением. Ни одна из этих операций не работает почти так же хорошо в обычной установке Stable Diffusion.
Но ничего не идеально – иногда система, кажется, удаляет и не заменяет, даже когда (как мы видели в изображении выше) основной механизм рендеринга определенно знает, что означает текстовый запрос. В этом случае оказывается невозможным превратить кофейный стол в ксеноморфа – вместо этого стол просто исчезает.

Более страшная версия ‘Где Вальдо’, когда Erase and Replace не может произвести инопланетянина.
Erase and Replace кажется эффективной системой замены объектов, с отличным заполнением. Однако он не может редактировать существующие воспринимаемые объекты, а только заменить их. Чтобы фактически изменить существующий контент изображения без компрометации окружающего материала, можно утверждать, что это гораздо более сложная задача, связанная с долгой борьбой сектора компьютерного зрения за разъединение в различных潜ных пространствах популярных фреймворков.
Imagic
Это задача, которую решает Imagic. Новая статья предлагает многочисленные примеры редактирований, которые успешно изменяют отдельные аспекты фотографии, оставляя остальную часть изображения нетронутой.

В Imagic измененные изображения не страдают от характерного растяжения, искажения и ‘угадывания окукления’, характерных для кукольного глубокого подделывания, которое использует ограниченные приоры, полученные из одного изображения.
Система использует трехэтапный процесс – оптимизацию текстового внедрения; тонкую настройку модели; и, наконец, генерацию измененного изображения.

Imagic кодирует целевой текстовый запрос, чтобы получить первоначальное текстовое внедрение, а затем оптимизирует результат, чтобы получить входное изображение. После этого генеративная модель тонко настраивается для исходного изображения, добавляя ряд параметров, прежде чем подвергаться запрошенной интерполяции.
Неудивительно, что фреймворк основан на архитектуре текст-видео от Google’s Imagen, хотя исследователи утверждают, что принципы системы в целом применимы к моделям диффузии.
Imagen использует трехуровневую архитектуру, а не семиуровневый массив, используемый для более recent итерации текст-видео программного обеспечения. Три различных модуля состоят из генеративной модели диффузии, работающей на разрешении 64x64px; модели супер-разрешения, которая масштабирует это выход до 256x256px; и дополнительной модели супер-разрешения, чтобы довести выход до разрешения 1024×1024.
Imagic вмешивается на самой ранней стадии этого процесса, оптимизируя запрошенное текстовое внедрение на стадии 64px с помощью оптимизатора Adam со статической скоростью обучения 0,0001.

Мастер-класс по разъединению: те пользователи, которые пытались изменить что-то так простое, как цвет отрендеренного объекта в диффузии, GAN или NeRF-модели, знают, насколько значимо то, что Imagic может выполнять такие преобразования без ‘разрыва’ последовательности остальной части изображения.
Тонкая настройка затем происходит на базовой модели Imagen, за 1500 шагов на входное изображение, условно на пересмотренном внедрении. Одновременно параллельно оптимизируется вторичный слой 64px>256px на условном изображении. Исследователи отмечают, что аналогичная оптимизация для окончательного слоя 256px>1024px имеет “малый или никакой” эффект на окончательные результаты и, следовательно, не реализовали это.
Статья гласит, что процесс оптимизации занимает примерно восемь минут для каждого изображения на двойных чипах TPUV4. Окончательный рендеринг происходит в ядре Imagen под схемой DDIM.
В общем с подобными процессами тонкой настройки для DreamBooth от Google, полученные внедрения могут быть использованы для стилизации, а также для фотореалистичных редактирований, содержащих информацию, полученную из более широкой базы данных, лежащей в основе Imagen (поскольку, как показывает первый столбец ниже, исходные изображения не содержат необходимого контента для выполнения этих преобразований).

Гибкие фотореалистичные движения и редактирования могут быть вызваны с помощью Imagic, а полученные и разъединенные коды, полученные в процессе, могут быть использованы для стилизованного вывода.
Исследователи сравнили Imagic с предыдущими работами SDEdit, подходом на основе GAN от 2021 года, сотрудничеством между Стэнфордским университетом и Университетом Карнеги-Меллона; и Text2Live, сотрудничеством от апреля 2022 года между Институтом Вейцмана и NVIDIA.

Визуальное сравнение между Imagic, SDEdit и Text2Live.
Ясно, что предыдущие подходы испытывают трудности, но в нижней строке, которая включает в себя введение значительного изменения позы, действующие лица полностью терпят неудачу в перестановке исходного материала по сравнению с заметным успехом Imagic.
Требования Imagic к ресурсам и времени обучения на изображение, хотя и короткие по стандартам таких занятий, делают его маловероятным включением в локальное приложение для редактирования изображений на персональных компьютерах – и неясно, в какой степени процесс тонкой настройки может быть масштабирован до потребительского уровня.
Как оно стоит, Imagic – это впечатляющее предложение, которое более подходит для API – среды, в которой Google Research, осторожная в отношении критики по поводу облегчения глубокого подделывания, может быть наиболее комфортной.
Опубликовано впервые 18 октября 2022 года.












