Взгляд Anderson

Редактирование объектов с помощью ИИ: Imagic от Google и функция «Erase and Replace» от Runway

mm
Добавьте Unite.AI в избранные источники в Google

На этой неделе два новых, но противоположных алгоритма графики, основанные на ИИ, предлагают пользователям новые способы вносить чрезвычайно детальные и эффективные изменения объектов на фотографиях.

Первый — Imagic, разработанный Google Research совместно с Израильским технологическим институтом и Институтом Вейцмана. Imagic предоставляет редактирование объектов, управляемое текстом, с высокой точностью посредством дообучения диффузионных моделей.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

Изменяйте то, что хотите, а остальное оставляйте нетронутым — Imagic обещает детальное редактирование только тех частей, которые вы хотите изменить. Source: https://arxiv.org/pdf/2210.09276.pdf

Любой, кто пытался изменить лишь один элемент при повторном рендеринге в Stable Diffusion, знает, что каждый удачный правка приводит к изменению пяти других элементов, которые вам нравились именно в таком виде. Это недостаток, из‑за которого многие из самых талантливых энтузиастов SD постоянно переключаются между Stable Diffusion и Photoshop, чтобы исправлять такие «побочные эффекты». Уже с этой точки зрения достижения Imagic выглядят примечательно.

На момент написания у Imagic ещё нет даже рекламного ролика, и учитывая осторожный подход Google к выпуску неограниченных инструментов синтеза изображений, неизвестно, насколько мы получим возможность протестировать эту систему.

Второй продукт — более доступный инструмент Runway ML Erase and Replace, новая функция в разделе «AI Magic Tools» их полностью онлайн‑пакета визуальных эффектов на основе машинного обучения.

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Функция Erase and Replace от Runway ML, уже продемонстрированная в предварительном просмотре системы редактирования текста в видео.

Давайте сначала посмотрим на релиз Runway.

Erase and Replace

Как и Imagic, Erase and Replace работает исключительно со статичными изображениями, хотя Runway предварительно показала ту же функцию в решении по редактированию текста в видео, которое ещё не выпущено:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

Хотя любой может протестировать новую функцию Erase and Replace на изображениях, видеоверсия пока недоступна публично. Source: https://twitter.com/runwayml/status/1568220303808991232

Хотя Runway ML не раскрыла детали технологий, лежащих в основе Erase and Replace, скорость, с которой можно заменить комнатное растение на довольно убедительный бюст Рональда Рейгана, указывает на то, что в качестве движка используется диффузионная модель, такая как Stable Diffusion (или, гораздо менее вероятно, лицензированная DALL‑E 2).

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

Замена комнатного растения бюстом «Гиппера» не столь быстра, как это, но всё же довольно быстра. Source: https://app.runwayml.com/

Система имеет некоторые ограничения, аналогичные DALL‑E 2 — изображения или текст, которые вызывают срабатывание фильтров Erase and Replace, вызывают предупреждение о возможной блокировке аккаунта при дальнейших нарушениях — по сути, шаблонная копия политик OpenAI для DALL‑E 2.

Во многих результатах отсутствуют типичные шероховатости Stable Diffusion. Runway ML являются инвесторами и научными партнёрами в SD, и возможно, что они обучили собственную модель, превосходящую открытые веса контрольной точки 1.4, с которыми сейчас борются все остальные (поскольку многие другие группы разработчиков, как любители, так и профессионалы, сейчас обучают или дообучают модели Stable Diffusion).

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Замена обычного стола на «стол изо льда» в Erase and Replace от Runway ML.

Как и в Imagic (см. ниже), Erase and Replace по сути «ориентирован на объекты» — нельзя просто стереть «пустую» часть изображения и заполнить её результатом вашего текстового запроса; в таком случае система просто определит ближайший видимый объект вдоль линии маски (например, стену или телевизор) и применит трансформацию к нему.

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

Как следует из названия, в Erase and Replace нельзя внедрять объекты в пустое пространство. Здесь попытка вызвать самого известного лорда Ситхов приводит к странному вейдеровскому муралу на телевизоре, примерно в том месте, где была нарисована область «замены».

Трудно определить, уклоняется ли Erase and Replace от использования защищённых авторским правом изображений (которые всё ещё в значительной степени блокируются, хотя с разной степенью успеха, в DALL‑E 2), или же модель, используемая в бек‑энд движке рендеринга, просто не оптимизирована для подобных задач.

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

Слегка NSFW «Мурал с Николь Кидман» показывает, что (по всей видимости) используемая диффузионная модель не обладает прежним системным отбрасыванием реалистичных лиц или откровенного контента, характерным для DALL‑E 2, а результаты попыток отобразить защищённые авторским правом работы варьируются от неоднозначных («ксеноморф») до абсурдных («железный трон»). В правом нижнем углу — исходное изображение.

Было бы интересно узнать, какие методы использует Erase and Replace для выделения объектов, которые он способен заменять. Предположительно, изображение проходит через некоторую модификацию CLIP, где отдельные элементы идентифицируются с помощью распознавания объектов и последующей семантической сегментации. Ни одна из этих операций не работает почти так же эффективно в обычной установке Stable Diffusion.

Но ничто не идеально — иногда система стирает, но не заменяет, даже когда (как мы видели на изображении выше) базовый механизм рендеринга явно понимает смысл текстового запроса. В таком случае превратить кофейный столик в ксеноморфа оказывается невозможным — стол просто исчезает.

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

Более жуткая версия «Где Уолдо?», поскольку Erase and Replace не смог создать пришельца.

Erase and Replace кажется эффективной системой замены объектов с отличным inpainting‑ом. Однако она не может редактировать уже существующие воспринимаемые объекты, а лишь заменять их. На самом деле изменить содержимое изображения, не нарушая окружающие материалы, — задача гораздо сложнее, тесно связанная с длительной борьбой исследователей компьютерного зрения за дисентанглмент в различных латентных пространствах популярных фреймворков.

Imagic

Это задача, которую решает Imagic. Новая статья предлагает множество примеров правок, успешно изменяющих отдельные аспекты фотографии, оставляя остальное изображение нетронутым.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

В Imagic изменённые изображения не страдают от характерного растягивания, искажений и «угадывания окклюзий», присущих deepfake‑марионеткам, использующим ограниченные приоры, полученные из одного изображения.

Система использует трёхэтапный процесс — оптимизацию текстовых эмбеддингов; дообучение модели; и, наконец, генерацию изменённого изображения.

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic кодирует целевой текстовый запрос, чтобы получить начальный эмбеддинг, затем оптимизирует результат для получения входного изображения. После этого генеративная модель дообучается на исходном изображении, добавляя ряд параметров, прежде чем применяется запрошенная интерполяция.

Неудивительно, что основа фреймворка — архитектура текст‑видео от Google Imagen, хотя исследователи отмечают, что принципы системы в целом применимы к латентным диффузионным моделям.

Imagen использует трёхуровневую архитектуру, в отличие от семьюуровневой схемы, применяемой в более недавней текст‑видео итерации программного обеспечения компании. Три отдельных модуля включают генеративную диффузионную модель с разрешением 64×64 px; модель супер‑разрешения, увеличивающую вывод до 256×256 px; и дополнительную модель супер‑разрешения, выводящую результат до 1024×1024 px.

Imagic вмешивается на самом раннем этапе этого процесса, оптимизируя запрошенный текстовый эмбеддинг на этапе 64 px с помощью Adam‑оптимизатора при фиксированном темпе обучения 0,0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

Мастер‑класс по дисентанглменту: пользователи, пытавшиеся изменить, например, цвет отрисованного объекта в диффузионной, GAN‑ или NeRF‑модели, поймут, насколько значимо, что Imagic способен выполнять такие трансформации, не «разрывая» согласованность остального изображения.

Дальше происходит дообучение базовой модели Imagen, 1500 шагов на каждое входное изображение, с условием на изменённый эмбеддинг. Одновременно вторичный слой 64px>256px оптимизируется параллельно на условном изображении. Исследователи отмечают, что аналогичная оптимизация финального слоя 256px>1024px оказывает «мало или совсем не влияет» на конечный результат, поэтому они его не реализовали.

В статье указано, что процесс оптимизации занимает примерно восемь минут на каждое изображение на двойных чипах TPUV4. Финальный рендер происходит в ядре Imagen согласно схеме выборки DDIM.

Как и в аналогичных процессах дообучения для Google DreamBooth, полученные эмбеддинги могут дополнительно использоваться для стилизации, а также для фотореалистичных правок, содержащих информацию из более широкой базовой базы данных, поддерживающей Imagen (поскольку, как показывает первый столбец ниже, исходные изображения не содержат необходимого контента для выполнения этих трансформаций).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Гибкое фотореалистичное перемещение и правки могут быть получены с помощью Imagic, а полученные в процессе дисентанглмент коды также могут использоваться для стилизованного вывода.

Исследователи сравнили Imagic с предыдущими работами SDEdit, подходом на основе GAN 2021 года, разработанным совместно Стэнфордским университетом и Университетом Карнеги‑Меллон; и Text2Live, совместным проектом из апреля 2022 года Института Вейцмана и NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.

Визуальное сравнение Imagic, SDEdit и Text2Live.

Очевидно, что предыдущие подходы сталкиваются с трудностями, но в нижнем ряду, где требуется кардинальное изменение позы, конкуренты полностью не справляются с перестройкой исходного материала, в отличие от заметного успеха Imagic.

Требования Imagic к ресурсам и время обучения на одно изображение, хотя и небольшие по сравнению с аналогичными задачами, делают его маловероятным кандидатом для локального приложения по редактированию изображений на персональных компьютерах — и неясно, насколько процесс дообучения можно масштабировать до уровня потребителя.

На данный момент Imagic представляет собой впечатляющий продукт, более подходящий для API — среды, в которой Google Research, осторожный в отношении критики за содействие deepfake, вероятно, будет чувствовать себя наиболее комфортно.

 

Первоначально опубликовано 18 октября 2022 года.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai