Взгляд Anderson

UniTune: Альтернативная нейронная техника редактирования изображений от Google

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Google, по-видимому, атакуют текстовое редактирование изображений с нескольких сторон и, предположительно, ждут, чтобы увидеть, что “сработает”. Горячо на след этой недели выпуска их Imagic paper, поисковый гигант предложил дополнительный метод редактирования изображений на основе текстовых команд, называемый UniTune.

На основе примеров, представленных в новой статье, UniTune достигла необыкновенного уровня дезентанглемента семантической позы и идеи от фактического содержания изображения:

UniTune демонстрирует исключительное мастерство семантической композиции. Обратите внимание, как в верхнем ряду изображений лица двух людей не были искажены необыкновенной трансформацией остальной части исходного изображения (справа).

UniTune демонстрирует исключительное мастерство семантической композиции. Обратите внимание, как в верхнем ряду изображений лица двух людей не были искажены необыкновенной трансформацией остальной части исходного изображения (справа). Источник: https://arxiv.org/pdf/2210.09477.pdf

Как поклонники Stable Diffusion уже узнали, применение редактирования к частям изображения без негативного влияния на остальную часть изображения может быть сложной, иногда невозможной операцией. Хотя популярные версии, такие как AUTOMATIC1111, могут создавать маски для локальных и ограниченных редактирований, процесс является мучительным и часто непредсказуемым.

Очевидный ответ, по крайней мере для специалиста по компьютерному зрению, заключается в том, чтобы ввести слой семантической сегментации, который может распознавать и изолировать объекты на изображении без вмешательства пользователя, и, действительно, были предприняты несколько новых инициатив в последнее время в этом направлении.

Другой возможностью для блокирования беспорядочных и запутанных нейронных операций редактирования изображений является использование модуля Contrastive Language-Image Pre-training (CLIP) от OpenAI, который является сердцем моделей латентного распространения, таких как DALL-E 2 и Stable Diffusion, в качестве фильтра в момент, когда модель текст-изображение готова отправить интерпретированное изображение обратно пользователю. В этом контексте CLIP должен действовать как часовой и модуль контроля качества, отклоняющий неправильные или неприемлемые изображения. Это скоро будет реализовано (ссылка на Discord) на портале API-driven от Stability.ai.

Однако, поскольку CLIP, по сути, является и виновником, и решением в такой ситуации (поскольку он также информировал способ, которым изображение было эволюционировано), и поскольку требования к аппаратному обеспечению могут превышать то, что, вероятно, будет доступно локально для конечного пользователя, этот подход может быть не идеальным.

Сжатый язык

Предлагаемый UniTune вместо этого “тонко настраивает” существующую модель распространения – в данном случае, собственную модель Google Imagen, хотя исследователи утверждают, что метод совместим с другими архитектурами латентного распространения – так, что уникальный токен вводится в нее, который может быть вызван путем включения его в текстовый запрос.

На первый взгляд, это звучит как DreamBooth от Google, который в настоящее время является одержимостью среди поклонников и разработчиков Stable Diffusion, и который может ввести новые персонажи или объекты в существующую контрольную точку, часто менее чем за час, на основе всего нескольких исходных изображений; или как Textual Inversion, который создает “сайдкар” файлы для контрольной точки, которые затем обрабатываются как если бы они были первоначально обучены в модели, и могут воспользоваться огромными ресурсами модели, изменяя ее текстовый классификатор, в результате чего получается крошечный файл (по сравнению с минимальными 2 ГБ обрезанными контрольными точками DreamBooth).

Фактически, исследователи утверждают, что UniTune отвергла оба этих подхода. Они обнаружили, что Textual Inversion опустила слишком много важных деталей, в то время как DreamBooth “работала хуже и дольше”, чем решение, которое они в конечном итоге выбрали.

Тем не менее, UniTune использует тот же подход к семантическому “метапромпту”, как и DreamBooth, с обученными изменениями, вызываемыми уникальными словами, выбранными тренером, которые не будут конфликтовать с любыми терминами, которые в настоящее время существуют в тщательно обученной публичной модели.

‘Чтобы выполнить операцию редактирования, мы выборочно сэмплируем тонко настроенные модели с запросом “[редкие_токены] редактировать_запрос” (например, “beikkpic два собаки в ресторане” или “beikkpic миньон”).’

Процесс

Метод UniTune по сути отправляет исходное изображение через модель распространения с набором инструкций о том, как его следует изменить, используя огромные репозитории доступных данных, обученных в модели. По сути, вы можете сделать это прямо сейчас с помощью функции img2img от Stable Diffusion – но не без искажения или изменения частей изображения, которые вы хотели бы сохранить.

Во время процесса UniTune система тонко настраивается, то есть UniTune заставляет модель возобновить обучение, с большинством ее слоев размороженных (см. ниже). В большинстве случаев тонкая настройка приведет к снижению общих общих значений потерь высокопроизводительной модели в пользу введения или усовершенствования некоторого другого аспекта, который желателен для создания или улучшения.

Однако с UniTune кажется, что копия модели, которая подвергается действию, хотя она может весить несколько гигабайт или более, будет рассматриваться как одноразовый “оболочечный” отход, и будет выброшена в конце процесса, выполнив единственную цель. Этот тип небрежного отношения к данным становится повседневной кризисной ситуацией для поклонников DreamBooth, чьи собственные модели, даже когда обрезаны, не менее 2 ГБ на предмет.

Как и в случае с Imagic, основная настройка в UniTune происходит на нижних двух из трех слоев в Imagen (базовый 64px, 64px>256px и 256px>1024px). В отличие от Imagic, исследователи видят некоторую потенциальную ценность в оптимизации настройки также для этого последнего и самого большого сверхразрешающего слоя (хотя они еще не попробовали это).

Для нижнего слоя 64px модель предвзята к базовому изображению во время обучения, с несколькими дублированными парами изображения/текста, введенными в систему за 128 итераций с размером пакета 4, и с Adafactor в качестве функции потерь, работающей на скорости обучения 0,0001. Хотя T5-кодировщик заморожен во время этой тонкой настройки, он также заморожен во время основного обучения Imagen

Эта операция затем повторяется для слоя 64>256px, используя ту же процедуру шумового усиления, используемую в исходном обучении Imagen.

Сэмплирование

Существует множество возможных методов сэмплирования, с помощью которых можно получить изменения, внесенные в модель, включая Classifier Free Guidance (CFG), который является основой также и для Stable Diffusion. CFG по сути определяет степень, в которой модель может “следовать своему воображению” и исследовать возможности рендеринга – или же, при более низких настройках, степень, в которой она должна придерживаться входных исходных данных и вносить менее значительные или драматические изменения.

Как и Textual Inversion (немного меньше с DreamBooth), UniTune подходит для применения различных графических стилей к исходным изображениям, а также более фотореалистичных редактирований.

Как и Textual Inversion (немного меньше с DreamBooth), UniTune подходит для применения различных графических стилей к исходным изображениям, а также более фотореалистичных редактирований.

Исследователи также экспериментировали с SDEdit с помощью техники “позднего старта”, где система поощряется сохранять исходные детали, будучи только частично “шумной” с самого начала, а не сохраняя свои основные характеристики. Хотя исследователи использовали это только на нижнем слое (64px), они считают, что это может быть полезным дополнительным методом сэмплирования в будущем.

Исследователи также использовали prompt-to-prompt в качестве дополнительной текстовой техники для условного моделирования:

‘В настройке “prompt to prompt” мы обнаружили, что техника, которую мы называем Prompt Guidance, особенно полезна для настройки точности и выразительности.

‘Prompt Guidance похожа на Classifier Free Guidance, за исключением того, что базовая модель – это другой запрос, а не неусловная модель. Это направляет модель к разнице между двумя запросами.’

Prompt-to-prompt в UniTune, эффективно изолируя области для изменения.

Prompt-to-prompt в UniTune, эффективно изолируя области для изменения.

Однако руководство по запросу, утверждают авторы, было необходимо только время от времени в случаях, когда CFG не смогла получить желаемый результат.

Другой новый подход к сэмплированию, встреченный во время разработки UniTune, – это интерполяция, где области изображения достаточно различны, что и исходное, и измененное изображение очень похожи по композиции, что позволяет использовать более “наивную” интерполяцию.

Интерполяция может сделать более трудоемкие процессы UniTune излишними в случаях, когда области для трансформации являются дискретными и хорошо отграниченными.

Интерполяция может сделать более трудоемкие процессы UniTune излишними в случаях, когда области для трансформации являются дискретными и хорошо отграниченными.

Авторы считают, что интерполяция потенциально может работать так хорошо, что она может быть использована в качестве настройки по умолчанию, и отмечают также, что она имеет силу вносить необыкновенные трансформации в случаях, когда сложные перекрытия не требуют более интенсивных методов.

UniTune может выполнять локальные редактирования с или без редакторских масок, но также может решать, где размещать редактирования, с необычной комбинацией интерпретационной силы и сущностной сущности исходных данных:

В верхнем изображении второго столбца UniTune, задача которого - вставить

В верхнем изображении второго столбца UniTune, задача которого – вставить “красный поезд на фоне”, поместила его в подходящее и аутентичное положение. Обратите внимание, как в других примерах сохраняется семантическая целостность исходного изображения, даже в середине необыкновенных изменений пиксельного содержания и основных стилей изображений.

Задержка

Хотя первая итерация любой новой системы будет медленной, и хотя возможно, что либо участие сообщества, либо корпоративные обязательства (обычно не оба) в конечном итоге ускорят и оптимизируют ресурсоемкий процесс, оба UniTune и Imagic выполняют некоторые довольно значительные манипуляции с машинным обучением, чтобы создать эти удивительные редактирования, и сомнительно, до какой степени такой ресурсоемкий процесс может быть уменьшен до домашнего использования, а не API-ориентированного доступа (хотя последний может быть более желательным для Google).

В настоящее время полный цикл от ввода к результату занимает около 3 минут на T4 GPU, с дополнительными 30 секундами для вывода (как и в любом другом выводе). Авторы признают, что это высокая задержка и едва ли квалифицируется как “интерактивная”, но они также отмечают, что модель остается доступной для дальнейших редактирований после первоначальной настройки, пока пользователь не закончит процесс, что снижает время редактирования.

 

Опубликовано впервые 21 октября 2022 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai