Взгляд Anderson
Модель диффузии eDiffi от NVIDIA позволяет «рисовать словами» и многое другое

Попытка создать точные композиции с помощью генеративных моделей изображений на основе диффузии, таких как Stable Diffusion, может быть похожа на то, как если бы вы пытались управлять котами; те же самые воображаемые и интерпретативные силы, которые позволяют системе создавать необыкновенные детали и вызывать необыкновенные изображения из относительно простых текстовых подсказок, также трудно отключить, когда вы ищете контроль на уровне Photoshop над генерацией изображений.
Теперь новый подход от исследователей NVIDIA, озаглавленный ensemble diffusion for images (eDiffi), использует смесь нескольких методов вложения и интерпретации (а не один и тот же метод на протяжении всего конвейера) для того, чтобы позволить гораздо больший уровень контроля над сгенерированным контентом. В примере ниже мы видим, как пользователь рисует элементы, где каждый цвет представляет одно слово из текстовой подсказки:

«Рисование словами» – одна из двух новых возможностей в модели диффузии eDiffi от NVIDIA. Каждая нарисованная цвет представляет слово из подсказки (см. их появление слева во время генерации), и цвет области будет состоять только из этого элемента. См. официальное видео для более подробных примеров и лучшего разрешения на https://www.youtube.com/watch?v=k6cOx9YjHJc
По сути, это «рисование с масками», и обратное парадигме inpainting в Stable Diffusion, которая основана на исправлении поврежденных или неудовлетворительных изображений, или на расширении изображений, которые могли бы быть желаемого размера с самого начала.
Здесь, вместо этого, границы нарисованных элементов представляют собой разрешенные приблизительные границы только одного уникального элемента из одной концепции, что позволяет пользователю задать окончательный размер холста с самого начала, а затем дискретно добавлять элементы.

Примеры из новой статьи. Источник: https://arxiv.org/pdf/2211.01324.pdf
Разнообразные методы, используемые в eDiffi, также означают, что система делает гораздо лучше работу по включению каждого элемента в длинные и подробные подсказки, тогда как Stable Diffusion и DALL-E 2 от OpenAI склонны отдавать предпочтение определенным частям подсказки, в зависимости либо от того, насколько рано целевые слова появляются в подсказке, либо от других факторов, таких как потенциальная сложность в разделении различных элементов, необходимых для полной, но всесторонней (относительно текстовой подсказки) композиции:

Из статьи: eDiffi способна более тщательно проходить через подсказку до максимально возможного количества элементов. Хотя улучшенные результаты для eDiffi (правый столбец) отобраны, так же отобраны и сравнительные изображения из Stable Diffusion и DALL-E 2.
Кроме того, использование специального T5 текстового кодировщика означает, что eDiffi способна генерировать понятный английский текст, либо абстрактно запрошенный из подсказки (т.е. изображение содержит некоторый текст [x]), либо явно запрошенный (т.е. футболка говорит «Nvidia Rocks»):

Специализированная текстовая обработка в eDiffi означает, что текст может быть сгенерирован дословно в изображениях, вместо того, чтобы быть запущенным только через текстово-изображаемый интерпретационный слой, который искажает вывод.
Еще одним преимуществом новой структуры является то, что также возможно предоставить одно изображение в качестве стиля подсказки, вместо того, чтобы обучать модель DreamBooth или текстовую вложенность на нескольких примерах жанра или стиля.

Передача стиля может быть применена из ссылочного изображения к текстово-изображаемой подсказке или даже изображению-изображению.
Кодировщик текста T5
Использование текстового кодировщика T5 от Google является ключевым элементом в улучшенных результатах, продемонстрированных в eDiffi. Средний конвейер диффузии основан на ассоциации между обученными изображениями и подписями, которые сопровождали их, когда они были соскоблены из интернета (или же вручную скорректированы позже, хотя это дорогостоящее и поэтому редкое вмешательство).

Из статьи от июля 2020 года о T5 — текстовые преобразования, которые могут помочь генеративному потоку изображений в eDiffi (и, потенциально, других моделях диффузии). Источник: https://arxiv.org/pdf/1910.10683.pdf
Перефразируя исходный текст и запуская модуль T5, можно получить более точные ассоциации и представления, чем были обучены в модели изначально, почти как пост фактум ручную маркировку, с большей специфичностью и применимостью к требованиям текстовой подсказки.
Авторы объясняют:
«В большинстве существующих работ по моделям диффузии денойзинговая модель общая для всех уровней шума, и временная динамика представлена с помощью простого временного вложения, которое подается в денойзинговую модель через сеть MLP. Мы утверждаем, что сложную временную динамику денойзинговой диффузии может быть неэффективно изучена из данных с помощью общей модели с ограниченной емкостью.
«Вместо этого мы предлагаем увеличить емкость денойзинговой модели, введя ансамбль экспертных денойзеров; каждый экспертный денойзер — это денойзинговая модель, специализированная для определенного диапазона уровней шума. Таким образом, мы можем увеличить емкость модели без замедления выборки, поскольку вычислительная сложность оценки [обработанного элемента] на каждом уровне шума остается прежней».

Концептуальная архитектура eDiffi.
Существующие модули кодирования CLIP, включенные в DALL-E 2 и Stable Diffusion, также способны находить альтернативные интерпретации изображений для текста, связанного с пользовательским вводом. Однако они обучены на подобной информации, как и исходная модель, и не используются как отдельный интерпретационный слой так, как T5 в eDiffi.
Авторы заявляют, что eDiffi — это первый раз, когда в одну трубу включены как кодировщик T5, так и кодировщик CLIP:
«Поскольку эти два кодировщика обучены с разными целями, их вложения предпочитают формирования разных изображений с одним и тем же входным текстом. Хотя вложения текста CLIP помогают определить общий вид сгенерированных изображений, они склонны пропускать мелкие детали в тексте».
«Напротив, изображения, сгенерированные с помощью вложений текста T5, лучше отражают отдельные объекты, описанные в тексте, но их общий вид менее точен. Совместное использование их обоих дает лучшие результаты генерации изображений в нашей модели».
Прерывание и дополнение процесса диффузии
Статья отмечает, что типичная модель диффузии начнет свое путешествие от чистого шума к изображению, полагаясь исключительно на текст на ранних этапах генерации.
Когда шум разрешается в некотором виде грубого макета, представляющего описание в текстовой подсказке, текстово-ориентированный аспект процесса практически исчезает, и остальная часть процесса смещается в сторону дополнения визуальных особенностей.
Это означает, что любой элемент, который не был разрешен на начальном этапе текстово-ориентированного толкования шума, трудно ввести в изображение позже, потому что два процесса (текст-разметка и разметка-изображение) имеют относительно небольшое пересечение, и базовая разметка довольно запутана к тому времени, когда она достигает процесса дополнения изображения.

Из статьи: карты внимания различных частей конвейера, когда процесс шума-изображения созревает. Мы можем увидеть резкое падение влияния CLIP на изображение в нижнем ряду, в то время как T5 продолжает влиять на изображение гораздо дальше в процессе рендеринга.
Профессиональный потенциал
Примеры на странице проекта и видео на YouTube сосредоточены на PR-дружественной генерации милых изображений. Как обычно, исследователи NVIDIA преуменьшают потенциал своей последней инновации для улучшения фотореалистичных или VFX-потоков, а также ее потенциал для улучшения глубоких подделок изображений и видео.
В примерах начинающий или любительский пользователь грубо очерчивает контуры размещения для конкретного элемента, тогда как в более систематическом VFX-потоке возможно использовать eDiffi для интерпретации нескольких кадров видеоэлемента с помощью текст-изображение, где контуры очень точны и основаны, например, на фигурах, где фон был удален через зеленый экран или алгоритмические методы.

Runway ML уже предоставляет AI-основанное ротоскопирование. В этом примере «зеленый экран» вокруг субъекта представляет альфа-слой, а извлечение было выполнено с помощью машинного обучения, а не алгоритмического удаления реального зеленого экрана. Источник: https://twitter.com/runwayml/status/1330978385028374529
Используя обученную модель персонажа DreamBooth и конвейер изображение-изображение с eDiffi, потенциально возможно начать решать одну из проблем любой модели диффузии: временную стабильность. В таком случае оба контура наложенного изображения и содержимое изображения будут «предварительно浮ированы» против пользовательского холста, с временной непрерывностью отображаемого контента (т.е. превращение реального практика тай-чи в робота) обеспечиваемой с помощью использования заблокированной модели DreamBooth, которая «запомнила» свои данные обучения — плохо для интерпретируемости, но хорошо для воспроизводимости, точности и непрерывности.
Метод, данные и тесты
Статья гласит, что модель eDiffi была обучена на «коллекции публичных и проприетарных наборов данных», сильно отфильтрованных с помощью предварительно обученной модели CLIP, чтобы удалить изображения, которые могут снизить общий эстетический балл вывода. Окончательный отфильтрованный набор изображений состоит из «около одного миллиарда» пар текст-изображение. Размер обучаемых изображений описывается как с «самой короткой стороной больше 64 пикселей».
Было обучено несколько моделей для процесса, с базовой и сверхразрешающей моделями, обученными на оптимизаторе AdamW с скоростью обучения 0,0001, весовым затуханием 0,01 и внушительной размером партии 2048.
Базовая модель была обучена на 256 GPU NVIDIA A100, а две сверхразрешающие модели — на 128 GPU NVIDIA A100 для каждой модели.
Система была основана на собственной библиотеке PyTorch Imaginaire от NVIDIA. Наборы данных COCO и Visual Genome были использованы для оценки, хотя не были включены в окончательные модели, с использованием MS-COCO в качестве конкретной версии для тестирования. Системы соперников, протестированные в статье, включали GLIDE, Make-A-Scene, DALL-E 2, Stable Diffusion и две системы синтеза изображений от Google, Imagen и Parti.
В соответствии с подобной предыдущей работой, zero-shot FID-30K был использован в качестве метрики оценки. Под FID-30K 30 000 подписей были извлечены случайным образом из набора проверки COCO (т.е. не изображений или текста, использованных в обучении), которые затем использовались в качестве текстовых подсказок для синтеза изображений.
Расстояние Фрехета-Инсепшна (FID) между сгенерированными и реальными изображениями затем рассчитывалось, а также записывался балл CLIP для сгенерированных изображений.

Результаты тестов zero-shot FID против текущих подходов на наборе данных COCO 2014, с более низкими результатами — лучше.
В результатах eDiffi смогла получить самый низкий (лучший) балл по zero-shot FID, даже против систем с гораздо большим количеством параметров, таких как 20 миллиардов параметров в Parti, по сравнению с 9,1 миллиардами параметров в самой мощной модели eDiffi, обученной для тестов.
Вывод
Модель диффузии eDiffi от NVIDIA представляет собой желаемую альтернативу простому добавлению все большего количества данных и сложности к существующим системам, вместо этого используя более интеллектуальный и многослойный подход к некоторым из самых острых препятствий, связанных с запутыванием и нередактируемостью в генеративных моделях изображений на основе диффузии.
Уже есть обсуждения на подфорумах и в Discord-каналах Stable Diffusion о том, чтобы либо直接 включить любой код, который может быть доступен для eDiffi, либо повторно реализовать принципы, лежащие в его основе, в отдельной реализации. Однако новая труба так радикально отличается, что это будет означать целую версию изменений для SD, отказываясь от некоторой обратной совместимости, но предлагая возможность значительно улучшить контроль над окончательными синтезированными изображениями, не жертвуя при этом завораживающими воображаемыми силами диффузии.












