Взгляд Anderson

Улучшение генерации зеленого экрана для стабильной диффузии

mm
Добавьте Unite.AI в избранные источники в Google
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Несмотря на энтузиазм сообщества и инвесторов вокруг визуального генеративного ИИ, вывод таких систем не всегда готов для реального использования; одним из примеров является то, что системы генеративного ИИ склонны выводить целые изображения (или серию изображений, в случае видео), а не индивидуальные, изолированные элементы, которые обычно требуются для различных приложений в мультимедиа и для практиков визуальных эффектов.

Простой пример этого – клип-арт, предназначенный для наложения на выбранный пользователем фон:

Светло-серый клетчатый фон, возможно, наиболее знакомый пользователям Photoshop, стал представлять альфа-канал, или канал прозрачности, даже в простых потребительских товарах, таких как изображения из股票.

Светло-серый клетчатый фон, возможно, наиболее знакомый пользователям Photoshop, стал представлять альфа-канал, или канал прозрачности, даже в простых потребительских товарах, таких как изображения из股票.

Прозрачность такого рода была доступна более тридцати лет; с момента цифровой революции начала 1990-х годов пользователи могли извлекать элементы из видео и изображений с помощью все более сложных наборов инструментов и методов.

Например, задача “выпадения” фонов синего и зеленого экрана в видеозаписях, когда-то областью дорогостоящих химических процессов и оптических принтеров (а также ручных матов), стала делом минут в системах, таких как Adobe’s After Effects и Photoshop (среди многих других бесплатных и проприетарных программ и систем).

Как только элемент был изолирован, альфа-канал (по сути, маска, которая скрывает любое нерелевантное содержимое) позволяет любому элементу в видео быть легко наложенным на новые фоны или составленным с другими изолированными элементами.

Примеры альфа-каналов, с их эффектами, изображенными в нижнем ряду. Источник: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Примеры альфа-каналов, с их эффектами, изображенными в нижнем ряду. Источник: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Выпадение

В компьютерном зрении создание альфа-каналов попадает в область семантической сегментации, с открытыми проектами, такими как Meta’s Segment Anything, предоставляющими метод изоляции/извлечения целевых объектов с помощью семантически-усиленного распознавания объектов.

Фреймворк Segment Anything был использован в широком диапазоне рабочих процессов визуальных эффектов и извлечения, таких как Alpha-CLIP проект.

Примеры извлечений, используя Segment Anything, в фреймворке Alpha-CLIP: Источник: https://arxiv.org/pdf/2312.03818

Примеры извлечений, используя Segment Anything, в фреймворке Alpha-CLIP: Источник: https://arxiv.org/pdf/2312.03818

Существует много альтернативных методов семантической сегментации, которые могут быть адаптированы для задачи присвоения альфа-каналов.

Однако семантическая сегментация полагается на обученные данные, которые могут не содержать всех категорий объектов, которые необходимо извлечь. Хотя модели, обученные на очень больших объемах данных, могут позволить распознавать более широкий диапазон объектов (эффективно становясь базовыми моделями или моделями мира), они все равно ограничены классами, на которых они обучены.

Системы семантической сегментации, такие как Segment Anything, могут испытывать трудности с определением определенных объектов или частей объектов, как это показано здесь в выводе из неоднозначных подсказок. Источник: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Системы семантической сегментации, такие как Segment Anything, могут испытывать трудности с определением определенных объектов или частей объектов, как это показано здесь в выводе из неоднозначных подсказок. Источник: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

В любом случае семантическая сегментация является таким же пост фактум процессом, как и процедура зеленого экрана, и должна изолировать элементы без преимущества единой области фона, которую можно эффективно распознать и удалить.

Поэтому иногда сообществу пользователей приходила в голову идея, что изображения и видео могли бы быть сгенерированы с фоновыми зелеными экранами, которые можно было бы мгновенно удалить с помощью обычных методов.

К сожалению, популярные латентные диффузионные модели, такие как Stable Diffusion, часто испытывают трудности с генерацией действительно яркого зеленого экрана. Это связано с тем, что обучающие данные этих моделей обычно не содержат многих примеров такого специализированного сценария. Даже когда система успешно генерирует зеленый экран, идея “зеленого” склонна распространяться в нежелательной форме на объект в переднем плане, из-за концептуального переплетения:

Выше мы видим, что Stable Diffusion отдал приоритет аутентичности изображения над необходимостью создания единой интенсивности зеленого, эффективно воспроизводя реальные проблемы, которые возникают в традиционных сценариях зеленого экрана. Ниже мы видим, что концепция “зеленого” загрязнила изображение в переднем плане. Чем больше подсказка фокусируется на концепции “зеленого”, тем хуже эта проблема, скорее всего, станет. Источник: https://stablediffusionweb.com/

Несмотря на продвинутые методы, используемые в этих системах, как платье женщины, так и галстук мужчины (в нижних изображениях, показанных выше) склонны “выпадать” вместе с зеленым фоном – проблема, которая восходит к дням фотохимических процессов удаления красителей в 1970-х и 1980-х годах.

Как всегда, недостатки модели можно преодолеть, бросив конкретные данные на проблему и посвятив значительные обучающие ресурсы. Системы, такие как Stanford’s 2024 предложение LayerDiffuse, создают тонко настроенную модель, способную генерировать изображения с альфа-каналами:

Проект Stanford LayerDiffuse был обучен на миллионе подходящих изображений, способных наделить модель возможностями прозрачности. Источник: https://arxiv.org/pdf/2402.17113

Проект Stanford LayerDiffuse был обучен на миллионе подходящих изображений, способных наделить модель возможностями прозрачности. Источник: https://arxiv.org/pdf/2402.17113

К сожалению, помимо значительных ресурсов, необходимых для этого подхода, набор данных, использованный для LayerDiffuse, не доступен публично, что ограничивает использование моделей, обученных на нем. Даже если это препятствие не существовало, этот подход трудно настраивать или разрабатывать для конкретных случаев использования.

Сlightly позже в 2024 году Adobe Research сотрудничал со Stonybrook University, чтобы создать MAGICK, подход к извлечению ИИ, обученный на сгенерированных диффузионных изображениях.

Из статьи 2024 года, пример тонкой извлечения альфа-канала в MAGICK. Источник: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

Из статьи 2024 года, пример тонкой извлечения альфа-канала в MAGICK. Источник: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

150 000 извлеченных, сгенерированных ИИ объектов были использованы для обучения MAGICK, чтобы система развила интуитивное понимание извлечения:

Примеры из набора данных MAGICK.

Примеры из набора данных MAGICK.

Этот набор данных, как указано в исходной статье, был очень трудно сгенерировать по вышеупомянутой причине – что диффузионные методы испытывают трудности с созданием сплошных ключевых областей цвета. Поэтому ручной выбор сгенерированных матов был необходим.

Этот логистический узел еще раз приводит к системе, которую нельзя легко разработать или настроить, а только использовать в пределах ее первоначальной обучающей способности.

TKG-DM – ‘Нативная’ экстракция хрома для латентной диффузионной модели

Новое сотрудничество между немецкими и японскими исследователями предложило альтернативу таким обученным методам, способную – как указано в статье – получить лучшие результаты, чем вышеупомянутые методы, без необходимости обучения на специально подобранных наборах данных.

TKG-DM изменяет случайный шум, который запускает генеративное изображение, чтобы оно было лучше способно производить сплошной, ключевой фон - в любом цвете. Источник: https://arxiv.org/pdf/2411.15580

TKG-DM изменяет случайный шум, который запускает генеративное изображение, чтобы оно было лучше способно производить сплошной, ключевой фон – в любом цвете. Источник: https://arxiv.org/pdf/2411.15580

Новый метод подходит к проблеме на уровне генерации, оптимизируя случайный шум, из которого генерируется изображение в латентной диффузионной модели (ЛДМ) такой, как Stable Diffusion.

Подход основан на предыдущем исследовании цветовой схемы распределения Stable Diffusion и способен производить фоновый цвет любого типа, с меньшим (или отсутствием) переплетением ключевого цвета фона в содержимое переднего плана, по сравнению с другими методами.

Первоначальный шум обусловлен сдвигом среднего канала, который может влиять на аспекты процесса денойзинга, не переплетая цветовой сигнал в содержимое переднего плана.

Первоначальный шум обусловлен сдвигом среднего канала, который может влиять на аспекты процесса денойзинга, не переплетая цветовой сигнал в содержимое переднего плана.

Статья гласит:

‘Наши обширные эксперименты показывают, что TKG-DM улучшает показатели FID и mask-FID на 33,7% и 35,9% соответственно.

‘Таким образом, наша модель без обучения соперничает с тонко настроенными моделями, предлагая эффективное и универсальное решение для различных задач создания визуального контента, требующих точного контроля переднего и фонового плана. ‘

Новая статья называется TKG-DM: Модель диффузионного контента с хромой без обучения, и исходит от семи исследователей из Hosei University в Токио и RPTU Kaiserslautern-Landau & DFKI GmbH, в Кайзерслаутерне.

Метод

Новый подход расширяет архитектуру Stable Diffusion, обусловливая первоначальный гауссовский шум через средний сдвиг канала (ССК), который производит шумовые закономерности, предназначенные для стимулирования желаемого разделения фона и переднего плана в сгенерированном результате.

Схема рабочего процесса предложенной системы.

Схема предложенной системы.

ССК регулирует среднее значение каждого цветового канала, сохраняя общее развитие процесса денойзинга.

Авторы объясняют:

‘Чтобы сгенерировать объект переднего плана на фоне хрома, мы применяем стратегию выбора начального шума, которая селективно объединяет начальный [шум] и начальный цвет [шум] с помощью 2D гауссовской [маски].

‘Эта маска создает постепенный переход, сохраняя исходный шум в области переднего плана и применяя цветоизмененный шум к области фона.’

Цветовой канал, желаемый для фонового хрома, реализуется с помощью пустой текстовой подсказки, в то время как фактическое содержимое переднего плана создается семантически из текстовой инструкции пользователя.

Цветовой канал, желаемый для фонового хрома, реализуется с помощью пустой текстовой подсказки, в то время как фактическое содержимое переднего плана создается семантически из текстовой инструкции пользователя.

Само-внимание и перекрестное внимание используются для разделения двух аспектов изображения (фон хрома и содержимое переднего плана). Само-внимание помогает с внутренней последовательностью объекта переднего плана, в то время как перекрестное внимание поддерживает верность текстовой подсказке. Статья отмечает, что поскольку фоновые изображения обычно менее детализированы и подчеркиваются в генерациях, их более слабое влияние относительно легко преодолеть и заменить сплошной цветовой областью.

Визуализация влияния само-внимания и перекрестного внимания в процессе генерации хрома.

Визуализация влияния само-внимания и перекрестного внимания в процессе генерации хрома.

Данные и тесты

TKG-DM был протестирован с помощью Stable Diffusion V1.5 и Stable Diffusion SDXL. Изображения были сгенерированы при размере 512x512px и 1024x1024px соответственно.

Изображения были созданы с помощью DDIM планировщика, родного для Stable Diffusion, при масштабе руководства 7,5, с 50 шагами денойзинга. Целевой фоновой цвет был зеленым, теперь доминирующим методом выпадения.

Новый подход был сравнен с DeepFloyd, под настройками, использованными для MAGICK; с тонко настроенной моделью диффузии низкого ранга GreenBack LoRA; и также с вышеупомянутым LayerDiffuse.

Для данных были использованы 3000 изображений из набора данных MAGICK.

Примеры из набора данных MAGICK, из которых были отобраны 3000 изображений для тестирования новой системы. Источник: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Примеры из набора данных MAGICK, из которых были отобраны 3000 изображений для тестирования новой системы. Источник: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Для метрик авторы использовали Fréchet Inception Distance (FID), чтобы оценить качество переднего плана. Они также разработали проектно-специфическую метрику, называемую m-FID, которая использует BiRefNet систему, чтобы оценить качество полученного маски.

Визуальные сравнения системы BiRefNet с предыдущими методами. Источник: https://arxiv.org/pdf/2401.03407

Визуальные сравнения системы BiRefNet с предыдущими методами. Источник: https://arxiv.org/pdf/2401.03407

Чтобы протестировать семантическую выравнивание с входными подсказками, были использованы методы CLIP-Sentence (CLIP-S) и CLIP-Image (CLIP-I). CLIP-S оценивает верность подсказке, а CLIP-I визуальное сходство с реальным изображением.

Первый набор качественных результатов для нового метода, в данном случае для Stable Diffusion V1.5. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения.

Первый набор качественных результатов для нового метода, в данном случае для Stable Diffusion V1.5. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения.

Авторы утверждают, что результаты (визуализированные выше и ниже, SD1.5 и SDXL соответственно) демонстрируют, что TKG-DM получает лучшие результаты без инженерии подсказок или необходимости обучать или тонко настраивать модель.

Качественные результаты для SDXL. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения.

Качественные результаты для SDXL. Пожалуйста, обратитесь к исходному PDF для лучшего разрешения.

Они наблюдают, что при подсказке, чтобы вызвать зеленый фон в сгенерированных результатах, Stable Diffusion 1.5 испытывает трудности с генерацией чистого фона, в то время как SDXL (хотя и работает немного лучше) производит нестабильные светло-зеленые оттенки, которые могут помешать разделению в процессе хрома.

Они进一步 отмечают, что хотя LayerDiffuse генерирует хорошо разделенные фоны, он иногда теряет детали, такие как точные числа или буквы, и авторы приписывают это ограничениям в наборе данных. Они добавляют, что генерация маски также иногда терпит неудачу, что приводит к “неразрезанным” изображениям.

Для количественных тестов, хотя LayerDiffuse, кажется, имеет преимущество в SDXL для FID, авторы подчеркивают, что это является результатом специализированного набора данных, который эффективно представляет “запечатанный” и негибкий продукт. Как упоминалось ранее, любые объекты или классы, не охваченные этим набором данных, или недостаточно охваченные, могут не работать так хорошо, в то время как дальнейшее тонкое настраивание для приспособления к новым классам представляет пользователю бремя курирования и обучения.

Количественные результаты для сравнений. Очевидное преимущество LayerDiffuse, как отмечено в статье, происходит за счет гибкости и бремени курирования и обучения.

Количественные результаты для сравнений. Очевидное преимущество LayerDiffuse, как отмечено в статье, происходит за счет гибкости и бремени курирования и обучения.

Статья гласит:

‘Высокие показатели FID, m-FID и CLIP-I для DeepFloyd отражают его сходство с реальным изображением на основе вывода DeepFloyd. Однако это сходство дает ему врожденное преимущество, что делает его непригодным в качестве справедливого эталона для качества изображения. Его более низкий показатель CLIP-S еще больше указывает на более слабую текстовую выравнивание по сравнению с другими моделями.

В целом, эти результаты подчеркивают способность нашей модели генерировать высококачественные, текстово-выровненные передние планы без тонкого настраивания, предлагая эффективное решение для генерации контента с хромой.

Наконец, исследователи провели пользовательское исследование, чтобы оценить придерживание подсказок в различных методах. Сто участников были попрослены оценить 30 пар изображений из каждого метода, с объектами, извлеченными с помощью BiRefNet и ручных уточнений во всех примерах. Подход исследователей без обучения был предпочтителен в этом исследовании.

Результаты пользовательского исследования.

Результаты пользовательского исследования.

TKG-DM совместим с популярной ControlNet третьей стороной для Stable Diffusion, и авторы утверждают, что он производит лучшие результаты, чем родная способность ControlNet достичь такого разделения.

Заключение

Возможно, наиболее заметным выводом из этой новой статьи является степень, в которой латентные диффузионные модели переплетены, в отличие от популярного общественного восприятия, что они могут легко разделить аспекты изображений и видео при генерации нового контента.

Исследование еще больше подчеркивает степень, в которой исследовательское и хобби-сообщество обратилось к тонкому настраиванию в качестве пост фактум решения для недостатков моделей – решения, которое всегда будет решать конкретные классы и типы объектов. В таком сценарии тонко настроенная модель будет работать очень хорошо на ограниченном количестве классов или терпимо хорошо на гораздо большем количестве возможных классов и объектов, в зависимости от количества данных в обучающих наборах.

Следовательно, приятно видеть, что существует хотя бы одно решение, которое не полагается на такие трудоемкие и спорные решения.

 

* Съемка фильма 1978 года Супермен, актер Кристофер Рив был вынужден носить бирюзовый костюм Супермена для съемок с синим экраном, чтобы избежать стирания иконического синего костюма. Цвет костюма был позже восстановлен с помощью цветокоррекции.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]