Модели и платформы ИИ
BrushNet: Встраиваемое решение для восстановления изображений с двойным диффузионным распределением
Восстановление изображений является одной из классических проблем в области компьютерного зрения, и оно направлено на восстановление поврежденных областей изображения с правдоподобным и естественным содержанием. Существующие работы, использующие традиционные методы восстановления изображений, такие как сети Ган и вариационные автоэнкодеры, часто требуют дополнительных手одельных функций, но при этом не дают удовлетворительных результатов. В последние годы методы, основанные на диффузии, приобрели популярность в сообществе компьютерного зрения благодаря их замечательной способности генерировать высококачественные изображения, обеспечивать разнообразие выходных данных и тонкий контроль. Первые попытки использования моделей диффузии для восстановления изображений, управляемого текстом, модифицировали стандартную стратегию денойзинга путем выборки поврежденных областей из предварительно обученной модели диффузии и копирования неповрежденных областей из исходного изображения на каждом шаге денойзинга. Хотя эти методы показали удовлетворительную производительность при простых задачах восстановления изображений, они испытывали трудности с сложными формами масок, текстовыми подсказками и содержанием изображений, что приводило к общему отсутствию согласованности. Отсутствие согласованности в этих методах можно объяснить в основном их ограниченными знаниями о границах масок и контексте неповрежденных областей изображения.
Несмотря на достижения, исследования и разработку этих моделей за последние годы, восстановление изображений остается серьезной проблемой для разработчиков компьютерного зрения. Текущие адаптации моделей диффузии для задач восстановления изображений включают изменение стратегии выборки или разработку моделей диффузии, специально предназначенных для восстановления изображений, что часто приводит к снижению качества изображения и несогласованности семантики. Чтобы решить эти проблемы и проложить путь вперед для моделей восстановления изображений, в этой статье мы будем говорить о BrushNet, новом встраиваемом двойном диффузионном решении, которое встраивает пиксельные функции поврежденного изображения в любую предварительно обученную модель диффузии, гарантируя согласованность и улучшенный результат при восстановлении изображений. Решение BrushNet вводит новый парадигму, в которой решение разделяет функции изображения и шумовые латентные переменные на отдельные ветви. Разделение функций изображения и шумовых латентных переменных снижает нагрузку на модель и позволяет тонко включать важную информацию о поврежденном изображении иерархически. В дополнение к решению BrushNet, мы также будем говорить о BrushBench и BrushData, которые обеспечивают оценку производительности на основе сегментации и обучение восстановлению изображений соответственно.

Эта статья направлена на подробное описание решения BrushNet, и мы исследуем механизм, методологию, архитектуру решения, а также его сравнение с современными решениями. Итак, начнем.
BrushNet: Восстановление изображений с двойным диффузионным распределением
Восстановление изображений, метод, который пытается восстановить поврежденные области изображения, сохраняя общую согласованность, является давней проблемой в области компьютерного зрения и беспокоит разработчиков и исследователей уже несколько лет. Восстановление изображений находит применение в различных задачах компьютерного зрения, включая редактирование изображений и виртуальные примерки. Недавно модели диффузии, такие как Stable Diffusion и Stable Diffusion 1.5, продемонстрировали замечательную способность генерировать высококачественные изображения и обеспечивают пользователям гибкость контроля семантических и структурных элементов. Замечательный потенциал моделей диффузии побудил исследователей использовать модели диффузии для высококачественных задач восстановления изображений, соответствующих текстовым подсказкам.
Методы, используемые традиционными решениями восстановления изображений на основе диффузии, можно разделить на две категории: Модификация стратегии выборки и Специальные модели восстановления изображений. Метод модификации стратегии выборки изменяет стандартный процесс денойзинга путем выборки поврежденных областей из предварительно обученной модели диффузии и копирования неповрежденных областей из исходного изображения на каждом шаге денойзинга. Хотя методы модификации стратегии выборки можно реализовать в произвольных моделях диффузии, они часто приводят к несогласованным результатам восстановления изображений, поскольку они имеют ограниченные знания о границах масок и контексте неповрежденных областей изображения. С другой стороны, специальные модели восстановления изображений настраивают модель восстановления изображений, специально разработанную для включения поврежденных изображений и масок, расширяя размерность входного канала базовой модели диффузии. Хотя специальные модели восстановления изображений позволяют модели диффузии генерировать более удовлетворительные результаты с помощью специализированных формо- и контекстно-осведомленных моделей, они могут не быть лучшим архитектурным решением для задач восстановления изображений.
Как показано на следующем изображении, специальные модели восстановления изображений объединяют латентные переменные поврежденного изображения, шумовые латентные переменные, текст и маску на ранней стадии. Архитектурное решение специальных моделей восстановления изображений легко влияет на функции поврежденного изображения и предотвращает получение чистых функций поврежденного изображения последующими слоями в архитектуре UNet из-за влияния текста. Кроме того, обработка генерации и условий в одном потоке накладывает дополнительную нагрузку на архитектуру UNet, и поскольку эти подходы также требуют настройки в различных вариантах модели диффузии, они часто являются трудоемкими и имеют ограниченную переносимость.

Может показаться, что добавление дополнительной ветви для извлечения функций поврежденного изображения может быть адекватным решением вышеуказанных проблем, однако существующие решения часто приводят к извлечению и вставке недостаточной информации при прямом применении к восстановлению изображений. В результате существующие решения, такие как ControlNet, дают неудовлетворительные результаты по сравнению со специальными моделями восстановления изображений. Чтобы решить эту проблему наиболее эффективным образом, решение BrushNet вводит дополнительную ветвь в исходную сеть диффузии, создавая более подходящую архитектуру для задач восстановления изображений. Архитектура и решение BrushNet можно суммировать в трех пунктах.
- Вместо инициализации сверток случайным образом, решение BrushNet реализует кодировщик VAE для обработки поврежденного изображения. В результате решение BrushNet может более эффективно извлекать функции изображения для адаптации к распределению UNet.
- Решение BrushNet постепенно включает полный слой функций UNet слой за слоем в предварительно обученную архитектуру UNet, что позволяет обеспечить плотный пер-пиксельный контроль.
- Решение BrushNet удаляет текстовое перекрестное внимание из компонента UNet, чтобы гарантировать, что в дополнительной ветви учитываются только чистые функции изображения. Кроме того, модель BrushNet предлагает реализовать размытую стратегию смешивания для достижения лучшей согласованности и более широкого диапазона контроля в неповрежденных областях изображения.
BrushNet: Метод и Архитектура
Следующая фигура дает нам краткий обзор решения BrushNet.

Как можно наблюдать, решение использует двойную стратегию ветвей для вставки функций поврежденного изображения и использует операции смешивания с размытой маской для лучшей сохранности неповрежденных областей. Стоит отметить, что решение BrushNet может регулировать добавляемый масштаб для достижения гибкого контроля. Для данного входного поврежденного изображения и маски модель BrushNet выводит восстановленное изображение. Модель сначала уменьшает масштаб маски для соответствия размеру латентного пространства, а поврежденное изображение подается в кодировщик VAE для согласования распределения латентного пространства. Затем модель объединяет латентные переменные поврежденного изображения, шумовые латентные переменные и уменьшенную маску и использует их в качестве входных данных. Извлеченные функции затем добавляются к предварительно обученному слою UNet после блока свертки с нулевым весом. После денойзинга модель смешивает поврежденное изображение и сгенерированное изображение с размытой маской.
Вставка функций поврежденного изображения
Решение BrushNet вставляет функции поврежденного изображения в предварительно обученную сеть диффузии с помощью дополнительной ветви, которая явно разделяет извлечение функций поврежденного изображения и процесс генерации изображения. Входные данные формируются путем объединения латентных переменных поврежденного изображения, шумовых латентных переменных и уменьшенной маски. Более конкретно, шумовые латентные переменные предоставляют информацию для генерации изображения во время текущего процесса генерации и помогают решению улучшить семантическую согласованность функций поврежденного изображения. Решение BrushNet затем извлекает латентные переменные поврежденного изображения из поврежденного изображения с помощью вариационного автоэнкодера. Кроме того, решение использует кубическую интерполяцию для уменьшения масштаба маски, чтобы гарантировать, что размер маски соответствует размеру латентных переменных поврежденного изображения и шумовых латентных переменных. Для обработки функций поврежденного изображения решение BrushNet реализует копию предварительно обученной модели диффузии и исключает слои перекрестного внимания модели диффузии. Причина заключается в том, что предварительно обученные веса модели диффузии служат сильным априорным знанием для извлечения функций поврежденного изображения, а исключение слоев перекрестного внимания гарантирует, что модель учитывает только чистые функции изображения в дополнительной ветви. Решение BrushNet вставляет функции в замороженную модель диффузии слой за слоем, что позволяет обеспечить иерархический плотный пер-пиксельный контроль, и также использует слои свертки с нулевым весом для установления связи между обучаемой моделью BrushNet и замороженной моделью, гарантируя, что вредоносный шум не влияет на скрытые состояния в обучаемой копии во время начальных стадий обучения.
Операция смешивания
Как упоминалось ранее, выполнение операции смешивания в латентном пространстве приводит к изменению размера маски, что часто приводит к неточностям, и решение BrushNet сталкивается с подобной проблемой при изменении размера маски для соответствия размеру латентного пространства. Кроме того, стоит отметить, что операции кодирования и декодирования в вариационных автоэнкодерах имеют внутренние ограничения и могут не гарантировать полную реконструкцию изображения. Чтобы гарантировать, что решение реконструирует полностью согласованное изображение неповрежденной области, существующие работы реализовали различные методы, такие как копирование неповрежденных областей из исходного изображения. Хотя этот подход работает, он часто приводит к отсутствию семантической согласованности в генерации окончательных результатов. С другой стороны, методы, такие как принятие операций смешивания в латентном пространстве, испытывают трудности в сохранении желаемой информации в неповрежденных областях.
Гибкий контроль
Архитектурное решение BrushNet делает его подходящим выбором для встраиваемых интеграций с различными предварительно обученными моделями диффузии и обеспечивает гибкое сохранение масштаба. Поскольку решение BrushNet не изменяет веса предварительно обученной модели диффузии, разработчики имеют гибкость интегрировать его как встраиваемый компонент с настроенной моделью диффузии, что позволяет легко采用 и экспериментировать с предварительно обученными моделями. Кроме того, разработчики также имеют возможность контролировать масштаб сохранения неповрежденных областей, включая функции решения BrushNet в замороженную модель диффузии с заданным весом, определяющим влияние решения BrushNet на масштаб сохранения, что позволяет разработчикам регулировать желаемый уровень сохранения. Наконец, решение BrushNet позволяет пользователям регулировать масштаб размытия и решать, реализовывать ли операцию размытия, что позволяет легко настраивать масштаб сохранения неповрежденных областей и обеспечивает гибкие регулировки и тонкий контроль над процессом восстановления изображений.
BrushNet: Реализация и результаты
Чтобы проанализировать его результаты, решение BrushNet предлагает BrushBench, набор данных для восстановления изображений на основе сегментации с более чем 600 изображениями, каждое из которых сопровождается ручной маской и аннотацией подписи. Изображения в наборе данных BrushBench распределены равномерно между натуральными и искусственными изображениями и также обеспечивают равномерное распределение среди различных категорий, что позволяет проводить справедливую оценку в различных категориях. Чтобы еще больше улучшить анализ задач восстановления изображений, решение BrushNet категоризирует набор данных на две отдельные части на основе методов, используемых: сегментация на основе и маски кисти.
Количественное сравнение
Следующая таблица сравнивает решение BrushNet с существующими моделями восстановления изображений на основе диффузии в наборе данных BrushBench с моделью Stable Diffusion в качестве базовой модели.

Как можно наблюдать, решение BrushNet демонстрирует замечательную эффективность при сохранении поврежденных областей, выравнивании текста и качестве изображения. Кроме того, модели, такие как Stable Diffusion Inpainting, HD-Painter, PowerPaint и другие, демонстрируют сильную производительность при задачах восстановления изображений внутри, хотя они испытывают трудности при задачах восстановления изображений снаружи, особенно в плане выравнивания текста и качества изображения. В целом, решение BrushNet обеспечивает самые сильные результаты.
Кроме того, следующая таблица сравнивает решение BrushNet с существующими моделями восстановления изображений на основе диффузии в наборе данных EditBench, и производительность аналогична той, что наблюдается в наборе данных BrushBench. Результаты указывают на то, что решение BrushNet обеспечивает сильную производительность при широком диапазоне задач восстановления изображений с различными типами масок.

Качественное сравнение
Следующая фигура качественно сравнивает решение BrushNet с существующими методами восстановления изображений, с результатами, охватывающими искусственный интеллект и натуральные изображения при различных задачах восстановления изображений, включая восстановление изображений с случайными масками, восстановление изображений внутри сегментации и восстановление изображений снаружи сегментации.

Как можно наблюдать, решение BrushNet обеспечивает замечательные результаты в плане согласованности неповрежденной области и согласованных областей и успешно реализует осведомленность о фоновых знаниях благодаря реализации подхода двойной ветви. Кроме того, неповрежденная ветвь предварительно обученной модели диффузии также обеспечивает преимущество лучшего покрытия различных доменов данных, таких как аниме и живопись, что приводит к лучшей производительности при различных сценариях.

Окончательные мысли
В этой статье мы говорили о решении BrushNet, новом встраиваемом двойном диффузионном решении, которое встраивает пиксельные функции поврежденного изображения в любую предварительно обученную модель диффузии, гарантируя согласованность и улучшенный результат при восстановлении изображений. Решение BrushNet вводит новый парадигму, в которой решение разделяет функции изображения и шумовые латентные переменные на отдельные ветви. Разделение функций изображения и шумовых латентных переменных снижает нагрузку на модель и позволяет тонко включать важную информацию о поврежденном изображении иерархически. В дополнение к решению BrushNet, мы также будем говорить о BrushBench и BrushData, которые обеспечивают оценку производительности на основе сегментации и обучение восстановлению изображений соответственно.












