Модели и платформы ИИ

InstantStyle: Сохранение Стиля в Генерации Изображений из Текста

mm
Добавьте Unite.AI в избранные источники в Google

За последние несколько лет модели диффузии на основе настройки продемонстрировали замечательный прогресс в широком спектре задач персонализации и настройки изображений. Однако, несмотря на их потенциал, текущие модели диффузии на основе настройки продолжают сталкиваться с рядом сложных проблем при генерации и производстве изображений, последовательных по стилю, и может быть три причины этого. Во-первых, понятие стиля остается широко неопределенным и неопределенным, и включает в себя комбинацию элементов, включая атмосферу, структуру, дизайн, материал, цвет и многое другое. Во-вторых, методы, основанные на инверсии, склонны к деградации стиля, что приводит к частой потере деталей. Наконец, подходы, основанные на адаптерах, требуют частой настройки весов для каждой ссылочной изображения, чтобы поддерживать баланс между контролем текста и интенсивностью стиля.

Более того, основная цель большинства подходов к передаче стиля или генерации стилизованных изображений заключается в использовании ссылочной изображения и применении его конкретного стиля из заданного подмножества или ссылочной изображения к целевой изображению содержания. Однако именно широкое количество атрибутов стиля делает задачу сложной для исследователей, чтобы собрать стилизованные наборы данных, представляющие стиль правильно, и оценить успех передачи. Ранее модели и рамки, которые имеют дело с процессом диффузии на основе настройки, настраивают набор данных изображений, которые имеют общий стиль, процесс, который является одновременно трудоемким и имеет ограниченную обобщаемость в реальных задачах, поскольку трудно собрать подмножество изображений, которые имеют одинаковый или почти идентичный стиль.

В этой статье мы будем говорить об InstantStyle, рамке, разработанной с целью решения проблем, с которыми сталкиваются текущие модели диффузии на основе настройки для генерации и настройки изображений. Мы будем говорить о двух ключевых стратегиях, реализованных в рамке InstantStyle:

  1. Простой, но эффективный подход к разделению стиля и содержания из ссылочных изображений в пространстве функций, основанный на предположении, что функции в одном и том же пространстве функций могут быть либо добавлены, либо вычтены друг из друга.
  2. Предотвращение утечки стиля путем инъекции функций ссылочной изображения исключительно в блоки, специфичные для стиля, и намеренного избегания необходимости использования громоздких весов для настройки, часто характеризующих более параметро-тяжелые конструкции.

Эта статья направлена на то, чтобы покрыть рамку InstantStyle в глубину, и мы исследуем механизм, методологию, архитектуру рамки, а также ее сравнение с рамками, являющимися лучшими в своем классе. Мы также будем говорить о том, как рамка InstantStyle демонстрирует замечательные визуальные результаты стилизации и достигает оптимального баланса между контролем текстовых элементов и интенсивностью стиля. Итак, давайте начнем.

InstantStyle: Сохранение Стиля в Генерации Изображений из Текста

Рамки генерации изображений из текста на основе диффузии продемонстрировали заметный и замечательный успех в широком спектре задач настройки и персонализации, особенно в задачах генерации изображений, включая настройку объектов, сохранение изображений и передачу стиля. Однако, несмотря на недавний успех и рост производительности, передача стиля остается сложной задачей для исследователей из-за неопределенной и неопределенной природы стиля, часто включающей в себя множество элементов, включая атмосферу, структуру, дизайн, материал, цвет и многое другое. С учетом этого, основная цель стилизованной генерации изображений или передачи стиля заключается в применении конкретного стиля из заданной ссылочной изображения или ссылочного подмножества изображений к целевой изображению содержания. Однако широкое количество атрибутов стиля делает задачу сложной для исследователей, чтобы собрать стилизованные наборы данных, представляющие стиль правильно, и оценить успех передачи. Ранее модели и рамки, которые имеют дело с процессом диффузии на основе настройки, настраивают набор данных изображений, которые имеют общий стиль, процесс, который является одновременно трудоемким и имеет ограниченную обобщаемость в реальных задачах, поскольку трудно собрать подмножество изображений, которые имеют одинаковый или почти идентичный стиль.

С учетом проблем, с которыми сталкиваются текущий подход, исследователи заинтересовались в разработке подходов на основе настройки для передачи стиля или стилизованной генерации изображений, и эти рамки можно разделить на две разные группы:

  • Подходы без адаптера: Подходы и рамки без адаптера используют силу само-внимания в процессе диффузии, и, реализуя общую операцию внимания, эти модели способны извлекать необходимые функции, включая ключи и значения, из заданной ссылочной изображения напрямую.
  • Подходы на основе адаптера: Подходы и рамки на основе адаптера включают в себя легковесную модель, разработанную для извлечения подробных представлений изображения из ссылочных изображений. Затем рамка интегрирует эти представления в процесс диффузии, используя механизмы кросс-внимания. Основная цель процесса интеграции заключается в том, чтобы направлять процесс генерации и обеспечить, чтобы результирующее изображение было согласовано с желаемыми стилистическими нюансами ссылочной изображения.

Однако, несмотря на обещания, методы без настройки часто сталкиваются с несколькими проблемами. Во-первых, подход без адаптера требует обмена ключами и значениями в слоях само-внимания, и предварительно вычисляет матрицы ключей и значений, полученные из ссылочных изображений. Когда он реализуется на натуральных изображениях, подход без адаптера требует инверсии изображения обратно к шумовой латентной представлению, используя методы, такие как DDIM или денойзинг-диффузионные неявные модели. Однако использование DDIM или других методов инверсии может привести к потере деталей, таких как цвет и текстура, что уменьшает информацию о стиле в сгенерированных изображениях. Кроме того, дополнительный шаг, введенный этими подходами, является трудоемким процессом и может представлять значительные недостатки в практических приложениях. С другой стороны, основная проблема для методов на основе адаптера заключается в нахождении правильного баланса между утечкой контекста и интенсивностью стиля. Утечка контекста возникает, когда увеличение интенсивности стиля приводит к появлению не-стилевых элементов из ссылочной изображения в сгенерированном выводе, с основной точкой сложности, заключающейся в разделении стилей от контекста внутри ссылочной изображения эффективно. Чтобы решить эту проблему, некоторые рамки строят парные наборы данных, представляющие один и тот же объект в разных стилях, что облегчает извлечение представления контекста и разделение стилей. Однако, благодаря неопределенной представленности стиля, задача создания крупномасштабных парных наборов данных ограничена в плане разнообразия стилей, которые она может захватить, и это ресурсоемкий процесс.

Чтобы решить эти ограничения, рамка InstantStyle вводится, которая представляет собой новую механику без настройки, основанную на существующих методах на основе адаптера, с возможностью бесшовной интеграции с другими методами, основанными на внимании, и достижением разделения содержания и стиля эффективно. Кроме того, рамка InstantStyle вводит не один, а два эффективных способа выполнить разделение стиля и содержания, достигая лучшей миграции стиля без необходимости введения дополнительных методов для разделения или построения парных наборов данных.

Кроме того, предыдущие рамки на основе адаптера были широко использованы в методах, основанных на CLIP, в качестве извлекателя функций изображения, некоторые рамки исследовали возможность реализации разделения функций внутри пространства функций, и, сравнивая с неопределенностью стиля, легче описать контекст текстом. Поскольку изображения и тексты имеют общее пространство функций в методах, основанных на CLIP, простая операция вычитания функций контекста текста и функций изображения может значительно уменьшить утечку контекста. Кроме того, в большинстве моделей диффузии существует определенный слой в его архитектуре, который вводит информацию о стиле и достигает разделения контекста и стиля, вводя функции изображения только в определенные блоки стиля. Реализуя эти две простые стратегии, рамка InstantStyle способна решить проблемы утечки контекста, с которыми сталкиваются большинство существующих рамок, сохраняя при этом силу стиля.

Чтобы суммировать, рамка InstantStyle использует две простые, но эффективные механизмы для достижения эффективного разделения содержания и стиля из ссылочных изображений. Рамка InstantStyle является модельно-независимым и механизмом без настройки, который демонстрирует замечательную производительность в задачах передачи стиля с огромным потенциалом для задач, следующих за этим.

Instant-Style: Методология и Архитектура

Как было продемонстрировано предыдущими подходами, существует баланс в инъекции условий стиля в моделях диффузии без настройки. Если интенсивность условия изображения слишком высока, это может привести к утечке контекста, тогда как если интенсивность условия изображения слишком низка, стиль может не быть достаточно очевидным. Основная причина этой наблюдаемости заключается в том, что в изображении стиль и контекст взаимосвязаны, и из-за неопределенной представленности стиля трудно разделить стиль и намерение. В результате часто настраиваются тщательные веса для каждой ссылочной изображения, чтобы сбалансировать контролем текста и силой стиля. Кроме того, для данного входного ссылочного изображения и его соответствующего текстового описания в методах, основанных на инверсии, используются методы инверсии, такие как DDIM, над изображением, чтобы получить инвертированную траекторию диффузии, процесс, который приближает уравнение инверсии для преобразования изображения в латентное шумовое представление. Основываясь на этом, и начиная с инвертированной траектории диффузии вместе с новым набором подсказок, эти методы генерируют новый контекст, стиль которого согласован с входным. Однако, как показано на следующем рисунке, подход DDIM к инверсии для реальных изображений часто нестабилен, поскольку он основан на локальной линеаризации, что приводит к распространению ошибок и потере контекста и неправильной реконструкции изображения.

Переходя к методологии, вместо использования сложных стратегий для разделения контекста и стиля из изображений, рамка InstantStyle принимает самый простой подход для достижения аналогичной производительности. Сравнивая с неопределенными атрибутами стиля, контекст может быть представлен естественным текстом, что позволяет рамке InstantStyle использовать текстовый кодировщик из CLIP для извлечения характеристик контекста текста в качестве представлений контекста. Одновременно рамка InstantStyle реализует кодировщик изображения CLIP для извлечения функций ссылочной изображения. Используя характеристику глобальных функций CLIP и вычитая функции контекста текста из функций изображения, рамка InstantStyle способна разделить стиль и контекст явно. Хотя это простая стратегия, она помогает рамке InstantStyle быть довольно эффективной в минимизации утечки контекста.

Кроме того, каждый слой в глубокой сети отвечает за захват различных семантических данных, и ключевое наблюдение из предыдущих моделей заключается в том, что существуют два слоя внимания, которые отвечают за обработку стиля. Конкретно, это блоки.0.attentions.1 и down blocks.2.attentions.1 слои, ответственные за захват стиля, такого как цвет, материал, атмосфера, и слой пространственной структуры захватывает структуру и композицию соответственно. Рамка InstantStyle использует эти слои неявно для извлечения информации о стиле и предотвращает утечку контекста без потери силы стиля. Стратегия проста, но эффективна, поскольку модель определила блоки стиля, которые могут вводить функции изображения в эти блоки для достижения бесшовной передачи стиля. Кроме того, поскольку модель значительно уменьшает количество параметров адаптера, способность контроля текста рамки усиливается, и механизм также применим к другим моделям, основанным на внимании, для редактирования и других задач.

Instant-Style: Эксперименты и Результаты

Рамка InstantStyle реализована на основе рамки Stable Diffusion XL, и она использует обычно принятый предварительно обученный IR-адаптер в качестве своего примера для проверки своей методологии, и глушит все блоки, кроме блоков стиля, для функций изображения. Модель InstantStyle также обучает IR-адаптер на 4 миллионах крупномасштабных текстово-изображенных парных наборов данных с нуля, и вместо обучения всех блоков обновляет только блоки стиля.

Чтобы провести эксперименты по проверке ее возможностей обобщения и устойчивости, рамка InstantStyle проводит многочисленные эксперименты по передаче стиля с различными стилями на разных контекстах, и результаты можно наблюдать на следующих изображениях. Учитывая одну ссылочную изображение и различные подсказки, рамка InstantStyle обеспечивает высококачественную, последовательную передачу стиля.

Кроме того, поскольку модель вводит информацию о изображении только в блоки стиля, она способна смягчить проблему утечки контекста значительно, и поэтому не требует выполнения настройки весов.

Двигаясь дальше, рамка InstantStyle также принимает архитектуру ControlNet для достижения стилизации изображения с пространственным контролем, и результаты демонстрируются на следующем изображении.

Сравнивая с предыдущими методами, рамка InstantStyle демонстрирует лучшие визуальные эффекты.

Окончательные Мысли

В этой статье мы говорили об InstantStyle, общей рамке, которая использует две простые, но эффективные стратегии для достижения эффективного разделения контекста и стиля из ссылочных изображений. Рамка InstantStyle разработана с целью решения проблем, с которыми сталкиваются текущие модели диффузии на основе настройки для генерации и настройки изображений. Рамка InstantStyle реализует две важные стратегии: простой, но эффективный подход к разделению стиля и контекста из ссылочных изображений в пространстве функций, основанный на предположении, что функции в одном и том же пространстве функций могут быть либо добавлены, либо вычтены друг из друга. Вторая, предотвращение утечки стиля путем инъекции функций ссылочной изображения исключительно в блоки, специфичные для стиля, и намеренного избегания необходимости использования громоздких весов для настройки, часто характеризующих более параметро-тяжелые конструкции.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.