Модели и платформы ИИ
Концептуальные ползунки: Точные контроли в диффузионных моделях с адаптерами LoRA
Благодаря своим возможностям, текст-изображение диффузионные модели стали чрезвычайно популярными в художественном сообществе. Однако, текущие модели, включая передовые фреймворки, часто испытывают трудности в поддержании контроля над визуальными концепциями и атрибутами в сгенерированных изображениях, что приводит к неудовлетворительным результатам. Большинство моделей полагаются исключительно на текстовые подсказки, что создает проблемы в модуляции непрерывных атрибутов, таких как интенсивность погоды, резкость теней, выражения лица или возраст человека точно. Это делает трудным для конечных пользователей регулировать изображения в соответствии с их конкретными потребностями. Кроме того, хотя эти генеративные фреймворки производят высококачественные и реалистичные изображения, они склонны к искажениям, таким как искаженные лица или отсутствующие пальцы.
Чтобы преодолеть эти ограничения, разработчики предложили использование интерпретируемых Концептуальных ползунков. Эти ползунки обещают большую гибкость для конечных пользователей в управлении визуальными атрибутами, улучшая генерацию и редактирование изображений в диффузионных моделях. Концептуальные ползунки в диффузионных моделях работают путем определения направления параметра, соответствующего отдельной концепции, минимизируя при этом помехи с другими атрибутами. Фреймворк создает эти ползунки с помощью образцов изображений или набора подсказок, устанавливая направления для текстовых и визуальных концепций.

В конечном итоге, использование Концептуальных ползунков в текст-изображение диффузионных моделях может привести к генерации изображений с минимальным уровнем помех и повышенным контролем над конечным результатом, а также увеличивая воспринимаемую реалистичность без изменения содержания изображений, и, таким образом, генерируя реалистичные изображения. В этой статье мы будем обсуждать концепцию использования Концептуальных ползунков в текст-изображение фреймворках более подробно и анализировать, как их использование может привести к получению изображений более высокого качества, сгенерированных с помощью ИИ.
Введение в Концептуальные ползунки
Как упоминалось ранее, текущие текст-изображение диффузионные фреймворки часто испытывают трудности в контроле визуальных концепций и атрибутов в сгенерированных изображениях, что приводит к неудовлетворительным результатам. Кроме того, многие из этих моделей испытывают трудности в модуляции непрерывных атрибутов, что еще больше способствует неудовлетворительным результатам. Концептуальные ползунки могут помочь смягчить эти проблемы, наделяя создателей контента и конечных пользователей повышенным контролем над процессом генерации изображений и решая проблемы, с которыми сталкиваются текущие фреймворки.
Большинство текущих текст-изображение диффузионных моделей полагаются на прямое изменение текстовых подсказок для контроля атрибутов изображений. Хотя этот подход позволяет генерировать изображения, он не является оптимальным, поскольку изменение подсказки может радикально изменить структуру изображения. Другой подход, используемый этими фреймворками, включает пост-обработочные методы, которые инвертируют процесс диффузии и изменяют перекрестные внимания для редактирования визуальных концепций. Однако пост-обработочные методы имеют ограничения, поддерживая только ограниченное количество одновременных редактирований и требуя индивидуальных проходов для каждого нового концепта. Кроме того, они могут ввести концептуальную запутанность, если не будут сконструированы осторожно.
Напротив, Концептуальные ползунки предлагают более эффективное решение для генерации изображений. Эти легкие, простые в использовании адаптеры могут быть применены к предварительно обученным моделям, повышая контроль и точность над желаемыми концепциями в одном проходе с минимальной запутанностью. Концептуальные ползунки также позволяют редактировать визуальные концепции, не охватываемые текстовыми описаниями, отличаясь от методов редактирования на основе текстовых подсказок. Хотя методы настройки на основе изображений могут эффективно добавлять токены для концепций на основе изображений, они трудно реализуемы для редактирования изображений. Концептуальные ползунки, с другой стороны, позволяют конечным пользователям предоставлять небольшое количество парных изображений, определяющих желаемую концепцию. Ползунки затем обобщают эту концепцию и автоматически применяют ее к другим изображениям, стремясь повысить реализм и исправить искажения, такие как в руках.
Концептуальные ползунки стремятся учиться и решать проблемы, общие для четырех генеративных концепций ИИ и диффузионных фреймворков: Редактирование изображений, Методы на основе руководства, Редактирование модели и Семантические направления.
Редактирование изображений
Текущие ИИ-фреймворки либо фокусируются на использовании условного входа для управления структурой изображения, либо манипулируют перекрестными вниманиями исходного изображения с его целевой подсказкой для включения единичного редактирования изображения в текст-изображение диффузионных фреймворках. В результате, эти подходы могут быть реализованы только на отдельных изображениях и они также требуют оптимизации базиса для каждого изображения в результате эволюции геометрической структуры во времени между подсказками.
Методы на основе руководства
Использование методов на основе руководства, основанных на классификаторе, показало их способность повысить качество сгенерированных изображений и улучшить текст-изображение выравнивание. Включая термины руководства во время интерференции, метод улучшает ограниченную составляемость, унаследованную диффузионными фреймворками, и они могут быть использованы для руководства через небезопасные концепции в диффузионных фреймворках.
Редактирование модели
Использование Концептуальных ползунков также может быть рассмотрено как метод редактирования модели, который использует адаптер низкого ранга для вывода единого семантического атрибута, который позволяет непрерывно контролировать атрибут, соответствующий ему. Методы настройки на основе тонкой настройки затем используются для персонализации фреймворка и добавления новых концепций. Кроме того, метод Custom Diffusion предлагает способ тонкой настройки слоев перекрестного внимания для включения новых визуальных концепций в предварительно обученные диффузионные модели. Напротив, метод Textual Diffusion предлагает оптимизировать вектор вложения для активации возможностей модели и введения текстовых концепций в фреймворк.
Семантическое направление в GAN
Манипулирование семантическими атрибутами является одним из ключевых атрибутов Генеративных противостоящих сетей, и траектории пространства признаков были найдены выровнены в самосупервизируемом режиме. В диффузионных фреймворках эти траектории пространства признаков существуют в средних слоях архитектуры U-Net, и основное направление пространства признаков в диффузионных фреймворках захватывает глобальную семантику. Концептуальные ползунки обучают подпространства низкого ранга, соответствующие специальным атрибутам напрямую, и получают точные и локализованные направления редактирования, используя текст или пары изображений для оптимизации глобальных направлений.
Концептуальные ползунки: Архитектура и работа
Диффузионные модели и адаптеры LoRA или низкого ранга
Диффузионные модели по сути являются подклассом генеративных ИИ-фреймворков, которые работают на принципе синтеза данных путем обращения диффузионного процесса. Прямой диффузионный процесс изначально добавляет шум к данным, таким образом, переход от организованного состояния к полному гауссовскому шуму. Основная цель диффузионных моделей заключается в обратном диффузионном процессе путем постепенного удаления шума и выборки случайного гауссовского шума для генерации изображения. В реальных приложениях основной целью диффузионных фреймворков является предсказание истинного шума, когда полный гауссовский шум подается в качестве входных данных с дополнительными входными данными, такими как условие и временной шаг.
Техника LoRA или низкого ранга разлагает обновления весов во время тонкой настройки для обеспечения эффективной адаптации крупных предварительно обученных фреймворков для задач вниз по потоку. Техника LoRA разлагает обновления весов для предварительно обученного слоя модели относительно как входных, так и выходных размерностей и ограничивает обновление до подпространства низкого ранга.
Концептуальные ползунки
Основная цель Концептуальных ползунков заключается в служении подходом для тонкой настройки адаптеров LoRA в диффузионном фреймворке для обеспечения большей степени контроля над концепциями, ориентированными на изображения, и это демонстрируется на следующем изображении.

Когда условие нацелено на целевые концепции, Концептуальные ползунки обучают направления параметров низкого ранга для увеличения или уменьшения выражения конкретных атрибутов. Для модели и ее целевой концепции основная цель Концептуальных ползунков заключается в получении улучшенной модели, которая изменяет вероятность усиления и подавления атрибутов для изображения при условии целевой концепции для увеличения вероятности усиления атрибутов и уменьшения вероятности подавления атрибутов. Используя репараметризацию и формулу Твиди, фреймворк вводит процесс шума, зависящий от времени, и выражает каждый балл как прогноз денойзинга. Кроме того, цель дезентанглирования тонко настраивает модули в Концептуальных ползунках, сохраняя при этом предварительно обученные веса постоянными, и коэффициент масштабирования, введенный во время формулировки LoRA, изменяется во время интерференции. Коэффициент масштабирования также позволяет регулировать силу редактирования и делает редактирование сильнее без необходимости повторной обучения фреймворка, как показано на следующем изображении.

Методы редактирования, используемые ранее фреймворками, обеспечивали более сильные редактирования путем повторной обучения фреймворка с увеличенным руководством. Однако масштабирование коэффициента масштабирования во время интерференции дает те же результаты редактирования без увеличения стоимости повторной обучения и времени.
Обучение визуальным концепциям
Концептуальные ползунки предназначены для управления визуальными концепциями, которые текстовые подсказки не могут определить хорошо, и эти ползунки используют небольшие наборы данных, которые либо парные до, либо после обучения на этих концепциях. Контраст между парами изображений позволяет ползункам обучаться визуальным концепциям. Кроме того, процесс обучения Концептуальных ползунков оптимизирует компонент LoRA, реализованный как в прямом, так и в обратном направлении. В результате компонент LoRA соответствует направлению, которое вызывает визуальные эффекты в обоих направлениях.
Концептуальные ползунки: Результаты реализации
Для анализа прироста производительности разработчики оценили использование Концептуальных ползунков в основном на Stable Diffusion XL, высокоразрешающем фреймворке 1024 пикселей с дополнительными экспериментами, проведенными на фреймворке Stable Diffusion v1.4, с моделями, обученными в течение 500 эпох.
Текстовые Концептуальные ползунки
Для оценки производительности текстовых Концептуальных ползунков они проверяются на наборе из 30 текстовых концепций, и метод сравнивается с двумя базовыми методами, которые используют стандартную текстовую подсказку для фиксированного количества временных шагов, а затем начинают композицию, добавляя подсказки для управления изображением. Как можно увидеть на следующем рисунке, использование Концептуальных ползунков приводит к постоянно более высокому баллу CLIP и постоянному уменьшению балла LPIPS по сравнению с исходным фреймворком без Концептуальных ползунков.


Как можно увидеть на приведенном выше изображении, использование Концептуальных ползунков позволяет точно редактировать атрибуты, желаемые во время процесса генерации изображений, сохраняя при этом общую структуру изображения.
Визуальные Концептуальные ползунки
Текст-изображение диффузионные модели, которые используют только текстовые подсказки, часто испытывают трудности в поддержании более высокого уровня контроля над визуальными атрибутами, такими как волосы на лице или форма глаз. Для обеспечения лучшего контроля над мелкими атрибутами Концептуальные ползунки используют необязательное текстовое руководство, парное с наборами изображений. Как можно увидеть на следующем рисунке, Концептуальные ползунки создают отдельные ползунки для «размера глаз» и «формы бровей», которые захватывают желаемые преобразования, используя пары изображений.

Результаты можно еще больше уточнить, предоставив конкретные тексты, чтобы направление фокусировалось на этой области лица, и создавая ползунки со ступенчатым контролем над целевым атрибутом.
Составление ползунков
Одним из основных преимуществ использования Концептуальных ползунков является их составляемость, которая позволяет пользователям объединять несколько ползунков для повышения контроля, а не сосредотачиваться на одной концепции за раз, что можно отнести к направлениям ползунков низкого ранга, используемых в Концептуальных ползунках. Кроме того, поскольку Концептуальные ползунки являются легкими адаптерами LoRA, они легко обмениваются и могут быть легко наложены на диффузионные модели. Пользователи также могут регулировать несколько ручек одновременно для управления сложными генерациями, загружая интересные наборы ползунков.

Следующее изображение демонстрирует возможности составления концептуальных ползунков, и несколько ползунков составляются прогрессивно в каждом ряду слева направо, позволяя проходить через пространства высоких концепций с повышенным контролем над концепциями.

Повышение качества изображений
Хотя передовые текст-изображение диффузионные фреймворки и крупномасштабные генеративные модели, такие как модель Stable Diffusion XL, способны генерировать реалистичные и высококачественные изображения, они часто страдают от искажений изображений, таких как размытые или искаженные объекты, даже если параметры этих передовых фреймворков оснащены潜ной возможностью генерировать высококачественные изображения с меньшим количеством генераций. Использование Концептуальных ползунков может привести к генерации изображений с меньшим количеством искажений, разблокируя истинные возможности этих моделей путем определения направлений параметров низкого ранга.
Исправление рук
Генерация изображений с реалистично выглядящими руками всегда была препятствием для диффузионных фреймворков, и использование Концептуальных ползунков имеет прямой контроль над тенденцией к искажению рук. Следующее изображение демонстрирует эффект использования ползунка «исправить руки», который позволяет фреймворку генерировать изображения с более реалистично выглядящими руками.

Ползунки ремонта
Использование Концептуальных ползунков может не только привести к генерации более реалистично выглядящих рук, но также показало свой потенциал в повышении общей реалистичности изображений, сгенерированных фреймворком. Концептуальные ползунки также определяют единственное направление параметра низкого ранга, которое позволяет сдвигать изображения от общих проблем искажения, и результаты демонстрируются на следующем изображении.

Окончательные мысли
В этой статье мы говорили о Концептуальных ползунках, простом, но масштабируемом новом парадигме, который обеспечивает интерпретируемый контроль над сгенерированным выводом в диффузионных моделях. Использование Концептуальных ползунков направлено на решение проблем, с которыми сталкиваются текущие текст-изображение диффузионные фреймворки, которые испытывают трудности в поддержании необходимого контроля над визуальными концепциями и атрибутами, включенными в сгенерированное изображение, что часто приводит к неудовлетворительным результатам. Кроме того, большинство текст-изображение диффузионных моделей испытывают трудности в модуляции непрерывных атрибутов в изображении, что часто приводит к неудовлетворительным результатам. Использование Концептуальных ползунков может позволить текст-изображение диффузионным фреймворкам смягчить эти проблемы и наделить создателей контента и конечных пользователей повышенным контролем над процессом генерации изображений и решить проблемы, с которыми сталкиваются текущие фреймворки.












