Модели и платформы ИИ

InstantID: Немедленное сохранение идентичности при генерации изображений за несколько секунд

mm
Добавьте Unite.AI в избранные источники в Google

Технология генерации изображений на основе искусственного интеллекта пережила значительный рост в последние годы, особенно после появления крупных моделей диффузии текста в изображение, таких как DALL-E, GLIDE, Stable Diffusion, Imagen и другие. Хотя модели генерации изображений на основе ИИ имеют уникальную архитектуру и методы обучения, они все имеют общую цель: настраиваемую и персонализированную генерацию изображений, направленную на создание изображений с последовательным идентификатором персонажа, предмета и стиля на основе эталонных изображений. Благодаря своим замечательным возможностям генерации, современные框架 генерации изображений на основе ИИ нашли применение в таких областях, как анимация изображений, виртуальная реальность, электронная коммерция, портреты на основе ИИ и многое другое. Однако, несмотря на их замечательные возможности генерации, эти框架 все имеют одну общую проблему: большинство из них не могут генерировать настраиваемые изображения, сохраняя при этом тонкие детали идентичности человеческих объектов.

Генерация настраиваемых изображений, сохраняя при этом тонкие детали, имеет решающее значение, особенно в задачах идентификации человеческого лица, требующих высокого уровня точности и детализации, а также нюансов семантики по сравнению с общими задачами генерации изображений объектов, которые в первую очередь фокусируются на грубых текстурах и цветах. Кроме того, персонализированные框架 синтеза изображений в последние годы, такие как LoRA, DreamBooth, Textual Inversion и другие, значительно продвинулись вперед. Однако персонализированные модели генерации изображений на основе ИИ все еще не идеальны для развертывания в реальных сценариях, поскольку они требуют большого объема хранилища, требуют нескольких эталонных изображений и часто имеют длительный процесс тонкой настройки. С другой стороны, хотя существующие методы, основанные на встроенных идентификаторах, требуют только одного прямого эталонного изображения, они либо несовместимы с общедоступными предварительно обученными моделями, либо требуют чрезмерного процесса тонкой настройки по множеству параметров, либо не могут сохранять высокую точность лица.

Для решения этих проблем и дальнейшего улучшения возможностей генерации изображений в этой статье мы будем говорить об InstantID, решении на основе модели диффузии для генерации изображений. InstantID – это модуль “подключи и воспользуйся”, который легко справляется с генерацией и персонализацией изображений в различных стилях с помощью только одного эталонного изображения и обеспечивает высокую точность. Основная цель этой статьи – дать нашим читателям полное понимание технических основ и компонентов框架а InstantID, поскольку мы рассмотрим подробную структуру модели, процесс обучения и сценарии применения. Итак, начнем.

InstantID: Немедленное сохранение идентичности при генерации изображений


Появление моделей диффузии текста в изображение внесло значительный вклад в развитие технологии генерации изображений. Основная цель этих моделей – настраиваемая и персонализированная генерация, а также создание изображений с последовательным предметом, стилем и идентификатором персонажа с помощью одного или нескольких эталонных изображений. Способность этих框架 создавать последовательные изображения открыла потенциальные применения в различных отраслях, включая анимацию изображений, генерацию портретов на основе ИИ, электронную коммерцию, виртуальную и дополненную реальность и многое другое.

Однако, несмотря на их замечательные возможности, эти框架 сталкиваются с фундаментальной проблемой: они часто испытывают трудности в генерации настраиваемых изображений, сохраняя при этом тонкие детали человеческих объектов точно. Стоит отметить, что генерация настраиваемых изображений с внутренними деталями – это сложная задача, поскольку идентификация человеческого лица требует более высокого уровня точности и детализации, а также более продвинутой семантики по сравнению с общими объектами или стилями, которые в первую очередь фокусируются на цветах или грубых текстурах. Существующие модели генерации изображений на основе текста полагаются на подробные текстовые описания и испытывают трудности в достижении сильной семантической релевантности для настраиваемой генерации изображений. Кроме того, некоторые крупные предварительно обученные модели генерации изображений на основе текста добавляют пространственные контроли, чтобы повысить управляемость, облегчая тонкий структурный контроль с помощью элементов, таких как позы тела, карты глубины, пользовательские эскизы, карты семантической сегментации и многое другое. Однако, несмотря на эти дополнения и улучшения, эти框架 могут достичь только частичной точности сгенерированного изображения по отношению к эталонному изображению.

Для преодоления этих препятствий框架 InstantID фокусируется на немедленном сохранении идентичности при синтезе изображений и пытается сократить разрыв между эффективностью и высокой точностью, введя простой модуль “подключи и воспользуйся”, который позволяет框架у справляться с персонализацией изображений, используя только одно изображение лица, сохраняя при этом высокую точность. Кроме того, для сохранения идентичности лица из эталонного изображения,框架 InstantID реализует новый кодировщик лица, который сохраняет тонкие детали изображения, добавляя слабые пространственные и сильные семантические условия, которые направляют процесс генерации изображений, включая текстовые подсказки, изображение ориентира и изображение лица.

Существуют три отличительных особенности, которые отличают框架 InstantID от существующих моделей генерации изображений на основе текста.

  • Совместимость и подключаемость: Вместо обучения на полных параметрах框架а UNet,框架 InstantID фокусируется на обучении легкого адаптера. В результате框架 InstantID совместим и подключаем с существующими предварительно обученными моделями.
  • Без тонкой настройки: Методология框架 InstantID исключает необходимость в тонкой настройке, поскольку для вывода требуется только один прямой проход, что делает модель высоко практичной и экономичной для тонкой настройки.
  • Высокая производительность: Фреймворк InstantID демонстрирует высокую гибкость и точность, поскольку он способен обеспечить производительность на уровне состояния искусства, используя только одно эталонное изображение, сопоставимую с методами, основанными на обучении, которые полагаются на несколько эталонных изображений.

В целом, вклад框架а InstantID можно категоризировать следующим образом.

  1. Фреймворк InstantID – это инновационный метод сохранения идентичности для предварительно обученных моделей диффузии текста в изображение, направленный на сокращение разрыва между эффективностью и точностью.
  2. Фреймворк InstantID совместим и подключаем с настраиваемыми моделями, используя один и тот же диффузионный модель в своей архитектуре, что позволяет сохранять идентичность в предварительно обученных моделях без дополнительных затрат.

InstantID: Методология и архитектура

Как упоминалось ранее, фреймворк InstantID – это эффективный легкий адаптер, который легко наделяет предварительно обученные модели диффузии текста в изображение возможностями сохранения идентичности.

Говоря об архитектуре, фреймворк InstantID построен на основе модели Stable Diffusion, известной своей способностью выполнять процесс диффузии с высокой вычислительной эффективностью в пространстве с низкой размерностью вместо пространства пикселей с помощью автоэнкодера. Для входного изображения автоэнкодер сначала отображает изображение в латентное представление с коэффициентом снижения и латентными размерами. Кроме того, для удаления шума, распределенного по нормальному закону, с шумным латентным, условием и текущим временным шагом, процесс диффузии принимает компонент денойзинга UNet. Условие – это вложение текстовых подсказок, сгенерированных с помощью предварительно обученного компонента кодирования текста CLIP.

Кроме того, фреймворк InstantID также использует компонент ControlNet, который способен добавлять пространственный контроль к предварительно обученной модели диффузии в качестве условия, что выходит за рамки традиционных возможностей текстовых подсказок. Компонент ControlNet также интегрирует архитектуру UNet из фреймворка Stable Diffusion, используя обученную реплику компонента UNet. Реплика компонента UNet имеет ноль сверточных слоев в средних блоках и блоках автоэнкодера. Несмотря на их сходства, компонент ControlNet отличается от модели Stable Diffusion; они различаются в последнем резидуальном элементе. Компонент ControlNet кодирует пространственную информацию условий, такую как позы, карты глубины, эскизы и многое другое, добавляя резидуалы к блоку UNet, а затем встраивает эти резидуалы в исходную сеть.

Фреймворк InstantID также черпает вдохновение из IP-Adapter или Image Prompt Adapter, который вводит новый подход к достижению возможностей подсказки изображением, работающим параллельно с текстовыми подсказками без необходимости модифицировать исходные модели текста в изображение. Компонент IP-Adapter также использует уникальную стратегию декуплированного перекрестного внимания, которая использует дополнительные слои перекрестного внимания для встраивания функций изображения, оставляя при этом другие параметры без изменений.

Методология

Чтобы дать вам краткий обзор, фреймворк InstantID направлен на генерацию настраиваемых изображений с разными стилями или позами, используя только одно эталонное изображение идентификатора с высокой точностью. Следующая фигура кратко представляет обзор фреймворка InstantID.

Как можно наблюдать, фреймворк InstantID имеет три основных компонента:

  1. Компонент встраивания идентификатора, который захватывает прочную семантическую информацию о чертах лица на изображении.
  2. Легкий адаптированный модуль с декуплированным компонентом перекрестного внимания, чтобы облегчить использование изображения в качестве визуальной подсказки.
  3. Компонент IdentityNet, который кодирует детальные функции из эталонного изображения, используя дополнительный пространственный контроль.

Встраивание идентификатора

В отличие от существующих методов, таких как FaceStudio, PhotoMaker, IP-Adapter и других, которые полагаются на предварительно обученный кодировщик изображения CLIP для извлечения визуальных подсказок, фреймворк InstantID фокусируется на улучшенной точности и более сильных семантических деталях в задаче сохранения идентичности. Стоит отметить, что внутренние ограничения компонента CLIP лежат в первую очередь в его процессе обучения на слабо выровненных данных, что означает, что закодированные функции кодировщика CLIP в основном захватывают широкую и неоднозначную семантическую информацию, такую как цвета, стиль и композиция. Хотя эти функции могут действовать как общий дополнение к текстовым вложениям, они не подходят для точных задач сохранения идентичности, которые подчеркивают сильную семантику и высокую точность. Кроме того, недавние исследования в области моделей представления лица, особенно в области распознавания лиц, продемонстрировали эффективность представления лица в сложных задачах, включая реконструкцию и распознавание лиц. Основываясь на этом, фреймворк InstantID направлен на использование предварительно обученной модели лица для обнаружения и извлечения вложений идентификатора лица из эталонного изображения, направляя модель для генерации изображений.

Адаптер изображения

Способность предварительно обученных моделей диффузии текста в изображение в задачах подсказки изображением значительно улучшает текстовые подсказки, особенно в сценариях, которые не могут быть описаны адекватно текстовыми подсказками. Фреймворк InstantID принимает стратегию, подобную той, которая используется в модели IP-Adapter для подсказки изображением, которая вводит легкий адаптивный модуль, объединенный с декуплированным компонентом перекрестного внимания, чтобы поддержать изображения в качестве входных подсказок. Однако, в отличие от грубо выровненных вложений CLIP, фреймворк InstantID отклоняется, используя вложения идентификатора в качестве подсказок изображения, чтобы достичь семантически богатой и более нюансированной интеграции подсказок.

IdentityNet

Хотя существующие методы способны интегрировать подсказки изображения с текстовыми подсказками, фреймворк InstantID утверждает, что эти методы только улучшают грубые функции с уровнем интеграции, который недостаточен для сохранения идентичности при генерации изображений. Кроме того, добавление изображения и текстовых токенов в слоях перекрестного внимания напрямую склоняется к ослаблению контроля текстовых токенов, и попытка усилить силу токенов изображения может привести к ухудшению способностей текстовых токенов при редактировании. Чтобы противостоять этим проблемам, фреймворк InstantID выбирает ControlNet, альтернативный метод вложения функций, который использует пространственную информацию в качестве входных данных для контролируемого модуля, что позволяет ему поддерживать согласованность с настройками UNet в моделях диффузии.

Фреймворк InstantID делает два изменения в традиционной архитектуре ControlNet: для условных входных данных фреймворк InstantID выбирает 5 ключевых точек лица вместо точных ключевых точек OpenPose. Во-вторых, фреймворк InstantID использует вложения идентификатора вместо текстовых подсказок в качестве условий для слоев перекрестного внимания в архитектуре ControlNet.

Обучение и вывод

На этапе обучения фреймворк InstantID оптимизирует параметры компонентов IdentityNet и Image Adapter, замораживая при этом параметры предварительно обученной модели диффузии. Всего фреймворк InstantID обучается на парах изображений и текста, в которых представлены человеческие объекты, и использует цель обучения, подобную той, которая используется в фреймворке стабильной диффузии, с условиями изображения, специфичными для задачи. Основное внимание метода обучения InstantID заключается в разделении между слоями перекрестного внимания изображения и текста внутри адаптера подсказки изображения, что позволяет фреймворку InstantID регулировать веса этих условий изображения гибко и независимо, обеспечивая более целевой и контролируемый процесс обучения и вывода.

InstantID: Эксперименты и результаты

Фреймворк InstantID реализует модель Stable Diffusion и обучает ее на LAION-Face, крупномасштабной открытой базе данных, состоящей из более чем 50 миллионов пар изображений и текста. Кроме того, фреймворк InstantID собирает более 10 миллионов изображений человека, автоматически сгенерированных с помощью модели BLIP2, чтобы еще больше улучшить качество генерации изображений. Фреймворк InstantID фокусируется в первую очередь на изображениях с одним человеком и использует предварительно обученную модель лица для обнаружения и извлечения вложений идентификатора лица из изображений человека, и вместо обучения обрезанных наборов данных лиц, обучает оригинальные изображения человека. Кроме того, во время обучения фреймворк InstantID замораживает предварительно обученную модель текста в изображение и обновляет только параметры компонентов IdentityNet и Image Adapter.

Генерация только изображения

Модель InstantID использует пустую подсказку для направления процесса генерации изображения, используя только эталонное изображение, и результаты без подсказок демонстрируются на следующем изображении.

Генерация с «пустой подсказкой», как показано на изображении выше, демонстрирует способность фреймворка InstantID сохранять богатые семантические функции лица, такие как идентичность, возраст и выражение, устойчиво. Однако стоит отметить, что использование пустых подсказок может не быть в состоянии точно воспроизвести результаты на других семантиках, таких как пол. Кроме того, в изображении выше столбцы 2-4 используют изображение и подсказку, и как можно видеть, сгенерированное изображение не демонстрирует ухудшения в способностях текстового контроля и также обеспечивает согласованность идентичности. Наконец, столбцы 5-9 используют изображение, подсказку и пространственный контроль, демонстрируя совместимость модели с предварительно обученными моделями пространственного контроля, что позволяет фреймворку InstantID гибко вводить пространственные контроли, используя предварительно обученный компонент ControlNet.

Стоит отметить, что количество эталонных изображений имеет значительное влияние на сгенерированное изображение, как показано на изображении выше. Хотя фреймворк InstantID способен обеспечить хорошие результаты, используя только одно эталонное изображение, несколько эталонных изображений производят изображение более высокого качества, поскольку фреймворк InstantID принимает среднее значение вложений идентификатора в качестве подсказки изображения. Далее, важно сравнить фреймворк InstantID с предыдущими методами, которые генерируют персонализированные изображения, используя одно эталонное изображение. Следующая фигура сравнивает результаты, сгенерированные фреймворком InstantID, и существующие модели на уровне состояния искусства для генерации настраиваемых изображений с помощью одного эталонного изображения.

Как можно видеть, фреймворк InstantID способен сохранять черты лица благодаря тому, что вложения идентификатора несут богатую семантическую информацию, такую как идентичность, возраст и пол. Можно сказать, что фреймворк InstantID превосходит существующие фреймворки в генерации настраиваемых изображений, поскольку он способен сохранять человеческую идентичность, сохраняя при этом контроль и гибкость стиля.

Окончательные мысли

В этой статье мы говорили о фреймворке InstantID, решении на основе модели диффузии для генерации изображений. InstantID – это модуль «подключи и воспользуйся», который легко справляется с генерацией и персонализацией изображений в различных стилях с помощью только одного эталонного изображения и обеспечивает высокую точность. Фреймворк InstantID фокусируется на немедленном сохранении идентичности при синтезе изображений и пытается сократить разрыв между эффективностью и высокой точностью, введя простой модуль «подключи и воспользуйся», который позволяет фреймворку справляться с персонализацией изображений, используя только одно изображение лица, сохраняя при этом высокую точность.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.