Модели и платформы ИИ
EasyPhoto: Ваш личный генератор фотографий на основе ИИ

Стабильная диффузия Веб-интерфейс, или SD-WebUI, – это комплексный проект для моделей стабильной диффузии, который использует библиотеку Gradio для предоставления интерфейса браузера. Сегодня мы поговорим об EasyPhoto, инновационном плагине WebUI, который позволяет конечным пользователям генерировать портреты и изображения на основе ИИ. Плагин WebUI EasyPhoto создает портреты на основе ИИ, используя различные шаблоны, поддерживающие разные стили фотографий и множество модификаций. Кроме того, для дальнейшего расширения возможностей EasyPhoto пользователи могут генерировать изображения, используя модель SDXL для получения более удовлетворительных, точных и разнообразных результатов. Давайте начнем.
Введение в EasyPhoto и стабильную диффузию
Фреймворк стабильной диффузии – это популярный и прочный фреймворк генерации на основе диффузии, используемый разработчиками для генерации реалистичных изображений на основе входных текстовых описаний. Благодаря своим возможностям, фреймворк стабильной диффузии имеет широкий спектр применения, включая расширение изображений, восстановление изображений и перевод изображений в изображения. Веб-интерфейс стабильной диффузии, или SD-WebUI, выделяется как одно из самых популярных и известных применений этого фреймворка. Он имеет интерфейс браузера, построенный на библиотеке Gradio, предоставляющий интерактивный и удобный интерфейс для моделей стабильной диффузии. Для дальнейшего улучшения контроля и удобства использования в генерации изображений SD-WebUI интегрирует множество приложений стабильной диффузии.
Благодаря удобству, предлагаемому фреймворком SD-WebUI, разработчики фреймворка EasyPhoto решили создать его в качестве веб-плагина, а не полноценного приложения. В отличие от существующих методов, которые часто страдают от потери идентичности или введения нереалистичных особенностей в изображения, фреймворк EasyPhoto использует возможности изображения в изображение моделей стабильной диффузии для производства точных и реалистичных изображений. Пользователи могут легко установить фреймворк EasyPhoto в качестве расширения в WebUI, улучшая удобство использования и доступность для более широкого круга пользователей. Фреймворк EasyPhoto позволяет пользователям генерировать идентификатор-ориентированные, высококачественные и реалистичные портреты на основе ИИ, которые тесно напоминают входную идентичность.
Сначала фреймворк EasyPhoto просит пользователей создать свой цифровой двойник, загрузив несколько изображений для обучения модели LoRA или модели низкоранговой адаптации в Интернете. Фреймворк LoRA быстро дообучает модели диффузии, используя технологию низкоранговой адаптации. Этот процесс позволяет базовой модели понять информацию об идентичности конкретных пользователей. Обученные модели затем объединяются и интегрируются в базовую модель стабильной диффузии для интерференции. Кроме того, во время процесса интерференции модель использует стабильные модели диффузии в попытке перерисовать области лица в шаблоне интерференции, и сходство между входным и выходным изображениями проверяется с помощью различных единиц ControlNet.
Фреймворк EasyPhoto также развертывает двухэтапный процесс диффузии для решения потенциальных проблем, таких как артефакты границ и потеря идентичности, обеспечивая тем самым, что генерируемые изображения минимизируют визуальные несоответствия, сохраняя при этом идентичность пользователя. Кроме того, трубопровод интерференции в фреймворке EasyPhoto не ограничивается только генерацией портретов, но также может быть использован для генерации всего, что связано с идентичностью пользователя. Это означает, что после обучения модели LoRA для конкретной идентичности можно сгенерировать широкий спектр изображений на основе ИИ, и поэтому он может иметь широкое применение, включая виртуальные примерки.
Вкратце, фреймворк EasyPhoto
- Предлагает новый подход к обучению модели LoRA, включающий несколько моделей LoRA для сохранения верности лица генерируемых изображений.
- Использует различные методы обучения с подкреплением для оптимизации моделей LoRA для наград за идентичность лица, что еще больше помогает улучшить сходство идентичностей между обучающими изображениями и результатами, сгенерированными.
- Предлагает двухэтапный процесс диффузии на основе inpaint, целью которого является генерация фотографий на основе ИИ с высокой эстетикой и сходством.
EasyPhoto: Архитектура и обучение
Следующая фигура демонстрирует процесс обучения фреймворка EasyPhoto.

Как можно увидеть, фреймворк сначала просит пользователей ввести обучающие изображения, а затем выполняет обнаружение лица для обнаружения местоположения лица. Как только фреймворк обнаруживает лицо, он обрезает входное изображение с помощью предварительно определенного соотношения, которое фокусируется исключительно на области лица. Фреймворк затем развертывает модель омоложения кожи и модель обнаружения слайни, чтобы получить чистое и четкое обучающее изображение лица. Эти две модели играют решающую роль в улучшении визуального качества лица и также обеспечивают удаление фоновых данных, и обучающее изображение в основном содержит лицо. Наконец, фреймворк использует эти обработанные изображения и входные подсказки для обучения модели LoRA, и таким образом наделяет ее способностью понимать характерные черты лица пользователя более эффективно и точно.
Кроме того, во время фазы обучения фреймворк включает критически важный шаг проверки, на котором фреймворк вычисляет разрыв идентичности лица между входным изображением пользователя и изображением проверки, сгенерированным обученной моделью LoRA. Шаг проверки является фундаментальным процессом, который играет ключевую роль в достижении слияния моделей LoRA, в конечном итоге обеспечивая, что обученная модель LoRA превращается в двойника, или точное цифровое представление пользователя. Кроме того, изображение проверки, которое имеет оптимальный балл идентичности лица, будет выбрано в качестве изображения идентичности лица, и это изображение идентичности лица затем будет использовано для улучшения сходства идентичности генерации интерференции.
Двигаясь дальше, на основе ансамблевого процесса фреймворк обучает модели LoRA с оценкой вероятности в качестве основной цели, тогда как сохранение сходства идентичности лица является целей вниз по потоку. Для решения этой проблемы фреймворк EasyPhoto использует методы обучения с подкреплением для прямой оптимизации цели вниз по потоку.В результате черты лица, которые модели LoRA учатся, демонстрируют улучшение, что приводит к улучшению сходства между результатами, сгенерированными шаблоном, и также демонстрирует обобщение через шаблоны.
Процесс интерференции
Следующая фигура демонстрирует процесс интерференции для отдельного идентификатора пользователя в фреймворке EasyPhoto и разделена на три части
- Предварительная обработка лица для получения справочного изображения ControlNet и предварительно обработанного входного изображения.
- Первая диффузия, которая помогает генерировать грубые результаты, похожие на входные данные пользователя.
- Вторая диффузия, которая исправляет артефакты границ, делая изображения более точными и реалистичными.

Для входных данных фреймворк принимает изображение идентичности лица (сгенерированное во время обучения проверки с помощью оптимального балла идентичности лица), и шаблон интерференции. Выходные данные – это высокодетализированный, точный и реалистичный портрет пользователя, который тесно напоминает идентичность и уникальный вид пользователя на основе шаблона интерференции. Давайте рассмотрим эти процессы подробнее.
Предварительная обработка лица
Способ генерации портрета на основе ИИ на основе шаблона интерференции без сознательного рассуждения – это использование модели SD для inpaint области лица в шаблоне интерференции. Кроме того, добавление фреймворка ControlNet к процессу не только улучшает сохранение идентичности пользователя, но также улучшает сходство между сгенерированными изображениями.
- Несоответствие между входным и сгенерированным изображением: Очевидно, что ключевые точки в шаблоне изображения несовместимы с ключевыми точками в изображении идентичности лица, поэтому использование ControlNet с изображением идентичности лица в качестве справочного изображения может привести к некоторым несоответствиям в выходных данных.
- Дефекты в области inpaint: Маскирование области и последующее inpaint с новым лицом может привести к заметным дефектам, особенно вдоль границы inpaint, что не только повлияет на аутентичность сгенерированного изображения, но также негативно повлияет на реализм изображения.
- Потеря идентичности Control Net: Поскольку процесс обучения не использует фреймворк ControlNet, использование ControlNet во время фазы интерференции может повлиять на способность обученных моделей LoRA сохранить идентичность пользователя.
Для решения вышеуказанных проблем фреймворк EasyPhoto предлагает три процедуры.
- Выравнивание и вставка: Используя алгоритм вставки лица, фреймворк EasyPhoto стремится решить проблему несоответствия между ориентировочными точками лица между идентичностью лица и шаблоном. Сначала модель рассчитывает ориентировочные точки лица идентичности лица и шаблона изображения, после чего модель определяет матрицу аффинного преобразования, которая будет использоваться для выравнивания ориентировочных точек шаблона изображения с идентичностью лица. Результатом является изображение, которое сохраняет те же ориентировочные точки, что и идентичность лица, и также соответствует шаблону изображения.
- Слияние лица: Слияние лица – это новый подход, используемый для исправления артефактов границ, являющихся результатом маскировки inpaint, и он включает в себя исправление артефактов с помощью фреймворка ControlNet. Метод позволяет фреймворку EasyPhoto обеспечить сохранение гармоничных краев и, таким образом, в конечном итоге направлять процесс генерации изображения. Алгоритм слияния лица еще больше объединяет изображение roop (реальное изображение пользователя) и шаблон, что позволяет полученному слиянному изображению демонстрировать лучшую стабилизацию краев границ, что затем приводит к улучшению выходных данных на этапе первой диффузии.
- Валидация, управляемая ControlNet: Поскольку модели LoRA не были обучены с помощью фреймворка ControlNet, использование его во время фазы интерференции может повлиять на способность модели LoRA сохранить идентичность. Для улучшения возможностей обобщения фреймворка EasyPhoto учитывается влияние фреймворка ControlNet, и в него интегрируются модели LoRA из разных стадий.
Первая диффузия
Этап первой диффузии использует шаблон изображения для генерации изображения с уникальной идентичностью, похожей на идентичность пользователя. Входное изображение является слиянием изображения пользователя и шаблона, тогда как откалиброванный маска лица является входным маском. Для дальнейшего увеличения контроля над генерацией изображений фреймворк EasyPhoto интегрирует три единицы ControlNet, где первая единица ControlNet фокусируется на контроле слиянных изображений, вторая единица ControlNet контролирует цвета слиянного изображения, и третья единица ControlNet – это openpose (контроль позы человека в реальном времени) замененного изображения, которое не только содержит структуру лица шаблона изображения, но также идентичность лица пользователя.
Вторая диффузия
На этапе второй диффузии артефакты возле границы лица уточняются и донастраиваются, а также предоставляется пользователям возможность маскировать определенный регион в изображении в попытке улучшить эффективность генерации в этом выделенном районе. На этом этапе фреймворк объединяет выходное изображение, полученное из этапа первой диффузии, с изображением roop или результатом изображения пользователя, генерируя тем самым входное изображение для этапа второй диффузии. В целом, этап второй диффузии играет решающую роль в улучшении общего качества и деталей сгенерированного изображения.
Множественные идентификаторы пользователей
Одним из достоинств EasyPhoto является его поддержка генерации множественных идентификаторов пользователей, и фигура ниже демонстрирует трубопровод процесса интерференции для множественных идентификаторов пользователей в фреймворке EasyPhoto.

Для поддержки генерации множественных идентификаторов пользователей фреймворк EasyPhoto сначала выполняет обнаружение лица на шаблоне интерференции. Эти шаблоны интерференции затем разделяются на несколько масок, где каждая маска содержит только одно лицо, и остальная часть изображения маскируется белым цветом, тем самым разбивая генерацию множественных идентификаторов пользователей на простую задачу генерации отдельных идентификаторов пользователей. Как только фреймворк генерирует изображения идентификаторов пользователей, эти изображения объединяются в шаблон интерференции, тем самым обеспечивая бесшовную интеграцию шаблонов изображений с сгенерированными изображениями, что в конечном итоге приводит к получению высококачественного изображения.
Эксперименты и результаты
Теперь, когда у нас есть понимание фреймворка EasyPhoto, пришло время изучить производительность фреймворка EasyPhoto.

Изображение выше сгенерировано плагином EasyPhoto и использует модель Style-based SD для генерации изображения. Как можно увидеть, сгенерированные изображения выглядят реалистично и точны.

Изображение выше сгенерировано фреймворком EasyPhoto, используя модель Comic Style-based SD. Как можно увидеть, комические фотографии и реалистичные фотографии выглядят очень реалистично и тесно напоминают входное изображение на основе пользовательских подсказок или требований.
Изображение, добавленное ниже, было сгенерировано фреймворком EasyPhoto, используя шаблон с несколькими людьми. Как можно четко увидеть, сгенерированные изображения четкие, точные и напоминают оригинальное изображение.

С помощью EasyPhoto пользователи теперь могут генерировать широкий спектр портретов на основе ИИ, генерировать множественные идентификаторы пользователей, используя сохраненные шаблоны, или использовать модель SD для генерации шаблонов интерференции. Изображения выше демонстрируют способность фреймворка EasyPhoto к производству разнообразных и высококачественных изображений на основе ИИ.
Вывод
В этой статье мы говорили об EasyPhoto, новом плагине WebUI, который позволяет конечным пользователям генерировать портреты и изображения на основе ИИ. Плагин WebUI EasyPhoto генерирует портреты на основе ИИ, используя произвольные шаблоны, и текущие последствия плагина WebUI EasyPhoto поддерживают разные стили фотографий и множество модификаций. Кроме того, для дальнейшего расширения возможностей EasyPhoto пользователи имеют возможность генерировать изображения, используя модель SDXL для получения более удовлетворительных, точных и разнообразных изображений. Фреймворк EasyPhoto использует базовую модель стабильной диффузии, объединенную с предварительно обученной моделью LoRA, которая производит высококачественные изображения.
Интересуетесь генераторами изображений? Мы также предоставляем список лучших генераторов портретов на основе ИИ и лучших генераторов изображений на основе ИИ, которые просты в использовании и не требуют технической экспертизы.












