Моделі та платформи ШІ
EasyPhoto: Ваш особистий генератор фотографій AI

Стабільна дифузія Веб-інтерфейс користувача, або SD-WebUI, – це комплексний проект для моделей Стабільної дифузії, який використовує бібліотеку Gradio для надання інтерфейсу браузера. Сьогодні ми хочемо поговорити про EasyPhoto, інноваційний плагін WebUI, який дозволяє кінцевим користувачам генерувати портрети та зображення AI. Плагін WebUI EasyPhoto створює портрети AI за допомогою різних шаблонів, підтримуючи різні стилі фотографій та кілька модифікацій. Крім того, для подальшого вдосконалення можливостей EasyPhoto користувачі можуть генерувати зображення за допомогою моделі SDXL для більш задовільних, точних та різноманітних результатів. Давайте почнемо.
Введення в EasyPhoto та Стабільну дифузію
Фреймворк Стабільної дифузії – це популярний та потужний фреймворк генерації на основі дифузії, який використовується розробниками для генерації реалістичних зображень на основі текстових описів вхідних даних. Завдяки своїм можливостям, фреймворк Стабільної дифузії має широкий спектр застосувань, включаючи розширення зображення, заповнення зображення та переклад зображення в зображення. Веб-інтерфейс Стабільної дифузії, або SD-WebUI, виділяється як один із найпопулярніших та найвідоміших застосувань цього фреймворку. Він має інтерфейс браузера, побудований на бібліотеці Gradio, який забезпечує інтерактивний та зручний інтерфейс для моделей Стабільної дифузії. Для подальшого вдосконалення контролю та зручності використання при генерації зображень SD-WebUI інтегрує численні застосунки Стабільної дифузії.
Завдяки зручності, наданій фреймворком SD-WebUI, розробники фреймворку EasyPhoto вирішили створити його як веб-плагін, а не повноцінний застосунок. На відміну від існуючих методів, які часто страждають від втрати ідентичності або введення нереалістичних особливостей у зображення, фреймворк EasyPhoto використовує можливості зображення в зображення моделей Стабільної дифузії для генерації точних та реалістичних зображень. Користувачі можуть легко встановити фреймворк EasyPhoto як розширення у WebUI, підвищуючи зручність використання та доступність для широкого кола користувачів. Фреймворк EasyPhoto дозволяє користувачам генерувати портрети AI, керованими ідентичністю, високої якості, які близькі до вхідної ідентичності.
Спочатку фреймворк EasyPhoto просить користувачів створити свій цифровий двійник, завантаживши кілька зображень для навчання моделі обличчя LoRA або низькорангової адаптації онлайн. Фреймворк LoRA швидко дофінує моделі дифузії, використовуючи технологію низькорангової адаптації. Цей процес дозволяє базовій моделі зрозуміти інформацію про ідентичність конкретних користувачів. Навчені моделі потім об’єднуються та інтегруються у базову модель Стабільної дифузії для інтерференції. Крім того, під час процесу інтерференції модель використовує стабільні моделі дифузії для спроби перерисування областей обличчя у шаблоні інтерференції, а схожість між вхідним та вихідним зображеннями перевіряється за допомогою різних блоків ControlNet.
Фреймворк EasyPhoto також розгортає двостадійний процес дифузії для вирішення потенційних проблем, таких як артефакти меж та втрата ідентичності, тим самим забезпечуючи, щоб зображення, згенеровані мінімально, мінімізували візуальні несумісності, зберігаючи при цьому ідентичність користувача. Крім того, трубопровід інтерференції у фреймворку EasyPhoto не обмежується генерацією портретів, а може бути використаний для генерації будь-чого, що пов’язано з ідентичністю користувача. Це означає, що після навчання моделі LoRA для конкретної ідентичності можна згенерувати широкий спектр зображень AI, а тому він може мати широке застосування, включаючи віртуальні примерки.
Підводячи підсумок, фреймворк EasyPhoto
- Представляє новий підхід до навчання моделі LoRA шляхом включення кількох моделей LoRA для збереження вірності обличчя згенерованих зображень.
- Використовує різні методи навчання з підкріпленням для оптимізації моделей LoRA для нагород за ідентичність обличчя, що далі допомагає у підвищенні схожості ідентичностей між тренувальними зображеннями та згенерованими результатами.
- Представляє двостадійний процес дифузії на основі заповнення, який спрямований на генерацію фотографій AI з високими естетичними якостями та схожістю.
EasyPhoto: Архітектура та навчання
Наступна фігура демонструє процес навчання фреймворку EasyPhoto AI.

Як можна побачити, фреймворк спочатку просить користувачів ввести тренувальні зображення, а потім виконує виявлення обличчя для виявлення місць розташування обличчя. Як тільки фреймворк виявляє обличчя, він обрізає вхідне зображення за допомогою попередньо визначеного певного співвідношення, яке зосереджується виключно на області обличчя. Фреймворк потім розгортає модель ошатності шкіри та модель виявлення салієнції для отримання чистого та чіткого тренувального зображення обличчя. Ці дві моделі відіграють важливу роль у підвищенні візуальної якості обличчя та забезпеченні того, щоб інформація про фон було видалено, а тренувальне зображення містить переважно обличчя. Нарешті, фреймворк використовує ці оброблені зображення та вхідні підказки для навчання моделі LoRA, наділяючи її здатністю краще та точніше зрозуміти особливості обличчя користувача.
Крім того, під час фази навчання фреймворк включає критичний етап перевірки, на якому фреймворк обчислює розрив ідентичності обличчя між зображенням, введеним користувачем, та зображенням перевірки, згенерованим навченою моделлю LoRA. Етап перевірки є фундаментальним процесом, який відіграє ключову роль у досягненні злиття моделей LoRA, в кінцевому підсумку забезпечуючи, щоб навчена модель LoRA перетворилася на двійника, або точну цифрову репрезентацію користувача. Крім того, зображення перевірки з оптимальним балом ідентичності обличчя буде вибрано як зображення ідентичності обличчя, і це зображення ідентичності обличчя буде використано для підвищення схожості ідентичності генерації інтерференції.
Переходячи далі, на основі процесу ансамблю фреймворк навчає моделі LoRA з оцінкою ймовірності як основною метою, тоді як збереження схожості ідентичності обличчя є hạstream-об’єктом. Для вирішення цієї проблеми фреймворк EasyPhoto використовує методи навчання з підкріпленням для оптимізації hạstream-об’єкта безпосередньо. В результаті особливості обличчя, вивчені моделями LoRA, демонструють покращення, яке призводить до підвищення схожості між згенерованими результатами шаблону та демонструє узагальнення по шаблонах.
Процес інтерференції
Наступна фігура демонструє процес інтерференції для окремого ідентифікатора користувача у фреймворку EasyPhoto, і складається з трьох частин
- Преобробка обличчя для отримання посилання ControlNet та попередньо обробленого вхідного зображення.
- Перша дифузія, яка допомагає генерувати грубі результати, які нагадують вхідні дані користувача.
- Друга дифузія, яка виправляє артефакти меж, роблячи зображення більш точними та реалістичними.

Для вхідних даних фреймворк приймає зображення ідентичності обличчя (згенероване під час тренувальної перевірки за допомогою оптимального балу ідентичності обличчя), та шаблон інтерференції. Вихідним є високодеталізований, точний та реалістичний портрет користувача, який близький до ідентичності та унікального вигляду користувача на основі шаблону інтерференції. Давайте розглянемо ці процеси детальніше.
Преобробка обличчя
Спосіб генерації портрета AI на основі шаблону інтерференції без свідомого розумування полягає у використанні моделі SD для заповнення області обличчя у шаблоні інтерференції. Крім того, додавання фреймворку ControlNet до процесу не тільки підвищує збереження ідентичності користувача, а й підвищує схожість між згенерованими зображеннями. Однак використання ControlNet безпосередньо для регіонального заповнення може привести до потенційних проблем, які можуть включати
- Несумісність між вхідним та згенерованим зображенням: Чи не очевидно, що ключові точки у шаблоні зображення не сумісні з ключовими точками у зображенні ідентичності обличчя, тому використання ControlNet з зображенням ідентичності обличчя як посилання може привести до деяких несумісностей у виводі.
- Дефекти у області заповнення: Маскування області та подальше заповнення її новим обличчям може привести до помітних дефектів, особливо уздовж межі заповнення, що не тільки вплине на автентичність згенерованого зображення, а й негативно вплине на реалізм зображення.
- Втрата ідентичності за допомогою Control Net: Оскільки процес навчання не використовує фреймворк ControlNet, використання його під час фази інтерференції може вплинути на здатність навчених моделей LoRA зберегти ідентичність користувача.
Для вирішення вищезазначених проблем фреймворк EasyPhoto пропонує три процедури.
- Вирівняти та вставити: Використовуючи алгоритм вставки обличчя, фреймворк EasyPhoto намагається вирішити проблему неузгодженості між ознаками обличчя між ідентичністю обличчя та шаблоном. Спочатку модель обчислює ознаки обличчя ідентичності обличчя та зображення шаблону, а потім визначає матрицю афінних перетворень, яка буде використана для вирівнювання ознак обличчя зображення шаблону з ідентичністю обличчя. Результатом залишається зображення з тими ж ознаками ідентичності обличчя, а також вирівнюється з шаблоном.
- Фузія обличчя: Фузія обличчя – це новий підхід, який використовується для виправлення артефактів меж, які є результатом маскування, і вона включає виправлення артефактів за допомогою фреймворку ControlNet. Метод дозволяє фреймворку EasyPhoto забезпечити збереження гармонійних країв, а тим самим керувати процесом генерації зображення. Алгоритм фузії обличчя далі зливає зображення (фактичне зображення користувача) та шаблон, що дозволяє отриманому зливному зображенню демонструвати кращу стабілізацію країв, що призводить до підвищення якості виводу під час першої стадії дифузії.
- Валідация за допомогою ControlNet: Оскільки моделі LoRA не були навчені за допомогою фреймворку ControlNet, використання його під час процесу інтерференції може вплинути на здатність моделі LoRA зберегти ідентичність. Для підвищення можливостей узагальнення фреймворку EasyPhoto фреймворк враховує вплив фреймворку ControlNet та включає моделі LoRA з різних стадій.
Перша дифузія
Перша стадія дифузії використовує зображення шаблону для генерації зображення з унікальною ідентичністю, яка нагадує ідентичність користувача. Вхідне зображення є зливом зображення, введеного користувачем, та зображення шаблону, тоді як підіготований маска обличчя є вхідною маскою. Для подальшого підвищення контролю над генерацією зображення фреймворк EasyPhoto інтегрує три блоки ControlNet, де перший блок ControlNet фокусується на контролі зливних зображень, другий блок ControlNet контролює кольори зливного зображення, а останній блок ControlNet – це відкрита поза (контроль пози людини в реальному часі) заміщеного зображення, яке містить не тільки структуру обличчя зображення шаблону, а й ідентичність обличчя користувача.
Друга дифузія
На другій стадії дифузії артефакти біля межі обличчя уточнюються та дофінуєтся разом з тим, як користувачам надається гнучкість для маскування певної області у зображенні в спробі підвищити ефективність генерації в цій присвяченій області. На цій стадії фреймворк зливає вихідне зображення, отримане з першої стадії дифузії, з зображенням користувача або результатом зображення користувача, тим самим генеруючи вхідне зображення для другої стадії дифузії. Загалом, друга стадія дифузії відіграє важливу роль у підвищенні загальної якості та деталізації згенерованого зображення.
Багатьох користувачів ідентифікатори
Однією з особливостей EasyPhoto є його підтримка генерації декількох ідентифікаторів користувача, і нижче наведена фігура демонструє трубопровід процесу інтерференції для декількох ідентифікаторів користувача у фреймворку EasyPhoto.

Для підтримки генерації декількох ідентифікаторів користувача фреймворк EasyPhoto спочатку виконує виявлення обличчя у шаблоні інтерференції. Ці шаблони інтерференції потім діляться на декілька масок, де кожна маска містить тільки одне обличчя, а решта зображення маскується білим, тим самим розбиваючи генерацію декількох ідентифікаторів користувача на просту задачу генерації окремих ідентифікаторів користувача. Як тільки фреймворк генерує зображення ідентифікатора користувача, ці зображення зливаються у шаблон інтерференції, тим самим забезпечуючи безшовну інтеграцію шаблонів зображень з згенерованими зображеннями, що в кінцевому підсумку призводить до високоякісного зображення.
Експерименти та результати
Тепер, коли ми маємо розуміння фреймворку EasyPhoto, час дослідити продуктивність фреймворку EasyPhoto.

Вище зображення згенероване плагіном EasyPhoto, і воно використовує модель Style-based SD для генерації зображення. Як можна побачити, згенеровані зображення виглядають реалістично та досить точно.

Зображення вище згенероване фреймворком EasyPhoto за допомогою моделі Comic Style-based SD. Як можна побачити, комічні фотографії та реалістичні фотографії виглядають досить реалістично та близькі до вхідного зображення на основі підказок користувача або вимог.
Зображення нижче згенероване фреймворком EasyPhoto за допомогою шаблону декількох осіб. Як можна побачити, згенеровані зображення чисті, точні та близькі до оригінального зображення.

З допомогою EasyPhoto користувачі тепер можуть генерувати широкий спектр портретів AI, або генерувати декілька ідентифікаторів користувача за допомогою збережених шаблонів, або використовувати модель SD для генерації шаблонів інтерференції. Вище зображення демонструють здатність фреймворку EasyPhoto до генерації різноманітних та високоякісних зображень AI.
Висновок
У цій статті ми говорили про EasyPhoto, новий плагін WebUI, який дозволяє кінцевим користувачам генерувати портрети та зображення AI. Плагін WebUI EasyPhoto генерує портрети AI за допомогою довільних шаблонів, а поточні наслідки плагіна WebUI EasyPhoto підтримують різні стилі фотографій та декілька модифікацій. Крім того, для подальшого вдосконалення можливостей EasyPhoto користувачі мають гнучкість для генерації зображень за допомогою моделі SDXL для генерації більш задовільних, точних та різноманітних зображень. Фреймворк EasyPhoto використовує стабільну модель дифузії разом з попередньо навченою моделлю LoRA, яка генерує високоякісні зображення.
Інтересовані генераторами зображень? Ми також надаємо список кращих генераторів портретів AI та кращих генераторів зображень AI, які легко використовувати та не вимагають технічних знань.












