Моделі та платформи ШІ
InstantID: генерація зображень із збереженням ідентичності за кілька секунд
Технологія генерації зображень на основі штучного інтелекту пережила значний розвиток за останні кілька років, починаючи з появи великих моделей дифузії тексту в зображення, таких як DALL-E, GLIDE, Stable Diffusion, Imagen та інші. Хоча моделі генерації зображень мають унікальну архітектуру та методи навчання, вони всі мають одну спільну мету: персоналізована генерація зображень, яка спрямована на створення зображень із постійним ідентифікатором об’єкта, суб’єкта та стилю на основі зображень-відповідей. Завдяки своїм видатним генеративним можливостям, сучасні рамки генерації зображень знайшли застосування в галузях, таких як анімація зображень, віртуальна реальність, електронна комерція, портрети на основі штучного інтелекту та інші. Однак, попри свої видатні генеративні можливості, ці рамки мають одну спільну перешкоду: більшість із них не можуть генерувати персоналізовані зображення, зберігаючи при цьому дрібні деталі людських об’єктів.
Генерація персоналізованих зображень із збереженням дрібних деталей має критичне значення, особливо у завданнях ідентифікації людських облич, які вимагають високого рівня відтворення та деталізації, а також нюансів семантики порівняно з загальними завданнями генерації зображень об’єктів, які зосереджені в основному на текстурах та кольорах. Крім того, персоналізовані рамки синтезу зображень у останні роки, такі як LoRA, DreamBooth, Textual Inversion та інші, значно покращились. Однак персоналізовані моделі генерації зображень все ще не ідеальні для розгортання в реальних сценаріях, оскільки вони мають високі вимоги до зберігання, потребують декількох зображень-відповідей та часто мають тривалий процес налаштування. З іншого боку, хоча існуючі методи на основі ID-ембеддингу вимагають лише одного прямого посилання, вони або не мають сумісності з попередньо навченими моделями, або потребують надмірного процесу налаштування по численним параметрам, або не можуть зберегти високе відтворення обличчя.
Щоб подолати ці виклики та ще більше покращити можливості генерації зображень, у цій статті ми розглянемо InstantID, рішення на основі моделі дифузії для генерації зображень. InstantID – це модуль “підключи та грай”, який майстерно обробляє генерацію зображень та персоналізацію за допомогою одного зображення-відповіді та забезпечує високе відтворення. Основною метою цієї статті є надання нашим читачам глибокого розуміння технічних основ та компонентів рамки InstantID, оскільки ми детально розглянемо архітектуру моделі, процес навчання та сценарії застосування. Тому почнімо.
InstantID: генерація зображень із збереженням ідентичності за кілька секунд
Поява моделей дифузії тексту в зображення значно сприяла розвитку технології генерації зображень. Основною метою цих моделей є персоналізована генерація, а також створення зображень із постійним об’єктом, стилем та ідентифікатором за допомогою одного або декількох зображень-відповідей. Можливість цих рамок створювати постійні зображення створила потенційні застосування в різних галузях, включаючи анімацію зображень, генерацію портретів на основі штучного інтелекту, електронну комерцію, віртуальну та доповнену реальність та багато іншого.
Однак, попри свої видатні можливості, ці рамки мають одну фундаментальну перешкоду: вони часто мають труднощі з генерацією персоналізованих зображень, які зберігають дрібні деталі людських об’єктів точно. Варто зазначити, що генерація персоналізованих зображень із внутрішніми деталями – це складне завдання, оскільки ідентифікація людських облич вимагає вищого рівня відтворення та деталізації, а також більш просунутих семантик порівняно з загальними завданнями генерації зображень об’єктів, які зосереджені в основному на текстурах та кольорах. Існуючі моделі генерації зображень на основі тексту залежать від детальних текстових описів та мають труднощі з досягненням сильної семантичної відповідності для персоналізованої генерації зображень. Крім того, деякі великі попередньо навчені моделі генерації зображень на основі тексту додають спейсові умовні контролі для покращення керованості, забезпечуючи тонкий структурний контроль за допомогою елементів, таких як пози тіла, карти глибини, користувацькі нариси, карти семантичної сегментації та інші. Однак, попри ці доповнення та вдосконалення, ці рамки можуть досягти лише часткової відповідності згенерованого зображення до зображення-відповіді.
Щоб подолати ці перешкоди, рамка InstantID зосереджена на генерації зображень із збереженням ідентичності, і намагається звузити розрив між ефективністю та високим відтворенням шляхом введення простого модуля “підключи та грай”, який дозволяє рамці обробляти персоналізацію зображень за допомогою одного лише зображення обличчя та забезпечує високе відтворення. Крім того, для збереження ідентичності обличчя з зображення-відповіді, рамка InstantID реалізує новий кодувальник обличчя, який зберігає дрібні деталі зображення шляхом додавання слабких спейсових та сильних семантичних умов, які керують процесом генерації зображення шляхом включення текстових підказок, зображення-відповідей та зображення обличчя.
Є три відмінні особливості, які відрізняють рамку InstantID від існуючих моделей генерації зображень на основі тексту.
- Сумісність та підключення: Натомість ніж навчання на повних параметрах рамки UNet, рамка InstantID зосереджена на навчанні легкого адаптера. Як результат, рамка InstantID сумісна та підключена до існуючих попередньо навчених моделей.
- Відсутність налаштування: Методологія рамки InstantID усуває потребу в налаштуванні, оскільки їй потрібно лише одне прямое поширення для висновку, що робить модель високою практичною та економічною для налаштування.
- Висока продуктивність: Рамка InstantID демонструє високу гнучкість та відтворення, оскільки вона здатна забезпечити продуктивність на рівні стану мистецтва за допомогою одного лише зображення-відповіді, порівнянну з методами навчання, які покладаються на декілька зображень-відповідей.
Загалом, внески рамки InstantID можна категоризувати наступним чином.
- Рамка InstantID – це інноваційна, зберігаюча ідентичність метод адаптації для попередньо навчених моделей генерації зображень на основі тексту з метою звузити розрив між ефективністю та відтворенням.
- Рамка InstantID сумісна та підключена до налаштованих моделей з використанням однієї й тієї ж моделі дифузії в своїй архітектурі, що дозволяє зберегти ідентичність у попередньо навчених моделях без додаткових витрат.
InstantID: методологія та архітектура
Як згадувалося раніше, рамка InstantID – це ефективний легкий адаптер, який наділяє попередньо навчені моделі генерації зображень на основі тексту можливостями збереження ідентичності без зусиль.
Говорячи про архітектуру, рамка InstantID побудована на основі моделі Stable Diffusion, відомої своєю здатністю виконувати процес дифузії з високою обчислювальною ефективністю у низьковимірному латентному просторі замість простору пікселів з авто-кодувальником. Для входного зображення кодувальник спочатку відображає зображення у латентне представлення з коефіцієнтом підзвідання та латентними розмірами. Крім того, для денойзингу нормально розподіленого шуму з шумним латентним, умовою та поточним кроком часу, процес дифузії приймає компонент денойзингу UNet. Умова – це вкладення текстових підказок, згенерованих за допомогою попередньо навченого компонента CLIP текстового кодувальника.
Крім того, рамка InstantID також використовує компонент ControlNet, який здатний додавати спейсовий контроль до попередньо навченої моделі дифузії як умову, що значно розширює традиційні можливості текстових підказок. Компонент ControlNet також інтегрує архітектуру UNet з рамки Stable Diffusion, використовуючи навчену репліку компонента UNet. Репліка компонента UNet має нульові конволюційні шари всередині середніх блоків та блоків кодувальника. Хоча вони схожі, компонент ControlNet відрізняється від моделі Stable Diffusion; вони відрізняються у останньому залишковому елементі. Компонент ControlNet кодує інформацію про спейсові умови, такі як пози, карти глибини, нариси тощо, додавши залишки до блоку UNet, а потім вкладає ці залишки в оригінальну мережу.
Рамка InstantID також черпає натхнення з IP-Adapter або Image Prompt Adapter, який вводить новий підхід для досягнення можливостей підказок зображень, що працює паралельно з текстовими підказками без потреби модифікувати оригінальні моделі генерації зображень на основі тексту. Компонент IP-Adapter також використовує унікальну декупльовану стратегію крос-аттенції, яка використовує додаткові шари крос-аттенції для вкладення функцій зображення, залишаючи інші параметри незмінними.
Методологія
Щоб дати вам короткий огляд, рамка InstantID спрямована на генерацію персоналізованих зображень з різними стилями або позами за допомогою одного лише зображення-відповіді з високим відтворенням. Наступна фігура коротко дає огляд рамки InstantID.

Як можна побачити, рамка InstantID має три основні компоненти:
- Компонент вкладення ID, який захоплює надійну семантичну інформацію про особливості обличчя на зображенні.
- Легкий адаптований модуль з декупльованим компонентом крос-аттенції для підтримки використання зображення як візуальної підказки.
- Компонент IdentityNet, який кодує детальні особливості з зображення-відповіді за допомогою додаткового спейсового контролю.
Вкладення ID
На відміну від існуючих методів, таких як FaceStudio, PhotoMaker, IP-Adapter тощо, які покладаються на попередньо навчений кодувальник зображення CLIP для витягування візуальних підказок, рамка InstantID зосереджена на підвищенні відтворення та сильнішій семантиці у завданнях збереження ідентичності. Варто зазначити, що вбудовані обмеження компонента CLIP лежать головним чином у його процесі навчання на слабо пов’язаних даних, тобто вкладені функції кодувальника CLIP головним чином захоплюють широкі та нечіткі семантичні особливості, такі як кольори, стиль та композиція. Хоча ці особливості можуть діяти як загальне доповнення до текстових вкладень, вони не підходять для точного збереження ідентичності, яке підкреслює сильну семантику та високе відтворення. Крім того, останні дослідження у моделях представлення обличчя, особливо у сфері розпізнавання облич, продемонстрували ефективність представлення обличчя у складних завданнях, включаючи реконструкцію та розпізнавання облич. Будуючи на цьому, рамка InstantID спрямована на використання попередньо навченої моделі обличчя для виявлення та витягування вкладень ідентичності обличчя з зображення-відповіді, керуючи процесом генерації зображення.
Адаптер зображення
Спроможність попередньо навчених моделей генерації зображень на основі тексту у завданнях підказок зображень значно покращується, особливо у сценаріях, які не можуть бути достатньо описані текстовими підказками. Рамка InstantID приймає стратегію, подібну до тієї, яка використовується моделлю IP-Adapter для підказок зображень, яка вводить легкий адаптований модуль, поєднаний з декупльованим компонентом крос-аттенції для підтримки зображень як входних підказок. Однак, на відміну від грубо пов’язаних вкладень CLIP, рамка InstantID розходиться шляхом використання вкладень ідентичності як підказок зображень у спробі досягти семантично багатого та більш нюансированого інтегрування підказок.
IdentityNet
Хоча існуючі методи здатні інтегрувати підказки зображень з текстовими підказками, рамка InstantID стверджує, що ці методи лише покращують грубі особливості з рівнем інтеграції, який є недостатнім для генерації зображень із збереженням ідентичності. Крім того, додавання підказок зображення та тексту в шарах крос-аттенції безпосередньо схильне до ослаблення контролю текстових підказок, а спроба посилити підказки зображення може призвести до порушення можливостей текстових підказок у завданнях редагування. Щоб подолати ці виклики, рамка InstantID вибирає ControlNet, альтернативний метод вкладення особливостей, який використовує спейсову інформацію як вхід для керованого модуля, дозволяючи йому зберігати узгодженість з налаштуваннями UNet у моделях дифузії.
Рамка InstantID робить два зміни до традиційної архітектури ControlNet: для умовних входів рамка InstantID вибирає 5 ключових точок обличчя замість тонких ключових точок OpenPose обличчя. Друга зміна полягає у використанні вкладень ідентичності замість текстових підказок як умов для шарів крос-аттенції в архітектурі ControlNet.
Навчання та висновок
Під час фази навчання рамка InstantID оптимізує параметри IdentityNet та адаптера зображення, заморожуючи параметри попередньо навченої моделі дифузії. Цілком процес InstantID навчається на парах зображень та тексту, які містять людські об’єкти, та використовує завдання навчання, подібне до того, яке використовується у рамці стабільної дифузії з умовами завдання зображення. Висвітлення методу навчання InstantID полягає у розділі між шарами крос-аттенції зображення та тексту всередині адаптера зображення, що дозволяє рамці InstantID регулювати ваги цих умов зображення гнучко та незалежно, забезпечуючи більш цілеве та контрольоване навчання та висновок.
InstantID: експерименти та результати
Рамка InstantID реалізує модель Stable Diffusion та навчається на LAION-Face, великому відкритому наборі даних, що складається з понад 50 мільйонів пар зображень та тексту. Крім того, рамка InstantID збирає понад 10 мільйонів людських зображень з автоматично згенерованими BLIP2 моделлю для подальшого покращення якості генерації зображень. Рамка InstantID зосереджена в основному на зображеннях одного людини та використовує попередньо навчену модель обличчя для виявлення та витягування вкладень ідентичності обличчя з людських зображень, та навчається на оригінальних людських зображеннях замість обрізаних наборів даних облич. Крім того, під час навчання рамка InstantID заморожує попередньо навчену модель генерації зображень на основі тексту та оновлює лише параметри IdentityNet та адаптера зображення.
Генерація лише зображень
Модель InstantID використовує порожню підказку для керування процесом генерації зображення лише за допомогою зображення-відповіді, та результати без підказок демонструються на наступному зображенні.

Генерація «порожньої підказки», як показано на вищезазначеному зображенні, демонструє здатність рамки InstantID зберігати багатий семантичний обличчя, такі як ідентичність, вік та вираз обличчя, міцно. Однак варто зазначити, що використання порожніх підказок може не бути здатним точно повторити результати на інших семантиках, таких як стать. Крім того, у вищезазначеному зображенні стовпці 2-4 використовують зображення та підказку, та, як можна побачити, згенероване зображення не демонструє жодного погіршення можливостей контролю тексту, та також забезпечує узгодженість ідентичності. Нарешті, стовпці 5-9 використовують зображення, підказку та спейсовий контроль, демонструючи сумісність моделі з попередньо навченими моделями спейсового контролю, дозволяючи моделі InstantID гнучко вводити спейсовий контроль за допомогою попередньо навченої компоненти ControlNet.

Також варто зазначити, що кількість зображень-відповідей має значний вплив на згенероване зображення, як показано на вищезазначеному зображенні. Хоча рамка InstantID здатна забезпечити хороші результати за допомогою одного лише зображення-відповіді, декілька зображень-відповідей дають краще якість зображення, оскільки рамка InstantID бере середнє значення вкладень ідентичності як підказку зображення. Продовжуючи, варто порівняти рамку InstantID з попередніми методами, які генерують персоналізовані зображення за допомогою одного лише зображення-відповіді. Наступна фігура порівнює результати, згенеровані рамкою InstantID, та існуючі моделі на рівні стану мистецтва для генерації персоналізованих зображень за допомогою одного лише зображення-відповіді.

Як можна побачити, рамка InstantID здатна зберігати особливості обличчя завдяки тому, що вкладення ідентичності внутрішньо містить багатий семантичний інформацію, такий як ідентичність, вік та стать. Безумовно, можна сказати, що рамка InstantID перевершує існуючі рамки у генерації персоналізованих зображень, оскільки вона здатна зберігати людську ідентичність, зберігаючи при цьому контроль та стилістичну гнучкість.

Фінальні думки
У цій статті ми розглянули рамку InstantID, рішення на основі моделі дифузії для генерації зображень. Рамка InstantID – це модуль “підключи та грай”, який майстерно обробляє генерацію зображень та персоналізацію за допомогою одного лише зображення-відповіді та забезпечує високе відтворення. Рамка InstantID зосереджена на генерації зображень із збереженням ідентичності, та намагається звузити розрив між ефективністю та високим відтворенням шляхом введення простого модуля “підключи та грай”, який дозволяє рамці обробляти персоналізацію зображень за допомогою одного лише зображення обличчя та забезпечує високе відтворення.












