Моделі та платформи ШІ

InstantStyle: Захист стилю в генерації зображень з тексту

mm
Додайте Unite.AI до бажаних джерел у Google

За останні кілька років моделі дифузії на основі налаштування продемонстрували помітний прогрес у широкому спектрі завдань персоналізації та налаштування зображень. Однак, незважаючи на свій потенціал, сучасні моделі дифузії на основі налаштування продовжують стикатися з рядом складних проблем при генерації та створенні зображень, що зберігають стиль, і можуть бути три причини цього. По-перше, концепція стилю залишається широко невизначеною та не визначеною, і складається з комбінації елементів, включаючи атмосферу, структуру, дизайн, матеріал, колір та багато іншого. По-друге, методи, засновані на інверсії, схильні до деградації стилю, що призводить до частої втрати дрібнозернистих деталей. Нарешті, підходи, засновані на адаптерах, вимагають частого налаштування ваг для кожного зображення-відповіді для підтримання балансу між текстовою керованості та інтенсивністю стилю.

Крім того, основною метою більшості підходів до переносу стилю або генерації зображень є використання зображення-відповіді та застосування його конкретного стилю з даної підмножини або зображення-відповіді до цілевого зображення-вмісту. Однак саме велика кількість атрибутів стилю робить цю роботу складною для дослідників, щоб зібрати стилізовані набори даних, правильно представити стиль та оцінити успіх переносу. Раніше моделі та рамки, що займаються процесом дифузії на основі налаштування, налаштовували набір зображень, що мають спільний стиль, процес, який є як часоємним, так і обмеженим у загальності в реальних завданнях, оскільки складно зібрати підмножину зображень, що мають相同ний або майже ідентичний стиль.

У цій статті ми поговоримо про InstantStyle, рамку, розроблену з метою вирішення проблем, з якими стикаються сучасні моделі дифузії на основі налаштування для генерації та налаштування зображень. Ми поговоримо про дві ключові стратегії, реалізовані рамкою InstantStyle:

  1. Простий, але ефективний підхід до розмежування стилю та вмісту зображень-відповідей у просторі функцій, передбачуваний на підставі припущення, що функції в одному просторі функцій можуть бути або додані, або видалені одна від одної.
  2. Запобігання витоку стилю шляхом ін’єкції функцій зображення-відповіді виключно в блоки, специфічні для стилю, та свідоме уникнення необхідності використання громіздких ваг для налаштування, часто характеризуючих більш параметро-важкі конструкції.

Ця стаття має на меті охопити рамку InstantStyle в глибині, і ми досліджуємо механізм, методологію, архітектуру рамки разом з її порівнянням з рамками державного мистецтва. Ми також поговоримо про те, як рамка InstantStyle демонструє видатні візуальні результати стилізації та знаходить оптимальний баланс між керованістю текстових елементів та інтенсивністю стилю. Тому давайте почнемо.

InstantStyle: Захист стилю в генерації зображень з тексту

Рамки генерації зображень з тексту на основі дифузії здобули помітний успіх у широкому спектрі завдань персоналізації та налаштування, особливо у завданнях генерації зображень, включаючи налаштування об’єктів, збереження зображень та перенос стилю. Однак, незважаючи на недавній успіх та підйом у продуктивності, перенос стилю залишається складним завданням для дослідників через невизначену та не визначену природу стилю, часто включаючи різноманітність елементів, включаючи атмосферу, структуру, дизайн, матеріал, колір та багато іншого. З тим сказавши, основною метою стилізованої генерації зображень або переносу стилю є застосування конкретного стилю з даного зображення-відповіді або зображення-відповіді до цілевого зображення-вмісту. Однак саме велика кількість атрибутів стилю робить цю роботу складною для дослідників, щоб зібрати стилізовані набори даних, правильно представити стиль та оцінити успіх переносу. Раніше моделі та рамки, що займаються процесом дифузії на основі налаштування, налаштовували набір зображень, що мають спільний стиль, процес, який є як часоємним, так і обмеженим у загальності в реальних завданнях, оскільки складно зібрати підмножину зображень, що мають相同ний або майже ідентичний стиль.

З урахуванням проблем, з якими стикаються сучасний підхід, дослідники взяли інтерес до розробки підходів до переносу стилю або стилізованої генерації зображень, і ці рамки можна розділити на дві різні групи:

  • Підходи без адаптера: Підходи без адаптера та рамки використовують силу самоуваги у процесі дифузії, і шляхом реалізації спільної операції уваги, ці моделі здатні витягувати суттєві функції, включаючи ключі та значення з даного зображення-стилю безпосередньо.
  • Підходи на основі адаптера: Підходи на основі адаптера та рамки, з іншого боку, включають легку модель, розроблену для витягування детальних уявлень зображення з зображень-відповідей. Рамка потім інтегрує ці уявлення в процес дифузії майстерно за допомогою механізмів跨-уваги. Основною метою процесу інтеграції є керівництво процесом генерації та забезпечення того, щоб результатом було зображення, що відповідає бажаним стилістичним нюансам зображення-відповіді.

Однак, незважаючи на обіцянки, методи без налаштування часто зустрічають кілька проблем. По-перше, підхід без адаптера вимагає обміну ключами та значеннями в шарах самоуваги, і попередньо ловить матриці ключів та значень, отримані з зображень-стилів. Коли реалізується на природних зображеннях, підхід без адаптера вимагає інверсії зображення назад до шуму за допомогою технік, таких як DDIM або Деноізинг Дифузійні Імпліцитні Моделі інверсії. Однак використання DDIM або інших підходів до інверсії може призвести до втрати дрібнозернистих деталей, таких як колір та текстура, тому зменшуючи інформацію про стиль у згенерованих зображеннях. Крім того, додатковий крок, введений цими підходами, є часоємним процесом та може становити значні недоліки у практичних застосуваннях. З іншого боку, основною проблемою для методів на основі адаптера є знаходження правильного балансу між витоком контексту та інтенсивністю стилю. Витік контексту відбувається, коли збільшення інтенсивності стилю призводить до появи нестильових елементів з зображення-відповіді у згенерованому виводі, з основною точкою складності, що полягає у розділенні стилів від вмісту в зображенні-відповіді ефективно. Для вирішення цієї проблеми деякі рамки будують парні набори даних, що представляють相同ний об’єкт у різних стилях, що полегшує витягування уявлень про вміст та роз’єднання стилів. Однак завдяки внутрішньо невизначеному представленню стилю, завдання створення великомасштабних парних наборів даних обмежене щодо різноманітності стилів, яку воно може захопити, і це ресурсоємкий процес.

Для подолання цих обмежень рамка InstantStyle вводиться, яка є новим механізмом без налаштування на основі існуючих методів на основі адаптера з можливістю безперешкодної інтеграції з іншими методами ін’єкції на основі уваги, та досягнення розмежування вмісту та стилю ефективно. Крім того, рамка InstantStyle вводить не один, а два ефективні способи завершити розмежування стилю та вмісту, досягнувши кращої міграції стилю без необхідності введення додаткових методів для розмежування або побудови парних наборів даних.

Крім того, попередні рамки на основі адаптера широко використовувалися в методах, заснованих на CLIP, як витягувачі функцій зображень, деякі рамки дослідили можливість реалізації розмежування функцій у просторі функцій, і при порівнянні з невизначеністю стилю, легше описати вміст текстом. Оскільки зображення та тексти спільно використовують простір функцій у методах, заснованих на CLIP, проста операція видалення функцій текстового вмісту з функцій зображення може суттєво зменшити витік вмісту. Крім того, у більшості моделей дифузії існує певний шар в його архітектурі, який ін’єктує інформацію про стиль, та здійснює розмежування вмісту та стилю шляхом ін’єкції функцій зображення лише в конкретні блоки стилю. Реалізуючи ці дві прості стратегії, рамка InstantStyle здатна вирішити проблеми витоку вмісту, з якими стикаються більшість існуючих рамок, зберігаючи при цьому силу стилю.

Підсумувавши, рамка InstantStyle використовує дві прості, прямолінійні, але ефективні механізми для досягнення ефективного розмежування вмісту та стилю з зображень-відповідей. Рамка Instant-Style є моделлю незалежним та механізмом без налаштування, який демонструє видатну продуктивність у завданнях переносу стилю з великим потенціалом для завдань нижчого рівня.

Instant-Style: Методологія та Архітектура

Як демонструють попередні підходи, існує баланс у введенні умов стилю в моделях дифузії без налаштування. Якщо інтенсивність умов зображення надто висока, це може призвести до витоку вмісту, тоді як якщо інтенсивність умов зображення занадто низька, стиль може не бути достатньо очевидним. Основною причиною цього спостереження є те, що в зображенні стиль та вміст взаємозалежні, і через внутрішньо невизначені атрибути стилю, складно розмежувати стиль та намір. Як результат, часто налаштовуються ваги для кожного зображення-відповіді в спробі збалансувати текстову керованість та силу стилю. Крім того, для даного вхідного зображення-відповіді та його текстового опису в методах, заснованих на інверсії, використовуються підходи інверсії, такі як DDIM, над зображенням для отримання інверсної траєкторії дифузії, процес, який наближає рівняння інверсії для перетворення зображення в латентне представлення шуму. Будуючи на цьому, і починаючи з інверсної траєкторії дифузії разом з новим набором提示в, ці методи генерують новий вміст зі стилем, що відповідає вхідному.

Переходячи до методології, замість реалізації складних стратегій для розмежування вмісту та стилю з зображень, рамка Instant-Style приймає найпростіший підхід для досягнення подібної продуктивності. При порівнянні з невизначеністю атрибутів стилю, вміст можна представити природним текстом, що дозволяє рамці Instant-Style використовувати текстовий кодувальник з CLIP для витягування характеристик текстового вмісту як представлення контексту. Одночасно рамка Instant-Style реалізує кодувальник зображення CLIP для витягування функцій зображення-відповіді. Використовуючи характеристики глобальних функцій CLIP, та після видалення функцій текстового вмісту з функцій зображення, рамка Instant-Style здатна розмежувати стиль та вміст явно. Хоча це проста стратегія, вона допомагає рамці Instant-Style бути досить ефективною у збереженні мінімального рівня витоку вмісту.

Крім того, кожний шар у глибокій мережі відповідає за захоплення різних семантичних відомостей, і ключове спостереження з попередніх моделей полягає в тому, що існують два шари уваги, які відповідають за обробку стилю. Конкретно, це блоки.0.attentions.1 та down.blocks.2.attentions.1 шари відповідають за захоплення стилю, такого як колір, матеріал, атмосфера, та шар просторового розкладу захоплює структуру та композицію відповідно. Рамка Instant-Style використовує ці шари неявно для витягування інформації про стиль, та запобігає витоку вмісту без втрати сили стилю. Стратегія проста, але ефективна, оскільки модель знайшла шари стилю, які можуть ін’єктувати функції зображення в ці шари для досягнення безперешкодного переносу стилю. Крім того, оскільки модель суттєво зменшує кількість параметрів адаптера, текстова керованість рамки підвищується, та механізм також застосовний до інших моделей ін’єкції на основі уваги для редагування та інших завдань.

Instant-Style: Експерименти та Результати

Рамка Instant-Style реалізована на основі рамки Stable Diffusion XL, та використовує широко прийнятий попередньо натренований IR-адаптер як свій екземпляр для валідування своєї методології, та вимикає всі блоки, крім блоків стилю для функцій зображення. Модель Instant-Style також тренує IR-адаптер на 4 мільйонах великомасштабних текстово-образових парних наборів даних з нуля, та замість тренування всіх блоків, оновлює лише блоки стилю.

Для проведення експериментів щодо його загальних можливостей та стійкості, рамка Instant-Style проводить численні експерименти з переносом стилю з різними стилями через різні вмісти, та результати можна спостерігати в наступних зображеннях. Для даного зображення-відповіді разом з різними提示вами, рамка Instant-Style демонструє високоякісну, послідовну генерацію зображень зі стилем.

Крім того, оскільки модель ін’єктує інформацію про зображення лише в блоки стилю, вона здатна суттєво зменшити проблему витоку вмісту, та тому, не потребує виконання налаштування ваг.

Далі, рамка Instant-Style також приймає архітектуру ControlNet для досягнення образного стилізування з просторовим контролем, та результати демонструються в наступному зображенні.

При порівнянні з попередніми методами державного мистецтва, включаючи StyleAlign, B-LoRA, Swapping Self Attention, та IP-Adapter, рамка Instant-Style демонструє найкращі візуальні ефекти.

Фінальні Думки

У цій статті ми поговорили про Instant-Style, загальну рамку, яка використовує дві прості, але ефективні стратегії для досягнення ефективного розмежування вмісту та стилю з зображень-відповідей. Рамка InstantStyle розроблена з метою вирішення проблем, з якими стикаються сучасні моделі дифузії на основі налаштування для генерації та налаштування зображень. Рамка Instant-Style реалізує дві важливі стратегії: простий, але ефективний підхід до розмежування стилю та вмісту з зображень-відповідей у просторі функцій, передбачуваний на підставі припущення, що функції в одному просторі функцій можуть бути або додані, або видалені одна від одної. Друга, запобігання витоку стилю шляхом ін’єкції функцій зображення-відповіді виключно в блоки, специфічні для стилю, та свідоме уникнення необхідності використання громіздких ваг для налаштування, часто характеризуючих більш параметро-важкі конструкції.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.