Моделі та платформи ШІ
BrushNet: Вбудовування зображень з подвійним розгалуженням дифузії
Вбудовування зображень є однією з класичних проблем у галузі комп’ютерного бачення, і воно спрямоване на відновлення масованих регіонів у зображенні з правдоподібним і природним вмістом. Існуюча робота, що використовує традиційні методи вбудовування зображень, такі як Генеративні суперницькі мережі або GANS, і Варіаційні автоенкодери або VAEs, часто вимагають допоміжних ручних функцій, але при цьому не забезпечують задовільних результатів. За останні кілька років методи, засновані на дифузії, здобули популярність у спільноті комп’ютерного бачення завдяки їхній видатній здатності генерувати високоякісні зображення, різноманітність виходу та тонкий контроль. Перші спроби використання моделей дифузії для текстово-керованого вбудовування зображень змінили стандартну стратегію денойзингу шляхом вибірки масованих регіонів з попередньо натренованої моделі дифузії, а не масованих областей з даного зображення. Хоча ці методи призвели до задовільної продуктивності при простих завданнях вбудовування зображень, вони боролися з складними формами масок, текстовими підказками та вмістом зображень, що призвело до загальної відсутності узгодженості.
Незважаючи на досягнення, дослідження та розвиток цих моделей за останні кілька років, вбудовування зображень залишається великою перешкодою для розробників комп’ютерного бачення. Поточні адаптації моделей дифузії для завдань вбудовування зображень涉ляють зміну стратегії вибірки або розробку моделей вбудовування зображень, спеціально створених шляхом розширення розмірів вхідного каналу базової моделі дифузії для включення пошкодженого зображення та масок. Хоча ці підходи дозволяють моделі дифузії генерувати більш задовільні результати з спеціалізованими формо- та вмістовими моделями, вони можуть не бути найкращим архітектурним дизайном для моделей вбудовування зображень.

Ця стаття спрямована на охоплення рамок BrushNet у глибину, і ми досліджуємо механізм, методологію, архітектуру рамок разом з їх порівнянням з рамками державного мистецтва. Тому давайте почнемо.
BrushNet: Вбудовування зображень з подвійним розгалуженням дифузії
Вбудовування зображень, метод, який намагається відновити пропущені регіони зображення, зберігаючи загальну узгодженість, було довгостроковою проблемою у галузі комп’ютерного бачення, і воно турбувало розробників та дослідників протягом декількох років. Вбудовування зображень знаходить застосування у широкому спектрі завдань комп’ютерного бачення, включаючи редагування зображень та віртуальні примерки. Нещодавно моделі дифузії, такі як Стабільна дифузія, та Стабільна дифузія 1.5 продемонстрували видатну здатність генерувати високоякісні зображення, і вони забезпечують користувачам гнучкість контролю семантичних та структурних елементів. Видатний потенціал моделей дифузії спонукав дослідників використовувати моделі дифузії для завдань високоякісного вбудовування зображень, які узгоджуються з текстовими підказками.
Методи, використовувані традиційними рамками вбудовування зображень, заснованими на дифузії, можна розділити на дві категорії, Модифікація стратегії вибірки та Присвячені моделі вбудовування. Метод модифікації стратегії вибірки змінює стандартний процес денойзингу шляхом вибірки масованих регіонів з попередньо натренованої моделі дифузії, а не масованих областей з даного зображення на кожному етапі денойзингу. Хоча підходи модифікації стратегії вибірки можна реалізувати в довільних моделях дифузії, вони часто призводять до неузгоджених результатів вбудовування зображень, оскільки вони мають обмежене сприйняття меж масок та контекст не масованих регіонів зображення. З іншого боку, присвячені моделі вбудовування досягають більш задовільних результатів з спеціалізованими формо- та вмістовими моделями, хоча вони можуть не бути найкращим архітектурним дизайном для моделей вбудовування зображень.
Як демонструється на наступному зображенні, присвячені моделі вбудовування зливають латентне зображення, шумове латентне, текст та маску на ранній стадії. Архітектурний дизайн таких присвячених моделей вбудовування легко впливає на масовані характеристики зображення, і запобігає наступним шарам у архітектурі UNet від отримання чистих масованих характеристик зображення через вплив тексту. Крім того, обробка генерації та умов у одному розгалуженні накладає додаткове навантаження на архітектуру UNet, і оскільки ці підходи також вимагають доопрацювання у різних варіантах моделі дифузії, ці підходи часто є часоємними з обмеженою переносимістю.

Може здатися, що додавання додаткового розгалуження для витягування масованих характеристик зображення може бути адекватним рішенням вищезгаданих проблем, однак існуючі рамки часто призводять до витягування та вставлення недостатньої інформації при безпосередньому застосуванні до вбудовування. Як результат, існуючі рамки, такі як ControlNet, дають незадовільні результати у порівнянні з присвяченими моделями вбудовування. Для вирішення цієї проблеми найбільш ефективним чином можливим, рамка BrushNet вводить додаткове розгалуження до оригінальної мережі дифузії, і створює більш підходящу архітектуру для завдань вбудовування зображень. Дизайн та архітектура рамки BrushNet можна підсумувати у трьох пунктах.
- Натомість初始化 випадкових шарів, рамка BrushNet реалізує кодувальник VAE для обробки масованого зображення. Як результат, рамка BrushNet може витягувати характеристики зображення для адаптації до розподілу UNet більш ефективно.
- Рамка BrushNet поступово включає повний шар особливостей UNet шар за шаром у попередньо натреновану архітектуру UNet, ієрархічний підхід, який забезпечує щільний пер-піксельний контроль.
- Рамка BrushNet видаляє текстове перехресне звернення з компоненту UNet, щоб забезпечити чисту інформацію про зображення у додатковому розгалуженні. Крім того, модель BrushNet також пропонує реалізувати розмиття стратегії зливання для досягнення кращої узгодженості разом з вищим рівнем контролю у не масованих регіонах зображення.
BrushNet: Метод і архітектура
Наступна фігура дає нам короткий огляд рамки BrushNet.

Як можна спостерігати, рамка використовує подвійну стратегію розгалуження для введення масованих характеристик зображення, і використовує операції зливання з розмитою маскою для забезпечення кращої збереження не масованих регіонів. Варто зазначити, що рамка BrushNet здатна регулювати доданий масштаб для досягнення гнучкого контролю. Для заданого масованого зображення та маски, модель BrushNet виводить вбудоване зображення. Модель спочатку знижує роздільну здатність маски для розміру латентного, а масоване зображення подається як вхід до кодувальника VAE для вирівнювання розподілу латентного простору. Модель потім з’єднує латентне масоване зображення, шумове латентне та зменшену маску, і використовує це як вхід. Особливості, які витягує модель, потім додаються до попередньо натренованого шару UNet після блоку нульової конволюції. Після денойзингу модель зливає масоване зображення та згенероване зображення з розмитою маскою.
Масоване керівництво зображення
Рамка BrushNet вводить масовані характеристики зображення у попередньо натреновану мережу дифузії за допомогою додаткового розгалуження, яке розділяє витягування особливостей масованих зображень від процесу генерації зображення явно. Вхід утворюється шляхом з’єднання латентного масованого зображення, шумового латентного та зменшеної маски. Для цього шумове латентне забезпечує інформацію для генерації зображення під час поточного процесу генерації, і допомагає рамці покращити семантичну узгодженість масованих характеристик зображення. Рамка BrushNet потім витягує латентне масоване зображення з масованого зображення за допомогою Варіаційного автоенкодера. Крім того, рамка використовує кубічну інтерполяцію для зниження роздільної здатності маски у спробі забезпечити розмір маски, який узгоджується з латентним масованим зображенням та шумовим латентним. Для обробки масованих характеристик зображення рамка BrushNet реалізує копію попередньо натренованої моделі дифузії, і виключає шари перехресного звернення моделі дифузії. Причина полягає в тому, що попередньо натреновані ваги моделі дифузії служать сильним апріорним для витягування особливостей масованого зображення, і виключення шарів перехресного звернення забезпечує, що модель розглядає лише чисту інформацію про зображення у додатковому розгалуженні. Рамка BrushNet вводить особливості у заморожену модель дифузії шар за шаром, тим самим забезпечуючи ієрархічний щільний пер-піксельний контроль, і також використовує шари нульової конволюції для встановлення з’єднання між тренованим моделем BrushNet та заблокованою моделлю, забезпечуючи, що шкідливі шуми не мають впливу на приховані стани у тренованій копії під час початкових стадій навчання.
Операція зливання
Як згадувалося раніше, проведення операції зливання у латентному просторі часто призводить до кількох неточностей, і рамка BrushNet зустрічає подібну проблему, коли вона зменшує маску для збігання з розміром латентного простору. Крім того, варто зазначити, що операції кодування та декодування у Варіаційних автоенкодерах мають внутрішні обмеження, і можуть не забезпечувати повну реконструкцію зображення. Для забезпечення того, що рамка реконструює повністю узгоджене зображення не масованого регіону, існуючі роботи реалізували різні техніки, такі як копіювання не масованих регіонів з оригінального зображення. Хоча підхід працює, він часто призводить до відсутності семантичної узгодженості у генерації кінцевих результатів. З іншого боку, інші методи, такі як прийняття операцій зливання у латентному просторі, зустрічають труднощі у збереженні бажаної інформації у не масованих регіонах.
Гнучкий контроль
Архітектурний дизайн рамки BrushNet робить її підходящим вибором для інтеграції у вигляді плагіна до різних попередньо натренованих моделей дифузії, і забезпечує гнучке збереження масштабу. Оскільки рамка BrushNet не змінює ваги попередньо натренованої моделі дифузії, розробники мають гнучкість інтегрувати її як плагін з доопрацьованою моделлю дифузії, що дозволяє легко采用 та експериментувати з попередньо натренованими моделями. Крім того, розробники також мають можливість контролювати масштаб збереження не масованих регіонів, включивши особливості моделі BrushNet у заморожену модель дифузії з заданим ваговим коефіцієнтом, який визначає вплив рамки BrushNet на масштаб збереження, забезпечуючи розробникам можливість регулювати бажані рівні збереження. Нарешті, рамка BrushNet дозволяє користувачам регулювати масштаб розмиття, і вирішувати, чи реалізовувати операцію розмиття, тим самим легко налаштовуючи масштаб збереження не масованих регіонів, залишаючи місце для гнучких регулювань та тонкого контролю над процесом вбудовування зображень.
BrushNet: Реалізація та результати
Для аналізу результатів рамка BrushNet пропонує BrushBench, набір даних вбудовування зображень на основі сегментації з більш ніж 600 зображеннями, кожне з яких супроводжується людьми-анотованою маскою та анотацією підпису. Зображення у наборі даних розподілені рівномірно між природними та штучними зображеннями, і також забезпечують рівномірний розподіл серед різних категорій, забезпечуючи справедливу оцінку серед різних категорій. Для покращення аналізу завдань вбудовування зображень ще далі, рамка BrushNet категоризує набір даних на дві окремі частини на основі методів, використаних: сегментація-основані та маскові розмітки.
Кількісне порівняння
Наступна таблиця порівнює рамку BrushNet з існуючими моделями вбудовування зображень, заснованими на дифузії, на наборі даних BrushBench з моделлю Стабільної дифузії як базовою моделлю.

Як можна спостерігати, рамка BrushNet демонструє видатну ефективність у збереженні масованих регіонів, узгодженості тексту та якості зображення. Крім того, моделі, такі як Стабільне вбудовування зображень, HD-Painter, PowerPaint та інші демонструють сильну продуктивність у завданнях вбудовування зображень усередині, хоча вони не можуть повторити свою продуктивність у завданнях вбудовування зображень зовні, особливо у термінах узгодженості тексту та якості зображення. Загалом, рамка BrushNet забезпечує найкращі результати.
Крім того, наступна таблиця порівнює рамку BrushNet з існуючими моделями вбудовування зображень, заснованими на дифузії, на наборі даних EditBench, і продуктивність є порівнянною з тією, яка спостерігається на наборі даних BrushBench. Результати вказують на те, що рамка BrushNet забезпечує сильну продуктивність у широкому спектрі завдань вбудовування зображень з різними типами масок.

Якість порівняння
Наступна фігура якісно порівнює рамку BrushNet з існуючими методами вбудовування зображень, з результатами, що охоплюють штучний інтелект та природні зображення у різних завданнях вбудовування зображень, включаючи випадкове вбудовування масок, вбудовування зображень усередині сегментації та вбудовування зображень зовні сегментації.

Як можна спостерігати, рамка BrushNet забезпечує видатні результати у узгодженості не масованого регіону та узгоджених регіонів, і успішно реалізує свідомість фонової інформації завдяки реалізації підходу подвійного розгалуження. Крім того, не змінений розгалуження попередньо натренованої моделі дифузії також забезпечує перевагу у покритті різних доменів даних, таких як аніме та живопис, що призводить до кращої продуктивності у різних сценаріях.

Фінальні думки
У цій статті ми говорили про рамку BrushNet, нову плагінну двозначну інженерну рамку, яка вкладає піксельні масовані характеристики зображення у будь-яку попередньо натреновану модель дифузії, тим самим забезпечуючи узгодженість та покращений результат у завданнях вбудовування зображень. Рамка BrushNet вводить новий парадигму, за яким рамка розділяє характеристики зображення та шумові латентні у окремі розгалуження. Розділення характеристик зображення та шумових латентних зменшує навантаження на навчання моделі, і забезпечує нюансований внесок масованих характеристик зображення у ієрархічний спосіб. Крім рамки BrushNet, ми також говоримо про BrushBench та BrushData, які забезпечують оцінку продуктивності на основі сегментації та навчання вбудовування зображень відповідно.












