Погляд Anderson

UniTune: Альтернативна техніка редагування зображень від Google

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Google Research, схоже, атакують текстове редагування зображень з кількох сторін, і, ймовірно, чекають, щоб побачити, що “пристосується”. Незабаром після виходу їхньої статті про Imagic цього тижня, компанія-гігант запропонувала додатковий метод редагування зображень на основі текстових команд, цього разу під назвою UniTune.

На основі прикладів, наведених у статті про проект, UniTune досягла надзвичайного рівня розрізнення семантичної пози та ідеї від фактичного вмісту зображення:

UniTune демонструє видатне володіння семантичною композицією. Помітно, як у верхньому ряду зображень обличчя двох людей не були спотворені під час надзвичайної трансформації решти джерельного зображення (праворуч). Джерело: https://arxiv.org/pdf/2210.09477.pdf

UniTune демонструє видатне володіння семантичною композицією. Помітно, як у верхньому ряду зображень обличчя двох людей не були спотворені під час надзвичайної трансформації решти джерельного зображення (праворуч). Джерело: https://arxiv.org/pdf/2210.09477.pdf

Для шанувальників Stable Diffusion це відомо, що застосування редагувань до окремих секцій зображення без негативного впливу на решту зображення може бути складною, іноді неможливою операцією. Хоча популярні розподіли, такі як AUTOMATIC1111, можуть створювати маски для локальних та обмежених редагувань, процес часто болісний і непередбачуваний.

Очевидна відповідь, принаймні для фахівця з комп’ютерного бачення, полягає в тому, щоб розмістити шар семантичної сегментації, який здатний розпізнавати та ізолювати об’єкти на зображенні без втручання користувача, і, дійсно, останнім часом з’явилися кілька нових ініціатив у цьому напрямку.

Інша можливість для блокування заплутаних та заплутаних операцій редагування зображень на основі нейронних мереж полягає у використанні модуля Contrastive Language–Image Pre-training (CLIP) від OpenAI, який є серцем моделей латентного розсіювання, таких як DALL-E 2 та Stable Diffusion, для дії як фільтра на етапі, коли модель текст-ізображення готова надіслати інтерпретований рендер користувачеві. У цьому контексті CLIP повинен діяти як сторож і модуль контролю якості, що відхиляє неправильно сформовані або інакше непридатні рендери. Це має бути впроваджено (посилання на Discord) на порталі API-driven DreamStudio.

Стиснута мова

Предложена UniTune замість цього “тонко налаштовує” існуючу модель розсіювання – у цьому випадку, власну модель Imagen від Google, хоча дослідники заявляють, що метод сумісний з іншими архітектурами латентного розсіювання – так, що унікальний токен вводиться в неї, який можна викликати, включивши його в текстовий промпт.

На перший погляд, це здається подібним до DreamBooth від Google, який зараз є об’єктом уваги серед шанувальників та розробників Stable Diffusion, який може вводити нові персонажі або об’єкти в існуючу точку, часто менш ніж за годину, на основі декількох джерельних зображень; або подібним до Textual Inversion, який створює “бокові” файли для точки, які потім обробляються як якщо б вони були спочатку навчені в моделі, і можуть скористатися власними величезними ресурсами моделі, змінивши її текстовий класифікатор, в результаті чого отримується малий файл (у порівнянні з мінімумом 2 ГБ обрізаних точок DreamBooth).

Фактично дослідники стверджують, що UniTune відхилила ці підходи. Вони виявили, що Textual Inversion пропускала занадто багато важливих деталей, тоді як DreamBooth “виконувала гірше і займала більше часу”, ніж рішення, яке вони нарешті прийняли.

Процес

Хоча дві майже ідентичні статті, за своїми кінцевими функціями, можуть вийти від Google у той самий тиждень, існує, попри велику кількість подібностей між двома ініціативами, принаймні одна чітка відмінність між UniTune та Imagic – остання використовує “нестиснуті” природні мовні промпти для керування операціями редагування зображень, тоді як UniTune тренується унікальними токенами у стилі DreamBooth.

Отже, якщо ви редагували з Imagic і хотіли здійснити таку трансформацію…

З статті про UniTune - UniTune протиставляє себе улюбленому суперницькому нейронному редакторському кадру Google, SDEdit. Результати UniTune знаходяться праворуч, тоді як оцінена маска видно на другому зображенні зліва.

З статті про UniTune – UniTune протиставляє себе улюбленому суперницькому нейронному редакторському кадру Google, SDEdit. Результати UniTune знаходяться праворуч, тоді як оцінена маска видно на другому зображенні зліва.

.. у Imagic ви ввели б ‘третю особу, що сидить на задньому плані, як милу пухнасту істоту’.

Еквівалентна команда UniTune була б ‘Чоловік позаду як [x]’, де x – це той дивний і унікальний словник, який був зв’язаний з тонко налаштованою концепцією, пов’язаною з персонажем пухнастої істоти.

Процес тонкої налаштовки

Метод UniTune фактично надсилає джерельне зображення через модель розсіювання з набором інструкцій щодо того, як його слід змінити, використовуючи величезні репозиторії доступних даних, навчених у моделі. По суті, ви можете зробити це прямо зараз за допомогою функції img2img Stable Diffusion – але не без викривлення або зміни тих частин зображення, які ви хотіли б зберегти.

Під час процесу UniTune система “тонко налаштовується”, тобто UniTune змушує модель відновити навчання, з більшістю її шарів, які не заморожені (див. нижче). У більшості випадків тонка налаштовка знижує загальні значення втрат високопродуктивної моделі на користь введення або вдосконалення якогось іншого аспекту, який бажано створити або поліпшити.

Зразкування

Є багато можливих методів зразкування, за допомогою яких можна отримати зміни, внесені до тонко налаштованої моделі, включаючи Classifier Free Guidance (CFG), основу Stable Diffusion. CFG визначає ступінь, у якій модель вільна “слідувати своїй уяві” та досліджувати можливості рендерингу – або ж, при нижчих налаштуваннях, ступінь, у якій вона повинна дотримуватися вхідних даних джерела та робити менше широких або драматичних змін.

Як і Textual Inversion (трохи менше з DreamBooth), UniTune підходить для застосування різних графічних стилів до оригінальних зображень, а також для більш фотореалістичних редагувань.

Як і Textual Inversion (трохи менше з DreamBooth), UniTune підходить для застосування різних графічних стилів до оригінальних зображень, а також для більш фотореалістичних редагувань.

Дослідники також експериментували з технікою “пізнього початку” SDEdit, де система заохочується зберегти оригінальні деталі, будучи лише частково “шумом” з самого початку, а не зберігаючи свої основні характеристики. Хоча дослідники використовували це лише на нижньому рівні (64px), вони вважають, що це може бути корисним додатковим методом зразкування в майбутньому.

Затримка

Хоча перший варіант будь-якої нової системи буде повільним, і хоча можливо, що або спільна участь, або корпоративна прив’язаність (зазвичай не обидва) в кінцевому підсумку прискорять і оптимізують ресурсоємкий процес, обидві UniTune та Imagic виконують деякі досить серйозні дії машинного навчання, щоб створити ці неймовірні редагування, і питання про те, якою мірою такий ресурсоємкий процес може бути зменшений до домашнього використання, а не доступу через API (хоча останнє може бути більш бажаним для Google).

Наразі повний цикл від вхідних даних до результату займає близько 3 хвилин на GPU T4, з додатковими 30 секундами на інференцію (як і будь-який інший інференційний рутин). Автори погоджуються, що це висока затримка, і майже не відповідає поняттю “інтерактивності”, але вони також зазначають, що модель залишається доступною для подальших редагувань після першої настройки, доки користувач не закінчить процес, що скорочує час на редагування.

 

Перша публікація 21 жовтня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai