Погляд Anderson

Редагування об’єктів за допомогою AI з Google’s Imagic та Runway’s ‘Erase and Replace’

mm
Додайте Unite.AI до бажаних джерел у Google

Цього тижня дві нові, але контрастні алгоритми графічних редакторів, керованих штучним інтелектом, пропонують нові способи для кінцевих користувачів зробити високодеталізовані та ефективні зміни об’єктів на фотографіях.

Перший з них – Imagic, від Google Research, у співпраці з Інститутом технологій Ізраїлю та Інститутом наук імені Вейцмана. Imagic пропонує редагування об’єктів на основі текстових умов за допомогою тонкої настройки моделей розсіювання.

Змініть те, що вам подобається, і залиште все інше - Imagic обіцяє детальне редагування лише тих частин, які ви хочете змінити. Джерело: https://arxiv.org/pdf/2210.09276.pdf

Змініть те, що вам подобається, і залиште все інше – Imagic обіцяє детальне редагування лише тих частин, які ви хочете змінити. Джерело: https://arxiv.org/pdf/2210.09276.pdf

Хтось, хто намагався змінити лише один елемент у Stable Diffusion, знає, що для кожного успішного редагування система змінить ще п’ять речей, які вам сподобалися саме так, як вони були. Це недолік, який зараз має багатьох талановитих ентузіастів Stable Diffusion, які постійно перемикаються між Stable Diffusion і Photoshop, щоб виправити цей тип “колатерального ушкодження”. З цієї точки зору досягнення Imagic здаються помітними.

На момент написання цього тексту Imagic ще не має навіть промо-відео, і, враховуючи обережне ставлення Google до випуску необмежених інструментів синтезу зображень, невідомо, чи отримаємо ми можливість протестувати систему.

Друга пропозиція – це досить доступна функція Erase and Replace від Runway ML, нова функція в розділі “AI Magic Tools” їхнього виключно онлайн-сюїту візуальних ефектів на основі машинного навчання.

Функція Erase and Replace від Runway ML, вже побачена в попередньому перегляді системи редагування відео за текстом. Джерело: https://www.youtube.com/watch?v=41Qb58ZPO60

Функція Erase and Replace від Runway ML, вже побачена в попередньому перегляді системи редагування відео за текстом. Джерело: https://www.youtube.com/watch?v=41Qb58ZPO60

Давайте спочатку розглянемо продукт Runway.

Erase and Replace

Як і Imagic, Erase and Replace займається виключно статичними зображеннями, хоча Runway вже показав ту ж саму функціональність у системі редагування відео за текстом, яка ще не випущена:

Хоча будь-хто може протестувати нову функцію Erase and Replace на зображеннях, версія для відео ще не доступна публічно. Джерело: https://twitter.com/runwayml/status/1568220303808991232

Хоча будь-хто може протестувати нову функцію Erase and Replace на зображеннях, версія для відео ще не доступна публічно. Джерело: https://twitter.com/runwayml/status/1568220303808991232

Хоча Runway ML не випустив інформації про технології, що стоять за Erase and Replace, швидкість, з якою ви можете замінити квітковий горщик на досить переконливу статую Рональда Рейгана, свідчить про те, що ймовірно використовується модель розсіювання, така як Stable Diffusion (або, менш імовірно, ліцензована DALL-E 2), яка переосмислює об’єкт вашого вибору в Erase and Replace.

Заміна квіткового горщика на статую Рональда Рейгана не відбувається так швидко, але досить швидко. Джерело: https://app.runwayml.com/

Заміна квіткового горщика на статую Рональда Рейгана не відбувається так швидко, але досить швидко. Джерело: https://app.runwayml.com/

Система має деякі обмеження типу DALL-E 2 – зображення або текст, які активують фільтри Erase and Replace, спровокують попередження про можливу заборону акаунту у випадку подальших порушень – практично ідентичну копію політики OpenAI щодо DALL-E 2.

Багато результатів не мають характерних грубих країв Stable Diffusion. Runway ML інвестує в SD і є партнером дослідження, і можливо, що вони тренували власну модель, яка перевершує відкриту модель 1.4, з якою зараз працюють інші групи розробників.

Заміна домашнього столу на 'стіл з льоду' у функції Erase and Replace від Runway ML.

Заміна домашнього столу на ‘стіл з льоду’ у функції Erase and Replace від Runway ML.

Як і Imagic (див. нижче), Erase and Replace орієнтований на об’єкти – ви не можете просто видалити “пусту” частину зображення і заповнити її результатом вашого текстового запиту; у цьому випадку система просто відстежує найближчий видимий об’єкт уздовж лінії зору маски (наприклад, стіну або телевізор) і застосовує перетворення там.

Як вказує назва, ви не можете ін'єкціювати об'єкти в порожній простір у Erase and Replace. Тут спроба викликати найбільш відомого з Сітхів лордів призводить до дивної вадер-пов'язаної фрески на телевізорі, приблизно там, де була намальована область заміни.

Як вказує назва, ви не можете ін’єкціювати об’єкти в порожній простір у Erase and Replace. Тут спроба викликати найбільш відомого з Сітхів лордів призводить до дивної вадер-пов’язаної фрески на телевізорі, приблизно там, де була намальована область заміни.

Важко сказати, чи функція Erase and Replace ухиляється від використання авторських зображень (які все ще в основному заблоковані, хоча з різним ступенем успіху, у DALL-E 2), чи модель, використовувана в рушії рендерингу, просто не оптимізована для цього типу завдань.

Легко непристойна 'Фреска Ніколь Кідман' вказує на те, що (ймовірно) модель розсіювання, використовувана тут, не має систематичної відмови в рендерингу реалістичних облич чи еротичного контенту, як це було раніше в DALL-E 2, тоді як результати спроб викликати авторські роботи варіюються від двозначних ('ксеноморф') до абсурдних ('залізний трон'). Внизу праворуч - джерельне зображення.

Легко непристойна ‘Фреска Ніколь Кідман’ вказує на те, що (ймовірно) модель розсіювання, використовувана тут, не має систематичної відмови в рендерингу реалістичних облич чи еротичного контенту, як це було раніше в DALL-E 2, тоді як результати спроб викликати авторські роботи варіюються від двозначних (‘ксеноморф’) до абсурдних (‘залізний трон’). Внизу праворуч – джерельне зображення.

Було б цікаво дізнатися, які методи використовує Erase and Replace для ізоляції об’єктів, які вона може замінити. Ймовірно, зображення проходить через деяку похідну від CLIP, з дискретними елементами, виділеними за допомогою розпізнавання об’єктів і подальшої семантичної сегментації. Жодна з цих операцій не працює майже так само добре в звичайній установці Stable Diffusion.

Але нічого не є досконалим – іноді система видається видаленням, а не заміною, навіть коли (як ми бачили вище), підлеглий механізм рендерингу точно знає, що означає текстовий запит. У цьому випадку виявляється неможливим перетворити кофейний столик на ксеноморфа – замість цього столик просто зникає.

Страшніша ітерація 'Де Вальдо', оскільки Erase and Replace не виробляє інопланетянина.

Страшніша ітерація ‘Де Вальдо’, оскільки Erase and Replace не виробляє інопланетянина.

Erase and Replace видається ефективною системою заміни об’єктів з чудовим заповненням. Однак вона не може редагувати існуючі сприйняті об’єкти, а лише замінює їх. Фактично змінити існуючий вміст зображення без компрометації навколишнього матеріалу – це доволі складне завдання, пов’язане з тривалими зусиллями сектору комп’ютерного бачення щодо розрізнення у різних латентних просторах популярних фреймворків.

Imagic

Це завдання Imagic вирішує. Нова стаття пропонує численні приклади редагувань, які успішно змінюють окремі аспекти фотографії, залишаючи решту зображення нечутливим.

У Imagic змінені зображення не страждають від характерного розтягування, спотворення та 'вгадування окулювання', властивих ляльковому глибокому фейкові, який використовує обмежені апріорні знання, отримані з одного зображення.

У Imagic змінені зображення не страждають від характерного розтягування, спотворення та ‘вгадування окулювання’, властивих ляльковому глибокому фейкові, який використовує обмежені апріорні знання, отримані з одного зображення.

Система використовує триступеневий процес – оптимізацію текстового вкладення; тонку настройку моделі; і, нарешті, генерацію зміненого зображення.

Imagic кодує текстовий запит для отримання початкового текстового вкладення, а потім оптимізує результат, щоб отримати вхідне зображення. Після цього генеративна модель донастроюється до джерельного зображення, додаючи ряд параметрів, перш ніж піддаватися запитовій інтерполяції.

Imagic кодує текстовий запит для отримання початкового текстового вкладення, а потім оптимізує результат, щоб отримати вхідне зображення. Після цього генеративна модель донастроюється до джерельного зображення, додаючи ряд параметрів, перш ніж піддаватися запитовій інтерполяції.

Не дивно, що фреймворк заснований на архітектурі тексту до відео Google’s Imagen, хоча дослідники заявляють, що принципи системи є загально застосовними до моделей латентного розсіювання.

Imagen використовує трирівневу архітектуру, а не сімрівневий масив, використовуваний для останньої ітерації тексту до відео цього програмного забезпечення. Три окремі модулі складаються з генеративної моделі розсіювання, що працює на роздільній здатності 64×64 пікселів; моделі супер-роздільної здатності, яка масштабує цей вивід до 256×256 пікселів; і додаткової моделі супер-роздільної здатності, яка виводить усе до роздільної здатності 1024×1024 пікселів.

Imagic втручається на найпершому етапі цього процесу, оптимізуючи запитане текстове вкладення на стадії 64 пікселів за допомогою оптимізатора Adam з статичним швидким темпом навчання 0,0001.

Майстер-клас з розрізнення: ті, хто намагався змінити щось так просте, як колір відтвореного об'єкта в моделі розсіювання, ГАН або NeRF, знає, наскільки значущим є те, що Imagic може виконувати такі перетворення без 'розриву' цілісності решти зображення.

Майстер-клас з розрізнення: ті, хто намагався змінити щось так просте, як колір відтвореного об’єкта в моделі розсіювання, ГАН або NeRF, знає, наскільки значущим є те, що Imagic може виконувати такі перетворення без ‘розриву’ цілісності решти зображення.

Тонка настройка відбувається на базовій моделі Imagen, за 1500 кроків на вхідне зображення, умовно на оновленому вкладенні. Водночас другий шар 64 пікселів до 256 пікселів оптимізується паралельно на умовному зображенні. Дослідники зазначають, що подібна оптимізація для останнього шару 256 пікселів до 1024 пікселів має ‘маленький або жодний’ вплив на кінцеві результати, і тому вони не реалізували це.

Стаття зазначає, що процес оптимізації займає приблизно вісім хвилин для кожного зображення на подвійних чітах TPUV4. Остаточний рендер відбувається в ядрі Imagen за схемою зразків DDIM.

У спільному з подібними процесами тонкої настройки для Google’s DreamBooth отримані вкладення можна додатково використовувати для стилізації, а також для фотореалістичних редагувань, які містять інформацію, отриману з більш широкої бази даних, що живить Imagen (оскільки, як показує перший стовпець нижче, джерельні зображення не мають жодного необхідного вмісту для виконання цих перетворень).

Гнучкий фотореалістичний рух і редагування можна викликати за допомогою Imagic, тоді як отримані і розрізнені коди, отримані в процесі, можуть бути використані для стилізованого виводу.

Гнучкий фотореалістичний рух і редагування можна викликати за допомогою Imagic, тоді як отримані і розрізнені коди, отримані в процесі, можуть бути використані для стилізованого виводу.

Дослідники порівняли Imagic з попередніми роботами SDEdit, підходом на основі ГАН 2021 року, спільної роботи між Стенфордським університетом і Університетом Карнегі-Меллон; і Text2Live, спільної роботи з квітня 2022 року між Інститутом наук імені Вейцмана та NVIDIA.

Візуальне порівняння між Imagic, SDEdit і Text2Live.

Візуальне порівняння між Imagic, SDEdit і Text2Live.

Чисто зрозуміло, що попередні підходи борються, але в нижньому ряду, який включає в себе масштабну зміну пози, чинні системи повністю не спроможні до перефігурації джерельного матеріалу порівняно з помітним успіхом Imagic.

Вимоги Imagic до ресурсів і часу навчання на зображення, хоча й короткі за стандартами таких занять, роблять його малоймовірним включенням до локальної програми редагування зображень на персональних комп’ютерах – і неясно, до якої міри процес тонкої настройки можна масштабувати до рівня споживачів.

Як воно є, Imagic – це вражаюча пропозиція, яка більше підходить для API – середовища, у якому Google Research, обережний щодо критики щодо сприяння глибокому фейкові, може бути найбільш комфортним.

 

Перша публікація 18 жовтня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai