Погляд Anderson

Створення.Custom Генеративної Суперницької Мережі З Нарисами

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Університету Карнегі-Меллона та Массачусетського технологічного інституту розробили нову методику, яка дозволяє користувачеві створити власну систему генерації зображень за допомогою генеративної суперницької мережі (GAN) просто малюючи вказівні нариси.

Система такого типу могла б дозволити кінцевому користувачеві створювати системи генерації зображень, здатні генерувати дуже конкретні зображення, такі як конкретні тварини, типи будівель – і навіть окремих людей. Наразі більшість систем генерації GAN створюють широкі та досить випадкові результати, з обмеженою можливістю вказівки конкретних характеристик, таких як порода тварини, типи волосся у людей, стилі архітектури або фактичні обличчя.

Підхід, викладений у статті “Нарисуй свою власну GAN”, використовує новий інтерфейс малювання як ефективну функцію пошуку для пошуку ознак і класів у великих базах даних зображень, які можуть містити тисячі типів об’єктів, включаючи багато підтипів, які не мають стосунку до намірів користувача. GAN потім тренується на цьому фільтрованому підмножині зображень.

Малюючи конкретний тип об’єкта, з яким користувач хоче калібрувати GAN, генераційна здатність системи спеціалізується на цьому класі. Наприклад, якщо користувач хоче створити систему, яка генерує конкретний тип кота (а не просто кота, як можна отримати за допомогою This Cat Does Not Exist), його вхідні нариси служать фільтром для виключення некоректних класів котів.

 

Джерело: https://peterwang512.github.io/GANSketching/

Джерело: https://peterwang512.github.io/GANSketching/

Дослідження очолює Шенг Ю-Ван з Університету Карнегі-Меллона, разом з колегою Джун-Ян Чжу та Девідом Бау з Лабораторії комп’ютерних наук та штучного інтелекту Массачусетського технологічного інституту.

Сам метод називається “GAN-малювання” і використовує вхідні нариси для прямого зміни ваги “шаблонної” моделі GAN для конкретної цілі або підцілі через крос-доменну суперницьку втрату.

Було досліджено різні методи регуляризації для забезпечення того, щоб результати були різноманітними, при збереженні високої якості зображення. Дослідники створили зразкові програми, які можуть інтерполювати латентний простір і проводити процедури редагування зображень.

Це [$class] Не Існує

Системи генерації зображень на основі GAN стали модою, якщо не мемом, за останні кілька років, з появою проекту проектів, здатних генерувати зображення неіснуючих речей, включаючи людей, орендовані квартири, закуски, ноги, коней, політиків і комах, серед інших.

Системи генерації зображень на основі GAN створюються шляхом компіляції або кураторства великих наборів даних, що містять зображення з цільової області, таких як обличчя або коні; тренування моделей, які узагальнюють ряд ознак по всім зображенням у базі даних; та реалізації генераторних модулів, які можуть виводити випадкові приклади на основі вивчених ознак.

Вихід з нарисів у DeepFacePencil, який дозволяє користувачам створювати фотореалістичні обличчя з нарисів. Багато подібних проектів існує.

Вихід з нарисів у DeepFacePencil, який дозволяє користувачам створювати фотореалістичні обличчя з нарисів. Багато подібних проектів існує.

Високовимірні ознаки є серед перших, які конкретизуються під час процесу тренування, і еквівалентні першим широким мазкам фарби на полотні. Ці високовимірні характеристики згодом корелюють з більш детальними ознаками (наприклад, блиском у очах і гострими вусами кота, а не просто загальним бежевим плямом, що представляє голову).

Я Розумію, Що Ви Маєте На Умі…

Відображаючи взаємозв’язок між цими ранніми семінальними формами та кінцевими детальними інтерпретаціями, які отримуються значно пізніше в процесі тренування, можна зробити висновок про взаємозв’язок між “неясними” та “конкретними” зображеннями, що дозволяє користувачам створювати складні та фотореалістичні зображення з грубих мазків.

Нещодавно NVIDIA випустила десктопну версію своєї довгострокової дослідницької роботи GauGAN щодо генерації ландшафтів на основі GAN, яка легко демонструє цей принцип:

Приблизні мазки перекладаються у багатий ландшафт через GauGAN та现在 NVIDIA Canvas. Джерело: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Приблизні мазки перекладаються у багатий ландшафт через GauGAN та现在 NVIDIA Canvas. Джерело: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Аналогічно, декілька систем, таких як DeepFacePencil, використовували той же принцип для створення генераторів фотореалістичних зображень, індукованих нарисами, для різних областей.

Архітектура DeepFacePencil.

Архітектура DeepFacePencil.

Упрощення Нарису-В-Зображення

Новий підхід GAN-малювання спрямований на усунення великого тягаря збору та кураторства даних, який зазвичай включений у розвиток систем генерації зображень GAN, шляхом використання вхідних даних користувача для визначення підмножини зображень, яка повинна скласти тренувальні дані.

Система була розроблена так, щоб вимагати лише невелику кількість вхідних нарисів для калібрування системи. Система фактично перевертає функціональність PhotoSketch, спільної дослідницької ініціативи 2019 року дослідників з Університету Карнегі-Меллона, Adobe, Uber ATG та Argo AI, яка включена у нову роботу. PhotoSketch був розроблений для створення художніх нарисів з зображень, і вже містить ефективне відображення відносин між створенняєю та конкретною створенням зображень.

Для генерації частини процесу новий метод змінює лише ваги StyleGAN2. Оскільки використовувані дані зображень являють собою лише підмножину всіх доступних даних, зміна лише мережі відображення дає бажані результати.

Метод був оцінений на декількох популярних підобластях, включаючи кінську, церкви та котів.

Набір даних LSUN Університету Принстона 2016 року був використаний як основний матеріал, з якого можна було отримати цільові підобласті. Для створення системи малювання, яка є стійкою до ексцентриків реального входу користувача, система тренується на зображеннях з набору даних QuickDraw, розробленого Microsoft між 2021-2016 роками.

Хоча система малювання між PhotoSketch та QuickDraw досить різні, дослідники виявили, що їхня система успішно працює на відносно простих позах, хоча більш складні пози (наприклад, коти, що лежать) виявилися більш складними, а надто абстрактний вхід користувача (наприклад, надто грубі малюнки) також погіршує якість результатів.

Латентний Простір та Редагування Зображень

Дослідники розробили дві програми на основі основної роботи: редагування латентного простору та редагування зображень. Редагування латентного простору пропонує інтерпретовані засоби керування, які здійснюються під час тренування, і дозволяють широкий ступінь варіації, залишаючись вірними цільовій області, і приємно узгоджені по всім варіаціям.

Гладке інтерполяція латентного простору з допомогою моделей GAN-малювання.

Гладке інтерполяція латентного простору з допомогою моделей GAN-малювання.

Компонент редагування латентного простору був сповнений проектом GANSpace 2020 року, спільною ініціативою Університету Аалто, Adobe та NVIDIA.

Одне зображення також можна подати на вхід до налаштованої моделі, що дозволяє природне редагування зображень. У цій програмі одне зображення проектується на налаштовану GAN, не тільки дозволяючи прямого редагування, але також зберігаючи вищу латентну редагування, якщо це також було використано.

Тут реальне зображення було використано як вхід до GAN (модель кота), яке редагує вхід, щоб відповідати наданим нарисам. Це дозволяє редагування зображень через малювання.

Тут реальне зображення було використано як вхід до GAN (модель кота), яке редагує вхід, щоб відповідати наданим нарисам. Це дозволяє редагування зображень через малювання.

Хоча система налаштовується, вона не призначена для роботи в реальному часі,至少 у термінах тренування та калібрування. Потрібно 30 000 ітерацій тренування GAN-малювання. Система також вимагає доступу до оригінальних тренувальних даних для оригінальної моделі.

У випадках, коли набір даних відкритий, і має ліцензію, яка дозволяє локальне копіювання, це можна забезпечити шляхом включення джерельних даних у локально встановлений пакет, хоча це займе значний об’єм дискового простору; або шляхом доступу або обробки даних віддалено, через хмарний підхід, який вводить мережеві витрати та (у разі обробки фактично відбувається на хмарі) можливо витрати на обчислення.

Трансформації з налаштованих моделей FFHQ, тренованих лише на 4 людських нарисах. Трансформації з налаштованих моделей FFHQ, тренованих лише на людських нарисах.[/caption>

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai