Погляд Anderson

Створення повних тіла Deepfakes шляхом поєднання декількох NeRFs

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідницька галузь синтезу зображень густо усіяна новими пропозиціями систем, здатних створювати повне тіло відео та зображення молодих людей – переважно молодих жінок – у різних типах одягу. Більшість згенерованих зображень статичні; іноді представлення навіть рухаються, хоча зазвичай не дуже добре.

Темп цієї конкретної дослідницької нитки гладкий у порівнянні з поточним дезорієнтуючим рівнем прогресу в пов’язаних галузях, таких як латентні дифузійні моделі; проте дослідницькі групи, більшість з яких розташована в Азії, продовжують наполегливо працювати над проблемою.

Одна з десятків, якщо не сотень запропонованих або напівзапущених систем 'віртуальної примерки', за останні 10-15 років, де тіла оцінюються через машинне навчання-об'єкт розпізнавання та адаптовані до запропонованих предметів одягу. Джерело: https://www.youtube.com/watch?v=2ZXrgGyhbak

Одна з десятків, якщо не сотень запропонованих або напівзапущених систем ‘віртуальної примерки’, за останні 10-15 років, де тіла оцінюються через машинне навчання-об’єкт розпізнавання та адаптовані до запропонованих предметів одягу. Джерело: https://www.youtube.com/watch?v=2ZXrgGyhbak

Мета полягає в створенні нових систем для забезпечення ‘віртуальної примерки’ для модної та одягу ринків – систем, які можуть адаптуватися як до клієнта, так і до конкретного продукту, який зараз доступний або скоро буде випущений, без незграбності реального часу надкладення одягу, або необхідності просити клієнтів надіслати трохи нецільові зображення для ML-основаних конвеєрів рендерингу.

Не одна з популярних синтезних архітектур не здається легко адаптованою до цього завдання: латентний простір Генеративних Адверсаріальних Мереж (GAN) не підходить для виробництва переконливого тимчасового руху (або навіть для редагування загалом); хоча здатні генерувати реалістичний рух людини, Нейронні Радіансні Площі (NeRF) зазвичай природно стійкі до типу редагування, який би був необхідний для ‘заміни’ людей або одягу за бажанням; автоенкодери потребували б обтяжливої особа/одяг-специфічної підготовки; а латентні дифузійні моделі, як і GAN, не мають нативних тимчасових механізмів для генерації відео.

EVA3D

Все ж таки, статті та пропозиції продовжуються. Остання є незвичайної цікавості в іншому нерозрізненному та виключно бізнес-орієнтованому напрямку досліджень.

EVA3D, з Наньянського технологічного університету Сінгапуру, є першою ознакою підходу, який довго приходив – використання багатьох Нейронних Радіансних Площ мереж, кожна з яких присвячена окремій частині тіла, і які потім складаються в зібрану та цілісну візуалізацію.

Мобільна молода жінка, складена з декількох NeRF мереж, для EVA3D. Джерело: https://hongfz16.github.io/projects/EVA3D.html

Мобільна молода жінка, складена з декількох NeRF мереж, для EVA3D. Джерело: https://hongfz16.github.io/projects/EVA3D.html

Результати, у термінах руху, є… нормальними. Хоча візуалізації EVA3D не виходять з долини незручності, вони можуть хоча б бачити з’їзд з місця, де вони стоять.

Що робить EVA3D видатним, то те, що дослідники за ним, майже унікально в галузі повного тіла синтезу зображень, усвідомили, що одна мережа (GAN, NeRF або інша) не зможе обробити редагування та гнучке повне тіло генерації для деяких років – частково через темп досліджень, і частково через апаратні та інші логістичні обмеження.

Отже, команда Наньяну розділила завдання на 16 мереж і декілька технологій – підхід, вже прийнятий для нейронного рендерингу міських середовищ у Block-NeRF і CityNeRF, і який здається ймовірним і потенційно плідним пів-мірою для досягнення повного тіла Deepfakes у наступні п’ять років, залежно від нових концептуальних або апаратних розробок.

Не всі виклики, присутні при створенні цього типу ‘віртуальної примерки’, є технічними або логістичними, і стаття описує деякі даних проблем, особливо щодо несупервізованого навчання:

‘[Модні] набори даних переважно мають дуже обмежені людські пози (більшість з них подібні стоячі пози), і високо несбалансовані оглядові кути (більшість з них передні огляди). Ця несбалансована 2D розподіл даних міг би перешкоджати несупервізованому навчанню 3D GAN, що призводить до труднощів у новому виді/позі синтезі. Отже, потрібна правильна стратегія навчання для пом’якшення проблеми.’

Робочий процес EVA3D розбиває людське тіло на 16 окремих частин, кожна з яких генерується через свою власну NeRF мережу. Очевидно, це створює достатньо ‘незаморожених’ секцій, щоб бути здатними галванізувати фігуру через рухову захоплення або інші типи рухових даних. Окрім цього переваги, проте, це також дозволяє системі призначити максимальні ресурси для частин тіла, які ‘продають’ загальне враження.

Наприклад, людські ноги мають дуже обмежений діапазон артикуляції, тоді як автентичність обличчя та голови, окрім якості всього руху тіла загалом, ймовірно, буде фокусним токеном автентичності для рендерингу.

Якість порівняння між EVA3D і попередніми методами. Автори стверджують SOTA результати в цьому відношенні.

Якість порівняння між EVA3D і попередніми методами. Автори стверджують SOTA результати в цьому відношенні.

Підхід радикально відрізняється від NeRF-центричного проекту, до якого він концептуально пов’язаний – 2021 року A-NeRF, з Університету Британської Колумбії та Reality Labs Research, який намагався додати внутрішній контрольований скелет до іншої конвенційної ‘одної частини’ NeRF представлення, роблячи його більш важким для розподілу обробних ресурсів до різних частин тіла на основі потреби.

Попередні рухи – A-NeRF облаштовує 'запечатаний' NeRF з тим же типом гнучкого та артикульованого центрального ригінгу, який індустрія VFX давно використовує для анімації CGI персонажів. Джерело: https://lemonatsu.github.io/anerf/

Попередні рухи – A-NeRF облаштовує ‘запечатаний’ NeRF з тим же типом гнучкого та артикульованого центрального ригінгу, який індустрія VFX давно використовує для анімації CGI персонажів. Джерело: https://lemonatsu.github.io/anerf/

У спільному з більшості подібних людських проектів, які намагаються використати латентний простір різних популярних підходів, EVA3D використовує Skinned Multi-Person Linear Model (SMPL), ‘традиційний’ CGI-оснований метод для додавання інструментальності до загальної абстракції поточних синтезних методів. Раніше цього року інша стаття, цього разу з Університету Чжецзяна в Ханчжоу, та Школи Креативних Медіа в Міському Університеті Гонконгу, використовувала такі методи для виконання нейронної зміни тіла.

Якість результатів EVA3D на DeepFashion.

Якість результатів EVA3D на DeepFashion.

Метод

Модель SMPL, використана в процесі, налаштована на людський ‘пріор’ – людину, яка, по суті, добровільно глибоко фейкова EVA3D, і її ваги шкіряного покриву ведуть розбіжності між канонічним простором (тобто ‘відпочинок’, або ‘нейтральна’ поза SMPL моделі) і тим, як остаточна поява відображається.

Концептуальний робочий процес для EVA3D. Джерело: https://arxiv.org/pdf/2210.04888.pdf

Концептуальний робочий процес для EVA3D. Джерело: https://arxiv.org/pdf/2210.04888.pdf

Як видно на ілюстрації вище, обмежувальні коробки SMPL використовуються як визначення меж для 16 мереж, які в кінцевому підсумку складуть тіло. Обернений Лінійна Бленд Скіннінг (LBS) алгоритм SMPL потім використовується для перенесення видимих вибіркових променів до канонічного (пасивної пози) простору. Потім 16 субмереж викликаються на основі цих конфігурацій і в кінцевому підсумку сформовані в остаточну візуалізацію.

Ціла NeRF композит використовується для створення 3D людської GAN рамки.

Візуалізації другої стадії GAN рамки в кінцевому підсумку будуть навчені проти справжніх 2D зображень людей/моди.

Візуалізації другої стадії GAN рамки в кінцевому підсумку будуть навчені проти справжніх 2D зображень людей/моди.

Кожна субмереж, що представляє частину людського тіла, складається зі стекових Багатошарових Перцептронів (MLP) з SIREN (Синусоїдальним Представленням Мереж) активацією. Хоча SIREN вирішує багато проблем у робочому процесі, подібному до цього, і в подібних проектах, він схильний до надмірної адаптації, а не узагальнення, і дослідники пропонують, що альтернативні бібліотеки можуть бути використані в майбутньому (див. кінець статті).

Дані, Навчання та Тести

EVA3D стикається з незвичайними проблемами даних, через обмеження та шаблоновані стиль поз, які доступні у модних наборах даних, які схильні до відсутності альтернативних або нових поглядів, і є, можливо, намерено повторюваними, щоб сфокусувати увагу на одязі, а не на людині, яка її носить.

Через цю несбалансовану розподілення поз, EVA3D використовує людські пріори (див. вище) на основі геометрії шаблону SMPL, і потім передбачає Відстань Поле (SDF) зміщення цієї пози, а не прямої цільової пози.

Для підтримки експериментів дослідники використовували чотири набори даних: DeepFashion; SHHQ; UBCFashion; і AIST Dance Video Database (AIST Dance DB).

Останні два містять більш різноманітні пози, ніж перші два, але представляють ті самі особи повторно, що скасовує цю різноманітність; коротко кажучи, дані більш ніж складні, враховуючи завдання.

Приклади з SSHQ. Джерело: https://arxiv.org/pdf/2204.11823.pdf

Приклади з SSHQ. Джерело: https://arxiv.org/pdf/2204.11823.pdf

Базові лінії, використані для порівняння, були ENARF-GAN, перший проект, який відображає NeRF візуальні ефекти з 2D зображень; Стенфордський та NVIDIA (NVDA ) EG3D; і StyleSDF, співпраця між Університетом Вашингтону, Adobe (ADBE ) Research та Стенфордським Університетом – всі методи, які вимагають супер-розрішувальних бібліотек для масштабування від рідної до високої роздільної здатності.

Метрики, прийняті для порівняння, були спірними Frechet Inception Distance (FID) і Kernel Inception Distance (KID), разом з Відсотком Правильних Ключових Пунктів (PCKh@0.5).

У кількісних оцінках EVA3D лідирував на всіх метриках у чотирьох наборах даних:

Кількісні результати.

Кількісні результати.

Дослідники відзначають, що EVA3D досягає найнижчої помилкової швидкості для геометричного рендерингу, критичного чинника у проекті цього типу. Вони також спостерігають, що їх система може контролювати згенеровану позу та досягти вищої оцінки PCKh@0.5, на відміну від EG3D, єдиної конкуруючої методики, яка набула вищу оцінку в одному категорії.

EVA3D працює рідно на стандартній роздільній здатності 512x512px, хоча його можна легко та ефективно масштабувати до HD роздільної здатності шляхом накладення шарів масштабування, як це зробила Google недавно з її 1024 роздільної здатності текст-відео пропозицією Imagen Video.

Метод не позбавлений обмежень. Стаття відзначає, що активація SIREN може спричинити кругові артефакти, які можна виправити в майбутніх версіях шляхом використання альтернативної базової репрезентації, такої як EG3D, у поєднанні з 2D декодером. Крім того, важко точно підігнати SMPL до джерел модних даних.

Нарешті, система не може легко розміщувати більші та більш текучі предмети одягу, такі як великі сукні; одяг цього типу демонструє той самий тип рідинної динаміки, який робить створення нейронно-рендереного волосся таким викликом. Мабуть, відповідне рішення могло б допомогти вирішити обидві проблеми.

 

Перша публікація 12 жовтня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai