Погляд Anderson

Фальшиві “кращі” тіла за допомогою штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження академії Alibaba DAMO пропонують штучно-інтелектуальний робочий процес для автоматизації зміни зображень тіл – рідкісна спроба в галузі комп’ютерного бачення, яка зараз зайнята маніпуляціями з обличчями, такими як deepfakes і редакторами обличчя на основі GAN.

Вставка в колонці 'результат', згенеровані карти уваги, які визначають області для зміни. Джерело: https://arxiv.org/pdf/2203.04670.pdf

Вставка в колонці ‘результат’, згенеровані карти уваги, які визначають області для зміни. Джерело: https://arxiv.org/pdf/2203.04670.pdf

Архітектура дослідників використовує оцінку пози скелета для подолання більшої складності, з якою зіштовхуються системи синтезу та редагування зображень, при спробі концептуалізувати та параметризувати існуючі зображення тіл, принаймні на рівні деталізації, який дозволяє здійснювати значимі та вибіркові редагування.

Оцінка пози скелета допомагає індивідуалізувати та зосередити увагу на частинах тіла, які найчастіше піддаються редагуванню, таких як верхня частина рук.

Система в кінцевому підсумку дозволяє користувачеві встановити параметри, які можуть змінити зовнішній вигляд ваги, м’язової маси або розподілу ваги на повному чи середньому зображенні людини, і здатна генерувати довільні перетворення на одягнених чи неодягнених частинах тіла.

Зліва, вхідне зображення; в середині, теплова карта похідних областей уваги; справа, перетворене зображення.

Зліва, вхідне зображення; в середині, теплова карта похідних областей уваги; справа, перетворене зображення.

Мотивацією для роботи є розвиток автоматизованих робочих процесів, які могли б замінити трудомісткі цифрові маніпуляції, які здійснюються фотографами та художниками графічного дизайну в різних галузях медіа, від моди до публіцистичних матеріалів.

Загалом, автори визнають, що такі перетворення зазвичай застосовуються за допомогою техніки “перетворення” в Photoshop та інших традиційних редакторах растрової графіки, і майже виключно застосовуються до зображень жінок. Отже, спеціально створена база даних для полегшення нового процесу складається переважно з фотографій жінок:

‘Оскільки редагування тіла в основному бажане жінками, більша частина нашої колекції складається з фотографій жінок, враховуючи різноманітність віків, рас (африканська:азіатська:каucasoid = 0,33:0,35:0,32), поз, і одягу.’

Стаття називається Структура-орієнтована генерація потоку для редагування тіла людини і походить від п’яти авторів, пов’язаних з глобальною академією Alibaba DAMO.

Розробка бази даних

Як правило, архітектура проекту вимагала спеціальної навчальної бази даних. Автори замовили трьом фотографам стандартні маніпуляції з зображеннями з сайту Unsplash, в результаті чого була створена база даних – названа BR-5K* – з 5 000 високоякісних зображень розширенням 2K.

Дослідники підкреслюють, що метою навчання на цій базі даних є не створення “ідеалізованих” і узагальнених рис, пов’язаних з індексом привабливості чи бажаного вигляду, а радше витягування центральних картографічних відображень, пов’язаних з професійними маніпуляціями зображеннями тіла.

Однак вони визнають, що маніпуляції в кінцевому підсумку відображають трансформаційні процеси, які відображають перехід від “реального” до попередньо визначеного “ідеального” вигляду:

‘Ми запрошуємо трьох професійних художників редагувати тіло за допомогою Photoshop незалежно, з метою досягнення стрункого вигляду, який відповідає популярній естетиці, і вибираємо найкращий варіант як еталон.’

Оскільки система не займається обличчями зовсім, вони були розмиті перед включенням до бази даних.

Архітектура та основні концепції

Робочий процес системи включає в себе введення високоякісного портрета, зниження роздільної здатності до рівня, який може поміститися в наявні обчислювальні ресурси, і витягування оцінки пози скелета (друге зображення зліва), а також полів спорідненості частин (PAF), які були запропоновані в 2016 році Інститутом робототехніки університету Карнегі-Меллона (див. відео, вставлене нижче).

Поля спорідненості частин допомагають визначити орієнтацію кінцівок і загальну асоціацію з більш широкою скелетною рамкою, забезпечуючи новий проект додатковим інструментом уваги/локалізації.

З паперу 2016 року про поля спорідненості частин, передбачені PAF кодують орієнтацію кінцівок як частину 2D-вектора, який також включає загальну позицію кінцівки. Джерело: https://arxiv.org/pdf/1611.08050.pdf

З паперу 2016 року про поля спорідненості частин, передбачені PAF кодують орієнтацію кінцівок як частину 2D-вектора, який також включає загальну позицію кінцівки. Джерело: https://arxiv.org/pdf/1611.08050.pdf

Незважаючи на їхню очевидну невідповідність зовнішньому вигляду ваги, карти скелета корисні для направлення кінцевих трансформаційних процесів до частин тіла, які підлягають зміні, таких як верхні частини рук, спина і стегна.

Після цього результати подаються до модулю Structure Affinity Self-Attention (SASA) в центральній частині процесу (див. зображення нижче).

Модуль SASA регулює узгодженість генератора потоку, який живить процес, результати якого потім подаються до модуля деформації (другого зправа на зображенні вище), який застосовує трансформації, вивчені під час навчання на ручних редагуваннях, включених до бази даних.

Модуль Structure Affinity Self-Attention (SASA) виділяє увагу відповідним частинам тіла, допомагаючи уникнути зайвих або невідповідних трансформацій.

Модуль Structure Affinity Self-Attention (SASA) виділяє увагу відповідним частинам тіла, допомагаючи уникнути зайвих або невідповідних трансформацій.

Вихідне зображення потім підвищується до початкової роздільної здатності 2K, використовуючи процеси, не схожі на стандартну архітектуру deepfake 2017 року, з якої пізніше були виведені популярні пакети, такі як DeepFaceLab; процес підвищення також поширений у рамках редакторів GAN.

Мережа уваги для схеми змодельована за допомогою Compositional De-Attention Networks (CODA), співробітництво 2019 року між США та Сінгапуром з Amazon AI і Microsoft.

Тести

Флоу-орієнтована структура була протестована проти попередніх флоу-орієнтованих методів FAL і Animating Through Warping (ATW), а також архітектур перекладу зображень Pix2PixHD і GFLA, з SSIM, PSNR і LPIPS як метриками оцінки.

Результати початкових тестів (напрямок стрілки в заголовках вказує, чи нижчі, чи вищі показники кращі).

Результати початкових тестів (напрямок стрілки в заголовках вказує, чи нижчі, чи вищі показники кращі).

На основі цих прийнятих метрик система авторів показала кращі результати, ніж попередні архітектури.

Вибрані результати. Будь ласка, зверніться до оригінального PDF, пов'язаного з цією статтею, для порівняння вищої роздільної здатності.

Вибрані результати. Будь ласка, зверніться до оригінального PDF, пов’язаного з цією статтею, для порівняння вищої роздільної здатності.

Крім автоматичних метрик, дослідники провели дослідження користувачів (остання колонка таблиці результатів, зображена вище), у якому 40 учасників були показані 30 запитань, випадково вибраних з пулу з 100 запитань, пов’язаних з зображеннями, створеними за допомогою різних методів. 70% респондентів віддали перевагу новій техніці як більш “візуально привабливій”.

Виклики

Нова стаття представляє рідкісну спробу штучно-інтелектуальної маніпуляції з тілом. Сектор синтезу зображень зараз значно більше зацікавлений у генерації редагованих тіл за допомогою методів, таких як Neural Radiance Fields (NeRF), або зайнятий дослідженням латентного простору GAN і потенціалу автоенкодерів для маніпуляції обличчями.

Ініціатива авторів зараз обмежена створенням змін у сприйманій вазі, і вони не реалізували жодної техніки інпейнтінгу, яка могла б відновити фон, який був раніше прихований на зображенні людини.

Однак вони пропонують, що портретний матting і змішування фону через текстурну інференцію могли б тривіально вирішити проблему відновлення частин світу, які були раніше приховані на зображенні через “недоліки” людини.

Пропонована рішення для відновлення фону, який відкривається штучно-інтелектуальною редукцією жиру.

Пропонована рішення для відновлення фону, який відкривається штучно-інтелектуальною редукцією жиру.

* Хоча попередня публікація посилається на додатковий матеріал, який містить більше інформації про базу даних, а також додаткові приклади з проекту, місце розташування цього матеріалу не вказано в статті, і відповідальний автор ще не відповів на наш запит щодо доступу.

Опубліковано вперше 10 березня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai