Погляд Anderson

Підробка «кращих» тіл за допомогою ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження Академії DAMO Alibaba пропонують робочий процес, керований ШІ, для автоматизації зміни форми зображень тіл — рідкісний проєкт у галузі комп’ютерного зору, яка наразі зайнята маніпуляціями з обличчями такими як deepfake та GAN‑базованим редагуванням обличчя.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Вставка у стовпці «результат», згенеровані карти уваги, які визначають області, що підлягають зміні. Джерело: https://arxiv.org/pdf/2203.04670.pdf

Архітектура дослідників використовує оцінку поз скелету, щоб впоратися з більшою складністю, яку системи синтезу та редагування зображень стикаються при концептуалізації та параметризації існуючих зображень тіл, принаймні до рівня деталізації, що дозволяє здійснювати змістовне та вибіркове редагування.

Оцінені карти скелету допомагають індивідуалізувати та зосереджувати увагу на ділянках тіла, які, ймовірно, будуть підправлені, наприклад, у області верхньої частини руки.

Система в кінцевому підсумку дозволяє користувачеві задавати параметри, які можуть змінювати зовнішній вигляд ваги, м’язової маси або розподілу ваги на повнотових або середньо‑тових фотографіях людей, і здатна генерувати довільні трансформації одягнутих чи безодягнутих ділянок тіла.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Ліворуч — вхідне зображення; посередині — теплова карта отриманих ділянок уваги; праворуч — трансформоване зображення.

Мотивація роботи — розробка автоматизованих робочих процесів, які могли б замінити складні цифрові маніпуляції, що виконуються фотографами та графічними художниками у різних галузях медіа, від моди до журнального формату та рекламних матеріалів.

Загалом, автори зазначають, що ці трансформації зазвичай застосовуються за допомогою технік «warp» у Photoshop та інших традиційних растрових редакторах і майже виключно використовуються для зображень жінок. Внаслідок цього спеціальний набір даних, розроблений для полегшення нового процесу, складається переважно з фотографій жінок:

‘Оскільки ретушування тіла в основному бажане жінками, більшість нашої колекції складається з фотографій жінок, враховуючи різноманітність віку, рас (Африканська:Азіатська:Кавказька = 0.33:0.35:0.32), поз та одягу.’

Стаття paper називається Structure-Aware Flow Generation for Human Body Reshaping і написана п’ятьма авторами, пов’язаними з глобальною Академією DAMO Alibaba.

Розробка набору даних

Як і зазвичай у системах синтезу та редагування зображень, архітектура проєкту потребувала спеціалізованого навчального набору даних. Автори замовили у трьох фотографів створення стандартних маніпуляцій у Photoshop над відповідними зображеннями зі стокового сайту Unsplash, що дало набір даних — названий BR-5K* — з 5 000 високоякісних зображень роздільною здатністю 2K.

Дослідники наголошують, що мета навчання на цьому наборі даних не полягає у створенні «ідеалізованих» та узагальнених ознак, пов’язаних з індексом привабливості чи бажаного вигляду, а скоріше у вилученні центральних карт функцій, пов’язаних з професійними маніпуляціями зображень тіл.

Проте вони визнають, що маніпуляції в кінцевому підсумку відображають трансформаційні процеси, які переходять від «реального» до заданого уявлення про «ідеал»:

‘Ми запросили трьох професійних художників самостійно ретушувати тіла за допомогою Photoshop з метою досягнення струнких фігур, що відповідають популярній естетиці, і обрали найкращу як еталон.’

Оскільки рамка взагалі не працює з обличчями, їх було розмито перед включенням у набір даних.

Архітектура та основні концепції

Робочий процес системи передбачає завантаження портрета високої роздільної здатності, його зменшення до нижчої роздільної здатності, що підходить до доступних обчислювальних ресурсів, та отримання оціненої карти скелету (друге зліва на зображенні нижче), а також полів афінності частин (PAFs), які були винайдені у 2016 році Робототехнічним інститутом Карнегі‑Меллон (дивіться відео, вбудоване нижче).

Поля афінності частин допомагають визначати орієнтацію кінцівок та їх загальну прив’язку до ширшого скелетного каркасу, забезпечуючи новий проєкт додатковим інструментом уваги/локалізації.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

З 2016‑го дослідження Part Affinity Fields, передбачені PAF кодують орієнтацію кінцівки як частину 2‑вимірного вектора, який також включає загальну позицію кінцівки. Джерело: https://arxiv.org/pdf/1611.08050.pdf

Незважаючи на їхню очевидну незначність для зовнішнього вигляду ваги, карти скелету корисні для спрямування кінцевих трансформаційних процесів до ділянок тіла, які потребують корекції, таких як верхні частини рук, сідниці та стегна.

Після цього результати передаються у модуль Structure Affinity Self-Attention (SASA) у центральному вузькому місці процесу (дивіться зображення нижче).

SASA регулює узгодженість генератора потоку, що живить процес; отримані результати потім передаються до модуля викривлення (друге з права на зображенні вище), який застосовує трансформації, вивчені під час навчання на ручних правках, включених у набір даних.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Модуль Structure Affinity Self-Attention (SASA) розподіляє увагу на відповідні ділянки тіла, допомагаючи уникнути зайвих або нерелевантних трансформацій.

Отримане зображення потім підвищується до початкової роздільної здатності 2K, використовуючи процеси, схожі на стандартну архітектуру deepfake 2017‑го року, від якої згодом виникли популярні пакети, такі як DeepFaceLab; процес підвищення роздільної здатності також поширений у фреймворках редагування GAN.

Мережа уваги для схеми змодельована за принципом Compositional De-Attention Networks (CODA), академічної співпраці США/Сінгапуру 2019 року з Amazon (AMZN ) AI та Microsoft.

Тести

Фреймворк, заснований на потоках, був протестований проти попередніх методів, заснованих на потоках, FAL та Animating Through Warping (ATW), а також архітектур перекладу зображень Pix2PixHD та GFLA, використовуючи SSIM, PSNR і LPIPS як метрики оцінки.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Результати первинних тестів (напрямок стрілки в заголовках вказує, чи кращі нижчі чи вищі показники).

Згідно з цими метриками, система авторів перевершує попередні архітектури.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Вибрані результати. Будь ласка, зверніться до оригінального PDF, посилання на який наведено в цій статті, для порівнянь у вищій роздільній здатності.

Окрім автоматичних метрик, дослідники провели дослідження користувачів (остання колонка таблиці результатів, зображена раніше), у якому 40 учасників отримали по 30 випадково обраних запитань з пулу в 100 запитань, що стосуються зображень, створених різними методами. 70 % респондентів віддали перевагу новій техніці як більш «візуально привабливій».

Виклики

Новий документ становить рідкісний крок у напрямку маніпуляцій тілами за допомогою ШІ. Сектор синтезу зображень наразі значно більше зацікавлений у створенні редагованих тіл за допомогою методів, таких як Neural Radiance Fields (NeRF), або ж зосереджений на дослідженні латентного простору GAN‑ів та потенціалу автокодерів для маніпуляцій обличчям.

Ініціатива авторів наразі обмежується створенням змін у сприйманій вазі, і вони не впровадили жодної техніки заповнення, яка могла б відновити фон, що неминуче виявляється при зменшенні ваги на зображенні людини.

Проте вони пропонують, що портретне матування та злиття фону за допомогою текстурного інференсу могли б простим чином вирішити проблему відновлення частин світу, які раніше були приховані на зображенні людською «недосконалістю».

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Запропоноване рішення для відновлення фону, що виявляється внаслідок зменшення ваги за допомогою ШІ.

 

* Хоча препринт посилається на додаткові матеріали, що містять більше деталей про набір даних, а також інші приклади проєкту, місце розташування цих матеріалів не вказано в статті, і відповідний автор ще не відповів на наш запит щодо доступу.

Перший раз опубліковано 10 березня 2022 року.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai