Погляд Anderson
Переформування людських типів тіла за допомогою штучного інтелекту

Нова дослідницька співпраця з Китаю пропонує новий метод переформування людського тіла на зображеннях за допомогою координованої подвійної нейронної мережі, керованої параметричною моделлю, яка дозволяє кінцевому користувачеві модулювати вагу, висоту та пропорції тіла в інтерактивному графічному інтерфейсі.

Параметрична модуляція форми тіла, з повзунками, які змінюють три доступні функції. Джерело: https://arxiv.org/pdf/2203.10496.pdf
Ця робота пропонує кілька покращень над подібним проектом з Alibaba, оскільки вона може переконливо змінювати висоту та пропорції тіла, а також вагу, і має окрему нейронну мережу для “замальовування” (неіснуючого) фону, який може бути відкритим шляхом “зменшення” зображення тіла. Вона також покращує ранню параметричну методу для переформування тіла, видаляючи необхідність у великому втручанні людини під час формування перетворення.
Названа NeuralReshaper, нова архітектура підходить параметричній 3D-шаблону людини до джерельного зображення, а потім використовує спотворення у шаблоні для адаптації оригінального зображення до нових параметрів.
Система здатна обробляти перетворення тіла на одягнених, а також напіводягнених (тобто пляжному) фігурах.
Перетворення цього типу зараз представляють великий інтерес для сектору досліджень моди штучного інтелекту, який створив ряд платформ StyleGAN/CycleGAN та загальних нейронних мереж для віртуальних примерок, які можуть адаптувати доступні речі до форми та типу тіла зображення, наданого користувачем, або інакше допомогти з візуальною конформністю.
Стаття називається Single-image Human-body Reshaping with Deep Neural Networks і походить від дослідників Університету Чжецзян у Ханчжоу та Школи креативних медіа в Міському університеті Гонконгу.
SMPL Fitting
NeuralReshaper використовує Skinned Multi-Person Linear Model (SMPL), розроблений Інститутом інтелектуальних систем імені Макса Планка та відомим домом візуальних ефектів Industrial Light and Magic у 2015 році.

Параметричні люди SMPL з колаборації Planck/ILM 2015 року. Джерело: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
На першому етапі процесу створюється модель SMPL з джерельного зображення, до якого бажано здійснити перетворення тіла. Адаптація моделі SMPL до зображення відбувається згідно з методологією методу Human Mesh Recovery (HMR), запропонованим університетами Німеччини та США у 2018 році.
Три параметри для деформації (вага, висота, пропорції тіла) обчислюються на цьому етапі, разом із урахуванням параметрів камери, таких як фокусна відстань. 2D-ключові точки та згенерована силует-відповідність забезпечують обмеження для деформації у вигляді 2D-силуета, додатковий оптимізаційний захід, який підвищує точність межі та дозволяє аутентичне заповнення фону далі по трубопроводу.

Етапи підгонки SMPL: зліва, джерельне зображення; другий зліва, результат оптимізації, отриманий за допомогою методу, описаного у дослідженні 2016 року під керівництвом Інституту інтелектуальних систем імені Макса Планка; третій зліва, прямий результат висновку з попередньо натренованої моделі для відновлення форми та положення людини; четвертий зліва, результати, отримані після оптимізації 2D-ключових точок; і, нарешті, праворуч, завершена підгонка після оптимізації силуета (див. вище).
Архітектура NeuralReshaper
NeuralReshaper використовує дві нейронні мережі паралельно: передню мережу, яка генерує перетворену форму тіла, та фонову мережу, яка зосереджується на заповненні “деоклюдованих” фонових регіонів (у разі, наприклад, “зменшення” тіла – див. зображення нижче).
Навчання та експерименти
NeuralReshaper реалізовано на PyTorch на одному GPU NVIDIA 1080ti з 11 ГБ відеопам’яті. Мережа була навчена протягом 100 епох під оптимізатором Adam, з генератором, встановленим на цільову втрату 0,0001, та дискримінатором, встановленим на цільову втрату 0,0004. Навчання відбувалося на розмірі партії 8 для пропрієтарної зовнішньої бази даних (відібраної з COCO, MPII та LSP), та 2 для навчання на базі даних DeepFashion.
Нижче наведено приклади виключно з бази даних DeepFashion, натренованої для NeuralReshaper, з оригінальними зображеннями завжди зліва.
Параметрична необхідність
Як зазначено в статті, перетворення одного й того ж типу представляють собою невизначену проблему в синтезі зображень. Багато трансформаційних ГАН та енкодерних рамок можуть використовувати парні зображення (наприклад, різні проекти, призначені для виконання перетворень “ескіз>фото” та “фото>ескіз”).
Однак, у цьому випадку це потребувало би парних зображень, що зображують одних і тих же людей у різних фізичних конфігураціях, таких як “до та після” зображення в рекламі дієти або пластичної хірургії – дані, які важко отримати або згенерувати.
Трансформаційні ГАН-мережі можуть бути натреновані на набагато більш різноманітних даних та здійснювати перетворення, шукаючи напрямок латентного простору між джерельним зображенням (оригінальним кодом латентного простору) та бажаним класом (у цьому випадку “товстим”, “тонким”, “високим” тощо). Однак цей підхід зараз надто обмежений для цілей тонкого переформування тіла.
Підходи Neural Radiance Fields (NeRF) значно більш просунуті у повному тілі симуляції, ніж більшість ГАН-мереж, але залишаються специфічними для сцени та ресурсоємкими, з зараз дуже обмеженою можливістю редагування типів тіла у спосіб, який NeuralReshaper та попередні проекти намагаються вирішити (за винятком масштабування всього тіла вниз відносно його середовища).
Латентний простір ГАН важко керувати; VAE самі по собі ще не звертають увагу на складності повного відтворення тіла; і здатність NeRF постійно та реалістично перебудовувати людські тіла ще в зародковому стані. Тому включення “традиційних” методів CGI, таких як SMPL, схоже, буде продовжуватися в секторі досліджень синтезу людських зображень, як метод коралізації та консолідації функцій, класів та латентних кодів, чиї параметри та експлуатабельність ще не повністю зрозумілі в цих нових технологіях.
Першопубліковано 31 березня 2022 року.

















