Unghiul lui Anderson

Reshaping Corpului Uman Cu Ajutorul Inteligenței Artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă colaborare de cercetare din China oferă o metodă inovatoare de a reshapă corpul uman în imagini, prin utilizarea unei rețele neuronale twin coordonate, ghidate de un model parametric, care permite unui utilizator să modifice greutatea, înălțimea și proporțiile corpului într-un mediu interactiv.

Modulare parametrică a formei corpului, cu slider-uri care modifică cele trei caracteristici disponibile. Sursă: https://arxiv.org/pdf/2203.10496.pdf

Modulare parametrică a formei corpului, cu slider-uri care modifică cele trei caracteristici disponibile. Sursă: https://arxiv.org/pdf/2203.10496.pdf

Lucrarea oferă mai multe îmbunătățiri față de un proiect similar recent de la Alibaba, întrucât poate modifica convingător înălțimea și proporțiile corpului, precum și greutatea, și are o rețea neurală dedicată pentru “inpainting” fundalului (non-existent) care poate fi revelat de imagini cu corp “slab”. De asemenea, îmbunătățește o metodă parametrică anterioară pentru reshaparea corpului prin eliminarea necesității de intervenție umană extinsă în timpul formulării transformării.

Denominat NeuralReshaper, noua arhitectură ajustează un șablon parametric 3D uman la o imagine sursă, și apoi utilizează distorsiunile șablonului pentru a adapta imaginea originală la noile parametri.

Sistemul poate gestiona transformări ale corpului pe figuri îmbrăcate, precum și pe figuri semi-îmbrăcate (de exemplu, îmbrăcăminte de plajă).

Transformări de acest tip sunt în prezent de un interes intens pentru sectorul de cercetare fashion AI, care a produs o serie de platforme bazate pe StyleGAN/CycleGAN și rețele neuronale generale pentru încercări virtuale care pot adapta articolele de îmbrăcăminte la forma și tipul corpului unei imagini transmise de utilizator, sau care pot ajuta la conformitatea vizuală.

Articolul paper se intitulează Single-image Human-body Reshaping with Deep Neural Networks și provine de la cercetători de la Universitatea Zhejiang din Hangzhou și Școala de Media Creative de la Universitatea Orașului Hong Kong.

Ajustarea SMPL

NeuralReshaper utilizează modelul Skinned Multi-Person Linear (SMPL) dezvoltat de Institutul Max Planck pentru Sisteme Intelligente și casa de efecte vizuale Industrial Light and Magic în 2015.

Oameni parametrici SMPL din colaborarea Planck/ILM din 2015. Sursă: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Oameni parametrici SMPL din colaborarea Planck/ILM din 2015. Sursă: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

În prima etapă a procesului, un model SMPL este generat dintr-o imagine sursă la care se dorește a fi efectuate transformări ale corpului. Adaptarea modelului SMPL la imagine urmează metodologia metodei Human Mesh Recovery (HMR) propusă de universități din Germania și SUA în 2018.

Cei trei parametri pentru deformare (greutate, înălțime, proporție a corpului) sunt calculați în această etapă, împreună cu o considerare a parametrilor camerei, cum ar fi lungimea focală. Punctele cheie 2D și alinierea siluetei generate oferă încadrarea pentru deformare sub forma unei siluete 2D, o măsură de optimizare suplimentară care crește acuratețea limitei și permite o “inpainting” autentică a fundalului în etapele ulterioare ale pipeline-ului.

Etapele ajustării SMPL: stânga, imaginea sursă; a doua de la stânga, rezultatul optimizării obținut prin metoda descrisă în cercetarea din 2016 condusă de Institutul Max Planck pentru Sisteme Intelligente; a treia de la stânga, un rezultat direct de inferență din modelul pre-antrenat pentru Recuperarea Formei și Poziției Umane; a doua de la dreapta, rezultatele obținute după optimizarea punctelor cheie 2D; și, în final, dreapta, ajustarea completă după optimizarea siluetei (vezi mai sus).

Etapele ajustării SMPL: stânga, imaginea sursă; a doua, rezultatul optimizării obținut prin metoda descrisă în cercetarea din 2016 condusă de Institutul Max Planck pentru Sisteme Intelligente; a treia, un rezultat direct de inferență din modelul pre-antrenat pentru Recuperarea Formei și Poziției Umane; a patra, rezultatele obținute după optimizarea punctelor cheie 2D; și, în final, a cincea, ajustarea completă după optimizarea siluetei (vezi mai sus).

Deformarea 3D este apoi proiectată în spațiul de imagine al arhitecturii pentru a facilita un câmp de deformare dens care va defini deformarea. Acest proces durează aproximativ 30 de secunde pe imagine.

Arhitectura NeuralReshaper

NeuralReshaper rulează două rețele neuronale în tandem: un encoder pentru corp care generează forma corpului transformat, și un encoder pentru fundal care se concentrează pe umplerea “de-occlusă” a regiunilor de fundal (în cazul, de exemplu, al slăbirii unui corp – vezi imaginea de mai jos).

Cadrul în stil U-net integrează ieșirile din caracteristicile celor două encodere înainte de a trece rezultatul la un encoder unificat care produce, în final, o imagine nouă din cele două intrări. Arhitectura prezintă un mecanism de ghidare a deformării pentru a permite integrarea.

Antrenament și Experimente

NeuralReshaper este implementat în PyTorch pe un singur GPU NVIDIA 1080ti cu 11gb de VRAM. Rețeaua a fost antrenată pentru 100 de epoci sub optimizerul Adam, cu generatorul setat la o pierdere țintă de 0,0001 și discriminatorul la o pierdere țintă de 0,0004. Antrenamentul a avut loc pe un batch size de 8 pentru un set de date outdoor proprietar (extras din COCO, MPII și LSP), și 2 pentru antrenament pe setul de date DeepFashion.

În stânga, imaginile originale, în dreapta, ieșirile reproportionate ale NeuralReshaper.

În stânga, imaginile originale, în dreapta, ieșirile reproportionate ale NeuralReshaper.

Mai jos sunt câteva exemple exclusiv din setul de date DeepFashion, antrenat pentru NeuralReshaper, cu imaginile originale întotdeauna în stânga.

Cele trei atribute controlabile sunt separate, și pot fi aplicate separat.

Transformările pe setul de date derivat outdoor sunt mai provocatoare, deoarece frecvent necesită umplerea fundalului complex și delimitarea clară și convingătoare a tipurilor de corp transformate:

Necesitatea Parametrică

Așa cum observă articolul, transformările de imagine de acest tip reprezintă o problemă slab pusă în sinteza de imagini. Multe cadre GAN și encoder pot utiliza imagini pereche (cum ar fi proiectele diverse proiectate pentru a efectua transformări schiță>fotografie și fotografie>schiță).

În cazul de față, ar fi necesar să se utilizeze perechi de imagini care prezintă aceleași persoane în configurații fizice diferite, cum ar fi imaginile “înainte și după” din reclamele de dietă sau chirurgie plastică – date care sunt greu de obținut sau generate.

Alternativ, rețelele GAN pot fi antrenate pe date mult mai diverse și pot efectua transformări prin căutarea direcției latente între codul latent al imaginii sursă și clasa dorită (în acest caz ‘gras’, ‘slab’, ‘înalt’, etc.). Cu toate acestea, această abordare este în prezent prea limitată pentru scopurile de reshapare fină a corpului.

Câmpurile de Radianță Neurală (NeRF) sunt mult mai avansate în simularea corpului complet decât majoritatea sistemelor bazate pe GAN, dar rămân specifice scenei și consumatoare de resurse, cu o capacitate actuală foarte limitată de a edita tipurile de corp în modul granular pe care NeuralReshaper și proiectele anterioare încearcă să îl abordeze (cu excepția scalării întregului corp în raport cu mediul său).

Spațiul latent al GAN-ului este greu de guvernat; VAE-urile singure nu abordează încă complexitățile reproducerii complete a corpului; și capacitatea NeRF de a remodela în mod constant și realist corpul uman este încă în stadiu incipient. Prin urmare, incorporarea metodelor “tradiționale” CGI, cum ar fi SMPL, pare să continue în sectorul de cercetare a sintezei de imagini umane, ca o metodă de a corala și consolida caracteristici, clase și coduri latente ale căror parametri și exploatare nu sunt încă pe deplin înțelese în aceste tehnologii emergente.

 

Publicat pentru prima dată pe 31 martie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai