Unghiul lui Anderson

Crearea de deepfakes cu corp întreg prin combinarea mai multor NeRF

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Sectorul de cercetare a sintezei de imagini este plin de noi propuneri pentru sisteme capabile să creeze videoclipuri și imagini cu corp întreg ale tinerilor – în special ale tinerelor femei – în diverse tipuri de îmbrăcăminte. În majoritatea cazurilor, imaginile generate sunt statice; ocazional, reprezentările se mișcă, deși nu de obicei foarte bine.

Ritmul acestei ramuri de cercetare este glacial în comparație cu nivelul actual de progres în domenii conexe, cum ar fi modelele de difuzie latentă; cu toate acestea, grupurile de cercetare, majoritatea din Asia, continuă să lucreze neîncetat la rezolvarea problemei.

Una dintre zecile, dacă nu sutele de sisteme 'virtual try-on' propuse sau lansate parțial, din ultimii 10-15 ani, în care corpurile sunt evaluate prin recunoaștere de obiecte bazate pe învățare automată și adaptate la articolele de îmbrăcăminte propuse. Sursă: https://www.youtube.com/watch?v=2ZXrgGyhbak

Una dintre zecile, dacă nu sutele de sisteme ‘virtual try-on’ propuse sau lansate parțial, din ultimii 10-15 ani, în care corpurile sunt evaluate prin recunoaștere de obiecte bazate pe învățare automată și adaptate la articolele de îmbrăcăminte propuse. Sursă: https://www.youtube.com/watch?v=2ZXrgGyhbak

Scopul este de a crea noi sisteme pentru a permite “încercări virtuale” pentru piața modei și a îmbrăcămintei – sisteme care pot adapta atât clientului, cât și produsului specific care este disponibil sau urmează să fie lansat, fără încetinirea suprapunerii în timp real a îmbrăcămintei, sau nevoia de a cere clienților să trimită poze puțin NSFW pentru conducte de renderizare bazate pe învățare automată.

Niciuna dintre arhitecturile de sinteză populare nu pare ușor de adaptat pentru această sarcină: spațiul latent al Rețelelor Adversative Generative (GAN) este nepotrivit pentru producerea de mișcare temporală convingătoare (sau chiar pentru editare în general); deși capabile de a genera mișcare umană realistă, Câmpurile de Radiație Neurală (NeRF) sunt de obicei natural rezistente la tipul de editare care ar fi necesar pentru a “schimba” oameni sau îmbrăcăminte la dorință; autoencoderii ar necesita antrenament greoi specific persoanei/îmbrăcămintei; și modelele de difuzie latentă, la fel ca GAN-urile, nu au mecanisme temporale native, pentru generarea de videoclipuri.

EVA3D

Cu toate acestea, articolele și propunerile continuă. Cel mai recent este de un interes neobișnuit într-o linie de cercetare în general nedistinsă și exclusiv orientată spre afaceri.

EVA3D, de la Universitatea Tehnică Nanyang din Singapore, este primul indiciu al unei abordări care a fost mult timp în așteptare – utilizarea mai multor rețelelor de Câmpuri de Radiație Neurală, fiecare dintre acestea fiind dedicată unei părți separate a corpului, și care sunt apoi compuse într-o vizualizare asamblată și coerentă.

O femeie tânără mobilă, compusă din mai multe rețele NeRF, pentru EVA3D. Sursă: https://hongfz16.github.io/projects/EVA3D.html

O femeie tânără mobilă, compusă din mai multe rețele NeRF, pentru EVA3D. Sursă: https://hongfz16.github.io/projects/EVA3D.html

Rezultatele, în ceea ce privește mișcarea, sunt…ok. Deși vizualizările EVA3D nu sunt ieșite din “valea neliniștii”, ele pot cel puțin vedea ieșirea de acolo de unde se află.

Ce face EVA3D remarcabil este că cercetătorii din spatele acestuia, aproape unic în sectorul sintezei de imagini cu corp întreg, au realizat că o singură rețea (GAN, NeRF sau altă) nu va fi capabilă să gestioneze generarea de corp întreg editabilă și flexibilă pentru câțiva ani – parțial din cauza ritmului cercetării, și parțial din cauza limitărilor hardware și logistice.

Prin urmare, echipa de la Nanyang a subdivizat sarcina în 16 rețele și tehnologii multiple – o abordare deja adoptată pentru renderizarea neurală a mediilor urbane în Block-NeRF și CityNeRF, și care pare să devină o măsură intermediară din ce în ce mai interesantă și potențial fructuoasă pentru a obține deepfakes cu corp întreg în următorii cinci ani, în așteptarea noilor dezvoltări conceptuale sau hardware.

Nu toate provocările prezentate în crearea acestui tip de “încercare virtuală” sunt tehnice sau logistice, iar articolul descrie unele dintre problemele de date, în special în ceea ce privește învățarea nesupravegheată:

‘[Datele de modă] au în general poze umane foarte limitate (majoritatea sunt poze similare de stat), și unghiuri de vedere foarte dezechilibrate (majoritatea sunt vederi din față). Această distribuție de date 2D dezechilibrată ar putea împiedica învățarea nesupravegheată a GAN-urilor 3D, conducând la dificultăți în sinteza de vedere/poză nouă. Prin urmare, o strategie de antrenament corespunzătoare este necesară pentru a atenua problema.’

Fluxul de lucru EVA3D segmentează corpul uman în 16 părți distincte, fiecare generată prin propria rețea NeRF. Evident, acest lucru creează suficiente secțiuni “dezghețate” pentru a putea galvaniza figura prin captură de mișcare sau alte tipuri de date de mișcare. Pe lângă acest avantaj, însă, acesta permite sistemului să aloce resurse maxime pentru părțile corpului care “vând” impresia generală.

De exemplu, picioarele umane au o gamă de articulație foarte limitată, în timp ce autenticitatea feței și a capului, pe lângă calitatea generală a mișcării corpului, este probabil să fie simbolul de autenticitate pentru renderizare.

O comparație calitativă între EVA3D și metodele anterioare. Autorii afirmă că obțin rezultate SOTA în acest sens.

O comparație calitativă între EVA3D și metodele anterioare.

Abordarea diferă radical de proiectul NeRF-centric cu care este conceptual legat – A-NeRF din 2021, de la Universitatea Columbia Britanică și Reality Labs Research, care a încercat să adauge un schelet intern de control unei reprezentări NeRF “într-o singură bucată”, făcând mai dificilă alocarea resurselor de procesare pentru diferite părți ale corpului pe baza nevoii.

Mișcări anterioare – A-NeRF echipamentează o rețea NeRF

Mișcări anterioare – A-NeRF echipamentează o rețea NeRF “coaptă” cu același tip de rigging ductil și articulat pe care industria VFX l-a folosit atât de mult timp pentru a anima personaje CGI. Sursă: https://lemonatsu.github.io/anerf/

În comun cu majoritatea proiectelor umane similare care încearcă să valorifice spațiul latent al abordărilor populare, EVA3D utilizează un Model Linear de Persoană Îmbrăcată (SMPL), o metodă “tradițională” CGI pentru adăugarea de instrumente la abstracția generală a metodelor de sinteză actuale. Mai devreme în acest an, un alt articol, de data aceasta de la Universitatea Zhejiang din Hangzhou și Școala de Media Creativă a Universității Orașului Hong Kong, a utilizat astfel de metode pentru a efectua reshaping corporal neural.

Rezultate calitative ale EVA3D pe DeepFashion.

Rezultate calitative ale EVA3D pe DeepFashion.

Metodă

Modelul SMPL utilizat în proces este ajustat la “priorul” uman – persoana care, în esență, este “deepfaked” voluntar de EVA3D, iar greutățile de îmbrăcăminte negociază diferențele dintre spațiul canonic (adică poza “de odihnă” sau “neutră” a unui model SMPL) și modul în care este renderizată apariția finală.

Fluxul de lucru conceptual pentru EVA3D. Sursă: https://arxiv.org/pdf/2210.04888.pdf

Fluxul de lucru conceptual pentru EVA3D. Sursă: https://arxiv.org/pdf/2210.04888.pdf

Așa cum se vede în ilustrația de mai sus, cutiile de delimitare ale SMPL sunt utilizate ca definiții de frontieră pentru cele 16 rețele care vor compune corpul. Algoritmul de îmbrăcăminte liniară inversă (LBS) al SMPL este apoi utilizat pentru a transfera razele vizibile eșantionate în spațiul canonic (poza “pasivă”). Apoi, cele 16 sub-rețele sunt interogate, pe baza acestor configurații, și în cele din urmă conformate într-o renderizare finală.

Întreaga compunere NeRF este apoi utilizată pentru a construi un cadru GAN 3D uman.

Renderizările cadrului GAN din a doua etapă vor fi antrenate în cele din urmă împotriva unor colecții reale de imagini 2D cu oameni și modă.

Renderizările cadrului GAN din a doua etapă vor fi antrenate în cele din urmă împotriva unor colecții reale de imagini 2D cu oameni și modă.

Fiecare sub-rețea care reprezintă o parte a corpului uman este compusă din Perceptroni Multi-Stratificați (MLP) împilați cu SIREN (Rețele de Reprezentare Sinusoidală) de activare. Deși SIREN rezolvă multe probleme într-un flux de lucru ca acesta, și în proiecte similare, are tendința de a supra-ajusta în loc de a generaliza, iar cercetătorii sugerează că biblioteci alternative ar putea fi utilizate în viitor (a se vedea sfârșitul articolului).

Date, Antrenament și Teste

EVA3D se confruntă cu probleme de date neobișnuite, datorită limitărilor și stilului tipizat al pozelor disponibile în seturile de date de modă, care tind să lipsească de vederi alternative sau noi, și sunt, poate intenționat, repetitive, pentru a concentra atenția asupra îmbrăcămintei, mai degrabă decât asupra persoanei care o poartă.

Din cauza acestei distribuții de poze dezechilibrate, EVA3D utilizează “priori” umane (a se vedea mai sus) bazate pe geometria șablonului SMPL, și apoi prezice un câmp de distanță semnat (SDF) offset al acestei poze, mai degrabă decât o poza țintă directă.

Pentru experimentele de susținere, cercetătorii au utilizat patru seturi de date: DeepFashion; SHHQ; UBCFashion; și Baza de Date a Videoclipurilor de Dans AIST (AIST Dance DB).

Cele două din urmă conțin poze mai variate decât primele două, dar reprezintă aceleași indivizi repetitiv, ceea ce anulează această diversitate utilă; pe scurt, datele sunt mai mult decât provocatoare, având în vedere sarcina.

Exemple din SSHQ. Sursă: https://arxiv.org/pdf/2204.11823.pdf

Exemple din SSHQ. Sursă: https://arxiv.org/pdf/2204.11823.pdf

Liniile de bază utilizate au fost ENARF-GAN, primul proiect care a renderizat imagini NeRF din seturi de date de imagini 2D; EG3D de la Stanford și NVIDIA (NVDA ); și StyleSDF, o colaborare între Universitatea din Washington, Adobe (ADBE ) Research și Universitatea Stanford – toate aceste metode necesită biblioteci de superraționare pentru a crește de la rezoluția nativă la rezoluția înaltă.

Metricele adoptate au fost controversata Distanță de Începtare Frechet (FID) și Distanță de Începtare Kernel (KID), împreună cu Procentul de Puncte Cheie Corecte (PCKh@0.5).

În evaluările cantitative, EVA3D a condus la toate metricele în patru seturi de date:

Rezultate cantitative.

Rezultate cantitative.

Cercetătorii observă că EVA3D obține cel mai mic rata de eroare pentru renderizarea geometriei, un factor critic într-un proiect de acest tip. Ei observă, de asemenea, că sistemul lor poate controla poza generată și obține scoruri PCKh@0.5 mai mari, în contrast cu EG3D, singura metodă concurentă care a obținut un scor mai mare într-o categorie.

EVA3D funcționează nativ la rezoluția standard de 512x512px, deși ar putea fi ușor și eficient escaladat la rezoluție HD prin adăugarea de straturi de escaladare, așa cum a făcut recent Google cu oferta sa de videoclipuri text-to-video de 1024 de rezoluție Imagen Video.

Metoda nu este lipsită de limite. Articolul menționează că activarea SIREN poate cauza artefacte circulare, care ar putea fi remediate în versiunile viitoare prin utilizarea unei reprezentări de bază alternative, cum ar fi EG3D, în combinație cu un decodificator 2D. În plus, este dificil să se potrivească SMPL cu exactitate cu sursele de date de modă.

În cele din urmă, sistemul nu poate adapta ușor articole de îmbrăcăminte mai mari și mai fluide, cum ar fi rochii lungi; articolele de îmbrăcăminte de acest tip prezintă același tip de dinamică fluidă care face ca crearea de păr neurorândat să fie o asemenea provocare. Presupunând că o soluție adecvată ar putea ajuta la abordarea ambelor probleme.

 

Publicat pentru prima dată pe 12 octombrie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai