Unghiul lui Anderson

Falsificarea corpurilor „mai bune” cu AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetări noi de la Academia Alibaba DAMO oferă un flux de lucru bazat pe AI pentru automatizarea remodelării imaginilor corpurilor – un efort rar în sectorul de viziune computerizată, ocupat în prezent de manipulări bazate pe fețe precum deepfake-urile și editarea fețelor bazate pe GAN.

Inserție în coloanele „result”, hărțile de atenție generate care definesc zonele de modificat. Sursă: https://arxiv.org/pdf/2203.04670.pdf

Inserție în coloanele „result”, hărțile de atenție generate care definesc zonele de modificat. Sursă: https://arxiv.org/pdf/2203.04670.pdf

Arhitectura cercetătorilor folosește estimarea poziției scheletului pentru a aborda complexitatea mai mare cu care se confruntă sistemele de sinteză și editare a imaginilor în conceptualizarea și parametrizarea imaginilor corporale existente, cel puțin la un nivel de granularitate care permite editări semnificative și selective.

Hărțile scheletice estimate ajută la individualizarea și focalizarea atenției pe zonele corpului ce pot fi retușate, cum ar fi zona brațului superior.

Sistemul permite în final utilizatorului să seteze parametri ce pot schimba aspectul greutății, masei musculare sau distribuției greutății în fotografii de la jumătate până la înălțime completă ale oamenilor și poate genera transformări arbitrare pe secțiuni corpului îmbrăcate sau dezbrăcate.

Stânga, imaginea de intrare; mijloc, o hartă termică a zonelor de atenție generate; dreapta, imaginea transformată.

Stânga, imaginea de intrare; mijloc, o hartă termică a zonelor de atenție generate; dreapta, imaginea transformată.

Motivația lucrării este dezvoltarea de fluxuri de lucru automate care ar putea înlocui manipulările digitale greoaie efectuate de fotografi și artiști grafici în diverse ramuri ale mediului, de la modă la producții de tip revistă și materiale de publicitate.

În general, autorii recunosc că aceste transformări sunt de obicei aplicate cu tehnici de „warp” în Photoshop și alți editori bitmap tradiționali și sunt aproape exclusiv utilizate pe imagini ale femeilor. Prin urmare, setul de date personalizat dezvoltat pentru a facilita noul proces este compus în mare parte din fotografii ale subiecților de sex feminin:

‘Deoarece retușarea corpului este în principal dorită de femei, majoritatea colecției noastre sunt fotografii feminine, luând în considerare diversitatea de vârste, rase (African:Asian:Caucasian = 0.33:0.35:0.32), poziții și îmbrăcăminte.’

Articolul paper poartă titlul Structure-Aware Flow Generation for Human Body Reshaping și provine de la cinci autori asociați cu academia globală DAMO a Alibaba.

Dezvoltarea setului de date

Așa cum se întâmplă de obicei cu sistemele de sinteză și editare a imaginilor, arhitectura proiectului a necesitat un set de date de antrenament personalizat. Autorii au comandat trei fotografi să producă manipulări standard în Photoshop ale imaginilor adecvate de pe site-ul de fotografii de stoc Unsplash, rezultând un set de date – intitulat BR-5K* – de 5.000 de imagini de înaltă calitate la rezoluție 2K.

Cercetătorii subliniază că obiectivul antrenării pe acest set de date nu este să producă trăsături „idealizate” și generalizate legate de un indice de atractivitate sau aspect dorit, ci să extragă mapările de trăsătură centrale asociate cu manipulările profesionale ale imaginilor corporale.

Totuși, ei recunosc că manipulările reflectă în final procese transformatoare ce mapă o progresie de la „real” la o noțiune presetată de „ideal”:

‘Invităm trei artiști profesioniști să retușeze corpurile folosind Photoshop independent, cu scopul de a obține siluete subțiri care să corespundă esteticii populare, și selectăm cea mai bună ca adevărată valoare de referință.’

Deoarece cadrul nu se ocupă deloc de fețe, acestea au fost estompate înainte de a fi incluse în setul de date.

Arhitectura și conceptele de bază

Fluxul de lucru al sistemului implică introducerea unui portret de înaltă rezoluție, reducerea acestuia la o rezoluție inferioară care să încapă în resursele de calcul disponibile și extragerea unei hărți scheletice estimate (a doua figură de la stânga în imaginea de mai jos), precum și a Part Affinity Fields (PAF-uri), care au fost inovate în 2016 de Institutul de Robotică de la Universitatea Carnegie Mellon (vezi video încorporat mai jos).

Part Affinity Fields ajută la definirea orientării membrelor și a asocierii generale cu cadrul scheletic mai larg, oferind noului proiect un instrument suplimentar de atenție/localizare.

Din lucrarea din 2016 despre Part Affinity Fields, PAF-urile prezise codifică orientarea membrelor ca parte a unui vector 2D care include și poziția generală a membrei. Sursă: https://arxiv.org/pdf/1611.08050.pdf

Din lucrarea din 2016 despre Part Affinity Fields, PAF-urile prezise codifică orientarea membrelor ca parte a unui vector 2D care include și poziția generală a membrei. Sursă: https://arxiv.org/pdf/1611.08050.pdf

În ciuda aparentei lor irelevanțe pentru aspectul greutății, hărțile scheletice sunt utile în direcționarea proceselor transformatoare finale către părțile corpului ce trebuie modificate, cum ar fi brațele superioare, zona posterioră și coapsele.

După aceasta, rezultatele sunt transmise către un Structure Affinity Self-Attention (SASA) în nodul central al procesului (vezi imaginea de mai jos).

SASA reglează consistența generatorului de flux care alimentează procesul, ale cărui rezultate sunt apoi transmise modulului de deformare (al doilea de la dreapta în imaginea de mai sus), care aplică transformările învățate din antrenamentul pe reviziile manuale incluse în setul de date.

Modulul Structure Affinity Self-Attention (SASA) alocă atenție părților corporale pertinente, ajutând la evitarea transformărilor inutile sau irelevante.

Modulul Structure Affinity Self-Attention (SASA) alocă atenție părților corporale pertinente, ajutând la evitarea transformărilor inutile sau irelevante.

Imaginea de ieșire este ulterior upsampleată înapoi la rezoluția originală de 2K, folosind procese nu foarte diferite de arhitectura standard de deepfake din 2017, din care au derivat pachete populare precum DeepFaceLab; procesul de upsampling este, de asemenea, comun în cadrele de editare GAN.

Rețeaua de atenție pentru schemă este modelată după Compositional De-Attention Networks (CODA), o colaborare academică din 2019 între SUA și Singapore cu Amazon (AMZN ) AI și Microsoft.

Teste

Cadru bazat pe flux a fost testat contra metodelor bazate pe flux anterioare FAL și Animating Through Warping (ATW), precum și a arhitecturilor de traducere a imaginii Pix2PixHD și GFLA, cu SSIM, PSNR și LPIPS ca metrici de evaluare.

Rezultatele testelor inițiale (direcția săgeții în antete indică dacă valorile mai mici sau mai mari sunt mai bune).

Rezultatele testelor inițiale (direcția săgeții în antete indică dacă valorile mai mici sau mai mari sunt mai bune).

Pe baza acestor metrici adoptate, sistemul autorilor depășește arhitecturile anterioare.

Rezultate selectate. Vă rugăm să consultați PDF-ul original legat în acest articol pentru comparații la rezoluție mai mare.

Rezultate selectate. Vă rugăm să consultați PDF-ul original legat în acest articol pentru comparații la rezoluție mai mare.

În plus față de metricile automate, cercetătorii au realizat un studiu cu utilizatori (coloana finală a tabelului de rezultate ilustrat anterior), în care 40 de participanți au fost fiecare prezentați cu 30 de întrebări selectate aleatoriu dintr-un pool de 100 de întrebări legate de imaginile produse prin diversele metode. 70% dintre respondenți au favorizat noua tehnică ca fiind mai „atractivă vizual”.

Provocări

Noua lucrare reprezintă o excursie rară în manipularea corporală bazată pe AI. Sectorul de sinteză a imaginilor este în prezent mult mai interesat fie în generarea de corpuri editabile prin metode precum Neural Radiance Fields (NeRF), fie este fixat pe explorarea spațiului latent al GAN-urilor și potențialul autoencodere-lor pentru manipularea feței.

Inițiativa autorilor este în prezent limitată la producerea de modificări ale greutății percepute și nu au implementat niciun tip de tehnică de inpainting care să restaureze fundalul inevitabil dezvăluit când se subțiază o fotografie a cuiva.

Totuși, ei propun că matrițarea portretului și amestecarea fundalului prin inferență texturală ar putea rezolva trivial problema restaurării părților lumii care erau anterior ascunse în imagine de „imperfecțiunile” umane.

O soluție propusă pentru restaurarea fundalului dezvăluit de reducerea de grăsime condusă de AI.

O soluție propusă pentru restaurarea fundalului dezvăluit de reducerea de grăsime condusă de AI.

 

* Deși preprintul face referire la material suplimentar care oferă mai multe detalii despre setul de date, precum și exemple suplimentare din proiect, locația acestui material nu este pusă la dispoziție în lucrare, iar autorul corespondent nu a răspuns încă la cererea noastră de acces.

Publicat prima dată pe 10 martie 2022.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai