Unghiul lui Anderson

Crearea de “corpuri mai bune” cu ajutorul inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Noi cercetări de la Academia Alibaba DAMO oferă un flux de lucru condus de inteligență artificială pentru automatizarea remodelării imaginilor corpului – o încercare rară într-un sector de viziune computerizată în prezent ocupat cu manipulări bazate pe față cum ar fi deepfakes și editare de față bazată pe GAN.

În coloanele 'rezultat', hărțile de atenție generate care definesc zonele ce urmează a fi modificate. Sursă: https://arxiv.org/pdf/2203.04670.pdf

În coloanele ‘rezultat’, hărțile de atenție generate care definesc zonele ce urmează a fi modificate. Sursă: https://arxiv.org/pdf/2203.04670.pdf

Arhitectura cercetătorilor utilizează estimarea poziției scheletului pentru a aborda complexitatea mai mare cu care se confruntă sistemele de sinteză și editare a imaginilor în conceptualizarea și parametrizarea imaginilor corpului existent, cel puțin la un nivel de granulație care permite editarea semnificativă și selectivă.

Hărțile scheletului estimate ajută la individualizarea și focalizarea atenției asupra zonelor corpului care sunt probabil să fie retuşate, cum ar fi zona brațului superior.

Sistemul permite în final unui utilizator să seteze parametri care pot modifica aspectul greutății, masei musculare sau distribuției greutății în fotografii de lungime completă sau mijlocie ale persoanelor și este capabil să genereze transformări arbitrare pe secțiuni ale corpului îmbrăcate sau dezbrăcate.

Stânga, imaginea de intrare; mijloc, o hartă de căldură a zonelor de atenție derivate; dreapta, imaginea transformată.

Stânga, imaginea de intrare; mijloc, o hartă de căldură a zonelor de atenție derivate; dreapta, imaginea transformată.

Motivația pentru această lucrare este dezvoltarea unor fluxuri de lucru automate care ar putea înlocui manipulările digitale laborioase efectuate de fotografi și artiști grafici în diverse ramuri ale mass-media, de la modă la materiale publicitare.

În general, autorii recunosc că aceste transformări sunt de obicei aplicate cu tehnici de “deformare” în Photoshop și alte editoare de bitmap tradiționale și sunt folosite aproape exclusiv pe imagini de femei. Prin urmare, setul de date personalizat dezvoltat pentru a facilita noul proces constă în mare parte din fotografii cu subiecte feminine:

‘Deoarece retușarea corpului este în principal dorită de femei, majoritatea colecției noastre sunt fotografii cu femei, luând în considerare diversitatea de vârste, rase (african:asiatic:caucazian = 0,33:0,35:0,32), poziții și îmbrăcăminte.’

Articolul științific se intitulează Generarea fluxului structurii pentru remodelarea corpului uman și provine de la cinci autori asociați cu Academia globală DAMO a lui Alibaba.

Dezvoltarea setului de date

Ca de obicei, arhitectura proiectului a necesitat un set de date personalizat de antrenament. Autorii au comandat trei fotografi să producă manipulări standard în Photoshop ale unor imagini adecvate de pe site-ul de fotografie Unsplash, rezultând un set de date – intitulat BR-5K* – de 5.000 de imagini de înaltă calitate la rezoluție 2K.

Cercetătorii subliniază că obiectivul antrenamentului pe acest set de date nu este de a produce caracteristici “idealizate” și generalizate legate de un indice de atractivitate sau de aspect dorit, ci mai degrabă de a extrage hărțile de caracteristici centrale asociate cu manipulările profesionale ale imaginilor corpului.

Cu toate acestea, ei recunosc că manipulările reflectă în final procese transformaționale care mapează o evoluție de la “real” la o noțiune prestabilită de “ideal”:

‘Invităm trei artiști profesioniști să retușeze corpurile folosind Photoshop în mod independent, cu scopul de a obține figuri zvelte care corespund esteticii populare, și selectăm cea mai bună ca fiind adevărul de referință.’

Deoarece cadrul nu se ocupă deloc de fețe, acestea au fost estompate înainte de a fi incluse în setul de date.

Arhitectură și concepte de bază

Fluxul de lucru al sistemului implică introducerea unei imagini de portret de înaltă rezoluție, reducerea rezoluției la o valoare mai mică care poate fi procesată de resursele de calcul disponibile și extragerea unei hărți de schelet estimată (a doua imagine de la stânga), precum și a câmpurilor de afinitate a părților (PAF), care au fost inovate în 2016 de Institutul de robotică de la Universitatea Carnegie Mellon (vezi videoul încorporat direct mai jos).

Câmpurile de afinitate a părților ajută la definirea orientării membrelor și a asocierii generale cu scheletul mai larg, oferind proiectului nou un instrument suplimentar de atenție și localizare.

Din articolul din 2016 despre câmpurile de afinitate a părților, PAF-urile prezise codifică orientarea membrelor ca parte a unui vector 2D care include și poziția generală a membrului. Sursă: https://arxiv.org/pdf/1611.08050.pdf

Din articolul din 2016 despre câmpurile de afinitate a părților, PAF-urile prezise codifică orientarea membrelor ca parte a unui vector 2D care include și poziția generală a membrului. Sursă: https://arxiv.org/pdf/1611.08050.pdf

În ciuda aparentei lor irelevanțe pentru aspectul greutății, hărțile scheletului sunt utile în direcționarea proceselor transformaționale finale către părți ale corpului care urmează a fi modificate, cum ar fi brațele superioare, spatele și coapsele.

După aceea, rezultatele sunt introduse într-un modul de autoatenție a afinității structurale (SASA) în gâtul de sticlă central al procesului (vezi imaginea de mai jos).

Modulul SASA reglează consistența generatorului de flux care alimentează procesul, iar rezultatele sunt apoi transmise modulului de deformare (al doilea din dreapta în imaginea de mai sus), care aplică transformările învățate din reviziile manuale incluse în setul de date.

Modulul de autoatenție a afinității structurale (SASA) alocă atenție părților corpului pertinente, ajutând la evitarea transformărilor extranee sau irelevante.

Modulul de autoatenție a afinității structurale (SASA) alocă atenție părților corpului pertinente, ajutând la evitarea transformărilor extranee sau irelevante.

Imaginea de ieșire este ulterior supradimensionată la rezoluția originală de 2K, folosind procese care nu sunt foarte diferite de arhitectura standard de deepfake din 2017, din care au fost derivate pachete populare cum ar fi DeepFaceLab; procesul de supradimensionare este, de asemenea, comun în cadrul editării GAN.

Rețeaua de atenție pentru schema este modelată după Rețelele de deatenție compozită (CODA), o colaborare academică din 2019 între SUA și Singapore, cu Amazon AI și Microsoft.

Teste

Cadrul bazat pe flux a fost testat împotriva metodelor anterioare bazate pe flux FAL și Animare prin deformare (ATW), precum și arhitecturi de traducere a imaginilor Pix2PixHD și GFLA, cu SSIM, PSNR și LPIPS ca metrice de evaluare.

Rezultatele testelor inițiale (direcția săgeții în anteturi indică dacă cifrele mai mici sau mai mari sunt mai bune).

Rezultatele testelor inițiale (direcția săgeții în anteturi indică dacă cifrele mai mici sau mai mari sunt mai bune).

Pe baza acestor metrice adoptate, sistemul autorilor depășește arhitecturile anterioare.

Rezultate selectate. Vă rugăm să consultați PDF-ul original legat de acest articol pentru comparații de înaltă rezoluție.

Rezultate selectate. Vă rugăm să consultați PDF-ul original legat de acest articol pentru comparații de înaltă rezoluție.

În plus față de metricile automate, cercetătorii au efectuat un studiu cu utilizatori (ultima coloană a tabelului cu rezultate prezentat anterior), în care 40 de participanți au fost arătați 30 de întrebări selectate aleator dintr-un set de 100 de întrebări legate de imaginile produse prin diverse metode. 70% dintre respondenți au preferat tehnica nouă ca fiind mai “vizual atractivă”.

Provocări

Noul articol reprezintă o incursiune rară în manipularea corpului bazată pe inteligență artificială. Sectorul de sinteză a imaginilor este în prezent mult mai interesat de generarea de corpuri editabile prin metode cum ar fi câmpurile de radianță neurală (NeRF) sau de explorarea spațiului latent al GAN-urilor și a potențialului autoencoderelor pentru manipularea feței.

Inițiativa autorilor este în prezent limitată la producerea de schimbări în greutatea percepută și nu au implementat nicio tehnică de retușare care ar putea restaura fundalul care este inevitabil dezvăluit atunci când se subțiază o imagine a cuiva.

Cu toate acestea, ei propun că masca portretului și amestecarea fundalului prin inferență texturată ar putea soluționa trivial problema restaurării părților lumii care au fost anterior ascunse în imagine de “imperfecțiunea” umană.

O soluție propusă pentru restaurarea fundalului care este dezvăluit de reducerea de greutate condusă de IA.

O soluție propusă pentru restaurarea fundalului care este dezvăluit de reducerea de greutate condusă de IA.

 

* Deși preimprimarea se referă la materialul suplimentar care oferă mai multe detalii despre setul de date, precum și la exemple suplimentare din proiect, locația acestui material nu este disponibilă în articol, iar autorul corespondent nu a răspuns încă la solicitarea noastră de acces.

Publicat pentru prima dată pe 10 martie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]