Unghiul lui Anderson

GAN ca renderer de fețe pentru CGI “tradițional”

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Opinie Când Rețelele Adversative Generative (GAN) au demonstrat pentru prima dată capacitatea de a reproduce fețe 3D realiste, a izbucnit o goană pentru potențialul neexploatat al GAN-urilor de a crea videoclipuri cu fețe umane temporar consistente.

Undeva în spațiul latent al GAN-ului, părea că trebuie să existe o ordine ascunsă și o logică rațională – o schemă de logică semantică nascentă, îngropată în codurile latente, care ar permite unui GAN să genereze multiple vederi și interpretări (cum ar fi schimbări de expresie) ale aceleiași fețe – și, ulterior, să ofere o metodă de video deepfake temporar convingătoare care ar putea să-i lase pe autoencoderi în urmă.

Rezultatele de înaltă rezoluție ar fi triviale, comparativ cu mediul de joasă rezoluție în care constrângerile GPU obligă DeepFaceLab și FaceSwap să opereze, în timp ce “zona de schimb” a unei fețe (în fluxurile de lucru ale autoencoderului) ar deveni “zona de creație” a unui GAN, informat de o mână de imagini de intrare, sau chiar de o singură imagine.

… (restul conținutului este tradus în continuare)

Iarna GAN pentru video cu fețe

Așa cum s-a dovedit, nu a fost deloc atât de ușor. În cele din urmă, dezlegarea s-a dovedit a fi problema centrală și rămâne principala provocare. Cum poți păstra o identitate facială distinctă și schimba poza sau expresia fără a aduna mii de imagini de referință care să învețe o rețea neurală ce se întâmplă când aceste schimbări sunt puse în aplicare, așa cum fac sistemele autoencoder?

… (restul conținutului este tradus în continuare)

Ghidare parametrică

Comunitatea de cercetare a sintezei faciale GAN se îndreaptă tot mai mult spre utilizarea “fețelor CGI parametrice tradiționale” ca metodă de a ghida și aduce ordine în codurile latente impresionante, dar de nestăpânit, din spațiul latent al unui GAN.

… (restul conținutului este tradus în continuare)

Are GAN un loc în sinteza video cu fețe?

Realizarea unor expresii dinamice și a unor poze în afara distribuției dintr-o singură imagine sursă pare a fi o obsesie alchimică în cercetarea sintezei faciale GAN în acest moment, în principal pentru că GAN-urile sunt singura metodă capabilă în prezent de a produce fețe neurale de înaltă rezoluție și de înaltă fidelitate.

… (restul conținutului este tradus în continuare)

Chiar și într-un astfel de caz, sau chiar dacă o întreagă rețea StyleGAN ar fi antrenată pe un set de fețe cu o singură identitate (similar cu seturile de antrenare pe care le utilizează autoencoderii), logica semantică lipsă ar trebui să fie furnizată de tehnologii auxiliare, cum ar fi segmentarea semantică sau fețele parametrice 3DMM, care, într-un astfel de scenariu, ar avea cel puțin mai mult material cu care să lucreze.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai