Unghiul lui Anderson

Dezvoltatorii TikTok șterg fețele pentru aplicații de realitate augmentată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

ByteDance, compania multinațională chineză din spatele TikTok, a dezvoltat o nouă metodă pentru ștergerea fețelor din videoclipuri, astfel încât distorsionarea identității și alte efecte ciudate pot fi impuse oamenilor în aplicații de realitate augmentată. Compania afirmă că tehnica a fost deja integrată în produse comerciale mobile, deși nu specifică care produse.

Odată ce fețele din videoclipuri au fost “zeroate”, există suficient “canvas de față” pentru a produce distorsionări uluitoare, precum și pentru a suprapune alte identități. Exemplele furnizate într-un nou articol de cercetători de la ByteDance ilustrează posibilitățile, inclusiv restaurarea “caracteristicilor șterse” în diverse configurații comice (și, în mod sigur, unele grotesce):

Unele dintre posibilitățile de reconfigurare facială incluse în articolul ByteDance.

Unele dintre posibilitățile de reconfigurare facială incluse în articolul ByteDance. Sursă: https://arxiv.org/pdf/2109.10760.pdf

Spre sfârșitul lunii august, a devenit cunoscut faptul că TikTok, prima aplicație non-Facebook care a a lansat TikTok Effect Studio (în prezent în beta închis), o platformă pentru dezvoltatori de realitate augmentată (AR) pentru a crea efecte AR pentru fluxurile de conținut TikTok.

În esență, compania se alătură comunităților de dezvoltatori similare de la Facebook’s AR Studio și Snap AR, cu comunitatea de cercetare AR a lui Apple, care urmează să fie iminent galvanizată de noi dispozitive în următorul an.

Expresii goale

Articolul, intitulat FaceEraser: Ștergerea părților faciale pentru realitate augmentată, notează că algoritmii de completare/inserare existenți, cum ar fi NVIDIA’s SPADE, sunt mai orientați spre completarea imaginilor trunchiate sau semi-ascunse decât spre efectuarea acestei proceduri neobișnuite de “ștergere”, și că materialul de date existent este, prin urmare, predictibil rar.

Deoarece nu există seturi de date de referință disponibile pentru oamenii care au o suprafață solidă de carne în locul feței, cercetătorii au creat o arhitectură de rețea nouă, numită pixel-clone, care poate fi suprapusă peste modelele de inserare neuronale existente, și care rezolvă problemele legate de inconsistențele de textură și culoare prezentate (articolul atestă) de metodele mai vechi, cum ar fi StructureFlow și EdgeConnect.

Fluxul general de lucru al lui pixel-clone în noul flux de lucru.

Fluxul general de lucru al lui pixel-clone în noul flux de lucru.

Pentru a antrena un model pe “fețe goale”, cercetătorii au exclus imagini cu ochelari sau cu păr care acoperă fruntea, deoarece zona dintre linia părului și sprâncene este, de obicei, cea mai mare grupare de pixeli care poate furniza material pentru “lipirea” caracteristicilor centrale ale feței.

Pregătirea imaginilor de antrenament. Zona frunții este decupată, pe baza punctelor cheie de recunoaștere a alinierii faciale, răsturnată vertical și cusută.

Pregătirea imaginilor de antrenament. Zona frunții este decupată, pe baza punctelor cheie de recunoaștere a alinierii faciale, răsturnată vertical și cusută.

O imagine de 256×256 de pixeli este obținută, o dimensiune suficient de mică pentru a fi alimentată în spațiul latent al unei rețele neuronale în loturi care sunt suficient de mari pentru a atinge generalizarea. Ulterior, algoritmul de escaladare va restaura rezoluțiile necesare pentru a lucra în spațiul AR.

Arhitectură

Rețeaua este alcătuită din trei rețele interne, care includ completarea marginilor, clonarea pixelilor și o rețea de rafinare. Rețeaua de completare a marginilor utilizează aceeași arhitectură de encoder-decoder folosită în EdgeConnect (vezi mai sus), precum și în cele două aplicații de deepfake mai populare. Encoderii reduc dimensiunile conținutului imaginii de două ori, iar decoderii restaurează dimensiunile originale ale imaginii.

Clonarea pixelilor utilizează o metodologie de encoder-decoder modificată, în timp ce stratul de rafinare utilizează arhitectura U-Net, o tehnică dezvoltată inițial pentru imagistica biomedicală, care apare adesea în proiectele de cercetare de sinteză a imaginilor.

În timpul fluxului de antrenament, este necesar să se evalueze acuratețea transformărilor și, după cum este necesar, să se repete încercările iterativ până la convergență. Pentru acest scop, se utilizează doi discriminatori bazati pe PatchGAN, fiecare dintre care evaluează realismul localizat al patch-urilor de 70×70 de pixeli, reducând valoarea realismului întregii imagini.

Antrenament și date

Rețeaua de completare a marginilor este antrenată inițial independent, în timp ce celelalte două rețele sunt antrenate împreună, pe baza greutăților care au rezultat din antrenamentul de completare a marginilor, care sunt fixate și înghețate în timpul acestei proceduri.

Deși articolul nu afirmă explicit că exemplele finale de distorsionare a caracteristicilor sunt scopul central al modelului, acesta implementează diverse efecte comice pentru a testa reziliența sistemului, inclusiv îndepărtarea sprâncenelor, guri mărite, sub-fețe micșorate și efecte “toonizate” (așa cum se arată în imaginea de mai sus).

Articolul afirmă că “fețele șterse permit diverse aplicații de realitate augmentată care necesită plasarea oricăror elemente personalizate de către utilizator”, indicând posibilitatea de a personaliza fețele cu elemente contribuite de terți, personalizate de utilizatori.

Modelul este antrenat pe măști din setul de date FFHQ creat de NVIDIA, care conține o varietate adecvată de vârste, etnii, iluminare și poziții faciale și stiluri pentru a atinge o generalizare utilă. Setul de date conține 35.000 de imagini și 10.000 de măști de antrenament pentru a delimita zonele de transformare, cu 4000 de imagini și 1000 de măști puse deoparte pentru scopuri de validare.

Mostre de antrenament.

Mostre de antrenament.

Modelul antrenat poate efectua inferențe pe date din 2017 de la CelebA-HQ și VoxCeleb, fețe nevăzute din FFHQ și orice alte fețe nevăzute și neconstrânse care sunt prezentate acestuia. Imaginile de 256×256 de pixeli au fost antrenate pe rețea în loturi de 8 peste un optimizator Adam, implementat în PyTorch și rulând pe un GPU Tesla (TSLA ) V100 pentru “2.000.000 de epoci”.

Rezultatele inferenței obținute pe o față reală.

Rezultatele inferenței obținute pe o față reală.

Ca și în cazul cercetărilor comune de sinteză de imagini bazate pe față, sistemul trebuie să facă față unor eșecuri ocazionale provocate de obstacole sau ocultări, cum ar fi părul, accesorii, ochelari și părul facial.

Raportul concluzionează:

“Abordarea noastră a fost comercializată și funcționează bine în produse pentru intrări de utilizator neconstrânse.”

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai