Unghiul lui Anderson
Adăugarea de dialog la videouri reale cu ajutorul inteligenței artificiale

O nouă arhitectură de inteligență artificială poate rescrie, șterge sau adăuga cuvintele unei persoane într-un videoclip fără a fi necesară refilmarea, într-un sistem complet integrat.
Acum trei ani, internetul ar fi fost șocat de oricare dintre cele 20-30 de cadre de editare video cu inteligență artificială publicate săptămânal pe portaluri academice; dar, deoarece această ramură de cercetare a devenit atât de prolifică, ea a ajuns să constituie aproape o altă ramură a “reziduurilor de inteligență artificială” și eu acoper mai puține astfel de lansări decât aș fi făcut cu doi sau trei ani în urmă.
Una dintre lansările actuale în această direcție a atras atenția mea: un sistem integrat care poate interveni în clipuri video reale și introduce discursuri noi în videoclipul existent (și nu creează un clip generativ întreg dintr-o față sau cadru, ceea ce este mult mai frecvent).
În exemplele de mai jos, pe care le-am editat dintr-o multitudine de videoclipuri de exemplu disponibile pe site-ul proiectului proiectului, vedem mai întâi clipul sursă real, și apoi, sub el, discursul impus de inteligența artificială în mijlocul clipului, inclusiv sinteza vocală și sincronizarea buzelor:
Apăsați pentru a reda. Editare locală cu cusătură – una dintre modalitățile oferite de FacEDiT. Vă rugăm să consultați site-ul sursă pentru o rezoluție mai bună. Sursă – https://facedit.github.io/
Acest mod de abordare este una dintre cele trei dezvoltate pentru noua metodă, aceasta fiind intitulată “editare locală cu cusătură”, și este cea care îi interesează cel mai mult pe autori (precum și pe mine). Esențial, clipul este extins prin utilizarea uneia dintre cadrele din mijloc ca punct de plecare pentru interpretarea nouă a inteligenței artificiale, iar cadra sa succesivă (reală) ca scop pe care clipul generativ inserat ar trebui să îl atingă. În clipurile de mai sus, aceste “seminte” și “ținte” sunt reprezentate de videoclipul superior care se oprește, în timp ce videoclipul modificat de mai jos oferă umplerea generativă.
Autorii prezintă această abordare de sinteză facială și vocală ca primul sistem complet integrat de la capăt la capăt pentru editarea video cu inteligență artificială de acest fel, observând potențialul unui cadru complet dezvoltat, cum ar fi acesta, pentru producția de televiziune și film:
‘Cineaștii și producătorii de mass-media trebuie adesea să revizuiască părți specifice ale videoclipurilor înregistrate – poate un cuvânt a fost vorbit greșit sau scenariul a fost modificat după filmare. De exemplu, în scena iconică din Titanic (1997) în care Rose spune, “Nu voi lăsa niciodată să mergi, Jack,” regizorul ar putea decide mai târziu că ar trebui să fie “Nu voi uita niciodată de tine, Jack”.
‘În mod tradițional, astfel de modificări necesită refilmarea întregii scene, ceea ce este costisitor și consumator de timp. Sinteza feței care vorbește oferă o alternativă practică prin modificarea automată a mișcării feței pentru a se potrivi cu discursul revizuit, eliminând nevoia de refilmări.’
Deși intervențiile inteligenței artificiale de acest fel pot întâmpina rezistență culturală sau industrială, ele pot constitui, de asemenea, un nou tip de funcționalitate în sistemele și seturile de instrumente VFX conduse de oameni. În orice caz, pentru moment, provocările sunt strict tehnice.
Pe lângă extinderea unui clip prin dialogul generat de inteligența artificială, noul sistem poate modifica, de asemenea, discursul existent:
Apăsați pentru a reda. Un exemplu de modificare a discursului existent, în loc de introducerea unui discurs suplimentar. Vă rugăm să consultați site-ul sursă pentru o rezoluție mai bună.
Stadiul actual
Nu există în prezent sisteme complete care să ofere această capacitate de sinteză; deși o serie tot mai mare de platforme de inteligență artificială generativă, cum ar fi seria Veo de la Google, poate genera audio, și diverse alte cadre pot crea audio deepfake, în prezent trebuie să creați o serie destul de complexă de arhitecturi și trucuri diverse pentru a interveni în filmări reale în felul în care noul sistem – intitulat FacEDiT – poate realiza.
Sistemul utilizează Transformatori de difuzie (DiT) în combinație cu coincidență a fluxului pentru a crea mișcări faciale condiționate de mișcările și conținutul audio contextual. Sistemul utilizează pachete populare existente care se ocupă de reconstrucția facială, inclusiv LivePortrait (recent preluat de Kling).
Pe lângă această metodă, dat fiind că abordarea lor este prima care integrează aceste provocări într-o singură soluție, autorii au creat o nouă bază de referință numită FacEDiTBench, împreună cu câteva metrice de evaluare complet noi, potrivite pentru această sarcină foarte specifică.
Noua lucrare nouă se intitulează FacEDiT: Editare și generare unificată de fețe care vorbesc prin umplerea mișcării faciale și provine de la patru cercetători de la Universitatea Științifică și Tehnologică Pohang (POSTECH) din Coreea, Institutul Avansat de Știință și Tehnologie din Coreea (KAIST) și Universitatea Texasului din Austin.
Metodă
FacEDiT este antrenat pentru a reconstrui mișcarea facială prin învățarea modului de umplere a părților lipsă ale performanței originale a unui actor, pe baza mișcării și a conținutului audio. Așa cum se arată în schema de mai jos, acest proces permite modelului să acționeze ca un umplutor de goluri în timpul antrenamentului, prevăzând mișcări faciale care se potrivesc cu vocea și care rămân consistente cu videoclipul original:

Prezentare generală a sistemului FacEDiT, care arată cum se învață mișcarea facială prin umplerea auto-supervizată în timpul antrenamentului, ghidată de discurs editat la inferență și, în final, redată înapoi în videoclip prin reutilizarea aspectului filmării originale, înlocuind doar mișcarea țintă. Sursă
La momentul inferenței, aceeași arhitectură susține două ieșiri diferite, în funcție de cât de mult din videoclip este mască: editări parțiale, în care doar o frază este modificată și restul este lăsat neatins; sau generare de propoziții complete, în care o nouă mișcare este sintetizată complet de la zero.
Modelul este antrenat prin coincidență a fluxului, care tratează editarea videoclipurilor ca o cale între două versiuni ale mișcării faciale.
În loc de a învăța să ghicească cum ar trebui să arate o față editată de la zero, coincidența fluxului învață să se deplaseze treptat și lin între un placeholder zgomotos și mișcarea corectă. Pentru a facilita acest lucru, sistemul reprezintă mișcarea facială ca un set compact de numere extrase din fiecare cadru, utilizând o versiune a sistemului LivePortrait menționat anterior (a se vedea schema de mai sus).
Aceste vectori de mișcare sunt proiectați pentru a descrie expresii și poziția capului fără a încurca identitatea, astfel încât schimbările de discurs să poată fi localizate fără a afecta aspectul general al persoanei.
Antrenarea FacEDiT
Pentru a antrena FacEDiT, fiecare clip video a fost împărțit într-o serie de instantanee de mișcare facială, iar fiecare cadru a fost asociat cu bucata corespunzătoare de audio. Părți ale datelor de mișcare au fost apoi ascunse, iar modelul a fost solicitat să ghicească cum ar trebui să arate mișcările lipsă, utilizând atât discursul, cât și mișcarea neascunsă din jur pentru context.
Deoarece porțiunile mascate și pozițiile lor variază de la un exemplu de antrenament la altul, modelul învață treptat să gestioneze atât editări interne mici, cât și lacune mai lungi, pentru generarea de secvențe complete, în funcție de câtă informație primește.
Transformatorul de difuzie menționat anterior învață să recupereze mișcarea mascată prin rafinarea intrărilor zgomotoase în timp. În loc de a introduce discurs și mișcare în model deodată, audio-ul este introdus în fiecare bloc de procesare prin atenție încrucișată, ajutând sistemul să potrivească mișcările buzelor mai precis cu discursul audio.
Pentru a păstra realismul de-a lungul editărilor, atenția este îndreptată către cadrele vecine, mai degrabă decât către întreaga cronologie, forțând modelul să se concentreze pe continuitatea locală și prevenind flicker-ul sau salturile de mișcare la marginile regiunilor modificate. Încorporările poziționale (care spun modelului unde apare fiecare cadru în secvență) ajută, de asemenea, modelul să mențină fluxul temporal natural și contextul.
În timpul antrenamentului, sistemul învață să prevadă mișcarea facială lipsă prin reconstruirea porțiunilor mascate pe baza discursului și a mișcării neascunse din jur. La momentul inferenței, aceeași configurație este reutilizată, dar cu măștile ghidate acum de editări în discurs.
Când un cuvânt sau o frază este introdus, eliminat sau modificat, sistemul localizează regiunea afectată, o mască și regenerează mișcarea care se potrivește cu noul audio. Generarea de secvențe complete este tratată ca un caz special, în care întreaga regiune este mască și sintetizată de la zero.
Date și teste
Spina dorsală a sistemului este formată din 22 de straturi pentru Transformatorul de difuzie, fiecare cu 16 capete de atenție și dimensiuni de alimentare înainte și înapoi de 1024 și 2024px. Caracteristicile de mișcare și aspect sunt extrase utilizând componente înghețate LivePortrait, iar discursul este codificat prin WavLM și modificat utilizând VoiceCraft.
Un strat de proiecție dedicat mappează caracteristicile de discurs de 786 de dimensiuni în spațiul latent al DiT, cu doar DiT și modulele de proiecție antrenate de la zero.
Antrenamentul a fost efectuat sub optimizerul AdamW la o rată de învățare țintă de 1e-4, timp de un milion de pași, pe două GPU-uri A6000 (fiecare cu 48GB de VRAM), la o dimensiune totală de lot de opt.
FacEDiTBench
Baza de date FacEDiTBench conține 250 de exemple, fiecare cu un clip video al discursului original și editat, și transcrierile pentru ambele. Videoclipurile provin din trei surse, cu 100 de clipuri din HDTF, 100 din Hallo3 și 50 din CelebV-Dub. Fiecare a fost verificat manual pentru a confirma că atât audio, cât și video erau suficient de clare pentru evaluare.
GPT-4o a fost utilizat pentru a revizui fiecare transcriere pentru a crea editări gramaticale valabile. Aceste transcrieri revizuite, împreună cu discursul original, au fost trecute prin VoiceCraft pentru a produce noul audio; și la fiecare etapă, atât transcrierea, cât și discursul generat au fost examinate manual pentru calitate.
Fiecare exemplu a fost etichetat cu tipul de editare, momentul schimbării și lungimea porțiunii modificate, iar editările au fost clasificate în inserții, ștergeri sau înlocuiri. Numărul de cuvinte modificate a variat de la editări scurte de 1-3 cuvinte, editări medii de 4-6 cuvinte și editări mai lungi de 7-10 cuvinte.
Trei metrice personalizate au fost definite pentru a evalua calitatea editării. Continuitatea fotometrică, pentru a măsura cât de bine se integrează segmentul editat în videoclipul înconjurător, prin compararea diferențelor la nivel de pixel la margini; continuitatea mișcării, pentru a evalua consistența mișcării faciale, prin măsurarea schimbărilor de flux optic între cadre editate și needitate; și păstrarea identității, pentru a estima dacă aspectul subiectului rămâne consistent după editare, prin compararea încorporărilor faciale din secvențele originale și generate, utilizând modelul de recunoaștere facială ArcFace.
Teste
Modelul de testare a fost antrenat pe material din cele trei seturi de date menționate anterior, totalizând aproximativ 200 de ore de conținut video, inclusiv vloguri și filme, precum și videoclipuri de înaltă rezoluție de pe YouTube.
Pentru a evalua editarea feței care vorbește, FacEDiTBench a fost utilizat, împreună cu setul de testare HDTF, care a devenit un standard de referință pentru această suită de sarcini.
Deoarece nu existau sisteme direct comparabile care să poată încapsula această funcționalitate de la capăt la capăt, autorii au ales o varietate de cadre care să reproducă cel puțin o parte a funcționalității țintă, și care ar putea servi ca linii de bază; și anume, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; și SadTalker.
Câteva metrice stabilite au fost utilizate, de asemenea, pentru a evalua calitatea generării și a editării, cu acuratețea sincronizării buzelor evaluată prin SyncNet, raportând atât eroarea absolută dintre mișcările buzelor și audio (LSE-D), cât și un scor de încredere (LSE-C); Distanța videoclipului Fréchet (FVD) care măsoară cât de realist pare videoclipul în ansamblu; și Metrii de similaritate perceptuală învățați (LPIPS), care măsoară similaritatea perceptuală între cadre generate și originale.
Pentru editare, toate metricele, cu excepția LPIPS, au fost aplicate doar segmentului modificat; pentru generare, întregul videoclip a fost evaluat, cu excepția continuității marginilor.
Fiecare model a fost solicitat să sintetizeze un segment de videoclip care se potrivea, care a fost apoi introdus în clipul original (cercetătorii notează că această metodă a introdus adesea discontinuități vizibile, acolo unde segmentul editat se întâlnea cu filmarea înconjurătoare). O a doua abordare a fost testată, de asemenea, în care întregul videoclip a fost regenerat de la audio-ul modificat – dar acest lucru a suprascris inevitabil regiunile needitate și a eșuat în a păstra performanța originală:

Compararea performanței de editare între sistemele proiectate inițial pentru generarea feței care vorbește, cu FacEDiT care depășește toate liniile de bază în fiecare metrică, realizând o eroare de sincronizare a buzelor mai mică (LSE-D), o încredere de sincronizare mai mare (LSE-C), o păstrare a identității mai puternică (IDSIM), o realism mai mare (FVD) și tranziții mai netede la marginile editării (Pcontinuity, Mcontinuity). Colonnele umbrite evidențiază criteriile cheie pentru evaluarea calității marginilor; valorile îngroșate și subliniate indică cele mai bune și, respectiv, al doilea cel mai bun rezultat.
În legătură cu aceste rezultate, autorii menționează:
‘Modelul nostru depășește semnificativ metodele existente la sarcina de editare. Acesta realizează o continuitate puternică a marginilor și o păstrare puternică a identității, demonstrând capacitatea sa de a menține coerența temporală și vizuală în timpul editării. În plus, acuratețea sa superioară de sincronizare a buzelor și FVD scăzut reflectă realismul videoclipului sintetizat.’
Apăsați pentru a reda. Rezultate, asamblate de mine din videoclipurile publicate pe site-ul proiectului. Vă rugăm să consultați site-ul sursă pentru o rezoluție mai bună.
Mai mult, a fost efectuat un studiu uman pentru a evalua calitatea percepută atât pentru editare, cât și pentru generare.
Pentru fiecare comparație, participanții au vizualizat șase videoclipuri și le-au clasat după calitatea generală, luând în considerare acuratețea sincronizării buzelor, naturalitatea și realismul mișcării capului. În încercările de editare, participanții au evaluat, de asemenea, netezimea tranzițiilor între segmentele editate și needitate:

Mediile clasamentului atribuite de evaluatorii umani, unde mai mic înseamnă mai bine. Atât la editare, cât și la generare, participanții au evaluat cât de natural și sincronizat a fost fiecare videoclip. Pentru editare, ei au evaluat, de asemenea, cât de netede au fost tranzițiile între discursul editat și needitat. Numerele îngroșate și subliniate arată primele două scoruri.
În studiu, FacEDiT a fost clasat constant pe primul loc de către participanți, cu o diferență clară, atât pentru calitatea editării, cât și pentru netezimea tranzițiilor, și a primit, de asemenea, scoruri puternice în setarea generării, sugerând că avantajele sale măsurate se traduc în ieșiri perceptual preferate.
Din cauza lipsei de spațiu, ne referim cititorul la lucrarea sursă pentru detalii suplimentare despre studiile de ablație și testele suplimentare care au fost efectuate și raportate în noua lucrare. În realitate, ofertele de cercetare prototipică de acest fel luptă pentru a genera secțiuni semnificative de teste, deoarece oferta însăși este inevitabil o bază potențială pentru lucrări ulterioare.
Concluzie
Chiar și pentru inferență, sistemele de acest fel pot necesita resurse computaționale semnificative la momentul inferenței, făcând dificil pentru utilizatorii din aval – aici, presupunem că sunt magazinele de efecte vizuale – să păstreze lucrul pe teren, motiv pentru care abordările care pot fi adaptate la resurse locale realiste vor fi întotdeauna preferate de furnizori, care sunt sub obligația legală de a proteja filmările și proprietatea intelectuală a clienților.
Asta nu înseamnă să criticăm noua ofertă, care poate funcționa perfect sub greutăți cuantificate sau alte optimizări, și care este prima ofertă de acest fel care m-a atras înapoi pe această alee de cercetare de ceva timp.
Publicat pentru prima dată miercuri, 17 decembrie 202. Editat 20.10 EET, în aceeași zi, pentru spațiu suplimentar în primul paragraf al corpului.












