Andersons vinkel

Tilføying dialog til virkelige videoer med AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Et nytt AI-rammeverk kan omskrive, fjerne eller legge til en persons ord i en video uten å gjøre omopptak, i ett enkelt sluttpunktssystem.

 

For tre år siden ville internettet ha vært sjokkert av noen av de 20-30 AI-videoendringsrammeverkene som publiseres på akademiske portalene hver uke; som det er, har denne populære forskningsretningen nå blitt så omfattende at den nesten utgjør en egen gren av “AI-søppel”, og jeg dekker langt færre av slike utgivelser enn jeg ville ha gjort for to eller tre år siden.

Likevel fanget en av de nyeste utgivelsene i denne retningen min oppmerksomhet: et integrert system som kan gripe inn i virkelige video klipp og sette inn nytt tale i den eksisterende videoen (i stedet for å lage en hel generativ klipp fra et ansikt eller ramme, som er mye vanligere).

I eksemplene nedenfor, som jeg har redigert sammen fra en mengde eksempelvideoer tilgjengelige på prosjektets nettsted, ser vi først den virkelige kildeklippen, og deretter, under, det påførte AI-talet i midten av klippen, inkludert tale-syntese og leppesynkronisering:

Trykk på å spille. Lokal redigering med sying – en av flere modaliteter tilbudt av FacEDiT. Vennligst se kilde-nettstedet for bedre oppløsning. Kilde – https://facedit.github.io/

Dette tilnærmingen er en av tre utviklet for den nye metoden, denne tittelen “lokal redigering med sying”, og den som interesserte forfatterne (så vel som meg). I praksis utvides klippen ved å bruke en av midt-rammene som utgangspunkt for ny AI-tolkning, og dens påfølgende (virkelige) rammene som mål som den generative innførte klippen skal prøve å matche opp til. I klippene over, representeres disse “frø” og “mål”-rammene av den øverste videoen som stopper mens den endrede videoen under gir generativ infylling.

Forfatterne rammer denne ansikts- og tale-syntese-tilnærmingen som den første fullt integrerte sluttpunkt-metoden for AI-videoendringer av denne typen, og observerer potensialet for et fullt utviklet rammeverk som dette for TV- og filmproduksjon:

‘Filmmakere og medieprodusenter trenger ofte å revidere bestemte deler av innspilte videoer – kanskje et ord ble feiluttalt eller manuset ble endret etter innspilling. For eksempel, i den ikoniske scenen fra Titanic (1997) hvor Rose sier, “I’ll never let go, Jack,” kan regissøren senere bestemme at det skal være “I’ll never forget you, Jack”.

‘Tradisjonelt krever slike endringer at hele scenen må gjøres om igjen, noe som er kostbart og tidskrevende. Tale-ansikts-syntese tilbyr en praktisk alternativ ved å automatisk modifisere ansiktsbevegelse for å matche revidert tale, og eliminere behovet for om-innspilling.’

Selv om AI-innskudd av denne typen kan møte kulturell eller bransjeresistans, kan de også utgjøre en ny type funksjonalitet i menneske-ledede VFX-systemer og verktøy-suiter. I alle fall, for øyeblikket, er utfordringene strengt tekniske.

Bortsett fra å utvide en klipp gjennom ekstra AI-generert dialog, kan det nye systemet også endre eksisterende tale:

Trykk på å spille. Et eksempel på å endre eksisterende dialog i stedet for å legge til ekstra dialog. Vennligst se kilde-nettstedet for bedre oppløsning.

Tilstand av kunst

Det finnes for øyeblikket ingen sluttpunkt-systemer som tilbyr denne type syntese-egenskap; selv om en voksende mengde generative AI-plattformer som Google’s Veo-serie, kan generere audio, og diverse andre rammeverk kan lage deepfaked audio, må man for øyeblikket lage en ganske komplisert pipeline av diverse arkitekturer og triks for å gripe inn i virkelige opptak på måten det nye systemet – tittelen FacEDiT – kan gjøre.

Systemet bruker Diffusion Transformers (DiT) i kombinasjon med Flow Matching for å lage ansiktsbevegelse betinget av omgivende (kontekstuelle) bevegelser og tale-audio-innhold. Systemet utnytter eksisterende populære pakker som håndterer ansiktsrekonstruksjon, inkludert LivePortrait (nylig overtatt av Kling).

I tillegg til denne metoden, gitt at deres tilnærming er den første til å integrere disse utfordringene i en enkelt løsning, har forfatterne skapt en ny benchmark kalt FacEDiTBench, sammen med flere helt nye evaluering-metrikker som er egnet for denne svært spesifikke oppgaven.

Det nye arbeidet er tittelen FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling, og kommer fra fire forskere fra Koreas Pohang University of Science and Technology (POSTECH ), Korea Advanced Institute of Science & Technology (KAIST), og The University of Texas at Austin.

Metode

FacEDiT er trent for å rekonstruere ansiktsbevegelse ved å lære hvordan man fyller inn manglende deler av en skuespillers opprinnelige ytelse, basert på omgivende bevegelse og tale-audio. Som vist i schemaet nedenfor, gjør denne prosessen at modellen kan fungere som en gap-fyller under trening, og forutsier ansiktsbevegelser som matcher stemmen mens den holder seg konsistent med den opprinnelige videoen:

Oversikt over FacEDiT-systemet, som viser hvordan ansiktsbevegelse lærer seg gjennom selv-supervisert infylling under trening, guidet av redigert tale under inferens, og til slutt rendre tilbake til video ved å gjenbruke utseendet av den opprinnelige opptaketen, mens kun erstatter den målrettede bevegelsen.. Kilde - https://arxiv.org/pdf/2512.14056

Oversikt over FacEDiT-systemet, som viser hvordan ansiktsbevegelse lærer seg gjennom selv-supervisert infylling under trening, guidet av redigert tale under inferens, og til slutt rendre tilbake til video ved å gjenbruke utseendet av den opprinnelige opptaketen, mens kun erstatter den målrettede bevegelsen. Kilde

Under inferens-tid, støtter den samme arkitekturen to forskjellige utdata, avhengig av hvor mye av videoen som er maskert: delvise redigeringer, hvor bare en frase er endret og resten blir uberørt; eller full-setning-generering, hvor ny bevegelse syntetiseres helt fra scratch.

Modellen er trent via flow matching, som behandler video-redigeringer som en type vei mellom to versjoner av ansiktsbevegelse.

I stedet for å lære å gjette hva en redigert ansikt skal se ut som fra scratch, lærer flow matching å flytte gradvis og jevnt mellom en støyende placeholder og den riktige bevegelsen. For å gjøre dette, representerer systemet ansiktsbevegelse som en kompakt mengde tall som er trukket ut fra hver rammene ved hjelp av en versjon av den ovennevnte LivePortrait-systemet (se schema ovenfor).

Disse bevegelsesvektorene er designet for å beskrive uttrykk og hodepose uten å blande identitet, så at tale-endringer kan lokaliseres uten å påvirke personens totale utseende.

FacEDiT-trening

For å trene FacEDiT, ble hver video-klipp delt inn i en serie ansiktsbevegelses-snapshot, og hver rammene ble parret med den tilhørende delen av audio. Tilfeldige deler av bevegelsesdataene ble deretter skjult, og modellen ble bedt om å gjette hva disse manglende bevegelsene skulle se ut som, ved å bruke både tale og omgivende umaskerte bevegelse som kontekst.

Fordi de maskerte spenn og deres posisjoner varierer fra ett treningseksempel til det neste, lærer modellen gradvis hvordan man håndterer både små interne redigeringer og lengre hull, for full-sekvens-generering, avhengig av hvor mye informasjon den får.

Systemets ovennevnte Diffusion Transformer lærer å gjenopprette maskert bevegelse ved å forbedre støyende inndata over tid. I stedet for å mata tale og bevegelse inn i modellen hele tiden, trådes audioen inn i hver prosesserings-blokk gjennom cross-attention, og hjelper systemet å matche leppebevegelser mer nøyaktig til tale-audioen.

For å bevare realisme over redigeringer, er oppmerksomheten biasert mot nærliggende rammene i stedet for hele tidslinjen, og tvinger modellen til å fokusere på lokal kontinuitet, og forhindrer flimring eller bevegelses-hopp på kantene av endrede regioner. Posisjonelle innlegg (som forteller modellen hvor hver rammene dukker opp i sekvensen) hjelper også modellen til å holde en naturlig tidsmessig flyt og kontekst.

Under trening, lærer systemet å forutsi manglende ansiktsbevegelse ved å rekonstruere maskerte spenn basert på tale og nærliggende umaskerte bevegelse. Under inferens-tid, gjenbrukes denne samme oppsettet, men med maskene nå guidet av endringer i tale.

Når et ord eller en frase settes inn, fjernes eller endres, lokaliserer systemet den berørte regionen, maskerer den og regenererer bevegelse som matcher den nye audioen. Full-sekvens-generering behandles som en spesialtilfelle, hvor hele regionen maskeres og syntetiseres fra scratch.

Data og tester

Systemets bakgrunn består av 22 lag for Diffusion Transformer, hver med 16 oppmerksomhets-hoder og feedforward-dimensjoner på 1024 og 2024px. Bevegelses- og utseende-egenskaper trekkes ut ved hjelp av frosne LivePortrait-komponenter, og tale kodet via WavLM og modifisert ved hjelp av VoiceCraft.

En dedikert prosjekterings-lag kartlegger de 786-dimensjonale tale-egenskapene inn i DiT’s latente rom, med kun DiT og prosjekterings-modulene trent fra scratch.

Trening ble utført under AdamW-optimalisatoren med et mål-læring-rate på 1e-4, i en million steg, på to A6000-GPUer (hver med 48GB VRAM), med en total batch-størrelse på åtte.

FacEDiTBench

FacEDiTBench-datasettet inneholder 250 eksempler, hvor hver eksempel består av en video-klipp av den opprinnelige og redigerte tale, samt transkripsjoner for begge. Videoene kommer fra tre kilder, med 100 klipp fra HDTF, 100 fra Hallo3, og 50 fra CelebV-Dub. Hver eksempel ble manuelt kontrollert for å bekrefte at både audio og video var tydelige nok for evaluering.

GPT-4o ble brukt til å revidere hver transkripsjon for å lage grammatisk gyldige redigeringer. Disse reviderte transkripsjonene, sammen med den opprinnelige tale, ble sendt til VoiceCraft for å produsere ny audio; og på hver stadium, ble både transkripsjonen og den genererte tale manuelt gjennomgått for kvalitet.

Hver eksempel ble merket med typen redigering, tidspunktet for endringen, og lengden på den endrede spannet, og redigeringer ble klassifisert som innføringer, slettinger, eller erstatninger. Antallet ord som ble endret varierte fra korte redigeringer på 1-3 ord, medium-redigeringer på 4-6 ord, og lengre redigeringer på 7-10 ord.

Tre egne metrikker ble definert for å evaluere redigeringskvalitet. Fotometrisk kontinuitet, for å måle hvor godt lyset og fargen på en redigert sekvens blander seg med den omgivende videoen, ved å sammenligne piksel-nivå-forskjeller på grensene; bevegelses-kontinuitet, for å vurdere konsistensen av ansiktsbevegelse, ved å måle optisk flyt-forandringer over redigerte og uredigerte rammene; og identitets-bevaring, for å anslå om subjektets utseende forblir konsistent etter redigering, ved å sammenligne ansikts-embeddings fra den opprinnelige og genererte sekvensene ved hjelp av ArcFace-ansikts-gjenkjenningsmodellen.

Tester

Test-modellen ble trent på materiale fra de tre ovennevnte datasettene, totalt rundt 200 timer med video-innhold, inkludert vlogger og filmer, samt høyoppløselige YouTube-videoer.

For å evaluere tale-ansikts-redigering, ble FacEDiTBench brukt, i tillegg til HDTF-test-delen, som har blitt en standard for benchmarking for denne type oppgaver.

Ettersom det ikke fantes noen direkte sammenlignbare systemer som kunne omfatte denne type funksjonalitet, valgte forfatterne en rekke rammeverk som kunne gjenskape minst noen av den ønskede funksjonaliteten, og kunne fungere som referanse-punkter; nemlig, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; og SadTalker.

Flere etablerte metrikker ble også brukt for å vurdere genererings- og redigeringskvalitet, med leppe-synkroniserings-nøyaktighet evaluert gjennom SyncNet, og rapporterte både den absolutte feilen mellom leppe-bevegelser og audio (LSE-D) og en tillits-score (LSE-C); Fréchet Video Distance (FVD) som kvantifiserer hvor realistisk videoen så ut i sin helhet; og Lærte Perseptuelle Likhet-metrikker (LPIPS), som måler perseptuell likhet mellom genererte og opprinnelige rammene.

For redigering, ble alle metrikker unntatt LPIPS kun brukt på den endrede sekvensen; for generering, ble hele videoen evaluert, med grense-kontinuitet ekskludert.

Hver modell ble bedt om å syntetisere en tilsvarende video-sekvens, som deretter ble innført i den opprinnelige klippen (forskerne noterer at denne metoden ofte introduserte synlige diskontinuiteter, der den redigerte sekvensen møtte den omgivende opptaketen). En annen tilnærming ble også testet, hvor hele videoen ble regenerert fra den endrede audioen – men dette overskrev uendrede regioner, og klarte ikke å bevare den opprinnelige ytelsen:

Sammenligning av redigerings-prestasjon over systemer som opprinnelig var designet for tale-ansikts-generering, med FacEDiT som overgår alle referanse-punkter over alle metrikker, og oppnår lavere leppe-synkroniserings-feil (LSE-D), høyere synkroniserings-tillit (LSE-C), sterkere identitets-bevaring (IDSIM), større perseptuell realisme (FVD), og jevnere overganger over redigerings-grensene (Pkontinuitet, Mkontinuitet). Grå-skuggede kolonner markerer de viktigste kriteriene for å vurdere grense-kvalitet; fete og underlinjede verdier indikerer de beste og nest beste resultater, henholdsvis

Sammenligning av redigerings-prestasjon over systemer som opprinnelig var designet for tale-ansikts-generering, med FacEDiT som overgår alle referanse-punkter over alle metrikker, og oppnår lavere leppe-synkroniserings-feil (LSE-D), høyere synkroniserings-tillit (LSE-C), sterkere identitets-bevaring (IDSIM), større perseptuell realisme (FVD), og jevnere overganger over redigerings-grensene (Pkontinuitet, Mkontinuitet). Grå-skuggede kolonner markerer de viktigste kriteriene for å vurdere grense-kvalitet; fete og underlinjede verdier indikerer de beste og nest beste resultater, henholdsvis

Med hensyn til disse resultater, kommenterer forfatterne:

‘[Vår] modell overgår eksisterende metoder på redigerings-oppgaven. Den oppnår sterk grense-kontinuitet og høy identitets-bevaring, og demonstrerer sin evne til å holde tidsmessig og visuell konsistens under redigering. I tillegg, dens overlegne leppe-synkroniserings-nøyaktighet og lav FVD reflekterer realisme av den syntetiserte videoen.’

Trykk på å spille. Resultater, satt sammen av denne forfatteren fra de publiserte videoene på prosjektets nettsted. Vennligst se kilde-nettstedet for bedre oppløsning.

En menneske-studie ble også utført, for å evaluere opplevd kvalitet over både redigering og generering.

For hver sammenligning, så deltakerne seks videoer og rangerte dem etter total kvalitet, og vurderte leppe-synkroniserings-nøyaktighet, naturalitet og realisme av hodebevegelse. I redigerings-forsøk, vurderte deltakerne også jevnheten av overganger mellom redigerte og uredigerte sekvenser:

Gjennomsnittlige rangeringer tildelt av menneskelige evaluatorene, hvor lavere betyr bedre. I både redigering og generering, vurderte deltakerne hvor naturlig og godt-synkronisert hver video så ut. For redigering, vurderte de også jevnheten av overganger mellom redigert og uredigert tale.Bold og underlinjede tall viser de beste to scorene.

Gjennomsnittlige rangeringer tildelt av menneskelige evaluatorene, hvor lavere betyr bedre. I både redigering og generering, vurderte deltakerne hvor naturlig og godt-synkronisert hver video så ut. For redigering, vurderte de også jevnheten av overganger mellom redigert og uredigert tale.Bold og underlinjede tall viser de beste to scorene.

I studien, ble FacEDiT konsekvent rangert som nummer én av deltakerne, med en klar ledelse, både for redigerings-kvalitet og overgangs-jevnhet, og fikk også sterke poeng i genererings-innstillinger, noe som tyder på at dens målte fordeler oversettes til perseptuelt foretrukne utdata.

På grunn av manglende plass, henviser vi leseren til kilde-artikkelen for ytterligere detaljer om reduksjons-studier og ytterligere tester som ble utført og rapportert i det nye arbeidet. I virkeligheten, strømlinjeformer prototypiske forsknings-tilbud av denne typen ofte å produsere meningsfulle test-resultat-seksjoner, ettersom kjerne-tilbudet selv er uunngåelig en potensiell referanse for senere arbeid.

Konklusjon

Selv for inferens, kan systemer som dette kreve betydelige beregningsressurser under inferens-tid, og gjøre det vanskelig for nedstrøms-brukere – her, antageligvis VFX-butikker – å holde arbeidet på egne premisser. Derfor vil tilnærminger som kan tilpasses realistiske lokale ressurser alltid være foretrukket av leverandører, som er under juridisk forpliktelse til å beskytte klients opptak og generell IP.

Dette betyr ikke å kritisere det nye tilbudet, som kan fungere perfekt under kvantiserte vekter eller andre optimaliseringer, og som er det første tilbudet av denne typen som har trukket meg tilbake til denne forsknings-retningen på lang tid.

 

Først publisert onsdag, 17. desember 202. Redigert 20.10 EET, samme dag, for ekstra plass i første tekst-avsnitt.

Forfatter innen maskinlæring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]