Andersons vinkel

Ændring af Emotioner i Videooptagelser med AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra Grækenland og Storbritannien har udviklet en ny deep learning-tilgang til at ændre udtryk og åbenlyse humør hos mennesker i videooptagelser, samtidig med at de bevarer trofastheden af deres læbebevægelser i forhold til den originale lyd på en måde, som tidligere forsøg ikke har kunnet matche.

Fra videoen, der ledsager artiklen (indlejret i slutningen af denne artikel), en kort klip af skuespiller Al Pacino, der får sin udtryk subtilt ændret af NED, baseret på højtniveau-semantiske begreber. Kilde: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Fra videoen, der ledsager artiklen (indlejret i slutningen af denne artikel), en kort klip af skuespiller Al Pacino, der får sin udtryk subtilt ændret af NED, baseret på højtniveau-semantiske begreber, der definerer individuelle ansigtsudtryk og deres associerede emotion. ‘Reference-Driven’-metoden til højre tager den fortolkede emotion/er fra en kildevideo og anvender det på hele videosekvensen. Kilde: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Dette felt hører under den voksende kategori af deepfaked emotioner, hvor identiteten af den oprindelige taler bevares, men udtryk og mikroudtryk ændres. Da denne specifikke AI-teknologi modner, åbner den muligheder for film- og tv-produktioner at foretage subtile ændringer af skuespillernes udtryk – men åbner også en ret ny kategori af ’emotion-ændrede’ video deepfakes.

Ændring af Ansigter

Ansigtudtryk for offentlige figurer, såsom politikere, er omhyggeligt kurateret; i 2016 kom Hillary Clintons ansigtudtryk under intens mediebevågenhed for deres potentielle negative indvirkning på hendes valgmuligheder; ansigtudtryk er også et emne af interesse for FBI; og de er en kritisk indikator i jobsamtaler, hvilket gør udsigten til en live ‘udtrykskontrol’-filter en ønskværdig udvikling for jobkandidater, der forsøger at bestå en forhåndsskrivning på Zoom.

En studie fra 2005 fra Storbritannien fastslog, at ansigtets udseende påvirker valgbeslutninger, mens en artikel fra 2019 i Washington Post undersøgte brugen af ‘uden for kontekst’ video-klipdeling, som i øjeblikket er det nærmeste, man kan komme til at ændre, hvordan en offentlig figur synes at opføre sig, reagere eller føle.

Mod Neuralt Udtryksmanipulation

For øjeblikket er tilstanden for manipulation af ansigtets udtryk ret rudimentær, da det indebærer at tackle disentanglement af højtniveau-begreber (såsom sad, angry, happy, smiling) fra den faktiske videoindhold. Selvom traditionelle deepfake-arkitekturer synes at opnå dette disentanglement ret godt, kræver spejling af emotioner på tværs af forskellige identiteter stadig, at to træningsansigts-sæt indeholder matchende udtryk for hver identitet.

Fordi ansigtets ID og pose-karakteristika i øjeblikket er så tæt sammenflettet, kræves en bred lighed af udtryk, hovedpose og (i mindre udstrækning) belysning på tværs af to ansigtsdataset for at træne en effektiv deepfake-model på systemer som DeepFaceLab. Jo mindre en bestemt konfiguration (såsom 'side-view/smiling/sunlit') er fremhævet i begge ansigts-sæt, jo mindre præcis vil den rendre i en deepfake-video, hvis det er nødvendigt.

Typiske eksempler på ansigtsbilleder i dataset, der bruges til at træne deepfakes. For øjeblikket kan man kun manipulere en persons ansigtudtryk ved at oprette ID-specifikke udtryk-udtryk-veje i en deepfake-neuralt netværk. 2017-æra deepfake-software har ingen intrinsisk, semantisk forståelse af et ‘smile’ – det kartærer og matcher blot opfattede ændringer i ansigtets geometri på tværs af de to subjekter.

Hvad der er ønskværdigt, og som endnu ikke er fuldstændigt opnået, er at genkende, hvordan subjekt B (for eksempel) smiler, og blot oprette en ‘smile’-knap i arkitekturen, uden at behøve at kartære det til et tilsvarende billede af subjekt A, der smiler.

Den nye artikel har titlen Neural Emotion Director: Speech-preserving semantic control of facial expressions in “in-the-wild” videos og kommer fra forskere ved Skolen for Elektrisk og Computerteknisk Ingeniørvidenskab ved Det Nationale Tekniske Universitet i Athen, Institut for Computer Science ved Foundation for Research and Technology Hellas (FORTH) og College of Engineering, Mathematics and Physical Sciences ved University of Exeter i Storbritannien.

Holdet har udviklet en ramme kaldet Neural Emotion Director (NED), der inkorporerer et 3D-baseret emotion-translation-netværk, 3D-Based Emotion Manipulator.

NED tager en modtaget sekvens af udtryksparametre og oversætter dem til et mål-domæne. Det er trænet på uparallel data, hvilket betyder, at det ikke er nødvendigt at træne på dataset, hvor hver identitet har tilsvarende ansigtudtryk.

Videoen, der vises i slutningen af denne artikel, løber gennem en række tests, hvor NED påfører et åbenlyst emotionelt tilstand til optagelser fra YouTube-datasettet.

Videoen, der vises i slutningen af denne artikel, løber gennem en række tests, hvor NED påfører et åbenlyst emotionelt tilstand til optagelser fra YouTube-datasettet.

Forfatterne hævder, at NED er den første video-baserede metode til at ‘instruere’ skuespillere i tilfældige og uforudsigelige situationer, og har gjort koden tilgængelig på NED’s projektside.

Metode og Arkitektur

Systemet er trænet på to store video-dataset, der er annoteret med ’emotion’-mærker.

Outputtet er muliggjort af en video-ansigtsgenerator, der renderer den ønskede emotion til video ved hjælp af traditionelle ansigtssynteseteknikker, herunder ansigtsssegmentering, ansigtlandmærkejustering og blending, hvor kun ansigtets område syntetiseres, og derefter påføres til den originale optagelse.

Arkitekturen for pipeline til Neural Emotion Detector (NED). Kilde: https://arxiv.org/pdf/2112.00585.pdf

Arkitekturen for pipeline til Neural Emotion Detector (NED). Kilde: https://arxiv.org/pdf/2112.00585.pdf

Initialt får systemet 3D-ansigtsgenvinding og påfører ansigtlandmærkejusteringer på inputrammerne for at identificere udtrykket. Efter dette bliver de genskabte udtryksparametre overført til 3D-baseret Emotion Manipulator, og en stil-vektor beregnes ved hjælp af enten en semantisk mærke (såsom ‘happy’) eller en referencefil.

En referencefil er en video, der portrætterer en bestemt genkendt udtryk/emotion, som derefter påføres til hele målvideoen, hvor det originale udtryk erstattes.

Stadier i emotionsoverførsels-pipeline, der viser forskellige skuespillere sampet fra YouTube-videoer.

Stadier i emotionsoverførsels-pipeline, der viser forskellige skuespillere sampet fra YouTube-videoer.

Den endelige genererede 3D-ansigtform er derefter konkateneret med Normalized Mean Face Coordinate (NMFC) og øjnebilleder (de røde prikker på billedet ovenfor), og overføres til neuralt render, der udfører den endelige manipulation.

Resultater

Forskerne har gennemført omfattende studier, herunder bruger- og ablationsstudier, for at evaluere effektiviteten af metoden i forhold til tidligere arbejde, og fandt, at i de fleste kategorier, NED overgår den nuværende tilstand af kunsten i denne undersektor af neural ansigtmanipulation.

Artiklens forfattere forestiller sig, at senere implementeringer af dette arbejde og værktøjer af samme natur vil være nyttige primært i tv- og filmindustrien, og udtaler:

‘Vores metode åbner en mangfoldighed af nye muligheder for nyttige anvendelser af neurale render-teknologier, der strækker sig fra film-postproduktion og videospil til fotorealistiske affektive avatars.’

Dette er et tidligt arbejde på området, men et af de første, der forsøger ansigtsgengivelse med video i stedet for stillebilleder. Selvom videoer i virkeligheden er mange stillebilleder, der løber meget hurtigt, er der temporale overvejelser, der gør tidligere anvendelser af emotionsoverførsel mindre effektive. I den tilhørende video og eksempler i artiklen inkluderer forfatterne visuelle sammenligninger af NED’s output mod andre sammenlignelige metoder.

Flere detaljerede sammenligninger og mange flere eksempler på NED kan findes i den fulde video nedenfor:

 

3. december 2021, 18:30 GMT+2 – Ved anmodning fra en af artiklens forfattere blev korrektioner foretaget med hensyn til ‘reference-filen’, som jeg fejlagtigt havde angivet som et stillebillede (da det i virkeligheden er en video-klip). Ligeledes blev en ændring foretaget i navnet på Institut for Computer Science ved Foundation for Research and Technology.
3. december 2021, 20:50 GMT+2 – En anden anmodning fra en af artiklens forfattere om en yderligere ændring af navnet på den ovennævnte institution.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai