Andersons vinkel
Omstrukturering af ansigter i videoer med maskinlæring

Et forskningssamarbejde mellem Kina og Storbritannien har udviklet en ny metode til at omforme ansigter i videoer. Teknikken tillader overbevisende udvidelse og indskrænkning af ansigtsstruktur med høj konsistens og uden artefakter.

Fra en YouTube-video brugt som kilde af forskerne, ser skuespilleren Jennifer Lawrence ud som en mere gul personlighed (højre). Se den tilhørende video nedenfor for flere eksempler i bedre opløsning. Kilde: https://www.youtube.com/watch?v=tA2BxvrKvjE
Dette slag af transformation er normalt kun muligt gennem traditionelle CGI-metoder, der ville kræve en fuldstændig genskabelse af ansigtet via detaljerede og dyre motion-capture-, rigging- og teksturprocedurer.
I stedet integrerer teknikken CGI i en neural pipeline som parametrisk 3D-ansigtsinformation, der herefter bruges som basis for en maskinlæringsworkflow.

Traditionelle parametriske ansigter bruges stadig mere som retningslinjer for transformative processer, der bruger AI i stedet for CGI. Kilde: https://arxiv.org/pdf/2205.02538.pdf
Forfatterne skriver:
‘Vores mål er at generere højkvalitets portrætvideo-omformning ved at redigere den overordnede form af portrætansigterne i overensstemmelse med naturlig ansigtsdeformation i den virkelige verden. Dette kan bruges til anvendelser som f.eks. ansigtsgeneration til skønhedsformål og ansigtsforstørrelse til visuelle effekter.’
Selvom 2D-ansigtsforvridning og -forvrængning har været tilgængelig for forbrugere siden Photoshop (og har ført til underlige og ofte uacceptable subkulturer omkring ansigtsforvridning og kropdysmorfisme), er det en svær trick at udføre i videoer uden at bruge CGI.

Mark Zuckerbergs ansigtsdimensioner udvidet og indskrænket af den nye kinesisk-britiske teknik.
Kroppsomformning er i øjeblikket et felt af intensiv interesse i computer vision-sektoren, primært på grund af dets potentiale i mode-e-handel, selvom det at gøre nogen til at se højere eller skeletmæssigt divers ud i øjeblikket er en bemærkelsesværdig udfordring.
Ligeledes har ændring af hovedformen i videooptagelser på en konsistent og overbevisende måde været genstand for tidligere arbejde fra papirets forfattere, selvom denne implementering led af artefakter og andre begrænsninger. Den nye metode udvider kapaciteten af denne tidligere forskning fra statisk til videooutput.
Det nye system blev trænet på en desktop-computer med en AMD Ryzen 9 3950X med 32 GB hukommelse og bruger en optisk flow-algoritme fra OpenCV til bevægelseskort, glattet af StructureFlow-rammen; Facial Alignment Network (FAN)-komponenten til landmark-estimation, der også bruges i populære deepfake-pakker; og Ceres Solver til at løse optimeringsudfordringer.

Et ekstremt eksempel på ansigtsudvidelse med det nye system.
Papiret hedder Parametric Reshaping of Portraits in Videos og kommer fra tre forskere fra Zhejiang Universitet og en fra University of Bath.
Om Ansigtet
Under det nye system udtrækkes videoen til en billedsekvens, og en rigid pose estimeres først for hvert ansigt. Herefter estimeres et repræsentativt antal efterfølgende billeder sammen for at konstruere konsistente identitetsparametre langs hele billedsekvensen (dvs. videoens billeder).

Arkitektonisk flow af ansigtsforvridningssystemet.
Efter dette vurderes udtrykket, hvilket giver en omformningsparameter, der implementeres ved lineær regression. Herefter konstruerer en ny signed distance-funktion (SDF)-tilgang en tæt 2D-mapping af ansigtslinierne før og efter omformning.
Til sidst udføres en indholdssensitiv forvridningsoptimering på outputvideoen.
Parametriske Ansigter
Processen benytter en 3D-morfabel ansigtsmodel (3DMM), en stadig mere populær tilføjelse til neurale og GAN-baserede ansigtssyntesystemer, samt applicabel for deepfake-detektionssystemer.

Ikke fra det nye papir, men et eksempel på en 3D-morfabel ansigtsmodel (3DMM) – en parametrisk prototypeansigt brugt i det nye projekt. Øverst til venstre, landmark-applikation på et 3DMM-ansigt. Øverst til højre, 3D-mesh-vertex af en isomap. Nederst til venstre viser landmark-tilpasning; nederst i midten, en isomap af den ekstraherede ansigtstekstur; og nederst til højre, en resulterende tilpasning og form. Kilde: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Arbejdsgangen i det nye system må tage højde for tilfælde af okklusion, såsom en situation, hvor subjektet kigger væk. Dette er en af de største udfordringer i deepfake-software, da FAN-landmarks har lidt kapacitet til at tage højde for disse tilfælde og tenderer til at nedbryde i kvalitet, når ansigtet vender væk eller er okkluderet.
Det nye system kan undgå denne fælde ved at definere en kontur-energi, der er i stand til at matche grænsen mellem det 3D-ansigt (3DMM) og det 2D-ansigt (defineret af FAN-landmarks).
Optimering
En nyttig implementering af sådant et system ville være at implementere realtidsdeformation, f.eks. i videochat-filtre. Den nuværende ramme tillader ikke dette, og de nødvendige beregningsressourcer ville gøre ‘live’-deformation til en bemærkelsesværdig udfordring.
Ifølge papiret og antagende et 24fps-video-mål, repræsenterer billedoperationer i pipeline-latenzen på 16,344 sekunder for hvert sekund af optagelse, med ekstra enkeltstående rammer for identitetsestimation og 3D-ansigtsdeformation (321 ms og 160 ms, henholdsvis).
Derfor er optimering nøgle til at gøre fremskridt mod at reducere latensen. Da fælles optimering på tværs af alle billeder ville tilføje alvorlig overhead til processen, og init-stil optimering (antagende den konsistente efterfølgende identitet af taleren fra det første billede) kunne føre til anomalier, har forfatterne valgt en sparsom skema til at beregne koefficienterne for billeder, der er sampet ved praktiske interval.
Fælles optimering udføres herefter på denne undermængde af billeder, hvilket fører til en mere lean proces for rekonstruktion.
Ansigtforvridning
Forvridningsteknikken brugt i projektet er en tilpasning af forfatternes arbejde fra 2020 Deep Shapely Portraits (DSP).

Deep Shapely Portraits, en indsendelse fra 2020 til ACM Multimedia. Papiret er ledt af forskere fra ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Kilde: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Forfatterne bemærker ‘Vi udvider denne metode fra omformning af ét monokulært billede til omformning af hele billedsekvensen.’
Tests
Papiret bemærker, at der ikke var nogen sammenlignelig tidligere materiale, som man kunne evaluere den nye metode mod. Derfor sammenlignede forfatterne billeder af deres forvrængede videooutput med statisk DSP-output.

Test af det nye system mod statiske billeder fra Deep Shapely Portraits.
Forfatterne bemærker, at artefakter resulterer fra DSP-metoden på grund af dens brug af sparsom mapping – et problem, som den nye ramme løser med tæt mapping. Derudover, video produceret af DSP, påstår papiret, demonstrerer mangel på glatthed og visuel kohærens.
Forfatterne skriver:
‘Resultaterne viser, at vores tilgang kan robust producere kohærente omformede portrætvideoer, mens den billedbaserede metode let kan føre til bemærkelsesværdige flimrenarter.
Se den tilhørende video nedenfor for flere eksempler:
Først udgivet den 9. maj 2022. Ændret kl. 18.00 EET, erstattede ‘felt’ med ‘funktion’ for SDF.












