Andersons vinkel

TikTok-udviklere sletter ansigter til forstærket virkelighedsapplikationer

mm
Føj Unite.AI til dine foretrukne kilder på Google

ByteDance, det kinesiske multinationale internetfirma bag TikTok, har udviklet en ny metode til at slette ansigter i video, så identitetsforvrængning og andre bizarre effekter kan påføres personer i forstærket virkelighedsapplikationer. Firmaet hævder, at teknikken allerede er integreret i kommercielle mobile produkter, selvom det ikke angives, hvilke produkter.

Når ansigter i video er “nulstillet”, er der nok “ansigts-canvas” til at producere øjenåbnende forvrængninger samt muligvis påføring af andre identiteter. Eksempler leveret i en ny rapport fra ByteDance-forskere illustrerer mulighederne, herunder genskabelse af “slettede” træk i forskellige komiske (og bestemt nogle groteske) konfigurationer:

Nogle af mulighederne for ansigtsomkonfiguration inkluderet i ByteDance-rapporten. Kilde: https://arxiv.org/pdf/2109.10760.pdf

Nogle af mulighederne for ansigtsomkonfiguration inkluderet i ByteDance-rapporten. Kilde: https://arxiv.org/pdf/2109.10760.pdf

I slutningen af august blev det kendt, at TikTok, den første non-Facebook-app til at nå tre milliarder downloads, havde lanceret TikTok Effect Studio (i øjeblikket i lukket beta), en platform for forstærket virkelighedsudviklere til at skabe forstærket virkelighedseffekter til TikTok-indholdstrømme.

Effektivt er firmaet ved at indhente lignende udviklerfællesskaber på Facebooks AR Studio og Snap AR, med Apples værdsatte AR R&D-fællesskab også sat til at blive galvaniseret af nyt hardware over de næste år.

Tomme udtryk

Rapporten “FaceEraser: Removing Facial Parts for Augmented Reality” bemærker, at eksisterende in-painting/infill-algoritmer, såsom NVIDIA’s SPADE, er mere rettet mod at fuldføre afkortede eller på anden måde semi-tilslørede billeder end at udføre denne usædvanlige “sletnings”-procedure, og at eksisterende datasett-materiale derfor er præget af mangel.

Siden der ikke er tilgængelige grund sandhed-datasets for personer, der har en solid udstrækning af kød, hvor deres ansigt burde være, har forskerne oprettet en ny netværksarkitektur kaldet pixel-clone, der kan indsættes i eksisterende neurale in-painting-modeller og som løser problemer relateret til tekstur- og farveuensartetheder vist (rapporten bekræfter) af ældre metoder såsom StructureFlow og EdgeConnect.

Den generelle arbejdsgang for pixel-clone i den nye pipeline.

Den generelle arbejdsgang for pixel-clone i den nye pipeline.

For at træne en model på “tomme” ansigter udelukkede forskerne billeder med briller eller hvor håret skjuler panden, da området mellem hårlinen og øjenbrynene normalt er den største enkeltgruppe af pixel, der kan levere “klistre-over”-materiale til ansigtets centrale træk.

Forberedelse af træningsbilleder. Panden afskæres, baseret på nøglepunkter i ansigts-alignment-genkendelse, vertikalt vendt og syet sammen.

Forberedelse af træningsbilleder.

Et billede på 256×256 pixel erhverves, en lille nok størrelse til at føre ind i det latente rum af et neuralt netværk i batches, der er store nok til at opnå generalisering. Senere algoritmisk opskalering vil genskabe nødvendige opløsninger til at arbejde i forstærket virkelighedsrum.

Arkitektur

Netværket består af tre indre netværk, bestående af Edge Completion, Pixel-Clone og et forfiningsnetværk. Edge completion-netværket bruger den samme encoder-decoder-arkitektur, der anvendes i EdgeConnect (se ovenfor), samt i de to mest populære deepfake-applikationer. Encoderne nedsample billedindhold to gange, og decoderne genskaber de oprindelige billedimensioner.

Pixel-Clone bruger en modificeret encoder-decoder-metodik, mens forfiningslaget bruger U-Net-arkitektur, en teknik oprindeligt udviklet til biomedicinsk billedbehandling, der ofte indgår i billedsyntheseforskningsprojekter.

Under træningsarbejdsgangen er det nødvendigt at evaluere transformationspræcisionen og, efter behov, gentage forsøgene iterativt op til konvergens. Til dette formål bruges to diskriminanter baseret på PatchGAN, hver af hvilke vurderer den lokaliserede realisme af 70×70 pixel-patches, med diskontering af realisme-værdien af hele billedet.

Træning og data

Edge completion-netværket trænes først uafhængigt, mens de to andre netværk trænes sammen, baseret på vægtene, der er resulteret fra edge completion-træningen, som er faste og frosne under denne procedure.

Selvom rapporten ikke udtrykkeligt angiver, at dens eksempler på endelige trækforvrængning er modellens centrale formål, implementerer den forskellige komiske effekter for at teste systemets robusthed, herunder øjenbryn-fjernelse, forstørrede munde, formindskede under-ansigter og “tegneserie”-effekter (som vist i billedet ovenfor).

Rapporten fastslår, at “de slettede ansigter muliggør forskellige forstærket virkelighedsapplikationer, der kræver placering af brugerdefinerede elementer”, hvilket antyder muligheden for at tilpasse ansigter med tredjeparts-, brugerbidragne elementer.

Modellen trænes på masker fra NVIDIA-oprettede FFHQ-dataset, der indeholder en tilstrækkelig variation af aldre, etniciteter, belysning og ansigtsposer og -stilarter til at opnå en nyttig generalisering. Datasettet indeholder 35.000 billeder og 10.000 træningsmasker til at afgrænse områderne for transformation, med 4000 billeder og 1000 masker sat til side til valideringsformål.

Træningsdata-eksempler.

Træningsdata-eksempler.

Den trænede model kan udføre slutning på data fra 2017’s CelebA-HQ og VoxCeleb, usete ansigter fra FFHQ og enhver anden ubegrænset, uset ansigter, der præsenteres for den. De 256×256 billeder blev trænet på netværket i batches på 8 over en Adam-optimizer, implementeret i PyTorch, og kørende på en Tesla (TSLA ) V100 GPU i “2000.000 epoker”.

Slutningsresultater erhvervet på et rigtigt ansigt.

Slutningsresultater erhvervet på et rigtigt ansigt.

Som er almindeligt i ansigtsbaseret billedsyntheseforskning, må systemet bekæmpe lejlighedsvis fejlprovokeret af forhindringer eller tilsløring såsom hår, peripherals, briller og ansigtsbehåring.

Rapporten slutter:

‘Vores tilgang er blevet kommercielt udnyttet og fungerer godt i produkter for ubegrænsede brugerindstillinger.’

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai