Andersons hoek

TikTok-ontwikkelaars wissen gezichten voor augmented reality-toepassingen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

ByteDance, het Chinese multinationale internetbedrijf achter TikTok, heeft een nieuwe methode ontwikkeld om gezichten in video’s uit te wissen, zodat identiteitsvervorming en andere vreemde effecten kunnen worden opgelegd aan mensen in augmented reality-toepassingen. Het bedrijf beweert dat de techniek al is geïntegreerd in commerciële mobiele producten, hoewel het niet specificeert welke producten.

Als de gezichten in video’s eenmaal zijn ‘gewist’, is er voldoende ‘gezichtscanvas’ om oogverblindende vervormingen te produceren, evenals het mogelijk superimponeren van andere identiteiten. Voorbeelden die zijn verstrekt in een nieuw artikel van onderzoekers van ByteDance, laten de mogelijkheden zien, waaronder het herstellen van de ‘gewiste’ kenmerken in verschillende komische (en zeker enkele groteske) configuraties:

Enkele van de mogelijkheden voor gezichtsreconfiguratie die zijn opgenomen in het artikel van ByteDance. Bron: https://arxiv.org/pdf/2109.10760.pdf

Enkele van de mogelijkheden voor gezichtsreconfiguratie die zijn opgenomen in het artikel van ByteDance. Bron: https://arxiv.org/pdf/2109.10760.pdf

Aan het einde van augustus werd bekend dat TikTok, de eerste niet-Facebook-app die drie miljard installs had bereikt, TikTok Effect Studio had gelanceerd (momenteel in gesloten bèta), een platform voor augmented reality-ontwikkelaars om AR-effecten te maken voor TikTok-contentstreams.

Effectief gezien, het bedrijf is aan het inhalen van soortgelijke ontwikkelaarsgemeenschappen bij Facebook’s AR Studio en Snap AR, met Apple’s vermaarde AR R&D-gemeenschap die ook op het punt staat om te worden gemobiliseerd door nieuwe hardware in de komende jaar.

Lege uitdrukkingen

Het artikel, getiteld FaceEraser: verwijderen van gezichtsdelen voor augmented reality, merkt op dat bestaande in-painting/infill-algoritmen, zoals NVIDIA’s SPADE, meer zijn gericht op het voltooien van afgeknotte of anderszins semi-verborgen afbeeldingen dan op het uitvoeren van deze ongebruikelijke ‘wissen’-procedure, en dat bestaande datasetmateriaal daarom voorspelbaar schaars is.

Omdat er geen beschikbare grondwaarheidsdatasets zijn voor mensen die een solide uitgestrektheid van vlees hebben waar hun gezicht zou moeten zijn, hebben de onderzoekers een nieuw netwerkarchitectuur genaamd pixel-clone gemaakt, dat kan worden gesuperponeerd in bestaande neurale inpainting-modellen, en dat problemen oplost die verband houden met textuur- en kleurinconsistenties die worden getoond (het artikel getuigt) door oudere methoden zoals StructureFlow en EdgeConnect.

Algemene workflow van pixel-clone in de nieuwe pipeline.

Algemene workflow van pixel-clone in de nieuwe pipeline.

Om een model te trainen op ‘lege’ gezichten, hebben de onderzoekers afbeeldingen uitgesloten met brillen, of waarbij haar het voorhoofd bedekt, aangezien het gebied tussen de haarlijn en de wenkbrauwen meestal de grootste enkele groep pixels is die ‘plak-over’-materiaal kan leveren voor de centrale kenmerken van het gezicht.

Het voorbereiden van trainingsafbeeldingen. Het voorhoofdsgebied wordt uitgesneden, op basis van sleutelpunten in gezichtsaligneringsherkenning, verticaal omgedraaid en genaaid.

Het voorbereiden van trainingsafbeeldingen. Het voorhoofdsgebied wordt uitgesneden, op basis van sleutelpunten in gezichtsaligneringsherkenning, verticaal omgedraaid en genaaid.

Een 256×256 pixel-afbeelding wordt verkregen, een klein genoeg formaat om te worden gevoed in de latent ruimte van een neurale netwerk in batches die groot genoeg zijn om generalisatie te bereiken. Later algoritme-upscaling zal de benodigde resoluties herstellen om te werken in de AR-ruimte.

Architectuur

Het netwerk bestaat uit drie innerlijke netwerken, waaronder Edge Completion, Pixel-Clone en een verfijningsnetwerk. Het edge completion-netwerk gebruikt dezelfde soort encoder-decoder-architectuur die wordt gebruikt in EdgeConnect (zie boven), evenals in de twee meest populaire deepfake-toepassingen. De encoders downsamplen de afbeeldingsinhoud tweemaal, en de decoders herstellen de oorspronkelijke afbeeldingsdimensies.

Pixel-Clone gebruikt een gemodificeerde encoder-decoder-methode, terwijl de verfijningslaag een U-Net-architectuur gebruikt, een techniek die oorspronkelijk is ontwikkeld voor biomedische beeldvorming, die vaak voorkomt in beeldsyntheseprojecten.

Tijdens de trainingsworkflow is het noodzakelijk om de nauwkeurigheid van de transformaties te evalueren, en, indien nodig, de pogingen herhaaldelijk te herhalen tot convergentie. Hiervoor worden twee discriminatoren op basis van PatchGAN gebruikt, die elk de gelokaliseerde realiteit van 70×70 pixel-patches evalueren, waarbij de realiteit van de gehele afbeelding wordt afgekeurd.

Training en gegevens

Het edge completion-netwerk wordt aanvankelijk onafhankelijk getraind, terwijl de andere twee netwerken samen worden getraind, op basis van de gewichten die zijn verkregen uit de edge completion-training, die zijn vastgelegd en bevroren tijdens deze procedure.

Hoewel het artikel niet expliciet vermeldt dat de voorbeelden van finale kenmerkvervorming het centrale doel van het model zijn, implementeert het verschillende komische effecten om de veerkracht van het systeem te testen, waaronder het verwijderen van wenkbrauwen, het vergroten van monden, het verkleinen van sub-gezichten en ‘toon-achtige’ effecten (zoals getoond in de eerder genoemde afbeelding).

Het artikel beweert dat ‘de gewiste gezichten verschillende augmented reality-toepassingen mogelijk maken die het plaatsen van gebruikerspecifieke elementen vereisen’, waarbij de mogelijkheid wordt geïmpliceerd om gezichten aan te passen met door derden bijgedragen elementen.

Het model is getraind op masks uit de door NVIDIA gemaakte FFHQ-dataset, die een adequate variëteit aan leeftijden, etniciteiten, verlichting en gezichtsposities en -stijlen bevat om een nuttige generalisatie te bereiken. De dataset bevat 35.000 afbeeldingen en 10.000 trainingsmasks om de gebieden van transformatie te definiëren, met 4000 afbeeldingen en 1000 masks die zijn gereserveerd voor validatiedoeleinden.

Trainingsgegevensvoorbeelden.

Trainingsgegevensvoorbeelden.

Het getrainde model kan inferentie uitvoeren op gegevens uit 2017’s CelebA-HQ en VoxCeleb, ongezien gezichten uit FFHQ, en alle andere ongeconstrueerde, ongeziene gezichten die aan het model worden gepresenteerd. De 256×256-afbeeldingen werden getraind op het netwerk in batches van 8 over een Adam-optimizer, geïmplementeerd in PyTorch, en draaiend op een Tesla V100-GPU voor ‘2000.000 epochs’.

Inferentieresultaten verkregen op een echt gezicht.

Inferentieresultaten verkregen op een echt gezicht.

Net als bij andere gezichtsgebaseerde beeldsyntheseprojecten, moet het systeem omgaan met incidentele mislukkingen veroorzaakt door obstakels of occlusies zoals haar, randapparatuur, brillen en gezichtsbeharing.

Het rapport concludeert:

‘Onze aanpak is geïntegreerd in commerciële producten en werkt goed voor ongeconstrueerde gebruikersinvoer.’

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]