Andersons Blickwinkel
Umgestaltung von Gesichtern in Videos mit Machine Learning

Eine Forschungskooperation zwischen China und dem Vereinigten Königreich hat eine neue Methode entwickelt, um Gesichter in Videos umzugestalten. Die Technik ermöglicht es, die Gesichtsstruktur überzeugend zu verbreitern und zu verengen, mit hoher Konsistenz und ohne Artefakte.

Aus einem YouTube-Video, das von den Forschern als Quellenmaterial verwendet wurde, erscheint Schauspielerin Jennifer Lawrence als eine mehr asketische Persönlichkeit (rechts). Siehe das begleitende Video am Ende des Artikels für viele weitere Beispiele in besserer Auflösung. Quelle: https://www.youtube.com/watch?v=tA2BxvrKvjE
Solche Transformationen sind normalerweise nur durch traditionelle CGI-Methoden möglich, die das Gesicht vollständig durch detaillierte und teure Motion-Capture-, Rigging- und Texturierungsverfahren neu erstellen müssten.
Stattdessen wird in der Technik das vorhandene CGI in eine neuronale Pipeline integriert, indem parametrierte 3D-Gesichtsinformationen verwendet werden, die anschließend als Grundlage für einen Machine-Learning-Workflow dienen.

Traditionelle parametrierte Gesichter werden zunehmend als Richtlinien für transformative Prozesse verwendet, die anstelle von CGI künstliche Intelligenz verwenden. Quelle: https://arxiv.org/pdf/2205.02538.pdf
Die Autoren erklären:
‘Unser Ziel ist es, hochwertige Portrait-Videos mit bearbeiteter Gesichtsform zu erzeugen, indem die Gesichtsform nach natürlicher Gesichtsdeformation in der realen Welt bearbeitet wird. Dies kann für Anwendungen wie die Erzeugung von Gesichtsformen für Schönheitszwecke und Gesichtsübertriebung für visuelle Effekte verwendet werden.’
Obwohl 2D-Gesichtsverzerrung und -verformung seit dem Aufkommen von Photoshop (und zu seltsamen und oft unannehmbaren Subkulturen rund um Gesichtsverzerrung und Körperdysmorphismus) für Verbraucher verfügbar ist, ist es ein schwieriger Trick, dies in Videos ohne CGI zu erreichen.

Mark Zuckerbergs Gesichtsdimensionen erweitert und verengt durch die neue chinesisch-britische Technik.
Körperumgestaltung ist derzeit ein Bereich von intensivem Interesse im Bereich Computer Vision, hauptsächlich aufgrund seines Potenzials im Bereich Mode-E-Commerce, obwohl es derzeit eine herausragende Herausforderung ist, jemanden größer oder skelettartig vielfältiger erscheinen zu lassen.
Ebenso ist die Änderung der Kopfform in Videoaufnahmen in konsistenter und überzeugender Weise Gegenstand vorheriger Arbeiten der Forscher, obwohl diese Implementierung unter Artefakten und anderen Einschränkungen litt. Die neue Methode erweitert die Fähigkeiten dieser vorherigen Forschung von statischen zu Video-Ausgaben.
Das neue System wurde auf einem Desktop-PC mit einem AMD Ryzen 9 3950X mit 32 GB Speicher trainiert und verwendet einen optischen Fluss-Algorithmus aus OpenCV für Bewegungskarten, die durch das StructureFlow-Framework geglättet werden; das Facial Alignment Network (FAN) für Landmarkenschätzung, das auch in den beliebten Deepfake-Paketen verwendet wird; und den Ceres Solver, um Optimierungsprobleme zu lösen.

Ein extremes Beispiel für Gesichtsverbreiterung mit dem neuen System.
Die Studie trägt den Titel Parametrische Umgestaltung von Porträts in Videos und stammt von drei Forschern der Zhejiang-Universität und einem Forscher der Universität Bath.
Über Gesichter
Unter dem neuen System wird das Video in eine Bildfolge extrahiert und eine starre Pose wird zunächst für jedes Gesicht geschätzt. Dann werden eine repräsentative Anzahl von nachfolgenden Frames gemeinsam geschätzt, um konsistente Identitätsparameter entlang des gesamten Bildlaufs (d. h. die Frames des Videos) zu konstruieren.

Architektonischer Fluss des Gesichtsverformungssystems.
Nach diesem Schritt wird der Ausdruck ausgewertet, was zu einem Umgestaltungsparameter führt, der durch lineare Regression implementiert wird. Als Nächstes konstruiert ein neuer signierter Abstandsfunktion (SDF)-Ansatz eine dichte 2D-Karte der Gesichtsmerkmale vor und nach der Umgestaltung.
Schließlich wird eine inhaltsbewusste Verformungsoptimierung auf dem Ausgabevideo durchgeführt.
Parametrische Gesichter
Der Prozess nutzt ein 3D-Morphable-Face-Modell (3DMM), ein zunehmend beliebtes Add-on zu neuronalen und GAN-basierten Gesichtssynthese-Systemen, sowie anwendbar für Deepfake-Erkennungssysteme.

Nicht aus der neuen Studie, sondern ein Beispiel für ein 3D-Morphable-Face-Modell (3DMM) – ein parametriertes Prototyp-Gesicht, das im neuen Projekt verwendet wird. Oben links, Landmarkenanwendung auf einem 3DMM-Gesicht. Oben rechts, die 3D-Mesh-Vertices eines Isomaps. Unten links zeigt Landmarkenanpassung; unten mittig, ein Isomap der extrahierten Gesichtstextur; und unten rechts, eine resultierende Anpassung und Form. Quelle: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Der Workflow des neuen Systems muss Fälle von Okklusion berücksichtigen, wie z. B. ein Fall, in dem der Proband wegschaut. Dies ist eine der größten Herausforderungen in Deepfake-Software, da FAN-Landmarken wenig Kapazität haben, um diese Fälle zu berücksichtigen, und tendenziell in Qualität abbauen, wenn das Gesicht wegschaut oder okkludiert wird.
Das neue System kann diese Falle vermeiden, indem es eine Konturenergie definiert, die in der Lage ist, die Grenze zwischen dem 3D-Gesicht (3DMM) und dem 2D-Gesicht (wie durch FAN-Landmarken definiert) zu entsprechen.
Optimierung
Eine nützliche Einsetzung für ein solches System wäre, Echtzeit-Deformationen umzusetzen, z. B. in Video-Chat-Filtern. Das aktuelle Framework ermöglicht dies nicht, und die erforderlichen Rechenressourcen würden eine “Live”-Deformation zu einer bemerkenswerten Herausforderung machen.
Laut der Studie und unter der Annahme eines 24-Bildern-pro-Sekunde-Videos als Ziel, stellen die pro-Frame-Operationen in der Pipeline eine Latenz von 16,344 Sekunden pro Sekunde des Footage dar, mit zusätzlichen Einmal-Hits für Identitäts-Schätzung und 3D-Gesichts-Deformation (321 ms und 160 ms, jeweils).
Daher ist Optimierung der Schlüssel, um Fortschritte bei der Reduzierung der Latenz zu machen. Da eine gemeinsame Optimierung über alle Frames einen schwerwiegenden Overhead für den Prozess hinzufügen würde und eine init-ähnliche Optimierung (unter der Annahme der konsistenten nachfolgenden Identität des Sprechers aus dem ersten Frame) zu Anomalien führen könnte, haben die Autoren ein sparsames Schema zur Berechnung der Koeffizienten von Frames, die in praktischen Abständen abgetastet werden, übernommen.
Die gemeinsame Optimierung wird dann auf diesem Teilmenge der Frames durchgeführt, was zu einem schlankeren Prozess der Rekonstruktion führt.
Gesichtsverformung
Die Verformungstechnik, die im Projekt verwendet wird, ist eine Anpassung der Arbeit der Autoren aus dem Jahr 2020 Deep Shapely Portraits (DSP).

Deep Shapely Portraits, ein Beitrag zum ACM Multimedia 2020. Der Beitrag wird von Forschern des ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab geleitet. Quelle: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Die Autoren bemerken ‘Wir erweitern diese Methode von der Umgestaltung eines monokularen Bildes zur Umgestaltung der gesamten Bildfolge.’
Tests
Die Studie bemerkt, dass es keine vergleichbaren vorherigen Materialien gab, gegen die die neue Methode bewertet werden konnte. Daher verglichen die Autoren Frames des verwandelten Video-Ausgabes mit statischen DSP-Ausgaben.

Test des neuen Systems gegen statische Bilder von Deep Shapely Portraits.
Die Autoren erklären, dass Artefakte durch die DSP-Methode entstehen, aufgrund ihrer Verwendung von sparsamer Abbildung – ein Problem, das das neue Framework durch dichte Abbildung löst. Zusätzlich, so behauptet die Studie, zeigt das Video, das von DSP produziert wird, einen Mangel an Glätte und visueller Kohärenz.
Die Autoren erklären:
‘Die Ergebnisse zeigen, dass unser Ansatz robust kohärente umgestaltete Portrait-Videos produzieren kann, während die bildbasierte Methode leicht zu auffälligen Flicker-Artefakten führen kann.’
Sieh dir das begleitende Video unten an, für weitere Beispiele:
Erstveröffentlicht am 9. Mai 2022. Geändert um 18 Uhr EET, ersetzt ‘Feld’ durch ‘Funktion’ für SDF.












