Andersons Blickwinkel

Google’s LipSync3D bietet verbesserte ‘Deepfaked’ Mundbewegungssynchronisierung

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine Zusammenarbeit zwischen Google-KI-Forschern und dem indischen Institut für Technologie Kharagpur bietet ein neues Framework, um sprechende Köpfe aus Audioinhalten zu synthetisieren. Das Projekt zielt darauf ab, optimierte und vernünftig ressourcenschonende Wege zu finden, um “sprechende Kopf”-Videoinhalte aus Audio zu erstellen, um Lippenbewegungen mit synchronisierten oder maschinell übersetzten Audio zu synchronisieren und für Avatare, interaktive Anwendungen und andere Echtzeitumgebungen zu verwenden.

Quelle: https://www.youtube.com/watch?v=L1StbX9OznY

Quelle: https://www.youtube.com/watch?v=L1StbX9OznY

Die im Prozess trainierten Machine-Learning-Modelle – genannt LipSync3D – benötigen nur ein einzelnes Video der Zielgesichtsidentität als Eingabedaten. Die Datenbereitungs-Pipeline trennt die Extraktion der Gesichtsgeometrie von der Bewertung von Beleuchtung und anderen Aspekten eines Eingabevideos, was eine wirtschaftlichere und fokussiertere Ausbildung ermöglicht.

Der zweistufige Arbeitsablauf von LipSync3D. Oben, die Erzeugung eines dynamisch texturierten 3D-Gesichts aus dem 'Ziel'-Audio; unten, die Einbindung des erzeugten Meshes in ein Zielvideo.

Der zweistufige Arbeitsablauf von LipSync3D. Oben, die Erzeugung eines dynamisch texturierten 3D-Gesichts aus dem ‘Ziel’-Audio; unten, die Einbindung des erzeugten Meshes in ein Zielvideo.

Tatsächlich ist LipSync3Ds bemerkenswerter Beitrag zum Forschungsbemühen in diesem Bereich möglicherweise seine Beleuchtungsnormierungs-Algorithmus, der die Trainings- und Inferenzbeleuchtung entkoppelt.

Die Entkopplung der Beleuchtungsdaten von der allgemeinen Geometrie hilft LipSync3D, realistischere Lippenbewegungsausgaben unter anspruchsvollen Bedingungen zu erzeugen. Andere Ansätze der letzten Jahre haben sich auf 'feste' Beleuchtungsbedingungen beschränkt, die ihre begrenzte Kapazität in dieser Hinsicht nicht offenbaren.

Die Entkopplung der Beleuchtungsdaten von der allgemeinen Geometrie hilft LipSync3D, realistischere Lippenbewegungsausgaben unter anspruchsvollen Bedingungen zu erzeugen. Andere Ansätze der letzten Jahre haben sich auf ‘feste’ Beleuchtungsbedingungen beschränkt, die ihre begrenzte Kapazität in dieser Hinsicht nicht offenbaren.

Während der Vorverarbeitung der Eingabedatenrahmen muss das System spekularische Punkte identifizieren und entfernen, da diese spezifisch für die Beleuchtungsbedingungen sind, unter denen das Video aufgenommen wurde, und ansonsten die Relighting-Prozess stören.

LipSync3D, wie der Name bereits andeutet, führt keine bloße Pixelanalyse auf den Gesichtern durch, die es auswertet, sondern nutzt aktiv identifizierte Gesichtsmerkmale, um bewegliche CGI-ähnliche Meshes zu erzeugen, zusammen mit den ‘entfalteten’ Texturen, die in einer traditionellen CGI-Pipeline um sie herum gewickelt sind.

Posenormierung in LipSync3D. Links sind die Eingabeframes und detektierten Merkmale; in der Mitte, die normalisierten Vertices der generierten Mesh-Evaluierung; und rechts, die entsprechende Texturen-Atlas, die die Grundwahrheit für die Texturen-Vorhersage liefert. Quelle: https://arxiv.org/pdf/2106.04185.pdf

Posenormierung in LipSync3D. Links sind die Eingabeframes und detektierten Merkmale; in der Mitte, die normalisierten Vertices der generierten Mesh-Evaluierung; und rechts, die entsprechende Texturen-Atlas, die die Grundwahrheit für die Texturen-Vorhersage liefert. Quelle: https://arxiv.org/pdf/2106.04185.pdf

Neben der neuartigen Relighting-Methode behaupten die Forscher, dass LipSync3D drei Hauptinnovationen gegenüber früheren Arbeiten bietet: die Trennung von Geometrie, Beleuchtung, Pose und Textur in separate Datenströme in einem normalisierten Raum; ein leicht trainierbares auto-regressives Texturen-Vorhersagemodell, das zeitlich konsistente Video-Synthese produziert; und erhöhte Realistik, wie durch menschliche Bewertungen und objektive Metriken bewertet.

Die Trennung der verschiedenen Aspekte der Video-Gesichtsbilder ermöglicht eine größere Kontrolle bei der Video-Synthese.

Die Trennung der verschiedenen Aspekte der Video-Gesichtsbilder ermöglicht eine größere Kontrolle bei der Video-Synthese.

LipSync3D kann angemessene Lippengeometrie-Bewegungen direkt aus Audio ableiten, indem es Phoneme und andere Aspekte der Sprache analysiert und sie in bekannte entsprechende Muskel-Posen um den Mundbereich übersetzt.

Bei diesem Prozess wird eine gemeinsame Vorhersage-Pipeline verwendet, bei der die abgeleitete Geometrie und Textur dedizierte Encoder in einem Autoencoder-Setup haben, aber einen Audio-Encoder mit der Sprache teilen, die auf das Modell aufgeprägt werden soll:

LipSync3Ds labile Bewegungssynthese soll auch stilisierte CGI-Avatare antreiben, die im Grunde nur dieselben Arten von Mesh- und Texturen-Informationen wie reale Welt-Bilder sind:

Ein stilisierter 3D-Avatar hat seine Lippenbewegungen in Echtzeit von einem Quell-Sprecher-Video angetrieben. In einem solchen Szenario würden die besten Ergebnisse durch personalisiertes Pre-Training erzielt.

Ein stilisierter 3D-Avatar hat seine Lippenbewegungen in Echtzeit von einem Quell-Sprecher-Video angetrieben. In einem solchen Szenario würden die besten Ergebnisse durch personalisiertes Pre-Training erzielt.

Die Forscher erwarten auch die Verwendung von Avataren mit einem slightly realistischeren Gefühl:

Beispiel-Trainingszeiten für die Videos reichen von 3-5 Stunden für ein 2-5-minütiges Video, in einer Pipeline, die TensorFlow, Python und C++ auf einem GeForce GTX 1080 verwendet. Die Trainings-Sitzungen verwendeten einen Batch-Größe von 128 Frames über 500-1000 Epochen, wobei jede Epoche eine vollständige Bewertung des Videos darstellt.

Richtung Dynamische Re-Synchronisierung von Lippenbewegungen

Das Feld der Re-Synchronisierung von Lippen, um eine neue Audio-Spur zu akkommodieren, hat in den letzten Jahren (siehe unten) eine große Aufmerksamkeit in der Computer-Vision-Forschung erhalten, nicht zuletzt, weil es ein Nebenprodukt der umstrittenen Deepfake-Technologie ist.

Im Jahr 2017 stellte die University of Washington eine Forschung vor, die in der Lage war, Lippen-Synchronisierung aus Audio zu lernen und diese zu verwenden, um die Lippenbewegungen des damaligen Präsidenten Obama zu ändern. Im Jahr 2018 leitete das Max-Planck-Institut für Informatik eine weitere Forschungsinitiative an, um die Identität-zu-Identität-Video-Übertragung zu ermöglichen, wobei die Lippen-Synchronisierung ein Nebenprodukt des Prozesses war; und im Mai 2021 enthüllte das KI-Startup FlawlessAI seine eigene Lippen-Synchronisierungstechnologie TrueSync, die weit in der Presse als ein Enabler verbesserter Synchronisierungstechnologien für große Film-Veröffentlichungen in verschiedenen Sprachen anerkannt wurde.

Und natürlich bietet die laufende Entwicklung von Deepfake-Open-Source-Repositorys einen weiteren Zweig der aktiven Benutzer-beiträgen-Forschung in diesem Bereich der Gesichtsbild-Synthese.

nc-Technologie TrueSync, die in der Presse weit verbreitet ist, als ein Enabler verbesserter Synchronisierungstechnologien für große Film-Veröffentlichungen in verschiedenen Sprachen. Und natürlich bietet die laufende Entwicklung von Deepfake-Open-Source-Repositorys einen weiteren Zweig der aktiven Benutzer-beiträgen-Forschung in diesem Bereich der Gesichtsbild-Synthese.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai