Andersons Blickwinkel

Disney kombiniert CGI mit neuronaler Bildsynthese, um das „Uncanny Valley“ zu bekämpfen

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Die KI‑Forschungsabteilung von Disney hat ein hybrides Verfahren für filmqualitative Gesichtssimulation entwickelt, das die Stärken des neuronalen Gesichtsrenderings mit der Konsistenz eines CGI‑basierten Ansatzes kombiniert.

Das noch ausstehende Paper trägt den Titel Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering und wird in einem neuen 10‑Minuten‑Video auf dem Disney Research YouTube‑Kanal vorgestellt (am Ende dieses Artikels eingebettet*).

Meshes kombiniert mit neuronalen Gesichtsrenderings. Quelle: https://www.youtube.com/watch?v=TwpLqTmvqVk

Meshes kombiniert mit neuronalen Gesichtsrenderings. Siehe das Video‑Embedding am Ende des Artikels für mehr Details und bessere Qualität. Quelle: https://www.youtube.com/watch?v=TwpLqTmvqVk

Wie das Video anmerkt, kann das neuronale Rendering von Gesichtern (einschließlich Deepfakes) weitaus realistischere Augen‑ und Mundinnenräume erzeugen als CGI, während von CGI gesteuerte Gesichts‑Texturen konsistenter und für VFX‑Ausgaben auf Kinoniveau besser geeignet sind.

Deshalb experimentiert Disney damit, NVIDIAs StyleGan2-Neuronalgenerator die umgebenden Merkmale eines Gesichts und die „lebenswichtigen“ Elemente wie die Augen verarbeiten zu lassen, während konsistente CGI‑Gesichtshaut und verwandte Elemente in das Ergebnis überlagert werden.

Aus dem Video (siehe Ende des Artikels) das architektonische Konzept hinter Disneys Hybridansatz, bei dem ein altmodisches CGI‑Mesh, wie es zur Rekonstruktion der „jungen“ Carrie Fisher und des verstorbenen Peter Cushing für Rogue One (2016) verwendet wurde, in neuronale Gesichts‑Umgebungen integriert wird.

Aus dem Video (siehe Ende des Artikels) das architektonische Konzept hinter Disneys Hybridansatz, bei dem ein altmodisches CGI‑Mesh, wie es zur Rekonstruktion der „jungen“ Carrie Fisher und des verstorbenen Peter Cushing für Rogue One (2016) verwendet wurde, in neuronale Gesichts‑Umgebungen integriert wird.

Das Video nimmt stillschweigend Bezug auf die häufige Kritik an der Unauthentizität und dem „Uncanny‑Valley“-Effekt der CGI‑Rekonstruktion des verstorbenen britischen Star‑Wars‑Schauspielers Peter Cushing in Rogue One (2016) und gesteht ein:

‘[Es] besteht immer noch eine riesige Lücke zwischen dem, was Menschen leicht erfassen und rendern können, und finalen fotorealistischen digitalen Doppelgängern, komplett mit Haaren, Augen und innerem Mund. Um diese Lücke zu schließen, erfordert es in der Regel viel manuelle Arbeit von erfahrenen Künstlern.’

In Wahrheit versuchen selbst die modernsten Gesichts‑Capture‑Systeme nicht, Augen, Mundinnenräume oder Haare zu rekonstruieren, da diese entweder Authentizitätsprobleme (Augen) oder Probleme mit der zeitlichen Konsistenz (Haare) aufweisen.

Das Video zeigt, was VFX‑Künstler nach einer typischen modernen Gesichts‑Capture‑Session erhalten werden. Augen, Haare, Gesichtsbehaarung und Mundinnenräume müssen alle von separaten Teams in der Produktionspipeline bearbeitet werden.

Das Video zeigt, was VFX‑Künstler nach einer typischen modernen Gesichts‑Capture‑Session erhalten werden. Augen, Haare, Gesichtsbehaarung und Mundinnenräume müssen alle von separaten Teams in der Produktionspipeline bearbeitet werden, zusätzlich zu Texturierung und Beleuchtung.

Beleuchtungssteuerung

Der hybride Ansatz bietet zudem Vorteile beim Nachbeleuchten – einer bemerkenswerten Herausforderung beim neuronalen Rendering von Gesichtern, da CGI‑Hautüberlagerungen leichter neu beleuchtet werden können.

Eine animierte Version des CGI/Neural‑Ansatzes.

Eine animierte Version des CGI/Neural‑Ansatzes.

In anspruchsvolleren Umgebungen, wie Außenaufnahmen, haben die Forscher eine Methode zum Inpainting um eine Art entmilitarisierte Zone rund um die zu „erstellende“ Person entwickelt.

Ein schwarzer Rand wird erzeugt, um eine ‚Leinwand‘ für das Inpainting der äußeren Teile der Identität zu ermöglichen und die CGI‑Haut in das kombinierte CGI/Neuron‑Ergebnis zu integrieren.

Ein schwarzer Rand wird erzeugt, um eine ‚Leinwand‘ für das Inpainting der äußeren Teile der Identität zu ermöglichen und die CGI‑Haut in das kombinierte CGI/Neuron‑Ergebnis zu integrieren.

Das Video weist darauf hin:

‘[Das] neuronale Rendering entspricht nicht perfekt den Hintergrundbeschränkungen – es dient nur als Leitfaden, da die Optimierung realistischer menschlicher Komponenten wie Haare, Augen und Zähne das Hauptziel ist. Schwieriger ist es, eine konsistente Identität beizubehalten, während die Umgebungsbeleuchtung geändert wird.’

Erstellung von CGI‑Meshes aus neuronalen Renderings

Das Forschungsteam hat zudem einen variationalen Autoencoder entwickelt, der auf einer (nicht näher bezeichneten) großen Datenbank von 3D‑Gesichtsaufnahmen trainiert wurde, und behauptet, dass er aus Ground‑Truth‑Daten „zufällige, aber plausible“ 3D‑Gesichtsmeshes erzeugen kann.

Es gibt Einschränkungen, die diese Forschung überwinden muss, darunter die Schwierigkeit, Haare in den neuronalen Renderings zeitlich konsistent zu halten; das Video (siehe unten) zeigt mehrere Beispiele für schnell mutierende Haare bei einer ansonsten konsistenten Schwenkaufnahme eines CGI/Neuron‑Gesichts.

Die zeitliche Konsistenz beim neuronalen Videorendering ist ein weitaus größeres Problem als nur bei Disney, und es erscheint wahrscheinlich, dass spätere Iterationen dieses Systems auf das Hinzufügen von Haaren ‚nachträglich‘ zurückgreifen oder verschiedene andere Ansätze zur Haargenerierung verfolgen, anstatt darauf zu hoffen, dass ein neuartiger neuronaler Ansatz dies schließlich löst.

Anwendungen für die Datensatzgenerierung

Der Ansatz wird zudem als potenzielle Methode zur Erzeugung synthetischer Daten und zur Bereicherung des Landschaftsbildes von Gesichtsbilddaten vorgeschlagen, das in den letzten Jahren gefährlich monoton geworden ist.

Disney stellt sich vor, dass die neue Technik Gesichtsbilddatensätze füllt.

Disney stellt sich vor, dass die neue Technik Gesichtsbilddatensätze füllt.

‘[Jedes] fotorealistische Ergebnis, das wir erzeugen, besitzt eine zugrunde liegende entsprechende Geometrie und Erscheinungs‑Maps, gerendert aus unbekannten Kameraperspektiven mit bekannter Beleuchtung. Diese ‚Ground‑Truth‘‑Information kann für das Training nachgelagerter Anwendungen, wie monokulare 3D‑Gesichtsrekonstruktion, Gesichtserkennung oder Szenenverständnis, von entscheidender Bedeutung sein. Somit kann jedes gerenderte Ergebnis als Datensatzprobe betrachtet werden, und wir können viele Variationen vieler verschiedener Individuen erzeugen.’

‘Darüber hinaus können wir selbst für eine einzelne Person, die in einem einzigen Ausdruck mit einer einzigen Ansicht und Beleuchtung gerendert wird, zufällige Variationen des fotorealistischen Renderings erzeugen, indem wir den Zufalls‑Seed während der Optimierung variieren.’

Die Forscher stellen fest, dass diese Vielfalt konfigurierbarer Ausgaben beim Training von Gesichtserkennungs‑Anwendungen nützlich sein könnte, und schließen mit:

‘[Unsere] Methode kann die aktuelle Technologie für die Erfassung, Modellierung und das Rendering von Gesichtshaut nutzen und automatisch vollständige fotorealistische Gesichts‑Renderings erzeugen, die die gewünschte Identität, den Ausdruck und die Szenenkonfiguration entsprechen. Dieser Ansatz findet Anwendung im Gesichts‑Rendering für Film und Unterhaltung, spart manuelle Künstlerarbeit und dient zudem der Datengenerierung in verschiedenen Bereichen des Deep Learning.’

Für einen tieferen Einblick in den neuen Ansatz sehen Sie sich das heute veröffentlichte 10‑Minuten‑Video an:

 * Der ursprüngliche Videolink wurde 8 Stunden nach Veröffentlichung dieses Artikels durch einen scheinbar identischen Link ersetzt. Ich habe alle relevanten Links geändert, da keine Spur des Originalvideos mehr vorhanden ist.

 

8:24 GMT+2 – Video ersetzt, da es aus einem Grund vom Disney Research YouTube‑Kanal ausgetauscht wurde.

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai