KI-Modelle und Plattformen
Ein neues System für temporally konsistente Stable Diffusion-Video-Charaktere

Ein neues Projekt der Alibaba Group bietet eines der besten Methoden, die ich gesehen habe, um vollständige menschliche Avatare aus einem Stable-Diffusion-basierten Grundmodell zu generieren.
Das System heißt MIMO (MIMicking mit Object Interactions) und verwendet eine Reihe von populären Technologien und Modulen, einschließlich CGI-basierten menschlichen Modellen und AnimateDiff, um temporally konsistente Charakterersatz in Videos zu ermöglichen – oder um einen Charakter mit einer benutzerdefinierten skelettalen Pose zu steuern.
Wir sehen hier Charaktere, die aus einer einzelnen Bildquelle interpoliert werden und durch eine vorgegebene Bewegung gesteuert werden:
[Klicken Sie auf das Video unten, um es abzuspielen]
Aus einzelnen Bildquellen werden drei verschiedene Charaktere durch eine 3D-Pose-Sequenz (links) mithilfe des MIMO-Systems gesteuert. Sehen Sie die Projektwebsite und das begleitende YouTube-Video (am Ende dieses Artikels eingebettet) für weitere Beispiele und eine höhere Auflösung. Quelle: https://menyifang.github.io/projects/MIMO/index.html
Generierte Charaktere, die auch aus Bildern in Videos und auf andere Weise stammen können, können in reale Aufnahmen integriert werden.
MIMO bietet ein neuartiges System, das drei separate Kodierungen generiert, jeweils für Charakter, Szene und Okklusion (d. h. Matting, wenn ein Objekt oder eine Person vor dem dargestellten Charakter vorbeigeht). Diese Kodierungen werden zur Inferenzzeit integriert.
[Klicken Sie auf das Video unten, um es abzuspielen]
MIMO kann ursprüngliche Charaktere durch photorealistische oder stilisierte Charaktere ersetzen, die der Bewegung aus dem Zielvideo folgen. Sehen Sie die Projektwebsite und das begleitende YouTube-Video (am Ende dieses Artikels eingebettet) für weitere Beispiele und eine höhere Auflösung.
Das System wird über das Stable-Diffusion-V1.5-Modell trainiert, unter Verwendung eines benutzerdefinierten Datensatzes, der von den Forschern kuratiert wurde und zu gleichen Teilen aus realen und simulierten Videos besteht.
Das große Problem der diffusion-basierten Videos ist die temporale Stabilität, bei der der Inhalt des Videos entweder flackert oder sich auf unerwünschte Weise entwickelt.
MIMO verwendet stattdessen effektiv ein einzelnes Bild als Karte für konsistente Führung, die durch das interstitielle SMPL-CGI-Modell orchestriert und eingeschränkt werden kann.
Da die Quellenreferenz konsistent ist und das Grundmodell, über das das System trainiert wird, mit ausreichenden repräsentativen Bewegungsbeispielen verbessert wurde, sind die Fähigkeiten des Systems für temporally konsistente Ausgaben weit über dem allgemeinen Standard für diffusion-basierte Avatare.
[Klicken Sie auf das Video unten, um es abzuspielen]
Weitere Beispiele für pose-gesteuerte MIMO-Charaktere. Sehen Sie die Projektwebsite und das begleitende YouTube-Video (am Ende dieses Artikels eingebettet) für weitere Beispiele und eine höhere Auflösung.
Es wird immer häufiger, dass einzelne Bilder als Quelle für effektive neuronale Darstellungen verwendet werden, entweder allein oder in einer multimodalen Weise, kombiniert mit Textprompts. Zum Beispiel kann das beliebte LivePortrait-System auch sehr plausible Deepfakes-Gesichter aus einzelnen Gesichtsbildern generieren.
Die Forscher glauben, dass die Prinzipien, die im MIMO-System verwendet werden, auf andere und neue Arten von generativen Systemen und Frameworks ausgeweitet werden können.
Der neue Beitrag trägt den Titel MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling und stammt von vier Forschern am Institute for Intelligent Computing der Alibaba Group. Die Arbeit hat eine video-reiche Projektseite und ein begleitendes YouTube-Video, das auch am Ende dieses Artikels eingebettet ist.
Methode
MIMO erreicht automatische und unbeaufsichtigte Trennung der oben genannten drei räumlichen Komponenten in einer End-to-End-Architektur (d. h. alle Subprozesse sind in das System integriert und der Benutzer muss nur die Eingabematerialien bereitstellen).

Das konzeptionelle Schema für MIMO. Quelle: https://arxiv.org/pdf/2409.16160
Objekte in Quellvideos werden von 2D in 3D übersetzt, zunächst unter Verwendung des monokularen Tiefenestimators Depth Anything. Der menschliche Teil in jedem Frame wird mit Methoden extrahiert, die vom Tune-A-Video-Projekt adaptiert wurden.
Diese Funktionen werden dann in video-basierte volumetrische Facetten übertragen, indem die Segment Anything 2-Architektur von Facebook Research verwendet wird.
Die Szenen-Ebene selbst wird durch Entfernen von Objekten erlangt, die in den anderen beiden Ebenen erkannt wurden, und liefert so eine rotoscope-ähnliche Maske automatisch.
Für die Bewegung werden eine Reihe von extrahierten latenten Codes für den menschlichen Teil extrahiert und an ein Standard-SMPL-Modell angebunden, dessen Bewegungen den Kontext für den gerenderten menschlichen Inhalt liefern.
Eine 2D-Funktionenkarte für den menschlichen Inhalt wird durch einen differentiable Rasterizer erhalten, der von einer 2020-Initiative von NVIDIA (NVDA ) abgeleitet ist. Durch Kombination der erhaltenen 3D-Daten von SMPL mit den 2D-Daten, die durch die NVIDIA-Methode erhalten werden, haben die latenten Codes, die den “neuronalen Menschen” darstellen, eine feste Korrespondenz zu ihrem Kontext.
Zu diesem Zeitpunkt ist es notwendig, eine Referenz zu etablieren, die in Architekturen, die SMPL verwenden, häufig benötigt wird – eine kanonische Pose. Dies ist im Großen und Ganzen ähnlich wie Da Vincis ‘Vitruvianischen Mann’, da es ein Null-Pose-Template darstellt, das Inhalt akzeptieren und dann deformieren kann, wobei der (effektiv) texture-mapped Inhalt mitgenommen wird.
Diese Deformationen oder ‘Abweichungen von der Norm’ stellen menschliche Bewegungen dar, während das SMPL-Modell die latenten Codes bewahrt, die die menschliche Identität darstellen, die extrahiert wurde, und somit den resultierenden Avatar korrekt in Bezug auf Pose und Textur darstellt.

Ein Beispiel für eine kanonische Pose in einem SMPL-Modell. Quelle: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
In Bezug auf das Problem der Verknüpfung (das Ausmaß, in dem trainierte Daten unflexibel werden, wenn man sie über ihre trainierten Grenzen und Assoziationen hinaus streckt) sagen die Autoren*:
‘Um die Erscheinung vollständig von den posierten Video-Frames zu trennen, ist eine ideale Lösung, die dynamische menschliche Darstellung aus dem monokularen Video zu lernen und sie vom posierten Raum in den kanonischen Raum zu transformieren.
‘In Anbetracht der Effizienz verwenden wir eine vereinfachte Methode, die das posierte menschliche Bild direkt in das kanonische Ergebnis im Standard-A-Pose-Format transformiert, unter Verwendung eines vorgefertigten menschlichen Repose-Modells. Das synthetisierte kanonische Erscheinungsbild wird an ID-Encoder gesendet, um den Identitätscode zu erhalten.
‘Diese einfache Konstruktion ermöglicht eine vollständige Trennung der Identitäts- und Bewegungsattribute. In Anlehnung an Animate Anyone umfassen die ID-Encoder einen CLIP-Bild-Encoder und eine Referenz-Netz-Architektur, um den globalen und lokalen Merkmal-Code zu erhalten [jeweils].’
Für die Szenen- und Okklusionsaspekte wird ein gemeinsamer und fester Variational Autoencoder (VAE – in diesem Fall von einer 2013-Veröffentlichung abgeleitet) verwendet, um die Szenen- und Okklusions-Elemente in den latenten Raum zu übertragen. Inkongruenzen werden durch eine Inpainting-Methode aus dem 2023-Projekt ProPainter behandelt.
Sobald diese dekompomponierten Attribute zusammengefügt und retuschiert sind, liefern sowohl der Hintergrund als auch die okkludierenden Objekte im Video eine Maske für den sich bewegenden menschlichen Avatar.
Diese dekompomponierten Attribute werden dann in ein U-Net-Backbone übertragen, das auf der Stable-Diffusion-V1.5-Architektur basiert. Der vollständige Szenen-Code wird mit dem nativen latenten Rauschen des Host-Systems verkettet. Der menschliche Teil wird durch Self-Attention– und Cross-Attention-Layer integriert.
Dann wird das entrauschte Ergebnis über den VAE-Decoder ausgegeben.
Daten und Tests
Für das Training haben die Forscher einen menschlichen Video-Datensatz mit dem Titel HUD-7K erstellt, der aus 5.000 realen Charakter-Videos und 2.000 synthetischen Animationen besteht, die vom En3D-System erstellt wurden. Die realen Videos benötigten keine Annotation, aufgrund der nicht-semantischen Natur der Figuren-Extraktions-Verfahren in MIMOs Architektur. Die synthetischen Daten waren vollständig annotiert.
Das Modell wurde auf acht NVIDIA A100-GPUs (obwohl die Veröffentlichung nicht spezifiziert, ob es sich um die 40GB- oder 80GB-VRAM-Modelle handelt) trainiert, für 50 Iterationen, unter Verwendung von 24 Video-Frames und einer Batch-Größe von vier, bis zur Konvergenz.
Der Bewegungs-Modul für das System wurde auf den Gewichten von AnimateDiff trainiert. Während des Trainingsprozesses wurden die Gewichte des VAE-Encoders/Decoders und des CLIP-Bild-Encoders eingefroren (im Gegensatz zu einer vollständigen Feinabstimmung, die einen viel breiteren Einfluss auf ein Grundmodell haben würde).
Obwohl MIMO nicht gegen analoge Systeme getestet wurde, testeten die Forscher es auf schwierige, außerhalb der Verteilung liegende Bewegungssequenzen aus AMASS und Mixamo. Diese Bewegungen umfassten Klettern, Spielen und Tanzen.
Sie testeten das System auch auf Videos von Menschen in der freien Natur. In beiden Fällen berichtet die Veröffentlichung von ‘hoher Robustheit’ für diese unbekannten 3D-Bewegungen aus verschiedenen Perspektiven.
Obwohl die Veröffentlichung mehrere statische Bildergebnisse anbietet, die die Wirksamkeit des Systems demonstrieren, wird die wahre Leistung von MIMO am besten durch die umfangreichen Video-Ergebnisse beurteilt, die auf der Projektseite und im YouTube-Video (am Ende dieses Artikels eingebettet) bereitgestellt werden.
Die Autoren schlussfolgern:
‘Experimentelle Ergebnisse [zeigen], dass unsere Methode nicht nur flexible Charakter-, Bewegungs- und Szenensteuerung ermöglicht, sondern auch eine erweiterte Skalierbarkeit auf beliebige Charaktere, Allgemeingültigkeit für neue 3D-Bewegungen und Anwendbarkeit auf interaktive Szenen.
‘Wir glauben auch, dass unsere Lösung, die die inhärente 3D-Natur und die automatische Kodierung des 2D-Videos in hierarchische räumliche Komponenten berücksichtigt, zukünftige Forschungen zu 3D-bewusster Video-Synthese inspirieren kann.
‘Darüber hinaus ist unser Framework nicht nur gut geeignet, um Charakter-Videos zu generieren, sondern kann auch potenziell auf andere steuerbare Video-Synthese-Aufgaben angepasst werden.’
Schlussfolgerung
Es ist erfrischend, ein Avatar-System basierend auf Stable Diffusion zu sehen, das anscheinend in der Lage ist, solche temporale Stabilität zu erreichen – nicht zuletzt, weil Gaussian-Avatare in diesem Forschungsbereich anscheinend die Oberhand gewinnen.
Die stilisierten Avatare in den Ergebnissen sind effektiv, und obwohl das Maß an Photorealismus, das MIMO derzeit produzieren kann, nicht mit dem von Gaussian Splatting vergleichbar ist, sind die Vorteile der Erstellung temporally konsistenter Menschen in einem semantisch-basierten Latent-Diffusions-Netzwerk (LDM) beträchtlich.
* Meine Umwandlung der Autorenzitate in Hyperlinks und, wo notwendig, externe erläuternde Hyperlinks.
Erstveröffentlicht am Mittwoch, den 25. September 2024












