Andersons Blickwinkel

Virtuelles Anprobieren neuer Kleidung durch KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

Ein KI-Modell kann nun ein einzelnes Foto und Kleidungsbilder in ein bewegtes Video einer Person mit neuen Outfits umwandeln, wobei die Fehler, die in älteren, zweistufigen Systemen häufig vorkommen, vermieden werden.

 

Die ‘virtuelles Anprobieren’ (VTON)-Kategorie in der Computer-Vision-Forschung ist eine der am besten finanzierten und produktivsten Forschungsgebiete – hauptsächlich weil, wie aus den häufigen Industrie-Akademischen-Kollaborationen, die jedes Jahr veröffentlicht werden, hervorgeht, dieses Ziel von der gut finanzierten Modeindustrie erheblich gefördert wird:

Aus dem Paper 'Image-Based Virtual Try-On: A Survey', Beispiele für Personendarstellungsarten und einige der Filter- und Verfeinerungsstufen, die sogar nackte Bilder für ein virtuelles Anprobieren durchlaufen müssen. Quelle - https://arxiv.org/pdf/2311.04811v3

Aus dem Paper ‘Image-Based Virtual Try-On: A Survey’, Beispiele für Personendarstellungsarten und einige der Filter- und Verfeinerungsstufen, die sogar nackte Bilder für ein virtuelles Anprobieren durchlaufen müssen. Quelle

Es gibt viele Variationen des Ziels, wie zum Beispiel Kleidung aus Bildern von Personen extrahieren und die vollere Figur berücksichtigen, wenn notwendig. Einige bildbasierte Systeme wurden kommerziell umgesetzt, auf Plattformen wie veesual.ai, wanna.fashion und fashn.ai.

Für Videos hat Google Labs’ experimentelle Doppl-App diese Funktionalität getestet, die im letzten Sommer gestartet wurde:

Bitte klicken Sie, um das Video abzuspielen, wenn es nicht automatisch abgespielt wird. Auszüge aus dem aufgegebenen Google-Doppl-Video-Anprobierungsprojekt.  Quelle

Das Doppl-Projekt wurde jedoch im April 2026 nach einer lauwarmen Resonanz eingestellt, und die Benutzer werden nun auf den bildbasierten Anprobierdienst des Unternehmens verwiesen:

Googles bildbasierter Anprobierdienst, auf den Benutzer vom aufgegebenen Doppl-Plattform verwiesen werden. Quelle - https://www.google.com/shopping/tryon

Googles bildbasierter Anprobierdienst, auf den Benutzer vom aufgegebenen Doppl-Plattform verwiesen werden. Quelle

Obwohl es einige Plattformen gibt, die virtuelles Anprobieren mit Video anbieten, scheint keine davon mit einem tatsächlichen Outlet verbunden zu sein; und sie sind alle ‘bleeding edge’, marginale (und oft ‘fragwürdige’) Token-basierte Produkte.

Während es einige interessante Forschungsansätze gibt, sind diese traditionell komplexe Architekturen, die schwierig zu implementieren sind, um eine niedrige Latenz und hohe Qualität zu erreichen:

Bitte klicken Sie, um das Video abzuspielen, wenn es nicht automatisch abgespielt wird. Aus dem 2024 Fashion-VDM-Projekt, ein Beispiel für ‘headless’ Kleidungstransfer. Quelle

Die Wahrheit ist, dass die Aufgabe, Kleidung an eine reale Person anzupassen, ohne die Kleidung oder die Person zu verzerren, und gleichzeitig eine nützliche demonstrative Bewegung zu erhalten (die genau den Rücken des Produkts zeigt, wenn die Person sich umdreht), eine enorme Herausforderung für den aktuellen Stand der Technik darstellt.

Vanast

Es ist eine Herausforderung, der ein neues Paper aus Korea begegnen will, indem es eine neuartige und vollständig integrierte Lösung für die Analyse von Kleidung + Person + Bewegung verwendet:

Bitte klicken Sie, um das Video abzuspielen, wenn es nicht automatisch abgespielt wird. Beispiele von der ergänzenden Website des Vanast-Projekts. Quelle 

Das neue System, das Vanast genannt wird, nutzt eine eigens erstellte Datenbank, die die Integration und Orchestrierung aller drei notwendigen Faktoren für die Aufgabe umfasst: die Kleidung; die Person; und die Bewegung:

Klicken Sie, um das Video abzuspielen. Weitere Beispiele vom Vanast-Projekt.

Das System nutzt Frameworks wie Flux, Qwen und ChatGPT, um eine ‘Tripel’-Datenbank zu erstellen, die eine End-to-End-Architektur informieren kann:

Aus dem neuen Paper, Beispiele für die Datenbank-Datensätze, die für die Generierung und das Training verwendet werden. Quelle - https://arxiv.org/pdf/2604.04934

Aus dem neuen Paper, Beispiele für die Datenbank-Datensätze, die für die Generierung und das Training verwendet werden. Quelle

Das neue Paper ist betitelt Vanast: Virtuelles Anprobieren mit menschlicher Bildanimation über synthetische Tripel-Überwachung und stammt von vier Forschern der Seoul National University. Es gibt auch eine video-reiche Projekt-Website.

Method

Das Ziel der Autoren in dieser Arbeit ist es, die drei genannten Aspekte in einem einzigen Framework zu vereinen – nicht nur, weil der Prozess diskret wäre, sondern auch, weil dies den verschiedenen Aspekten mehr Gelegenheit gibt, sich während des Trainings zu verbinden und zu interagieren, mit dem Ziel einer kohärenteren Generierung:

Vanast kombiniert ein einzelnes Foto einer Person, separate Kleidungsbilder und eine Bewegungsreferenz, um eine bewegte Sequenz zu generieren, in der die gleiche Person das neue Outfit trägt, wobei die Pose-Leitung eine konsistente Bewegung sicherstellt, während Identität und Kleidungsdetails über die Frames hinweg erhalten bleiben.

Vanast kombiniert ein einzelnes Foto einer Person, separate Kleidungsbilder und eine Bewegungsreferenz, um eine bewegte Sequenz zu generieren, in der die gleiche Person das neue Outfit trägt, wobei die Pose-Leitung eine konsistente Bewegung sicherstellt, während Identität und Kleidungsdetails über die Frames hinweg erhalten bleiben.

Um dies zu erreichen, nimmt das System Bilder der Ziel-Kleidungsstücke; ein Foto der Person, die andere Kleidung trägt; eine Bewegungsreferenz-Video, die definiert, wie die Person sich bewegen soll; und einen Text-Prompt, der die Aktion und die Umgebung beschreibt; und produziert eine vollständige Video-Sequenz, in der die gleiche Person das neue Outfit trägt, während sie der auferlegten Bewegung folgt, wobei jeder Frame visuell konsistent über die Zeit hinweg bleibt.

Anstatt das Anziehen und die Animation in separate Schritte zu unterteilen – was in den meisten ähnlichen vorherigen Arbeiten der Ansatz war – behandelt Vanast Kleidung, Identität und Bewegung zusammen in einem einzigen Prozess, wodurch diese Elemente während der Generierung interagieren können, und reduziert die Arten von Fehlern und Instabilitäten, die in früheren Methoden auftraten.

Dataset

Das Training für das Projekt basiert auf gepaarten Beispielen eines Personbildes, der entsprechenden Kleidungsstücke und eines Videos der Person, die sich bewegt, während sie diese Kleidung trägt, wobei die Bewegung mithilfe einer vorherigen Architektur extrahiert wird, um eine stabile Pose-Leitung über die Frames hinweg zu gewährleisten.

Da es keine öffentlich verfügbare Datenbank gibt, die die Anforderungen des Projekts erfüllt, wurden Daten von (nicht spezifizierten) Online-Einkaufsplattformen gesammelt, um eine Sammlung von Videos mit vielfältigen Kleidungsstücken zu erhalten. Allerdings erforderte die Aufgabe Videos von der gleichen Person, die mehrere Outfits trägt, was in wilden Daten selten zu finden ist und die Erstellung von synthetischen Daten notwendig machte.

Der dreistufige Prozess umfasste die Auswahl geeigneter Kandidaten-Frames aus den gesammelten Videos, die über das Qwen2.5-VL Vision-Language-Modell (VLM) gehandhabt wurde, mit entsprechender Beschneidung und Bewertung der Eignung (d. h. keine Verdeckungen, das Thema in der richtigen Position usw.); und die Erstellung geeigneter Inpainting-Masken, um die betroffenen Bereiche zu isolieren – was (in Übereinstimmung mit der vorherigen Arbeit PERSE) über das SDXL-Diffusionsmodell gehandhabt wird.

Überblick über die Vanast-Pipeline, bei der ein Personbild, Ziel-Kleidungsbilder und eine Bewegungsleitungs-Video kodiert und in einem einheitlichen Video-Diffusionsmodell verarbeitet werden. Das System generiert eine Animation, die Identität, Pose-Sequenz und Ziel-Kleidung bewahrt, während synthetische Tripel-Generierung das Training unterstützt und ein Dual-Modul-Design die Animation von der Kleidungstransfer trennt, um Konsistenz zu erhalten.

Überblick über die Vanast-Pipeline, bei der ein Personbild, Ziel-Kleidungsbilder und eine Bewegungsleitungs-Video kodiert und in einem einheitlichen Video-Diffusionsmodell verarbeitet werden. Das System generiert eine Animation, die Identität, Pose-Sequenz und Ziel-Kleidung bewahrt, während synthetische Tripel-Generierung das Training unterstützt und ein Dual-Modul-Design die Animation von der Kleidungstransfer trennt, um Konsistenz zu erhalten.

Im dritten Schritt übernimmt Qwen wieder die Aufgabe, Bilder nach Geschlecht zu klassifizieren, und das beliebte Flux-Bild-Diffusions-Framework wird verwendet, um Änderungen an der Kleidung in einem Bild vorzunehmen (da Flux in der Lage ist, mehrere Eingabeelemente zu kombinieren). Die Inpainting-Text-Prompts wurden von ChatGPT (Version nicht spezifiziert) kuratiert.

Um die Pose- und Hintergrundvielfalt weiter zu erhöhen, wurde eine Pipeline eingeführt, um Trainings-Tripletts aus wilden Videos zu erstellen, unter Verwendung der HumanVid-Datenbank. Der gleiche Prozess wurde verwendet, um die identitätsbewahrende menschliche Bild zu generieren.

Da in diesen Videos keine eigenständigen Kleidungsbilder existierten, wurden Kleidungsbilder direkt aus den Footage synthetisiert. Frames wurden aus jedem Video ausgewählt, und Qwen wurde verwendet, um sie nach frontaler Sichtbarkeit zu bewerten, bevor der am besten geeignete Kandidat ausgewählt wurde, basierend auf vollständiger Sichtbarkeit, Bildklarheit, minimalem Verschleierung, Beleuchtungsqualität und Gesamtkomposition.

Ein Oberkörper-Bereich wurde dann unter Verwendung von SegFormer extrahiert, und der Hintergrund entfernt, um die Kleidung zu isolieren.

Um positionale Verzerrung zu vermeiden, wurde der Kleidungsbereich zufällig innerhalb seiner Begrenzungsbox verschoben, und Qwen wurde erneut verwendet, um unzuverlässige Segmentierungen zu filtern. Dieser Prozess produzierte synthetische Kleidungsbilder, die mit Bewegung und Identität gepaart waren, was die groß angelegte Tripel-Konstruktion aus unstrukturierten Video-Daten ermöglichte, während die Robustheit über verschiedene reale Bedingungen hinweg verbessert wurde.

Architektur

Eine Dual-Modul-Architektur wurde eingeführt, um die langsame Konvergenz und schwache Kontrollbalance zu adressieren, die in den vorherigen Methoden beobachtet wurden, die versucht hatten, alle Bedingungen zu fusionieren. Der Ansatz nutzte den Text-zu-Video-Diffusions-Transformer von Wan, und zog auch auf das VACE-Projekt (siehe unten) zurück.

Das Modell wurde in ein Menschliche-Animation-Modul (HAM) unterteilt, das die Bewegung und Identität aus menschlichen und Pose-Eingaben handhabte; und ein Kleidungstransfer-Modul (GTM), das die Kleidung aus Kleidungsbildern handhabte. Beide teilten sich den Zugang zum Backbone, während sie Funktionen in einer verteilten, kasadenartigen Weise integrierten, um die Bedingung zu verbessern.

Das Training wurde durchgeführt, indem der Backbone eingefroren und nur die Parameter von HAM und GTM optimiert wurden, wobei ihre Beiträge während der Feature-Integration ausgeglichen wurden. Die Eingaben aus der synthetischen Tripel-Datenbank wurden in latente Darstellungen mithilfe von WANs Variational Autoencoder (VAE) umgewandelt.

Bewegungs-bewusster Kontext wurde konstruiert, indem menschliche und Pose-Informationen über die Zeit kombiniert wurden, während Kleidungsmerkmale separat verarbeitet und durch Projektion in Token-Embeddings ausgerichtet wurden.

Das Modell wurde auch erweitert, um Kleidungsinterpolation zu unterstützen. Hier wurden Darstellungen von zwei Kleidungsstücken kombiniert, um eine glatte Übergänge zu generieren, was eine konsistente und kohärente Mischung zwischen Kleidungsstücken ermöglichte, ohne zusätzliche Optimierung.

Daten und Tests

Das Modell wurde auf 9.135 Videos trainiert, mit Längen, die von drei bis zehn Sekunden variierten, die von den oben genannten ‘Einkaufszentren-Websites’; der eigenen generierten Datenbank der Autoren; und der HumanVid-Datenbank stammten.

Aus diesen wurden zwei Bewertungsdatenbanken etabliert: die ‘Internet-Datenbank’, die Videos und Produktbilder aus Einkaufszentren enthält; und der offizielle Test-Split der Alibaba-ViViD-Datenbank.

Da die ViViD-Daten Gesichter fehlen (siehe oben Video, für ein Beispiel, das in der virtuellen Anprobier-Literatur sehr häufig ist), wurden diese mithilfe von Flux-Outpainting hinzugefügt.

Die verwendeten Metriken waren L1-Verlust; Peak-Signal-zu-Rausch-Verhältnis (PSNR); Strukturelle Ähnlichkeits-Index (SSIM); Gelernte Wahrnehmungs-Ähnlichkeits-Maß (LPIPS); Fréchet-Inception-Distanz (FID); und Fréchet-Video-Distanz†† (FVD)

Die getesteten Systeme für die Kleidungstransfer waren OOTDiffusion; CatVTON; OmniTry; und Any2AnyTryon. Die getesteten Modelle für die Bild-zu-Bild-Generierung waren VisualCloze; MOSAIC; und ByteDance’s UNO.

Für die zweite Kategorie von Tests, bei denen Kombinationen von Bild-virtuellen Anprobierungen und Animation-Modellen getestet wurden, konnte die neue Arbeit erneut die höchste Punktzahl erreichen:

Quantitative Vergleich mit Kombinationen von bildbasierten virtuellen Anprobierungen und Animation-Modellen auf den Internet- und ViViD-Datenbanken. Die vorgeschlagene Methode erreichte die beste Gesamtleistung über alle Metriken, wobei SSIM im Vergleich zum stärksten Baseline-Modell blieb. Fett gedruckte Werte zeigen den höchsten Wert in jeder Spalte an.

Quantitative Vergleich mit Kombinationen von bildbasierten virtuellen Anprobierungen und Animation-Modellen auf den Internet- und ViViD-Datenbanken. Die vorgeschlagene Methode erreichte die beste Gesamtleistung über alle Metriken, wobei SSIM im Vergleich zum stärksten Baseline-Modell blieb. Fett gedruckte Werte zeigen den höchsten Wert in jeder Spalte an.

Die Autoren fügen hinzu:

‘[Unser] Modell erreicht die beste Leistung über alle Metriken, wenn es mit Kombinationen von Bild-zu-Bild-Generierungs-Modellen und Animation-Modellen verglichen wird.

‘Qualitative Ergebnisse [siehe unten] bestätigen, dass unser Ansatz die genaueste Pose-Verfolgung und Kleidungstransfer produziert, während er die Identität treuer bewahrt als alle Bild-zu-Bild-basierten Baseline-Modelle.’

Qualitativer Vergleich auf den Internet- und ViViD-Datenbanken gegen Bild-zu-Bild- und Animation-Baselines, bei dem die vorgeschlagene Methode, so behaupten die Autoren, eine genauere Pose-Verfolgung und Kleidungstransfer bietet, während sie die Identität konsistenter bewahrt als VisualCloze, MOSAIC, UNO und VACE.

Qualitativer Vergleich auf den Internet- und ViViD-Datenbanken gegen Bild-zu-Bild- und Animation-Baselines, bei dem die vorgeschlagene Methode, so behaupten die Autoren, eine genauere Pose-Verfolgung und Kleidungstransfer bietet, während sie die Identität konsistenter bewahrt als VisualCloze, MOSAIC, UNO und VACE.

Für die zweite Kategorie von Tests, bei denen Kombinationen von Bild-virtuellen Anprobierungen und Animation-Modellen getestet wurden, konnte die neue Arbeit erneut die höchste Punktzahl erreichen:

Quantitative Vergleich mit Kombinationen von bildbasierten virtuellen Anprobierungen und Animation-Modellen auf den Internet- und ViViD-Datenbanken. Die vorgeschlagene Methode erreichte die beste Gesamtleistung über alle Metriken, wobei SSIM im Vergleich zum stärksten Baseline-Modell blieb. Fett gedruckte Werte zeigen den höchsten Wert in jeder Spalte an.

Quantitative Vergleich mit Kombinationen von bildbasierten virtuellen Anprobierungen und Animation-Modellen auf den Internet- und ViViD-Datenbanken. Die vorgeschlagene Methode erreichte die beste Gesamtleistung über alle Metriken, wobei SSIM im Vergleich zum stärksten Baseline-Modell blieb. Fett gedruckte Werte zeigen den höchsten Wert in jeder Spalte an.

Die Autoren fügen hinzu:

‘Qualitative Vergleiche [siehe unten] demonstrieren, dass unsere Ergebnisse den Ground-Truth am nächsten kommen unter allen Bild-virtuellen Anprobierungen-basierten Baseline-Modellen.’

Qualitative Tests mit Baseline-Modellen, die durch Kombination von VTON-Modellen mit Animation-Modellen erstellt wurden.

Qualitative Tests mit Baseline-Modellen, die durch Kombination von VTON-Modellen mit Animation-Modellen erstellt wurden.

Schlussfolgerung

Obwohl das Vanast-Projekt eine diskrete End-to-End-Lösung erreicht, deutet der Mangel an Details über die Trainings- und Inferenz-Ressourcenanforderungen darauf hin, dass dies möglicherweise nicht die agilste oder flexibelste Lösung ist. In Wahrheit ist die Herausforderung selbst extrem schwierig zu erreichen, selbst in einem nicht optimierten System – und wie viel mehr in einer kommerziellen Bereitstellung, die eine niedrige Latenz und eine gute Rentabilität erfordern würde.

Das virtuelle Anprobieren ist eines von mehreren ‘Mondlande’-Zielen der KI, bei denen der aktuelle Stand der Technik, wie er durch verschiedene Schlagzeilen und ausgewählte Ergebnisse vermittelt wird, die tatsächliche Schwierigkeit der Aufgabe verdeckt, die möglicherweise durch spätere und leichtere Technologien als die Transformer gelöst werden wird.

 

Verfügbar in den USA, geo-blockiert in vielen anderen Regionen, wenn nicht in allen.

†† Die Autoren beziehen sich auf ‘VFID’, verlinken jedoch nur auf das ViViD-Paper, das die Referenz nicht rechtfertigt, soweit ich es mit begrenzter Zeit verfolgen kann. Ich habe angenommen, dass sie tatsächlich die Fréchet-Video-Distanz (FVD) meinten und ebenfalls knapp bei der Zeit waren. Bitte kontaktieren Sie mich für Änderungen, falls erforderlich.

Erstveröffentlichung am Mittwoch, den 8. April 2026

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai