Η γωνία του Anderson
Εικονική δοκιμή ενδυμάτων μέσω της τεχνητής νοημοσύνης

Ένα μοντέλο ΤΝ μπορεί τώρα να μετατρέψει μια đơnική φωτογραφία και εικόνες ενδυμάτων σε μια κινούμενη βίντεο ενός ατόμου που φοράει νέα ενδύματα, αποφεύγοντας τις δυσλειτουργίες που είναι συχνές στα παλαιότερα, δύο-βήματα συστήματα.
Η κατηγορία ‘εικονική δοκιμή’ (VTON) στην έρευνα της υπολογιστικής όρασης είναι μεταξύ των καλύτερα χρηματοδοτούμενων και πιο παραγωγικών στόχων στην βιβλιογραφία – κυρίως επειδή, όπως μπορεί να εξαχθεί από τις συχνές βιομηχανικές/ακαδημαϊκές συνεργασίες που δημοσιεύονται κάθε χρόνο, αυτό το αντικείμενο λαμβάνει σημαντική χρηματοδότηση από τη βιομηχανία της μόδας:

Από το έγγραφο ‘Image-Based Virtual Try-On: A Survey’, παραδείγματα τύπων αναπαράστασης ατόμων και некоторых σταδίων φιλτραρίσματος και βελτίωσης που ακόμη και οι βασικές εικόνες πρέπει να περάσουν για μια εικονική δοκιμή (VTON). Πηγή
Υπάρχουν πολλές παραλλαγές του στόχου, όπως εξαγωγή ενδυμάτων από εικόνες ατόμων, και προσαρμογή του πλήρους σώματος όταν είναι απαραίτητο. Ορισμένα συστήματα βασισμένα σε εικόνες έχουν εφαρμοστεί εμπορικά, σε πλατφόρμες όπως veesual.ai, wanna.fashion και fashn.ai.
Για βίντεο, η πειραματική εφαρμογή Doppl του Google Labs πειραματίστηκε με αυτή τη λειτουργικότητα, εκκινώντας πέρυσι το καλοκαίρι:
Παρακαλούμε κάντε κλικ για αναπαραγωγή εάν το βίντεο δεν αναπαράγεται αυτόματα. Αποσπάσματα από το εγκαταλελειμμένο έργο βίντεο δοκιμής του Google Doppl. Πηγή
Ωστόσο, το Doppl σταμάτησε να λειτουργεί τον Απρίλιο του 2026 μετά από μια ψυχρή υποδοχή, με τους χρήστες που ανακατευθύνονται τώρα στην υπηρεσία δοκιμής εικόνας της εταιρείας†:

Η υπηρεσία δοκιμής εικόνας του Google, όπου οι χρήστες ανακατευθύνονται από την εγκαταλελειμμένη πλατφόρμα Doppl. Πηγή
Αν και υπάρχουν ορισμένες πλατφόρμες που προσφέρουν εικονική δοκιμή με βίντεο, καμία από αυτές δεν φαίνεται να συνδέεται με ένα πραγματικό κατάστημα και όλες είναι ‘ακραίες’, περιφερειακές (και συχνά ‘αμφίβολες’) προϊόντα.
Ενώ υπάρχουν ορισμένα ενδιαφέροντα βήματα από τον τομέα της έρευνας, αυτά είναι παραδοσιακά σύνθετα αρχιτεκτονικά που είναι δύσκολο να εφαρμοστούν για χαμηλή καθυστέρηση και υψηλή ποιότητα:
Παρακαλούμε κάντε κλικ για αναπαραγωγή εάν το βίντεο δεν αναπαράγεται αυτόματα. Από το έργο Fashion-VDM του 2024, ένα παράδειγμα ‘ακέφαλου’ μεταφοράς ενδυμάτων. Πηγή
Η αλήθεια είναι ότι η εργασία της προσαρμογής των ενδυμάτων σε ένα πραγματικό άτομο, χωρίς να παραμορφώνει τα ενδύματα ή το άτομο, διατηρώντας παράλληλα κάποιο είδος χρήσιμης επίδειξης (η οποία ακρίβεια δείχνει την πίσω πλευρά του προϊόντος όταν το άτομο γυρίζει την πλάτη του), είναι một τεράστιο πρόκληση για την τρέχουσα κατάσταση της τεχνολογίας.
Vanast
Είναι μια πρόκληση που μια νέα εργασία από τη Κορέα προσπαθεί να ανταποκριθεί, χρησιμοποιώντας μια καινοτόμο και εντελώς ολοκληρωμένη λύση για την ανάλυση των ενδυμάτων + ατόμου + κίνησης:
Παρακαλούμε κάντε κλικ για αναπαραγωγή εάν το βίντεο δεν αναπαράγεται αυτόματα. Παραδείγματα από τον ιστότοπο των υλικών του έργου Vanast. Πηγή
Το νέο σύστημα, με τίτλο Vanast, αξιοποιεί ένα εξειδικευμένο σύνολο δεδομένων που περιλαμβάνει την ενσωμάτωση και την ορχήστρα των τριών παραγόντων που είναι απαραίτητοι για την εκπλήρωση της εργασίας: τα ενδύματα, το άτομο και η κίνηση:
Κάντε κλικ για αναπαραγωγή. Περισσότερα παραδείγματα από τον ιστότοπο του έργου Vanast.
Το σύστημα αξιοποιεί πλαισιά αυτά τόσο διαφορετικά όσο τα Flux, Qwen και ChatGPT, για να δημιουργήσει ένα ‘τρίτη’ σύνολο δεδομένων ικανό να ενημερώσει μια αρχιτεκτονική από άκρο σε άκρο:

Από το νέο έγγραφο, παραδείγματα των σημείων δεδομένων του συνόλου δεδομένων που χρησιμοποιούνται για την γεννήτρια και την εκπαίδευση. Πηγή –
Το νέο έγγραφο έχει τίτλο Vanast: Εικονική δοκιμή με ανίμαση εικόνας ανθρώπου μέσω συνθετικής τριπλέτας επιτήρησης, και προέρχεται από τέσσερις ερευνητές στο Πανεπιστήμιο της Σεούλ. Υπάρχει επίσης ένας πλούσιος σε βίντεο ιστότοπος του έργου.
Μέθοδος
Ο δηλωμένος στόχος των συγγραφέων στην εργασία είναι να συνδυάσουν τους τρεις προαναφερθέντες παράγοντες σε ένα πλαίσιο ενός σταδίου – όχι μόνο επειδή η διαδικασία θα ήταν διακριτή, αλλά και επειδή δίνει στους verschiedenen παράγοντες περισσότερες ευκαιρίες να αλληλεπιδράσουν και να αλληλεπιδράσουν κατά την εκπαίδευση, με στόχο μια πιο συνοχή γεννήτρια:

Το Vanast συνδυάζει μια đơnική φωτογραφία ανθρώπου, ξεχωριστές εικόνες ενδυμάτων και μια αναφορά κίνησης για να δημιουργήσει μια κινούμενη ακολουθία στην οποία το ίδιο άτομο φοράει το νέο ένδυμα, με οδηγία στάσης που εξασφαλίζει συνεχή κίνηση, ενώ ταυτόχρονα διατηρούνται η ταυτότητα και τα λεπτομέρεια του ενδύματος σε όλα τα πλαίσια.
Για να επιτύχει αυτό, το σύστημα λαμβάνει εικόνες των στόχων ενδυμάτων, μια φωτογραφία του ατόμου που φοράει διαφορετικά ενδύματα, μια αναφορά βίντεο που ορίζει πώς πρέπει να κινηθεί το άτομο, και μια κειμενική προτροπή που περιγράφει την ενέργεια και το περιβάλλον, και παράγει μια πλήρη βίντεο ακολουθία στην οποία το ίδιο άτομο φαίνεται να φοράει το νέο ένδυμα, ενώ ακολουθεί την επιβαλλόμενη κίνηση, με κάθε πλάισιο να διατηρείται οπτικά συνεπές με το χρόνο.
Αντί να χωρίζει το ντύσιμο και την ανίμαση σε διαφορετικά στάδια – που ήταν η προσέγγιση στην πλειοψηφία των παρόμοιων προηγούμενων εργασιών – το Vanast χειρίζεται τα ενδύματα, την ταυτότητα και την κίνηση μαζί σε μια διαδικασία, επιτρέποντας σε αυτά τα στοιχεία να αλληλεπιδράσουν κατά τη γεννήτρια, και μειώνοντας τους τύπους των αντιστοιχιών και της αστάθειας που εμφανίζονται στις προηγούμενες μεθόδους.
Σύνολο Δεδομένων
Η εκπαίδευση για το έργο βασίζεται σε ζευγαρωμένα παραδείγματα μιας εικόνας ατόμου, των αντίστοιχων ενδυμάτων και ενός βίντεο του ατόμου που κινείται जबकαι φοράει αυτά τα ενδύματα, με κίνηση που εξάγεται χρησιμοποιώντας μια προηγούμενη αρχιτεκτονική, για να παρέχει σταθερή οδηγία στάσης σε όλα τα πλαίσια.
Στην απουσία ενός δημόσια διαθέσιμου συνόλου δεδομένων που να ικανοποιεί τις απαιτήσεις του έργου, δεδομένα συλλέχθηκαν από (απροσδιόριστες)在线 εμπορικές πλατφόρμες, παρέχοντας μια κρυψώνα βίντεο με ποικίλα ενδύματα. Ωστόσο, η εργασία απαιτούσε βίντεο του ίδιου ατόμου φορώντας πολλά ενδύματα, που είναι ένα σπάνιο εύρημα σε άγρια δεδομένα, και που απαιτούσε τη δημιουργία συνθετικών δεδομένων.
Η τρίβα διαδικασία περιελάμβανε την επιλογή κατάλληλων πλαισίων από τα συλλεγμένα βίντεο, που χειριζόταν μέσω του Qwen2.5-VL Vision-Language Model (VLM), με κατάλληλη περικοπή και αξιολόγηση της καταλληλότητας (π.χ., keine occlusions, αντικείμενο στη σωστή θέση, κ.λπ.); και τη δημιουργία κατάλληλων inpainting масок για να απομονώσουν τις επηρεαζόμενες περιοχές – που (σε γραμμή με την προηγούμενη εργασία PERSE) χειρίζεται από το πλέον αξιόλογο SDXL diffusion model.
<img class=" wp-image-409007" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-2-2.jpg" alt="Επισκόπηση της διαδικασίας Vanast, όπου μια εικόνα ανθρώπου, στόχοι ενδυμάτων και μια αναφορά κίνησης κωδικοποιούνται και επεξεργάζονται σε ένα ενοποιημένο μοντέλο διασποράς βίντεο. Το σύστημα παράγει μια ανίμαση που διατηρεί την ταυτότητα, ακολουθεί την ακολουθία στάσης και εφαρμόζει τα στόχοι ενδυμάτων, ενώ η συνθετική τριπλέτα γεννήτρια υποστηρίζει την εκπαίδευση, και μια διπλή-μονάδα σχεδιασμός分離ζει την ανίμαση από τη μεταφορά ενδυμάτων, για να διατηρήσει τη συνεπή.
Στο τρίτο στάδιο, το Qwen αναλαμβάνει και πάλι καθήκοντα για να ταξινομήσει εικόνες κατά φύλο, και το δημοφιλές Flux πλαίσιο διασποράς εικόνας χρησιμοποιείται για να δημιουργήσει αλλαγές στα ενδύματα σε μια εικόνα (καθώς το Flux είναι ικανό να συνδυάζει πολλαπλά στοιχεία εισόδου). Οι προτροπές inpainting κειμένου επιμελώντας από το ChatGPT (έκδοση μη καθορισμένη).
Για να αυξήσει περαιτέρω την ποικιλία στάσης και φόντου, μια διαδικασία εισαγωγής κατασκευάστηκε για να δημιουργήσει τριπλέτες εκπαίδευσης από βίντεο in-the-wild, χρησιμοποιώντας το HumanVid dataset. Η ίδια διαδικασία χρησιμοποιήθηκε για να δημιουργήσει την ταυτότητα-διατηρούμενη εικόνα ανθρώπου.
Καθώς δεν υπήρχε αυτόνομη εικόνα ενδύματος σε αυτά τα βίντεο, εικόνες ενδυμάτων συνθέθηκαν直接 από τα βίντεο. Πλαίσια δείγματος από κάθε βίντεο, και το Qwen χρησιμοποιήθηκε για να βαθμολογήσει για ορατότητα μπροστά, πριν να επιλεγεί ο πιο κατάλληλος υποψήφιος, με βάση την ορατότητα του πλήρους σώματος, την καθαρότητα της εικόνας, την ελάχιστη οκλούση, την ποιότητα φωτισμού και την tổngική σύνθεση.
Μια περιοχή ανώτερων ενδυμάτων εξαγωγής χρησιμοποιώντας SegFormer, και το φόντο αφαιρέθηκε για να απομονώσει το ένδυμα.
Για να αποφευχθεί positional bias, η περιοχή ενδύματος μετατοπίστηκε τυχαία μέσα στο οριοθετημένο κουτί, και το Qwen χρησιμοποιήθηκε και πάλι για να φιλτράρει τις αξιόπιστες segmentations. Αυτή η διαδικασία παρήγαγε συνθετικές εικόνες ενδυμάτων ζευγαρωμένες με κίνηση και ταυτότητα, επιτρέποντας την κατασκευή μεγάλης κλίμακας τριπλέτας από μη δομημένα δεδομένα βίντεο, ενώ βελτιώνει τη ρομποτική σε διάφορες πραγματικές συνθήκες.
Αρχιτεκτονική
Μια διπλή-μονάδα αρχιτεκτονική εισήχθη για να αντιμετωπίσουν την αργή συνέργεια και την αδύναμη ισορροπία ελέγχου που εμφανίστηκαν σε εκείνες τις προηγούμενες μεθόδους που είχαν προσπαθήσει να συνδυάσουν όλες τις συνθήκες. Η προσέγγιση αξιοποίησε τον μετασχηματιστή διασποράς βίντεο από Wan, και drew επίσης από το VACE project (see below).
Το μοντέλο χωρίστηκε σε ένα Μονάδα Ανίμασης Ανθρώπου (HAM), που χειρίζεται κίνηση και ταυτότητα από ανθρώπινη και στάση εισόδου, και μια Μονάδα Μεταφοράς Ενδυμάτων (GTM), που χειρίζεται ενδύματα από εικόνες ενδυμάτων. Και τα δύο μοιράζονται πρόσβαση στο σκελετό, ενώ ενσωματώνουν χαρακτηριστικά σε μια κατανεμημένη, κασκαντίζουσα τρόπο, για να βελτιώσουν την κατάσταση.
Η εκπαίδευση πραγματοποιήθηκε με παγώνοντας τον σκελετό και βελτιώνοντας μόνο τους παράγοντες HAM και GTM, με τις συνεισφορές τους ισορροπημένες κατά τη διάρκεια της ενσωμάτωσης χαρακτηριστικών. Οι εισόδους από το συνθετικό σύνολο δεδομένων τριπλέτας μετατράπηκαν σε λατινικές αναπαραστάσεις χρησιμοποιώντας το VAE του WAN.
Η κίνηση-ευαίσθητη контекστ κατασκευάστηκε με結合 ανθρώπινη και στάση πληροφορίες στο χρόνο, ενώ τα χαρακτηριστικά ενδυμάτων επεξεργάστηκαν ξεχωριστά, και ευθυγραμμίστηκαν μέσω προβολής σε token ενσωματώσεις.
Το μοντέλο επεκτάθηκε επίσης για να υποστηρίξει μεταφορά ενδυμάτων. Εδώ, αναπαραστάσεις από δύο ενδύματα συνδυάστηκαν για να δημιουργήσουν ομαλές μεταβάσεις, επιτρέποντας συνεπή και συνεκτική ανάμιξη μεταξύ ενδυμάτων, χωρίς πρόσθετη βελτίωση.
Δεδομένα και Τεστ
Το μοντέλο εκπαιδεύτηκε σε 9.135 βίντεο, με μήκη που ποικίλλουν από τρία έως δέκα δευτερόλεπτα, από τις προαναφερθείσες ‘εμπορικές’ πλατφόρμες, το δικό τους σύνολο δεδομένων και το HumanVid dataset.
Από αυτά, δύο σύνολα δεδομένων αξιολόγησης καθορίστηκαν: το ‘Διαδικτυακό σύνολο δεδομένων’, που περιλαμβάνει βίντεο και εικόνες προϊόντων από εμπορικές πλατφόρμες, και το επίσημο τεστ διαχωρισμού του συνόλου δεδομένων ViViD της Alibaba.
Καθώς το ViViD dataset λείπει από πρόσωπα (δείτε το προηγούμενο βίντεο παραπάνω, για ένα παράδειγμα, που είναι πολύ κοινό στη βιβλιογραφία της εικονικής δοκιμής), αυτά προστέθηκαν μέσω Flux outpainting.
Οι μετρήσεις που χρησιμοποιήθηκαν ήταν L1 απώλεια, Δείκτης Σήματος προς Θόρυβο (PSNR), Δείκτης Ομοιότητας Κονструкτού (SSIM), Μαθημένη Αντιληπτική Ομοιότητα Πλαίσια Εικόνας (LPIPS), Απόσταση Fréchet Inception (FID) και Απόσταση Fréchet Βίντε (FVD)
Σύστημα που δοκιμάστηκαν για μεταφορά ενδυμάτων ήταν OOTDiffusion, CatVTON, OmniTry και Any2AnyTryon. Μοντέλα γεννήτριας εικόνας ανθρώπου που δοκιμάστηκαν ήταν VisualCloze, MOSAIC και το UNO της ByteDance.
Για τη δεύτερη κατηγορία τεστ, όπου συνδυασμοί εικονικής δοκιμής εικόνας και μοντέλων ανίμασης δοκιμάστηκαν, η νέα εργασία ήταν σε θέση να επιτύχει το υψηλότερο σκορ:

Ποσοτική σύγκριση με συνδυασμούς μοντέλων εικονικής δοκιμής εικόνας και μοντέλων ανίμασης στο Διαδικτυακό και ViViD datasets. Η προτεινόμενη μέθοδος επιτύχει την καλύτερη συνολική απόδοση σε όλους τους μετρητές, με SSIM που παραμένει συγκρίσιμη με το ισχυρότερο baseline. Bold τιμές υποδεικνύουν την υψηλότερη βαθμολογία σε κάθε στήλη.
Οι συγγραφείς προσθέτουν:
‘[Το] μοντέλο μας επιτύχει την καλύτερη απόδοση σε όλους τους μετρητές όταν συγκρίνεται με συνδυασμούς μοντέλων γεννήτριας εικόνας ανθρώπου και μοντέλων ανίμασης.
‘Ποιοτικές αποτελέσματα [δείχνουν παρακάτω] επιβεβαιώνουν περαιτέρω ότι η προσέγγισή μας παράγει την πιο ακριβή ακολουθία στάσης και μεταφορά ενδυμάτων, ενώ διατηρεί την ταυτότητα πιο πιστά από όλα τα baselines που βασίζονται σε εικόνα.’

Ποιοτική σύγκριση στο Διαδικτυακό και ViViD datasets εναντίον baselines εικόνας ανθρώπου και ανίμασης, όπου η προτεινόμενη μέθοδος, σύμφωνα με τους συγγραφείς, προσφέρει πιο ακριβή ακολουθία στάσης και μεταφορά ενδυμάτων, ενώ διατηρεί την ταυτότητα πιο συνεχώς από το VisualCloze, MOSAIC, UNO και VACE.
Για τη δεύτερη κατηγορία τεστ, όπου συνδυασμοί εικονικής δοκιμής εικόνας και μοντέλων ανίμασης δοκιμάστηκαν, η νέα εργασία ήταν σε θέση να επιτύχει το υψηλότερο σκορ:

Ποιοτικές δοκιμές χρησιμοποιώντας baselines που δημιουργούνται με συνδυασμό μοντέλων εικονικής δοκιμής και μοντέλων ανίμασης.
Συμπέρασμα
Αν και το έργο Vanast επιτύχει μια διακριτή λύση από άκρο σε άκρο, η έλλειψη λεπτομερειών γύρω από τις απαιτήσεις πόρων εκπαίδευσης και inference υποδηλώνει ότι αυτό μπορεί να μην είναι η πιο ευέλικτη ή γρήγορη λύση. Στην πραγματικότητα, η πρόκληση είναι εξαιρετικά δύσκολο να επιτευχθεί ακόμη και σε ένα μη βελτιωμένο σύστημα – και πόσο περισσότερο σε μια εμπορική ανάπτυξη που θα χρειαζόταν χαμηλή καθυστέρηση και οικονομική απόδοση/ΕΠΙ σε μεγάλη κλίμακα..?
Η εικονική δοκιμή είναι ένας από τους στόχους ‘σεληνιακής πτήσης’ της ΤΝ, όπου η τρέχουσα κατάσταση της τεχνολογίας, όπως διαχέεται μέσω διαφόρων τίτλων και επιλεγμένων αποτελεσμάτων, κρύβει την πραγματική δυσκολία της εργασίας, η οποία ίσως θα επιλυθεί από μεταγενέστερες και ελαφρύτερες τεχνολογίες από τις μετασχηματιστές.
† Διαθέσιμο στις ΗΠΑ, γεω-μπλοκαρισμένο σε πολλές άλλες περιοχές, αν όχι όλες.
†† Οι συγγραφείς αναφέρουν ‘VFID’, αλλά συνδέουν μόνο με το έγγραφο ViViD, το οποίο δεν δικαιολογεί την αναφορά, όσο μπορώ να καταλάβω, με περιορισμένο χρόνο για να το αναζητήσω. Έχω υποθέσει ότι εννοούν Fréchet Video Distance (FVD), και ήταν επίσης λίγο βιαστικοί. Παρακαλώ επικοινωνήστε μαζί μου για διορθώσεις, όπως απαιτείται.
Πρώτη δημοσίευση Τετάρτη, 8 Απριλίου 2026












