Η γωνία του Anderson

Τα Πλεονεκτήματα του Να Γίνεις Λιπαρός Μέσω του AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Images of synthetically altered data, from the paper 'Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping at https://arxiv.org/abs/2508.13065

Ένα νέο σύστημα AI μπορεί να μεταμορφώσει με ρεαλιστικό τρόπο τα σώματα των ανθρώπων σε φωτογραφίες, κάνοντάς τους πιο λιπαρούς, πιο λεπτούς ή πιο μυώδεις, χωρίς να αλλάζει το πρόσωπο, τα ρούχα ή το φόντο. Το σύστημα έχει εκπαιδευτεί σε ένα πλήρως συνθετικό σύνολο δεδομένων που παρουσιάζει κάθε ταυτότητα σε πολλαπλά σώματα.

 

Εκτός από τη χρήση του AI ως μέθοδο για βελτίωση του σώματος στα κοινωνικά δίκτυα, ή (πιθανότατα) για αλλαγή του τύπου του σώματος για σκοπούς VFX, η χρήση της μηχανικής μάθησης για αλλαγή της εμφάνισης των ατόμων μπορεί να έχει μια πιο σημαντική λειτουργία: να βοηθήσει τα άτομα με διαταραχές της όρεξης να κατανοήσουν τη δυσμορφική ερμηνεία της εμφάνισής τους, καθώς και να προσφέρει ένα πιθανό κίνητρο για γενικότερα αθλητικά και φυσικά σκοπούς:

Από το έγγραφο 'Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars', μια διεπαφή για να οπτικοποιήσει αλλαγές στο σώμα. Τα άτομα με δυσμορφία του σώματος μπορεί να έχουν δυσκολία να συνδέσουν μια ρεαλιστική ερμηνεία του σώματός τους με μια παρόμοια εικόνα, δίνοντας στους κλινικούς ένα μέτρο για δυσμορφικές απαντήσεις, μεταξύ άλλων σκοπών.

Από το έγγραφο ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’, μια διεπαφή για να οπτικοποιήσει αλλαγές στο σώμα. Τα άτομα με δυσμορφία του σώματος μπορεί να έχουν δυσκολία να συνδέσουν μια ρεαλιστική ερμηνεία του σώματός τους με μια παρόμοια εικόνα, δίνοντας στους κλινικούς ένα μέτρο για δυσμορφικές απαντήσεις, μεταξύ άλλων σκοπών. Source: https://www.nature.com/articles/s41598-017-15339-z.pdf

Επιπλέον, η πρόσφατη έρευνα στον τομέα της μόδας για την προβολή εικόνων cũng έχει ενδιαφέρον για την παροχή ακριβών οπτικοποιήσεων σε μια σειρά από τύπους σωμάτων. Εν τω μεταξύ, πλαίσια όπως το DiffBody του 2024 από το Πανεπιστήμιο του Tsukuba στην Ιαπωνία, έχουν δημιουργήσει κάποια εντυπωσιακή λειτουργικότητα σε αυτόν τον τομέα:

Κάποιες από τις μεταμορφώσεις που είναι δυνατές με την προηγούμενη τεχνική DiffBody. Source: https://arxiv.org/pdf/2401.02804

Κάποιες από τις μεταμορφώσεις που είναι δυνατές με την προηγούμενη τεχνική DiffBody. Source: https://arxiv.org/pdf/2401.02804

Από τη στιγμή που τα μοντέλα AI είναι βελτιστοποιημένα για συνήθως ελκυστικά ή άλλα κοινά σώματα, τα ασυνήθιστα μεγέθη όπως το ‘λιπαρό’ είναι είτε ελάχιστα διαθέσιμα στα τυπικά μοντέλα, είτε έρχονται με κάποια ποινικά προκατάληψη.

Ζευγαρωμένα Απαραίτητα

Ένα από τα μεγαλύτερα προβλήματα στη δημιουργία συστημάτων AI που μπορούν να μεταμορφώσουν ρεαλιστικά το λίπος και τους μυς σε εικόνες ατόμων, χωρίς να αλλάζουν την ταυτότητα, το περιβάλλον ή τα ρούχα, είναι ότι αυτό περιλαμβάνει ζευγαρωμένη εκπαίδευση, όπου το σύστημα AI μαθαίνει ‘πριν’ και ‘μετά’ εικόνες που ορίζουν οποιαδήποτε μεταμόρφωση το μοντέλο προορίζεται να εκτελέσει.

Είδος εκπαίδευσης έχει επανακερδίσει τη δημοτικότητά του το καλοκαίρι λόγω της επιτυχίας των μοντέλων Kontext της Black Forest Labs, όπου χρησιμοποιήθηκαν ζευγαρωμένα δεδομένα για να διδάξουν μια σειρά από μεταμορφώσεις στα μοντέλα:

Από την ιστοσελίδα Flux Kontext, ένα παράδειγμα μιας μεταμόρφωσης που αντανακλά το είδος των δεδομένων που χρειάζεται για να εκπαιδεύσει ένα μοντέλο ικανό να διατηρεί την ακεραιότητα της εικόνας όταν επιβάλλει σημαντικές αλλαγές. Source: https://bfl.ai/models/flux-kontext

Από την ιστοσελίδα Flux Kontext, ένα παράδειγμα μιας μεταμόρφωσης που αντανακλά το είδος των δεδομένων που χρειάζεται για να εκπαιδεύσει ένα μοντέλο ικανό να διατηρεί την ακεραιότητα της εικόνας όταν επιβάλλει σημαντικές αλλαγές. Source: https://bfl.ai/models/flux-kontext

Φυσικά, στην περίπτωση της ανάπτυξης ενός μοντέλου που μπορεί να改变ει σημαντικά την εμφάνιση ενός ατόμου (χωρίς να ξαναφτιάχνει ολόκληρη την εικόνα), χρειάζεται κάτι που είναι απολύτως αδύνατο στον πραγματικό κόσμο: ριζικές ‘πριν’ και ‘μετά’ εικόνες που τραβήχτηκαν μόνο δευτερόλεπτα πριν.

Η μόνη διέξοδος είναι τα συνθετικά δεδομένα. Κάποια έργα αυτού του είδους έχουν χρησιμοποιήσει μεμονωμένα, χειροκίνητα ζευγαρωμένα δεδομένα που δημιουργήθηκαν με Photoshop. Ωστόσο, αυτό είναι ακατόρθωτο σε κλίμακα, και μια αυτοματοποιημένη ή ημι-αυτοματοποιημένη, AI-κίνητη διαδικασία για τη δημιουργία των ζευγαριών θεωρείται τώρα ολοένα και πιο προτιμώμενη.

Το πρόβλημα με τις GAN-βασισμένες και τις περισσότερες SMPL/X-βασισμένες προσεγγίσεις (όπου χρησιμοποιείται ένα εικονικό CGI πρόσωπο ως είδος μηχανισμού ανταλλαγής μεταξύ πραγματικών εικόνων και των επιθυμητών μεταμορφώσεων), και με τις προσεγγίσεις που χρησιμοποιούν image-warping, είναι ότι το φόντο και η ταυτότητα τείνουν να υποφέρουν στη διαδικασία.

Παραμετρικά, διανυσματικά μοντέλα CGI όπως το SMPL και το SMPL-X (μεταξύ άλλων), παρέχουν καθορισμένες συμβατικές φυσικές 3D συντεταγμένες που μπορούν να ερμηνευτούν και να ενσωματωθούν σε πλαίσια υπολογιστικής όρασης. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Παραμετρικά, διανυσματικά μοντέλα CGI όπως το SMPL και το SMPL-X (μεταξύ άλλων), παρέχουν καθορισμένες συμβατικές φυσικές 3D συντεταγμένες που μπορούν να ερμηνευτούν και να ενσωματωθούν σε πλαίσια υπολογιστικής όρασης. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Από τη στιγμή που είναι σημαντικό το AI να μάθει να αλλάζει μόνο τα επιθυμητά χαρακτηριστικά, αντί να μάθει να διαστρεβλώνει φόντα και να αναπαράγει άλλες ανεπιθύμητες σφάλματα, κανένα σύστημα αλλαγής του σώματος δεν έχει ακόμη φτάσει σε μια τέλεια λύση.

Ένα πρόσφατο έγγραφο από την Ινδία, ωστόσο, προτείνει μια αξιοσημείωτη πρόοδο στην κατάσταση της τέχνης μέσω της χρήσης του παλαιότερου Flux diffusion model framework, ενισχυμένο με μια σειρά από δευτερεύουσες προσεγγίσεις που επιτρέπουν ένα υπεροχή και πιο συνεπές ζευγαρωμένο σύνολο δεδομένων:

Παραδείγματα συνόλου δεδομένων από το νέο έργο. Source: https://arxiv.org/pdf/2508.13065

Παραδείγματα συνόλου δεδομένων από το νέο έργο. Source: https://arxiv.org/pdf/2508.13065

Το έργο αποτελείται από ένα νέο και εκτενές ζευγαρωμένο σύνολο δεδομένων, Odo, ένα γενετικό διαχυτικό μοντέλο που εκπαιδεύτηκε σε αυτά τα δεδομένα, και ένα ειδικό νέο βENCHMARK που σχεδιάστηκε για να αξιολογήσει ποσοτικά την απόδοση της επεξεργασίας του σώματος. Σε δοκιμές, οι συγγραφείς ισχυρίζονται μια αξιοσημείωτη πρόοδο σε σχέση με τα πρότυπα που επιτεύχθηκαν από παρόμοια συγκρίσιμα μοντέλα.

Το νέο έγγραφο έχει τον τίτλο Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping και προέρχεται από τρεις ερευνητές στην Fast Code AI Pvt. Ltd στο Μπανγκαλόρ.

Δεδομένα και Μέθοδος

Το σύνολο δεδομένων που δημιούργησαν οι ερευνητές περιλαμβάνει 7.615 υψηλής ανάλυσης (960x1280px) εικόνες για κάθε στόχο τύπου σώματος (λιπαρό, λεπτό και μυώδες).

Αρχικά, 1.523 ανθρώπινα πρόσωπα δημιουργήθηκαν μέσω του FLUX.1-dev 12-δισεκατομμυρίου παραμέτρου διαχυτικού μοντέλου, αν και χρησιμοποιώντας ένα μη καθορισμένο αριθμό αδειών-ελεύθερων αναφορών προσώπων από Pexels και Unsplash, για να αυξήσει την ποικιλία.

Για να δημιουργηθούν εικόνες πλήρους σώματος που περιλαμβάνουν αυτά τα πρόσωπα, οι ερευνητές χρησιμοποίησαν το PuLID της ByteDance του 2024, ένα σημείο ελέγχου που βελτιστοποιήθηκε πάνω από τη βάση Flux, και που περιλαμβάνει μια αντιθετική ID απώλεια που σχεδιάστηκε για να βοηθήσει στη διατήρηση της ταυτότητας του προσώπου κατά τη διάρκεια διαδικασίων μεταμόρφωσης:

Παραδείγματα από το έργο PuLID. Source: https://arxiv.org/pdf/2404.16022

Παραδείγματα από το έργο PuLID. Source: https://arxiv.org/pdf/2404.16022

Το μοντέλο έλαβε μια εικόνα προσώπου και μια τυποποιημένη πρόσκληση που ζητούσε φύλο, ενδυμασία, στάση, σκήνη, καθώς και τύπο σώματος λεπτό, λιπαρό ή μυώδες.

Οι τρεις εικόνες τύπου σώματος για κάθε ταυτότητα εμφάνιζαν μερικές φορές ελαφριές μετατοπίσεις στη στοίχιση του φόντου και την αντίληψη του μεγέθους του υποκειμένου, που προέρχονταν από τη στατιστική συμπεριφορά των διαχυτικών μοντέλων, όπου κάθε γεννήθηκε ξεκινά από ένα νέο θόρυβο σπορά. Ακόμη και μικρές αλλαγές στην πρόσκληση, όπως η τροποποίηση της περιγραφής του τύπου σώματος, μπορούν να επηρεάσουν την πορεία του μοντέλου στο λατινικό χώρο και να προκαλέσουν οπτική διαφυγή.

Για να διορθώσει αυτή τη μεταβλητότητα, εφαρμόστηκε μια αυτόματη διαδικασία μετα-επεξεργασίας σε τέσσερις στάδια, με την εικόνα λεπτή σε κάθε τριπλό επιλεγμένη ως αναφορά,既然 η μικρότερη σιλουέτα της εκθέτει περισσότερο το φόντο.

Η ανίχνευση προσώπου πραγματοποιήθηκε χρησιμοποιώντας RT-DETRv2, ακολουθούμενη από διαχωρισμό με SAM 2.1 για να εξαγάγει μάσκες υποκειμένου για όλα τα τρία τύπου σώματος. Η εικόνα λεπτή αναφορά तब μεταφέρθηκε στο FLUX.1 Kontext Pro (το νέο σύστημα επεξεργασίας εικόνας) για την επανασύνθεση του φόντου, παράγοντας μια καθαρή εκδοχή της σκηνής, με το υποκείμενο αφαιρεμένο.

Οι εκδοχές λιπαρό και μυώδες αναδιαμορφώθηκαν χρησιμοποιώντας ομοιόμορφη κλιμάκωση για να ταιριάζουν στο ύψος της μάσκας αναφοράς λεπτής, και συνθέθηκαν πάνω στο καθαρό φόντο στην ίδια κάτω στοίχιση, εξασφαλίζοντας συνεπή κάδρα σε όλες τις εικόνες.

Οι συγγραφείς δηλώνουν:

‘Τα αποτελέσματα μεταμόρφωσης τριπλό (λεπτό, λιπαρό και μυώδες) έχουν μια ταυτόσημη φόντο και ομοιόμορφη κλίμακα υποκειμένου. Αυτό αφαιρεί μη σχετικές μεταβλητότητες που θα μπορούσαν να επηρεάσουν αρνητικά την επόμενη εκπαίδευση ή αξιολόγηση.’

Κάθε τριπλό εικόνων λεπτό, λιπαρό και μυώδες επέτρεψε έξι πιθανές ζευγαρωμένες μεταμορφώσεις, με αποτέλεσμα 45.690 θεωρητικές συνδυασμούς σε 7.615 ταυτότητες.

Μετά τη φιλτράρισή τους για παραδείγματα με μη ταιριαστές ενδυμασίες, μη φυσιολογικές στάσεις, παραμορφωμένα άκρα, κίνηση ταυτότητας ή ελάχιστη αλλαγή σχήματος, 18.573 υψηλής ποιότητας ζευγάρια διατηρήθηκαν. Αν και κάποιες μικρές διαφορές στάσης παρέμειναν, το μοντέλο θα αποδείξει ανθεκτικό σε αυτές τις μεταβλητότητες.

Εκπαίδευση και Δοκιμές

Οι εικόνες που προέκυψαν χρησιμοποιήθηκαν για την εκπαίδευση του μοντέλου Odo – μια διαχυτική προσέγγιση για την επανασχήνωση των ανθρώπων, με τη χρήση του Skinned Multi-Person Linear Model (SMPL, δηλαδή, ενδιάμεσο CGI) χάρτες.

Ενημερωμένο από τις μεθόδους του Neural Localizer’s, τα δεδομένα συμμορφώθηκαν με το μοντέλο SMPL σε ατομική βάση, με τους παραμετρικούς παράμετρους που προέκυψαν ικανούς να παράγουν βαθμομετρικές χάρτες από τους οποίους θα προέκυπταν οι αλλαγμένες εικόνες:

Σχήμα για τη διαδικασία εκπαίδευσης. Η αριστερή πλευρά δείχνει τη ρύθμιση εκπαίδευσης, όπου οι βαθμομετρικοί χάρτες SMPL από την εικόνα-στόχο οδηγούν το ReshapeNet μέσω του ControlNet για να εκτελέσει μεταμόρφωση σώματος. Χαρακτηριστικά από την εικόνα-πηγή εξάγονται από το ReferenceNet και ενσωματώνονται στο ReshapeNet χρησιμοποιώντας χωρική αυτοπροσοχή. Η δεξιά πλευρά δείχνει την εύρεση, όπου οι παράμετροι SMPL εκτιμώνται από την είσοδο εικόνας, τροποποιούνται από σημασιολογικές ιδιότητες και αποδίδονται σε einen στόχο βαθμομετρικό χάρτη που συνδύασε το ReshapeNet κατά τη διάρκεια της αποθόρυβωσης για να παράγει την τελική μεταμορφωμένη εικόνα.

Σχήμα για τη διαδικασία εκπαίδευσης. Η αριστερή πλευρά δείχνει τη ρύθμιση εκπαίδευσης, όπου οι βαθμομετρικοί χάρτες SMPL από την εικόνα-στόχο οδηγούν το ReshapeNet μέσω του ControlNet για να εκτελέσει μεταμόρφωση σώματος. Χαρακτηριστικά από την εικόνα-πηγή εξάγονται από το ReferenceNet και ενσωματώνονται στο ReshapeNet χρησιμοποιώντας χωρική αυτοπροσοχή. Η δεξιά πλευρά δείχνει την εύρεση, όπου οι παράμετροι SMPL εκτιμώνται από την είσοδο εικόνας, τροποποιούνται από σημασιολογικές ιδιότητες και αποδίδονται σε einen στόχο βαθμομετρικό χάρτη που συνδύασε το ReshapeNet κατά τη διάρκεια της αποθόρυβωσης για να παράγει την τελική μεταμορφωμένη εικόνα.

Το μοντέλο (βλέπε σχήμα παραπάνω) αποτελείται από το ReshapeNet μονάδα, υποστηριζόμενο από τρεις βοηθητικές μονάδες: ReferenceNet, ένα IP-Adapter μονάδα και ένα βαθμομετρικό ControlNet μονάδα.

Το ReferenceNet εξάγει λεπτομερή χαρακτηριστικά όπως φόντο, ενδυμασία και ταυτότητα από την είσοδο εικόνας και τα μεταφέρει στο ReshapeNet. Το IP-Adapter συμβάλλει στην υψηλού επιπέδου οδηγία χαρακτηριστικών, ενώ το Depth ControlNet εφαρμόζει SMPL-βασισμένη σύνδεση για να οδηγήσει τη μεταμόρφωση του σώματος. Σύμφωνα με προηγούμενες έργα, μια SDXL-βασισμένη παγωμένη UNet χρησιμοποιήθηκε για να εξαγάγει ενδιάμεσα χαρακτηριστικά.

Όσον αφορά το IP-Adapter μονάδα, αυτό κωδικοποιεί την είσοδο εικόνας μέσω CLIP, με τις αποκτηθείσες εμφυτεύσεις ολοκληρωμένες πίσω στο ReshapeNet μέσω διασταυρούμενης προσοχής.

Όσον αφορά το Depth ControlNet μονάδα, αυτό οδηγεί τα μεσαία και αποκωδικοποιητές στρώματα του ReshapeNet χρησιμοποιώντας υπολειμματικές συνδέσεις. Στη συνέχεια, λαμβάνει einen βαθμομετρικό χάρτη που αποδίδεται από τους στόχους παραμέτρους SMPL και τον ευθυγραμμίζει με την εικόνα-στόχο.

Το ReshapeNet, βασισμένο στο SDXL UNet, είναι το κεντρικό δίκτυο του Odo. Κατά τη διάρκεια της εκπαίδευσης, οι εικόνες-στόχοι κωδικοποιούνται σε λατινικό χώρο με ένα διαχυτικό αυτοκωδικοποιητή, θορυβώνονται με την πάροδο του χρόνου και στη συνέχεια αποθορυβώνονται από το ReshapeNet χρησιμοποιώντας χαρακτηριστικά από το ControlNet και το ReferenceNet.

Κατηγορίας-ειδικές κειμενικές πρόσκλησεις όπως ‘Κάνε το άτομο πιο λιπαρό’, ‘Κάνε το άτομο πιο λεπτό’ ή ‘Κάνε το άτομο πιο μυώδες’ προστέθηκαν, για να οδηγήσουν τις μεταμορφώσεις. Ενώ οι βαθμομετρικοί χάρτες κατέγραψαν χονδρές σιλουέτες σώματος, οι πρόσκλησεις παρείχαν τις σημασιολογικές λεπτομέρειες που χρειάζονταν για αλλαγές όπως η ορισμός των μυών, επιτρέποντας στο μοντέλο να παράγει πιο ακριβείς και ρεαλιστικές αλλαγές.

Εφαρμογή Εκπαίδευσης

Το Odo εκπαιδεύτηκε στο συνθετικό σύνολο δεδομένων του έργου, σε συνδυασμό με ένα υποσύνολο του DeepFashion-MultiModal συνόλου δεδομένων, που οδηγούσε σε συνολικά 20.000 ζευγαρωμένες εικόνες.

Το DeepFashion-MultiModal δεδομένα παρείχαν ποικιλία σε ενδυμασίες και χαρακτηριστικά προσώπου, με εικόνες που ζευγαρώθηκαν εναντίον του εαυτού τους κατά τη διάρκεια της εκπαίδευσης. Με όλους τους βαθμομετρικούς χάρτες SMPL προ-υπολογισμένους για αποτελεσματικότητα, η εκπαίδευση διήρκεσε 60 epochs σε ένα μόνο NVIDIA A100 GPU με 80GB VRAM.

Με τις είσοδους εικόνων να έχουν αναδιαμορφωθεί σε 768×1024, ο Adam βελτιστοποιητής χρησιμοποιήθηκε, σε μια ταχύτητα μάθησης 1×10⁻⁵. Το ReshapeNet αρχικοποιήθηκε με SDXL UNet βαρίδια και βελτιστοποιήθηκε από κοινού με το IP-Adapter από το σημείο ελέγχου του.

Το ReferenceNet αρχικοποιήθηκε με SDXL βαρίδια και διατηρήθηκε παγωμένο, ενώ το Depth ControlNet χρησιμοποίησε προ-εκπαιδευμένα βαρίδια και επίσης παρέμεινε παγωμένο.

Το τελικό μοντέλο απαιτούσε περίπου 23GB μνήμης GPU, απαιτώντας 18 δευτερόλεπτα για μια εύρεση εικόνας.

Μια Νέα Μέτρηση

Η έλλειψη συνόλων δεδομένων του είδους που απαιτούνται για αυτό το είδος έργου σήμαινε ότι δεν υπήρχε κανένα υπάρχον μέτρο που να αντιμετωπίζει πραγματικά την πρόκληση. Έτσι, οι συγγραφείς ανέπτυξαν ένα νέο βENCHMARK, που αποτελείται από 3.600 ζευγαρωμένες εικόνες, που παρουσιάζουν πραγματικές εικόνες προσώπων και περιγραφές φόντου, μαζί με ποικιλία αλλαγών σώματος.

Άλλα μέτρα που χρησιμοποιήθηκαν ήταν ο Δείκτης Ομοιότητας Δομής (SSIM), ο Δείκτης Σήματος προς Θόρυβο (PSNR), η Μάθηση της Ομοιότητας Εικόνων (LPIPS), και η Σφαλματική Ευκλείδεια Απόσταση ανά ΒέρTEX σε ουδέτερη (Τ-)στάση (PVE-T-SC).

Πρώτα, οι συγγραφείς δοκιμάζουν την μέθοδο τους ποιοτικά εναντίον εικόνων που δεν έχουν δει το μοντέλο κατά τη διάρκεια της εκπαίδευσης:

Ποιοτικές δοκιμές. Τα παραδείγματα δείχνουν μετατροπές από την αρχική εικόνα σε λεπτότερη, υπέρβαρη και μυώδη σώματα σε διάφορες στάσεις, συμπεριλαμβανομένων καθισμάτων και στάσεων.

Ποιοτικές δοκιμές. Τα παραδείγματα δείχνουν μετατροπές από την αρχική εικόνα σε λεπτότερη, υπέρβαρη και μυώδη σώματα σε διάφορες στάσεις, συμπεριλαμβανομένων καθισμάτων και στάσεων. Παρακαλώ αναφερθείτε στο αρχικό έγγραφο για καλύτερη ορισμό και λεπτομέρεια.

Από αυτά τα αποτελέσματα, το έγγραφο αναφέρει:

‘[Η] μέθοδος μας χειρίζεται αποτελεσματικά ποικίλες στάσεις, φόντα και ενδυμασίες ενώ διατηρεί την ταυτότητα του ατόμου.

‘Εκτός από τις σιλουέτες στόχου SMPL, παρέχουμε κειμενικές πρόσκλησεις – ‘Κάνε το άτομο πιο λιπαρό’, ‘Κάνε το άτομο πιο λεπτό’ ή ‘Κάνε το άτομο πιο μυώδες’– για να οδηγήσουν σαφώς τις επιθυμητές μεταμορφώσεις…

…'[Η εικόνα παρακάτω] δείχνει περαιτέρω την ικανότητα του μοντέλου μας να εκτελέσει ποικίλες μεταμορφώσεις σώματος. Το μοντέλο ακολουθεί με ακρίβεια τους βαθμομετρικούς χάρτες SMPL για να παράγει πολλές παραλλαγές λεπτότερων και λιπαρότερων εκδόσεων από την εικόνα-αναφορά.’

Περαιτέρω ποιοτικές δοκιμές που καλύπτουν την εύρος των τύπων σώματος-στόχου.

Περαιτέρω ποιοτικές δοκιμές που καλύπτουν την εύρος των τύπων σώματος-στόχου. Παρακαλώ αναφερθείτε στο αρχικό έγγραφο για καλύτερη ορισμό και λεπτομέρεια.

Οι συγγραφείς σχολιάζουν περαιτέρω:

‘Τα αποτελέσματά μας δείχνουν πιο ρεαλιστικές μεταμορφώσεις σύμφωνα με το στόχο βάρος, поскольку το μοντέλο μας ταυτόχρονα調整ζει την общή σιλουέτα του σώματος, τις αναλογίες των άκρων και την ενδυμασία, με αποτέλεσμα ανατομικά συνεπείς και οπτικά πειστικές αλλαγές.’

Για ποσοτικές δοκιμές, οι συγγραφείς έθεσαν το σύστημά τους ενάντια στο μοντέλο Flux Kontext [dev] και το προϊόν Structure-Aware Flow Generation for Human Body Reshaping του 2022.

Για το FLUX.1 Kontext [dev], οι πρόσκλησεις σχεδιάστηκαν για να οδηγήσουν ‘Κάνε το άτομο πιο λιπαρό’, ‘Κάνε το άτομο πιο λεπτό’ ή ‘Κάνε το άτομο πιο μυώδες’, με τους στόχους βάρους να καθορίζονται – αν και η έλλειψη λεπτομερούς ελέγχου περιόρισε την απόδοση:

Σύγκριση του Odo με το Structure-Aware Flow Generation for Human Body Reshaping και το FLUX.1 Kontext [dev] στο σύνολο δοκιμών, μαζί με αποτελέσματα αφαίρεσης για μοντέλα που εκπαιδεύτηκαν χωρίς προγραμματιστική κατάσταση στο ReshapeNet, χωρίς ReferenceNet (χρησιμοποιώντας μόνο IP-Adapter), και με εκπαίδευση περιορισμένη στο σύνολο δεδομένων BR-5K. Ο πίνακας περιλαμβάνει επίσης υλικό σχετικά με μελέτες αφαίρεσης (BR-5K), τις οποίες δεν καλύπτουμε εδώ.

Σύγκριση του Odo με το Structure-Aware Flow Generation for Human Body Reshaping και το FLUX.1 Kontext [dev] στο σύνολο δοκιμών, μαζί με αποτελέσματα αφαίρεσης (που δεν καλύπτονται σε αυτό το άρθρο) για μοντέλα που εκπαιδεύτηκαν χωρίς προγραμματιστική κατάσταση στο ReshapeNet, χωρίς ReferenceNet (χρησιμοποιώντας μόνο IP-Adapter), και με εκπαίδευση περιορισμένη στο σύνολο δεδομένων BR-5K.

Συμπέρασμα

Η έλευση του Flux Kontext φέτος, και ακόμη πιο πρόσφατα η κυκλοφορία των μη-κβαντισμένων βαρίδων για το Qwen Image Edit, έχουν φέρει ξανά τα ζευγαρωμένα δεδομένα στο επίκεντρο των ερασιτεχνικών και επαγγελματικών κοινοτήτων. Σε ένα κλίμα που αυξάνει η κριτική και η αδιαλλαξία σχετικά με την ακαρίθεια της γενετικής AI, μοντέλα αυτού του είδους σχεδιάζονται για πολύ υψηλότερη πιστότητα στις είσοδου εικόνες (αν και τα μικρότερα μοντέλα μερικές φορές είναι εγκλωβισμένα από τους πολύ συγκεκριμένους στόχους εκπαίδευσης).

Σε αυτήν την περίπτωση, η χρησιμότητα ενός συστήματος σχήματος σώματος φαίνεται να βρίσκεται σε ψυχολογικούς, ιατρικούς και fashion-βασισμένους τομείς. Παρόλα αυτά, παραμένει πιθανό ότι συστήματα αυτού του είδους θα επιτύχουν υψηλότερο επίπεδο προβολής, και vielleicht ένα πιο χαλαρό και ακόμη πιθανότατα ανησυχητικό σύνολο χρήσεων.

 

Πρώτη δημοσίευση Δευτέρα, 25 Αυγούστου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai