Η γωνία του Anderson
Αναδιαμόρφωση Τυπολογιών Ανθρώπινου Σώματος με τη Βοήθεια του AI

Μια νέα ερευνητική συνεργασία από την Κίνα προσφέρει ένα καινοτόμο μέθοδο για αναδιαμόρφωση του ανθρώπινου σώματος σε εικόνες, χρησιμοποιώντας ένα συντονισμένο δίκτυο νευρικών εγκωδών, που καθοδηγείται από ένα παραμετρικό μοντέλο, το οποίο επιτρέπει στον τελικό χρήστη να điều chỉnh το βάρος, το ύψος και την αναλογία του σώματος σε μια διαδραστική διεπαφή.

Παραμετρική αναδιαμόρφωση του σώματος, με διακόπτες που αλλάζουν τις τρεις διαθέσιμες λειτουργίες. Πηγή: https://arxiv.org/pdf/2203.10496.pdf
Το έργο προσφέρει πολλές βελτιώσεις σε σχέση με ένα πρόσφατο παρόμοιο έργο από την Alibaba, καθώς μπορεί να αλλάξει πειστικά το ύψος και την αναλογία του σώματος, καθώς και το βάρος, και έχει ένα αφοσιωμένο νευρικό δίκτυο για την ‘επανασύνθεση’ του (μη υπαρκτού) φόντου που μπορεί να αποκαλυφθεί από ‘λιγότερο’ σώματα. Επίσης, βελτιώνει μια πρότερη παραμετρική μέθοδο για αναδιαμόρφωση του σώματος, αφαιρώντας την ανάγκη για εκτεταμένη ανθρώπινη παρέμβαση κατά τη διαμόρφωση της μεταμόρφωσης.
Ονομάζεται NeuralReshaper, η νέα αρχιτεκτονική προσαρμόζει ένα παραμετρικό τρισδιάστατο μοντέλο ανθρώπινου σώματος σε μια πηγή εικόνας, και στη συνέχεια χρησιμοποιεί παραμορφώσεις στο μοντέλο για να προσαρμόσει την αρχική εικόνα στα νέα παραμέτρα.
Το σύστημα μπορεί να χειριστεί μεταμορφώσεις του σώματος σε ενδύματα καθώς και σε ημι-ενδύματα (π.χ. μαγιό) σώματα.
Μεταμορφώσεις αυτού του τύπου είναι目前 του ενδιαφέροντος για τον τομέα της μόδας AI, ο οποίος έχει παράγει eine σειρά από StyleGAN/CycleGAN-βασισμένα και γενικά νευρικά δίκτυα για εικονικές δοκιμές που μπορούν να προσαρμόσουν τα διαθέσιμα ενδύματα στο σώμα και τον τύπο του χρήστη, ή να βοηθήσουν με την οπτική συμμόρφωση.
Το έγγραφο ονομάζεται Single-image Human-body Reshaping with Deep Neural Networks, και προέρχεται από ερευνητές στο Πανεπιστήμιο Zhejiang στην Hangzhou, και την Σχολή Δημιουργικής Μέσων στο Πανεπιστήμιο City του Hong Kong.
SMPL Fitting
Ο NeuralReshaper χρησιμοποιεί το Skinned Multi-Person Linear Model (SMPL) αναπτύχθηκε από το Ινστιτούτο Max Planck για τα Ευφυή Συστήματα και το διάσημο σπίτι VFX Industrial Light and Magic το 2015.

Παραμετρικοί άνθρωποι SMPL από τη συνεργασία Planck/ILM του 2015. Πηγή: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
Στο πρώτο στάδιο της διαδικασίας, ένα μοντέλο SMPL δημιουργείται από μια πηγή εικόνας στην οποία επιθυμούνται μεταμορφώσεις του σώματος. Η προσαρμογή του μοντέλου SMPL στην εικόνα ακολουθεί τη μεθοδολογία της μεθόδου Human Mesh Recovery (HMR) που προτάθηκε από πανεπιστήμια στη Γερμανία και τις ΗΠΑ το 2018.
Οι τρεις παράμετροι για παραμόρφωση (βάρος, ύψος, αναλογία σώματος) υπολογίζονται σε αυτό το στάδιο, μαζί με μια σκέψη των παραμέτρων της κάμερας, όπως η εστιακή απόσταση. 2D σημεία και δημιουργημένη σιλουέτα συναρμογή παρέχουν την περικύκλωση για την παραμόρφωση με τη μορφή μιας 2D σιλουέτας, ένα πρόσθετο μέτρο βελτίωσης που αυξάνει την ακρίβεια του ορίου και επιτρέπει μια αυθεντική επανασύνθεση του φόντου.

Στάδια προσαρμογής SMPL: αριστερά, η πηγή εικόνας; δεύτερη, το αποτέλεσμα βελτίωσης που λαμβάνεται από τη μέθοδο που περιγράφεται στην έρευνα του 2016 με επικεφαλής το Ινστιτούτο Max Planck για τα Ευφυή Συστήματα; τρίτη, ένα άμεσο αποτέλεσμα από το προ-εκπαιδευμένο μοντέλο για την ανάκτηση της μορφής και της στάσης του ανθρώπινου σώματος; τέταρτη, τα αποτελέσματα που λαμβάνονται μετά την βελτίωση των 2D σημείων; και τέλος, πέμπτη, η ολοκληρωμένη προσαρμογή μετά την βελτίωση της σιλουέτας (βλέπε παραπάνω).
Η 3D παραμόρφωση προβάλλεται στη συνέχεια στο χώρο της εικόνας για να διευκολύνει ένα πυκνό πεδίο παραμόρφωσης που θα ορίσει την παραμόρφωση. Αυτή η διαδικασία διαρκεί περίπου 30 δευτερόλεπτα ανά εικόνα.
Αρχιτεκτονική NeuralReshaper
Ο NeuralReshaper εκτελεί δύο νευρικά δίκτυα παράλληλα: einen κωδικοποιητή προσώπου που δημιουργεί το μεταμορφωμένο σώμα, και einen κωδικοποιητή φόντου που επικεντρώνεται στην επανασύνθεση των (μη υπαρχόντων) περιοχών του φόντου (στην περίπτωση, για παράδειγμα, της λεπτότερης σώματος – βλέπε εικόνα παρακάτω).
Το U-net-στυλ πλαίσιο ενσωματώνει την έξοδο από τα χαρακτηριστικά των δύο κωδικοποιητών πριν από το να περάσει το αποτέλεσμα σε einen ενιαίο κωδικοποιητή που τελικά παράγει μια νέα εικόνα από τις δύο εισόδους. Η αρχιτεκτονική διαθέτει einen καινοτόμο μηχανισμό οδηγού που επιτρέπει την ενσωμάτωση.
Εκπαίδευση και Πειράματα
Ο NeuralReshaper υλοποιείται στο PyTorch σε ένα μόνο NVIDIA 1080ti GPU με 11gb της VRAM. Το δίκτυο εκπαιδεύτηκε για 100 επωχές υπό τον βελτιστοποιητή Adam, με τον γεννήτορα να ορίζεται σε μια στόχο απώλεια 0,0001 και τον διακρίβυτη σε μια στόχο απώλεια 0,0004. Η εκπαίδευση πραγματοποιήθηκε σε μια παρτίδα μεγέθους 8 για ένα ιδιωτικό εξωτερικό σύνολο δεδομένων (που προέρχεται από COCO, MPII, και LSP), και 2 για την εκπαίδευση στο DeepFashion σύνολο δεδομένων.
Παρακάτω είναι κάποια παραδείγματα αποκλειστικά από το DeepFashion σύνολο δεδομένων όπως εκπαιδεύτηκε για τον NeuralReshaper, με τις αρχικές εικόνες πάντα αριστερά.
Οι τρεις ελεγχόμενες ιδιότητες είναι αποσυνδεμένες και μπορούν να εφαρμοστούν ξεχωριστά.
Μεταμορφώσεις στο παραγόμενο εξωτερικό σύνολο δεδομένων είναι πιο απαιτητικές, поскольку συχνά απαιτούν την επανασύνθεση σύνθετων φόντων και σαφή και πειστική περιγραφή των μεταμορφωμένων τυπολογιών του σώματος:
Παραμετρική Ανάγκη
Όπως παρατηρεί το έγγραφο, οι μεταμορφώσεις της ίδιας εικόνας αντιπροσωπεύουν ένα πρόβλημα που δεν έχει λυθεί στη σύνθεση εικόνας. Πολλά μεταμορφωτικά GAN και κωδικοποιητικά πλαίσια μπορούν να χρησιμοποιήσουν ζευγαρωμένες εικόνες (όπως τα διάφορα έργα που σχεδιάστηκαν για να επηρεάσουν σχεδίαση>φωτογραφία και φωτογραφία>σχεδίαση μεταμορφώσεις).
Ωστόσο, στην περίπτωση αυτή, αυτό θα απαιτούσε ζευγαρωμένες εικόνες με τους ίδιους ανθρώπους σε διαφορετικές φυσικές διαμορφώσεις, όπως οι ‘πριν και μετά’ εικόνες στις διατροφικές ή χειρουργικές διαφημίσεις – δεδομένα που είναι δύσκολο να αποκτήσουν ή να δημιουργηθούν.
Εναλλακτικά, μεταμορφωτικά GAN δίκτυα μπορούν να εκπαιδευτούν σε πολύ πιο ποικίλα δεδομένα και να επηρεάσουν μεταμορφώσεις αναζητώντας την κατεύθυνση του.latent μεταξύ της πηγαίας (αρχικής εικόνας κωδικού) και της επιθυμητής κατηγορίας (σε αυτή την περίπτωση ‘παχύ’, ‘λεπτό’, ‘ψηλό’, κ.λπ.). Ωστόσο, αυτή η προσέγγιση είναι ακόμη πολύ περιορισμένη για τους σκοπούς της λεπτομερούς αναδιαμόρφωσης του σώματος.
Προσέγγιση Neural Radiance Fields (NeRF) είναι πολύ πιο προηγμένες σε πλήρη σίμουλेशन σώματος από τα περισσότερα GAN-βασισμένα συστήματα, αλλά παραμένουν συγκεκριμένα για την σκηνή και πόρους-εντατική, με τώρα πολύ περιορισμένη ικανότητα να επεξεργαστούν τύπους σώματος με τον τρόπο που ο NeuralReshaper και προηγούμενα έργα προσπαθούν να αντιμετωπίσουν (εκτός από κλιμάκωση του ολόκληρου σώματος σχετικά με το περιβάλλον).
Ο χώρος του GAN είναι δύσκολο να κυβερνήσει; VAEs μόνο δεν αντιμετωπίζουν ακόμη τις сложότητες της πλήρους αναπαραγωγής του σώματος; και η ικανότητα του NeRF να αναμορφώσει συνεχώς και πραγματικά το ανθρώπινο σώμα είναι ακόμη νέα.,因此, η ενσωμάτωση ‘παραδοσιακών’ μεθοδολογιών CGI όπως το SMPL φαίνεται να συνεχίζει στον τομέα της σύνθεσης εικόνας ανθρώπινου σώματος, ως μέθοδος για να συλλέξει και να συντηρήσει χαρακτηριστικά, κατηγορίες και κωδικούς που οι παράμετροι και η εκμετάλλευση δεν είναι ακόμη πλήρως κατανοητές σε αυτές τις αναδυόμενες τεχνολογίες.
Πρώτη δημοσίευση 31ης Μαρτίου 2022.




















