Η γωνία του Anderson

Ψεύτικα ‘Καλύτερα’ Σώματα με AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα από την Alibaba DAMO academy προσφέρει μια ροή εργασίας με τεχνητή νοημοσύνη για την αυτοματοποίηση του επανασχεδιασμού εικόνων σωμάτων – μια σπάνια προσπάθεια σε έναν τομέα υπολογιστικής όρασης που αυτή τη στιγμή επικεντρώνεται σε επεμβάσεις βάσει προσώπου όπως τα deepfakes και την επεξεργασία προσώπων με GAN επεξεργασία προσώπου.

Στις στήλες 'αποτέλεσμα', οι παραγόμενοι χάρτες προσοχής ορίζουν τις περιοχές που πρέπει να τροποποιηθούν. Πηγή: https://arxiv.org/pdf/2203.04670.pdf

Ενσωματωμένα στις στήλες «αποτέλεσμα», οι παραγόμενοι χάρτες προσοχής που ορίζουν τις περιοχές που πρέπει να τροποποιηθούν. Πηγή: https://arxiv.org/pdf/2203.04670.pdf

Η αρχιτεκτονική των ερευνητών χρησιμοποιεί εκτίμηση σκελετικού πόζε (skeleton pose estimation) για να αντιμετωπίσει τη μεγαλύτερη πολυπλοκότητα που αντιμετωπίζουν τα συστήματα σύνθεσης και επεξεργασίας εικόνας όταν προσπαθούν να κατανοήσουν και να παραμετροποιήσουν υπάρχουσες εικόνες σωμάτων, τουλάχιστον σε επίπεδο λεπτομέρειας που επιτρέπει ουσιαστική και επιλεκτική επεξεργασία.

Οι εκτιμημένοι σκελετικοί χάρτες βοηθούν στον εντοπισμό και την εστίαση της προσοχής σε περιοχές του σώματος που είναι πιθανό να χρειαστούν επεξεργασία, όπως η περιοχή του άνω βραχίονα.

Το σύστημα επιτρέπει τελικά στον χρήστη να ορίσει παραμέτρους που μπορούν να αλλάξουν την εμφάνιση βάρους, μυϊκής μάζας ή κατανομής βάρους σε φωτογραφίες πλήρους ή μεσαίου μήκους ανθρώπων, και μπορεί να δημιουργήσει αυθαίρετες μετασχηματίσεις σε ενδυμένα ή γυμνά τμήματα σώματος.

Αριστερά η εικόνα εισόδου, στη μέση ένας χάρτης θερμότητας των παραγόμενων περιοχών προσοχής και δεξιά η μετασχηματισμένη εικόνα.

Αριστερά, η εισαγόμενη εικόνα· στη μέση, ένας χάρτης θερμότητας των παραγόμενων περιοχών προσοχής· δεξιά, η μετασχηματισμένη εικόνα.

Το κίνητρο για αυτήν τη δουλειά είναι η ανάπτυξη αυτοματοποιημένων ροών εργασίας που θα μπορούσαν να αντικαταστήσουν τις επίπονες ψηφιακές επεμβάσεις που πραγματοποιούν φωτογράφοι και γραφίστες παραγωγής σε διάφορους κλάδους των μέσων, από τη μόδα μέχρι το περιοδικό‑στυλ και το υλικό προώθησης.

Γενικά, οι συγγραφείς παραδέχονται ότι αυτές οι μετασχηματίσεις εφαρμόζονται συνήθως με τεχνικές «παραμόρφωσης» (warp) στο Photoshop και σε άλλους παραδοσιακούς επεξεργαστές bitmap, και χρησιμοποιούνται σχεδόν αποκλειστικά σε εικόνες γυναικών. Συνεπώς, το προσαρμοσμένο σύνολο δεδομένων που δημιουργήθηκε για να διευκολύνει τη νέα διαδικασία αποτελείται κυρίως από φωτογραφίες γυναικών:

«Καθώς η επεξεργασία σώματος ζητείται κυρίως από γυναίκες, η πλειονότητα της συλλογής μας αποτελείται από γυναικείες φωτογραφίες, λαμβάνοντας υπόψη την ποικιλία ηλικιών, φυλών (Αφρικανική:Ασιατική:Καυκάσια = 0.33:0.35:0.32), πόζες και ενδύματα».

Το έγγραφο έχει τίτλο Δημιουργία Ροής με Δομική Συνείδηση για την Επανασχηματισμό του Ανθρώπινου Σώματος και προέρχεται από πέντε συγγραφείς που συνδέονται με την παγκόσμια DAMO academy της Alibaba.

Ανάπτυξη Συνόλου Δεδομένων

Όπως συμβαίνει συνήθως με συστήματα σύνθεσης και επεξεργασίας εικόνας, η αρχιτεκτονική του έργου απαιτούσε ένα προσαρμοσμένο σύνολο εκπαίδευσης. Οι συγγραφείς ανέθεσαν σε τρεις φωτογράφους να δημιουργήσουν τυπικές επεμβάσεις Photoshop σε κατάλληλες εικόνες από την ιστοσελίδα αποθεμάτων Unsplash, με αποτέλεσμα ένα σύνολο – με τίτλο BR-5K* – 5.000 εικόνων υψηλής ποιότητας ανάλυσης 2K.

Οι ερευνητές τονίζουν ότι ο στόχος της εκπαίδευσης σε αυτό το σύνολο δεν είναι η παραγωγή «ιδεαλισμένων» και γενικευμένων χαρακτηριστικών που σχετίζονται με ένα δείκτη ελκυστικότητας ή επιθυμητής εμφάνισης, αλλά η εξαγωγή των κεντρικών αντιστοιχίσεων χαρακτηριστικών που συνδέονται με επαγγελματικές επεμβάσεις σε εικόνες σώματος.

Ωστόσο, παραδέχονται ότι οι επεμβάσεις τελικά αντανακλούν μετασχηματιστικές διαδικασίες που χαρτογραφούν μια πρόοδο από το «πραγματικό» σε μια προκαθορισμένη αντίληψη του «ιδανικού»:

«Προσκαλέσαμε τρεις επαγγελματίες καλλιτέχνες να επεξεργαστούν σώματα με Photoshop ανεξάρτητα, με στόχο την επίτευξη αδύνατων φιγούρων που ταιριάζουν στην δημοφιλή αισθητική, και επιλέξαμε την καλύτερη ως αληθινό έδαφος».

Δεδομένου ότι το πλαίσιο δεν ασχολείται καθόλου με πρόσωπα, αυτά θολώθηκαν πριν ενσωματωθούν στο σύνολο δεδομένων.

Αρχιτεκτονική και Κύριες Έννοιες

Η ροή εργασίας του συστήματος περιλαμβάνει την εισαγωγή ενός πορτρέτου υψηλής ανάλυσης, τη μείωσή του σε ανάλυση που χωρά στους διαθέσιμους υπολογιστικούς πόρους και την εξαγωγή ενός εκτιμώμενου χάρτη σκελετικής πόζας (δεύτερη εικόνα από αριστερά παρακάτω), καθώς και Πεδίων Συγγένειας Μερών (PAFs), τα οποία παρουσιάστηκαν το 2016 από το Robotics Institute του Carnegie Mellon University (δείτε το βίντεο που είναι ενσωματωμένο ακριβώς παρακάτω).

Τα Πεδία Συγγένειας Μέρους βοηθούν στον καθορισμό του προσανατολισμού των άκρων και της γενικής συσχέτισης με το ευρύτερο σκελετικό πλαίσιο, παρέχοντας στο νέο έργο ένα επιπλέον εργαλείο προσοχής/εντοπισμού.

Στην εργασία του 2016 για τα Part Affinity Fields, τα προβλεπόμενα PAFs κωδικοποιούν τον προσανατολισμό των άκρων ως μέρος ενός δισδιάστατου διανύσματος που περιλαμβάνει και τη γενική θέση του άκρου. Πηγή: https://arxiv.org/pdf/1611.08050.pdf

Από την εργασία του 2016 για τα Part Affinity Fields, τα προβλεπόμενα PAFs κωδικοποιούν τον προσανατολισμό των άκρων ως μέρος ενός δισδιάστατου διανύσματος που περιλαμβάνει επίσης τη γενική θέση του άκρου. Πηγή: https://arxiv.org/pdf/1611.08050.pdf

Παρά το φαινομενικό τους ασήμαντο ρόλο στην εμφάνιση βάρους, οι σκελετικοί χάρτες είναι χρήσιμοι για την κατεύθυνση των τελικών μετασχηματισμών προς τα μέρη του σώματος που πρέπει να τροποποιηθούν, όπως οι άνω βραχίονες, η περιοχή του γλουτού και οι μηροί.

Μετά από αυτό, τα αποτελέσματα τροφοδοτούνται σε ένα Structure Affinity Self‑Attention (SASA) στο κεντρικό σημείο συμφόρησης της διαδικασίας (δείτε την εικόνα παρακάτω).

Το SASA ρυθμίζει τη συνοχή της γεννήτριας ροής που τροφοδοτεί τη διαδικασία, τα αποτελέσματα των οποίων στη συνέχεια περνούν στο μοντέλο παραμόρφωσης (δεύτερο από δεξιά στην παραπάνω εικόνα), το οποίο εφαρμόζει τις μετασχηματίσεις που έμαθε από την εκπαίδευση στις χειροκίνητες διορθώσεις που περιλαμβάνονται στο σύνολο δεδομένων.

Η μονάδα Structure Affinity Self-Attention (SASA) κατανέμει την προσοχή στα σχετικά μέρη του σώματος, συμβάλλοντας στην αποφυγή περιττών ή άσχετων μετασχηματισμών.

Η μονάδα Structure Affinity Self‑Attention (SASA) κατανέμει προσοχή σε σχετικές περιοχές του σώματος, βοηθώντας στην αποφυγή περιττών ή άσχετων μετασχηματισμών.

Η τελική εικόνα αναβαθμίζεται ξανά στην αρχική ανάλυση 2K, χρησιμοποιώντας διαδικασίες παρόμοιες με την τυπική, 2017‑στυλ αρχιτεκτονική deepfake από την οποία έχουν προκύψει δημοφιλή πακέτα όπως το DeepFaceLab· η διαδικασία αναβάθμισης είναι επίσης κοινή σε πλαίσια επεξεργασίας GAN.

Το δίκτυο προσοχής για το σχήμα είναι μοντελοποιημένο βάσει των Compositional De‑Attention Networks (CODA), μιας ακαδημαϊκής συνεργασίας ΗΠΑ/Σιγκαπούρης του 2019 με την Amazon (AMZN ) AI και τη Microsoft.

Δοκιμές

Το πλαίσιο βασισμένο σε ροή δοκιμάστηκε έναντι προηγούμενων μεθόδων ροής FAL και Animating Through Warping (ATW), καθώς και αρχιτεκτονικών μετάφρασης εικόνας Pix2PixHD και GFLA, με SSIM, PSNR και LPIPS ως μετρικές αξιολόγησης.

Αποτελέσματα των αρχικών δοκιμών· η κατεύθυνση του βέλους στις επικεφαλίδες υποδεικνύει αν οι χαμηλότερες ή υψηλότερες τιμές είναι καλύτερες.

Αποτελέσματα των αρχικών δοκιμών (η κατεύθυνση του βέλους στις επικεφαλίδες υποδεικνύει αν χαμηλότεροι ή υψηλότεροι δείκτες είναι καλύτεροι).

Βάσει αυτών των μετρικών, το σύστημα των συγγραφέων υπερβαίνει τις προηγούμενες αρχιτεκτονικές.

Επιλεγμένα αποτελέσματα. Ανατρέξτε στο πρωτότυπο PDF που συνδέεται σε αυτό το άρθρο για συγκρίσεις υψηλότερης ανάλυσης.

Επιλεγμένα αποτελέσματα. Παρακαλούμε ανατρέξτε στο αρχικό PDF που συνδέεται σε αυτό το άρθρο για συγκρίσεις υψηλότερης ανάλυσης.

Εκτός από τις αυτοματοποιημένες μετρικές, οι ερευνητές διεξήγαγαν μελέτη χρηστών (τελική στήλη του πίνακα αποτελεσμάτων που φαίνεται νωρίτερα), στην οποία 40 συμμετέχοντες έβλεπαν 30 ερωτήσεις τυχαία επιλεγμένες από μια βάση 100 ερωτήσεων σχετικές με τις εικόνες που παρήχθησαν μέσω των διαφόρων μεθόδων. Το 70 % των ερωτηθέντων προτίμησε τη νέα τεχνική ως πιο «οπτικά ελκυστική».

Προκλήσεις

Το νέο έγγραφο αντιπροσωπεύει μια σπάνια βόλτα στον τομέα της επεξεργασίας σώματος με τεχνητή νοημοσύνη. Ο τομέας της σύνθεσης εικόνας ενδιαφέρεται αυτή τη στιγμή περισσότερο για τη δημιουργία επεξεργάσιμων σωμάτων μέσω μεθόδων όπως τα Neural Radiance Fields (NeRF), ή είναι εστιασμένος στην εξερεύνηση του λανθάνοντος χώρου των GAN και του δυναμικού των autoencoders για επεμβάσεις προσώπου.

Η πρωτοβουλία των συγγραφέων περιορίζεται προς το παρόν στην παραγωγή αλλαγών στην αντιληπτή βαρύτητα, και δεν έχουν υλοποιήσει καμία τεχνική inpainting που θα αποκαθιστούσε το φόντο που αδιαμφισβήτητα αποκαλύπτεται όταν αδυνατίζετε τη φωτογραφία ενός ατόμου.

Ωστόσο, προτείνουν ότι η μάσκα πορτραίτου και η ανάμειξη φόντου μέσω συμπερασματολογίας υφής θα μπορούσαν να λύσουν με απλότητα το πρόβλημα της αποκατάστασης των τμημάτων του κόσμου που ήταν προηγουμένως κρυμμένα στην εικόνα από την ανθρώπινη «ατέλεια».

Μια προτεινόμενη λύση για την αποκατάσταση του φόντου που αποκαλύπτεται από τη μείωση λίπους με AI.

Μια προτεινόμενη λύση για την αποκατάσταση του φόντου που αποκαλύπτεται από την AI‑οδηγούμενη μείωση λίπους.

 

* Παρόλο που το προπρότυπο αναφέρεται σε συμπληρωματικό υλικό που παρέχει περισσότερες λεπτομέρειες για το σύνολο δεδομένων, καθώς και περαιτέρω παραδείγματα από το έργο, η θέση αυτού του υλικού δεν είναι διαθέσιμη στο έγγραφο, και ο υπεύθυνος συγγραφέας δεν έχει ακόμη απαντήσει στο αίτημά μας για πρόσβαση.

Πρώτη δημοσίευση 10 Μαρτίου 2022.

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai