Η γωνία του Anderson

Ψευτοποιώντας ‘Καλύτερα’ Σώματα Με Τον AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα από την ακαδημία Alibaba DAMO προσφέρει ένα εργαλείο AI που αυτοματοποιεί την αναμόρφωση εικόνων του σώματος – μια σπάνια προσπάθεια σε ένα τομέα οπτικής υπολογιστή που είναι目前 καταλήφθηκε με επεξεργασίες προσώπου όπως deepfakes και GAN-based επεξεργασία προσώπου.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Inset in ‘result’ columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Η αρχιτεκτονική των ερευνητών χρησιμοποιεί εκτίμηση σκελετικής στάσης για να αντιμετωπίσει την μεγαλύτερη复잡η που αντιμετωπίζουν τα συστήματα σύνθεσης και επεξεργασίας εικόνων στο να концепτικοποιούν και να παραμετροποιούν τις υπάρχουσες εικόνες του σώματος, τουλάχιστον σε ένα επίπεδο λεπτομέρειας που επιτρέπει μια σημαντική και επιλεκτική επεξεργασία.

Estimated skeleton maps help to individuate and focus attention on areas of the body likely to be retouched, such as the upper arm area.

Το σύστημα εν τέλει επιτρέπει στον χρήστη να ορίσει παραμέτρους που μπορούν να αλλάξουν την εμφάνιση του βάρους, της μυϊκής μάζας ή της κατανομής του βάρους σε φωτογραφίες πλήρους μήκους ή μέσου μήκους ανθρώπων και μπορεί να παράγει αυθαίρετες μετασχηματισμοί σε ενδύματα ή γυμνά τμήματα του σώματος.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Η мотивασία για το έργο είναι η ανάπτυξη αυτοματοποιημένων εργαλείων που θα μπορούσαν να αντικαταστήσουν τις χρονοβόρες ψηφιακές επεξεργασίες που πραγματοποιούνται από φωτογράφους και καλλιτέχνες γραφικών σε διάφορους κλάδους των μέσων ενημέρωσης, από τη μόδα μέχρι τα έντυπα και υλικό δημοσιότητας.

Σε γενικές γραμμές, οι συγγραφείς αναγνωρίζουν ότι αυτές οι μετασχηματισμοί εφαρμόζονται συνήθως με τεχνικές ‘warp’ στο Photoshop και άλλα παραδοσιακά bitmap editors και χρησιμοποιούνται σχεδόν αποκλειστικά σε εικόνες γυναικών. Συνεπώς, το προσαρμοσμένο σύνολο δεδομένων που αναπτύχθηκε για να διευκολύνει τη νέα διαδικασία αποτελείται κυρίως από φωτογραφίες γυναικών:

‘As body retouching is mainly desired by females, the majority of our collection are female photos, considering the diversity of ages, races (African:Asian:Caucasian = 0.33:0.35:0.32), poses, and garments.’

Το έγγραφο έχει τον τίτλο Structure-Aware Flow Generation for Human Body Reshaping και προέρχεται από πέντε συγγραφείς που συνδέονται με την παγκόσμια ακαδημία DAMO της Alibaba.

Ανάπτυξη Δεδομένων

Όπως συνήθως συμβαίνει με τα συστήματα σύνθεσης και επεξεργασίας εικόνων, η αρχιτεκτονική του έργου απαιτούσε ένα προσαρμοσμένο σύνολο δεδομένων. Οι ερευνητές ανέθεσαν σε τρεις φωτογράφους να παράγουν τυποποιημένες επεξεργασίες Photoshop σε εικόνες από τον ιστότοπο stock photography Unsplash, με αποτέλεσμα ένα σύνολο δεδομένων – με τίτλο BR-5K* – 5.000 υψηλής ποιότητας εικόνων σε ανάλυση 2K.

Οι ερευνητές τονίζουν ότι ο στόχος της εκπαίδευσης σε αυτό το σύνολο δεδομένων δεν είναι να παράγει ‘ιδανικές’ και γενικευμένες λειτουργίες που σχετίζονται με ένα δείκτη ελκυστικότητας ή επιθυμητής εμφάνισης, αλλά να εξαγάγει τις κεντρικές λειτουργίες που συνδέονται με τις επαγγελματικές επεξεργασίες εικόνων του σώματος.

Ωστόσο, παραδέχονται ότι οι επεξεργασίες τελικά αντανακλούν μετασχηματιστικές διαδικασίες που αντιπροσωπεύουν μια πρόοδο από ‘πραγματικό’ σε μια προκαθορισμένη έννοια ‘ιδεαλού’:

‘We invite three professional artists to retouch bodies using Photoshop independently, with the goal of achieving slender figures that meet the popular aesthetics, and select the best one as ground-truth.’

Καθώς η αρχιτεκτονική δεν ασχολείται με τα πρόσωπα, αυτά ήταν θολωμένα πριν προστεθούν στο σύνολο δεδομένων.

Αρχιτεκτονική και Κεντρικές Εννοιες

Η διαδικασία του συστήματος περιλαμβάνει την εισαγωγή μιας υψηλής ανάλυσης πορτρέτου, την υποδειγματοποίηση σε μια χαμηλότερη ανάλυση που μπορεί να χωρέσει στα διαθέσιμα υπολογιστικά μέσα, και την εξαγωγή μιας εκτιμώμενης σκελετικής στάσης (δεύτερη εικόνα από τα αριστερά), καθώς και Part Affinity Fields (PAFs), τα οποία αναπτύχθηκαν το 2016 από το Ινστιτούτο Ρομποτικής του Πανεπιστημίου Carnegie Mellon (βλέπε βίντεο που είναι ενσωματωμένο παρακάτω).

Τα Part Affinity Fields βοηθούν να οριστεί η προσανατολισμός των άκρων και η γενική σύνδεση με το ευρύτερο σκελετικό πλαίσιο, παρέχοντας στο νέο έργο ένα επιπλέον εργαλείο προσοχής/τοποθεσίας.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Παρά την εμφανή αδιαφορία τους για την εμφάνιση του βάρους, τα σκελετικά χάρτες είναι χρήσιμα στη διεύθυνση των τελικών μετασχηματιστικών διαδικασιών σε τμήματα του σώματος που πρέπει να τροποποιηθούν, όπως τα άνω άκρα, ο πίσω και τα μηρά.

Μετά από αυτό, τα αποτελέσματα παρέχονται σε ένα Structure Affinity Self-Attention (SASA) στο κεντρικό μπουκάλι της διαδικασίας (βλέπε εικόνα παρακάτω).

Το SASA ρυθμίζει τη συνέπεια του flow generator που τροφοδοτεί τη διαδικασία, τα αποτελέσματα της οποίας στη συνέχεια παρέχονται στο module warping (δεύτερο από τα δεξιά στην εικόνα παραπάνω), το οποίο εφαρμόζει τις μετασχηματιστικές που μάθει από την εκπαίδευση στο σύνολο δεδομένων.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Η έξοδος εικόνας στη συνέχεια αναβαθμίζεται πίσω στην αρχική ανάλυση 2K, χρησιμοποιώντας διαδικασίες που δεν διαφέρουν σημαντικά από την τυπική, 2017-στιλ αρχιτεκτονική deepfake από την οποία έχουν προέλθει δημοφιλείς πακέτα όπως το DeepFaceLab. Η διαδικασία αναβάθμισης είναι επίσης κοινή σε πλαίσια επεξεργασίας GAN.

Το δίκτυο προσοχής για το σχήμα μοντελοποιείται μετά το Compositional De-Attention Networks (CODA), μια συνεργασία ακαδημαϊκών ΗΠΑ/Σιγκαπούρης με την Amazon AI και την Microsoft.

Δοκιμές

Η ροή-βασισμένη αρχιτεκτονική δοκιμάστηκε ενάντια σε προηγούμενες ροή-βασισμένες μεθόδους FAL και Animating Through Warping (ATW), καθώς και αρχιτεκτονικές μετάφρασης εικόνων Pix2PixHD και GFLA, με SSIM, PSNR και LPIPS ως μετρικές αξιολόγησης.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Βάσει αυτών των μετρικών, το σύστημα των συγγραφέων υπερέχει τις προηγούμενες αρχιτεκτονικές.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Εκτός από τις αυτοματοποιημένες μετρικές, οι ερευνητές διεξήγαγαν μια μελέτη χρηστών (τελευταία στήλη του πίνακα αποτελεσμάτων που εμφανίζεται παραπάνω), στην οποία 40 συμμετέχοντες έδειξαν 30 ερωτήσεις που επιλέχθηκαν τυχαία από ένα σύνολο 100 ερωτήσεων που σχετίζονται με τις εικόνες που παράγονται μέσω των διαφόρων μεθόδων. Το 70% των απαντήσεων ευνοούσε τη νέα τεχνική ως πιο ‘οπτικά ελκυστική’.

Προκλήσεις

Η νέα εργασία αντιπροσωπεύει μια σπάνια εξόρμηση στην AI-βασισμένη χειραφέτηση του σώματος. Ο τομέας της σύνθεσης εικόνων είναι目前 πιο ενδιαφερόμενος είτε για τη δημιουργία επεξεργάσιμων σωμάτων μέσω μεθόδων όπως τα Neural Radiance Fields (NeRF), είτε είναι εστιασμένος στην εξερεύνηση του.latent χώρου των GANs και του potencial των autoencoders για χειραφέτηση προσώπου.

Η πρωτοβουλία των συγγραφέων είναι目前 περιορισμένη στην παραγωγή αλλαγών στο αντιλαμβανόμενο βάρος και δεν έχουν εφαρμόσει καμία τεχνική inpainting που θα επαναφέρει το φόντο που αποκαλύπτεται όταν λεπταίνει μια εικόνα κάποιου.

Ωστόσο, προτείνουν ότι η matting πορτρέτου και η ανάμιξη φόντου μέσω textural inference θα μπορούσε να λύσει εύκολα το πρόβλημα της επαναφοράς των τμημάτων του κόσμου που ήταν προηγουμένως κρυμμένα στην εικόνα από την ανθρώπινη ‘ατελειότητα’.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

A proposed solution for restoring background that’s revealed by AI-driven fat reduction.

 

* Though the preprint refers to supplemental material giving more details about the dataset, as well as further examples from the project, the location of this material is not made available in the paper, and the corresponding author has not yet responded to our request for access.

First published 10th Μάρτιος 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai