Η γωνία του Anderson
Δημιουργία Πλήρους Σώματος Deepfakes με Συνδυασμό Πολλαπλών NeRFs

Το τομέας της έρευνας της σύνθεσης εικόνων είναι πυκνά σκεπασμένος με νέες προτάσεις για συστήματα που μπορούν να δημιουργήσουν πλήρη σώμα βίντεο και εικόνες νέων ανθρώπων – κυρίως νέων γυναικών – σε διάφορους τύπους ενδυμάτων. Οι περισσότερες από τις γενεσιουργμένες εικόνες είναι στατικές; περιστασιακά, οι αναπαραστάσεις κουνιούνται, αν και συνήθως δεν πολύ καλά.
Ο ρυθμός αυτής της συγκεκριμένης έρευνας είναι παγετώδης σε σύγκριση με το τρέχον ταχύ ρυθμό προόδου σε συναφείς τομείς όπως λατέντ διασπορά μοντέλα; ωστόσο, οι ερευνητικές ομάδες, η πλειοψηφία στην Ασία, συνεχίζουν να εργάζονται ακατάπαυστα στο πρόβλημα.

Μια από τις δεκάδες, αν όχι εκατοντάδες, προτεινόμενων ή ημι-εκκινήθεισων ‘εικονικών δοκιμών’ συστημάτων από τα τελευταία 10-15 χρόνια, όπου τα σώματα αξιολογούνται μέσω μηχανικής μάθησης-βασισμένης αναγνώρισης αντικειμένων και προσαρμόζονται στα προτεινόμενα είδη ενδυμάτων. Πηγή: https://www.youtube.com/watch?v=2ZXrgGyhbak
Ο στόχος είναι να δημιουργηθούν νέα συστήματα για να ενεργοποιήσουν ‘εικονικές δοκιμές’ για την αγορά μόδας και ενδυμάτων – συστήματα που μπορούν να προσαρμοστούν και στο πελάτη και στο συγκεκριμένο προϊόν που είναι διαθέσιμο ή πρόκειται να κυκλοφορήσει, χωρίς την ακαταστασία της πραγματικής-time επίθεσης των ενδυμάτων, ή την ανάγκη να ζητήσουν από τους πελάτες να στέλνουν ελαφρώς NSFW εικόνες για ML-βασισμένες αγωγούς.
Κανένα από τα δημοφιλή αρχιτεκτονικά συστήματα σύνθεσης δεν φαίνεται να προσαρμόζεται εύκολα σε αυτήν την εργασία: ο λατέντ χώρος των Γενετικών Αντιπαλών Δικτύων (GANs) δεν είναι κατάλληλος για την παραγωγή πειστικών χρονικών κινήσεων (ή ακόμη και για επεξεργασία γενικά); αν και κατάλληλο για την παραγωγή ρεαλιστικών ανθρώπινων κινήσεων, Νευρωνικές Ραδιοφωνικές Πεδία (NeRF) είναι συνήθως φυσικά αντιστατικά στην επεξεργασία που θα ήταν απαραίτητη για να ‘ανταλλάξουν’ ανθρώπους ή ενδύματα με τη βούληση; οι αυτο-κωδικοποιητές θα απαιτούσαν βαρύτατες προσωπο-ενδυμασίες-ειδικές εκπαιδεύσεις; και τα λατέντ διασπορά μοντέλα, όπως τα GANs, δεν έχουν κανένα φυσικό χρονικό μηχανισμό, για τη γενεσιουργία βίντεο.
EVA3D
Παρά τα αυτά, τα έγγραφα και οι προτάσεις συνεχίζουν. Το τελευταίο είναι ασυνήθιστα ενδιαφέρον σε μια αλλιώς ανιαρή και αποκλειστικά επιχειρηματική γραμμή έρευνας.
EVA3D, από το Νανγιάνγκ Τεχνικό Πανεπιστήμιο της Σιγκαπούρης, είναι η πρώτη ένδειξη μιας προσέγγισης που έχει έρθει για πολύ καιρό – η χρήση πολλαπλών Νευρωνικών Ραδιοφωνικών Πεδίων, κάθε ένα από τα οποία είναι αφιερωμένο σε ένα ξεχωριστό μέρος του σώματος, και τα οποία στη συνέχεια συνθέτουν μια συναρμολογημένη και συνεκτική οπτική.

Μια κινητική νεαρή γυναίκα συνθέτη από πολλαπλά NeRF δίκτυα, για EVA3D. Πηγή: https://hongfz16.github.io/projects/EVA3D.html
Τα αποτελέσματα, σε όρους κίνησης, είναι…εντάξει. Αν και οι οπτικές του EVA3D δεν είναι έξω από την κοιλάδα του αντικειμένου, μπορούν τουλάχιστον να δουν την έξοδο από όπου στέκονται.

Τι κάνει το EVA3D εξαιρετικό είναι ότι οι ερευνητές πίσω του, σχεδόν μοναδικά στον τομέα της σύνθεσης πλήρους σώματος, έχουν συνειδητοποιήσει ότι ένα μόνο δίκτυο (GAN, NeRF ή άλλο) δεν θα είναι σε θέση να χειριστεί επεξεργάσιμη και ευέλικτη γενεσιουργία πλήρους σώματος για κάποια χρόνια – частично λόγω του ρυθμού της έρευνας, και частично λόγω hardware και άλλων λογιστικών περιορισμών.
Επομένως, η ομάδα του Νανγιάνγκ έχει υποδιαιρέσει την εργασία σε 16 δίκτυα και πολλαπλά τεχνολογικά μέσα – μια προσέγγιση που έχει ήδη υιοθετηθεί για νευρωνική απόδοση αστικών περιβαλλόντων σε Block-NeRF και CityNeRF, και η οποία φαίνεται να γίνεται μια όλο και πιο ενδιαφέρουσα και πιθανώς γόνιμη μέση λύση για την επίτευξη πλήρους σώματος deepfakes στα επόμενα πέντε χρόνια, εν αναμονή νέων концептуαλών ή hardware εξελίξεων.
Δεν όλα τα προβλήματα που παρουσιάζονται στη δημιουργία αυτού του είδους ‘εικονικής δοκιμής’ είναι τεχνικά ή λογιστικά, και το έγγραφο περιγράφει κάποια από τα προβλήματα δεδομένων, ιδιαίτερα σε σχέση με την μη επιτηρούμενη μάθηση:
‘[Μόδα] δεδομένα έχουν κυρίως πολύ περιορισμένες ανθρώπινες στάσεις (περισσότερες είναι παρόμοιες στάσεις στάσης), και υψηλά ανισορροπημένες γωνίες θέασης (περισσότερες είναι μπροστινές απόψεις). Αυτή η ανισορροπημένη 2D κατανομή δεδομένων θα μπορούσε να εμποδίσει την μη επιτηρούμενη μάθηση 3D GANs, οδηγώντας σε δυσκολίες στη σύνθεση νέας απόψης/στάσης. Επομένως, μια σωστή στρατηγική εκπαίδευσης είναι απαραίτητη για να ανακουφίσει το ζήτημα.’
Το EVA3D χωρίζει το ανθρώπινο σώμα σε 16 ξεχωριστά μέρη, κάθε ένα από τα οποία παράγεται μέσω του δικού του NeRF δικτύου. Φυσικά, αυτό δημιουργεί αρκετά ‘απαλά’ τμήματα για να能够 να galvanize την εικόνα μέσω κίνησης ή άλλων τύπων κίνησης δεδομένων. Εκτός από αυτό το πλεονέκτημα, ωστόσο, αυτό επίσης επιτρέπει στο σύστημα να ανατεθεί μέγιστα πόρους στα μέρη του σώματος που ‘πωλούν’ την tổngική εντύπωση.
Για παράδειγμα, τα ανθρώπινα πόδια έχουν πολύ περιορισμένο εύρος άρθρωσης, ενώ η αυθεντικότητα του προσώπου και του κεφαλιού, εκτός από την ποιότητα της ολόκληρης σωματικής κίνησης γενικά, είναι πιθανό να είναι το κεντρικό σημείο αυθεντικότητας για την απόδοση.
Η προσέγγιση διαφέρει ριζικά από το NeRF-κεντρικό έργο στο οποίο είναι концепτουαλικά σχετίζεται – το A-NeRF του 2021, από το Πανεπιστήμιο της Βρετανικής Κολομβίας και το Reality Labs Research, το οποίο προσπάθησε να προσθέσει ένα εσωτερικό ελεγχόμενο σκελετό σε μια αλλιώς συμβατική ‘ένα κομμάτι’ NeRF αναπαράσταση, καθιστώντας το πιο δύσκολο να ανατεθεί επεξεργαστικοί πόροι σε διάφορα μέρη του σώματος με βάση την ανάγκη.

Προηγούμενες κινήσεις – το A-NeRF εξοπλίζει ένα ‘ψημένο’ NeRF με το ίδιο είδος δύναμης και εύκαμπτου κεντρικού σκελετού που η βιομηχανία VFX έχει χρησιμοποιήσει για τόσο καιρό για να animate CGI χαρακτήρες. Πηγή: https://lemonatsu.github.io/anerf/
Σε κοινή με την πλειοψηφία των παρόμοιων ανθρώπινο-κεντρικών έργων που επιδιώκουν να αξιοποιήσουν τον λατέντ χώρο των διάφορων δημοφιλών προσεγγίσεων, το EVA3D χρησιμοποιεί ένα Skinned Multi-Person Linear Model (SMPL), μια ‘παραδοσιακή’ CGI-βασισμένη μέθοδο για την προσθήκη οργανωτικής ικανότητας στις γενικές αφηγήσεις των τρεχουσών μεθόδων σύνθεσης. Νωρίτερα φέτος, ένα άλλο έγγραφο, αυτό από το Πανεπιστήμιο Zhejiang στο Hangzhou, και το Σχολείο Δημιουργικής Μέσων στο City University του Hong Kong, χρησιμοποίησε τέτοιες μεθόδους για να πραγματοποιήσει νευρωνική αναδιαμόρφωση του σώματος.
Μέθοδος
Το μοντέλο SMPL που χρησιμοποιείται στη διαδικασία είναι ρυθμισμένο στο ανθρώπινο ‘πρότερο’ – το άτομο που είναι, ουσιαστικά, εθελοντικά deepfaked από το EVA3D, και τα βαρίδια δέρματος του διαπραγματεύονται τις διαφορές μεταξύ του κανονικού χώρου (δηλ. της ‘σε ηρεμία’, ή ‘neutral’ στάσης του μοντέλου SMPL) και του τρόπου με τον οποίο η τελική εμφάνιση αποδίδεται.
Όπως φαίνεται στην εικόνα παραπάνω, οι οριοθετημένες περιοχές του SMPL χρησιμοποιούνται ως οι ορισμοί ορίων για τα 16 δίκτυα που θα συνθέσουν το σώμα. Η αντίστροφη Linear Blend Skinning (LBS) αλγόριθμος του SMPL χρησιμοποιείται για να μεταφέρει ορατές δείγματα ακτίνων στο κανονικό (παθητικό) χώρο. Στη συνέχεια, τα 16 υπο-δίκτυα ερωτώνται, με βάση αυτές τις ρυθμίσεις, και τελικά συνθέτουν μια τελική απόδοση.
Το ολόκληρο NeRF σύνθετο χρησιμοποιείται για να κατασκευάσει ένα 3D ανθρώπινο GAN πλαίσιο.

Οι αποδώσεις του δεύτερου σταδίου GAN πλαίσιο θα τελικά εκπαιδευτούν ενάντια σε γνήσιες 2D εικόνες ανθρώπων/μόδας.
Κάθε υπο-δίκτυο που αντιπροσωπεύει μέρος του ανθρώπινου σώματος αποτελείται από στοιβάζοντα Πολυ-Στρώματα Περίπτωσης (MLPs) με SIREN (Σινουσοειδής Αναπαράσταση Δικτύων) ενεργοποίηση. Αν και το SIREN λύνει πολλά προβλήματα σε μια ροή εργασίας όπως αυτή, και σε παρόμοια έργα, έχει την τάση να υπερ-προσαρμόζεται παρά να γενικεύει, και οι ερευνητές προτείνουν ότι εναλλακτικές βιβλιοθήκες θα μπορούσαν να χρησιμοποιηθούν στο μέλλον (δείτε το τέλος του άρθρου).
Δεδομένα, Εκπαίδευση, και Δοκιμές
Το EVA3D αντιμετωπίζει ασυνήθιστα προβλήματα δεδομένων, λόγω των περιορισμών και του στυλ των στάσεων που είναι διαθέσιμες στα δεδομένα μόδας, τα οποία τείνουν να λείπουν εναλλακτικών ή καινοτόμων απόψεων, και είναι, ίσως εσκεμμένα, επαναλαμβανόμενα, για να εστιάσουν την προσοχή στα ρούχα παρά στο ανθρώπινο σώμα που τα φόρεσε.
Λόγω αυτής της ανισορροπημένης κατανομής στάσεων, το EVA3D χρησιμοποιεί ανθρώπινους προηγούμενους (δείτε παραπάνω) με βάση τη γεωμετρία του SMPL, και στη συνέχεια προβλέπει ένα Πεδίο Υπογεγραμμένης Απόστασης (SDF) από αυτήν τη στάση, αντί για μια απλή στόχευση στάσης.
Για τις υποστηρικτικές πειράματα, οι ερευνητές χρησιμοποίησαν τέσσερα σύνολα δεδομένων: DeepFashion; SHHQ; UBCFashion; και τη Βάση Δεδομένων Χορού AIST (AIST Dance DB).
Τα δύο τελευταία περιέχουν πιο ποικίλες στάσεις από τα πρώτα δύο, αλλά αντιπροσωπεύουν τους ίδιους ανθρώπους επαναλαμβανόμενα, το οποίο ακυρώνει αυτήν την αλλιώς χρήσιμη ποικιλία; σε σύντομη, τα δεδομένα είναι περισσότερο από προκλητικά, δεδομένης της εργασίας.

Παραδείγματα από SSHQ. Πηγή: https://arxiv.org/pdf/2204.11823.pdf
Οι βασικές γραμμές που χρησιμοποιήθηκαν ήταν ENARF-GAN, το πρώτο έργο που αποδίδει NeRF οπτικές από 2D εικόνες; το EG3D του Stanford και της NVIDIA (NVDA ); και StyleSDF, μια συνεργασία μεταξύ του Πανεπιστημίου της Ουάσινγκτον, της Adobe (ADBE ) Research, και του Πανεπιστημίου του Στάνφορντ – όλα τα μέθοδοι που απαιτούν βιβλιοθήκες υπερ-ανάλυσης για να κλιμακωθούν από την εγγενή στην υψηλή ανάλυση.
Οι μετρήσεις που υιοθετήθηκαν ήταν η αμφισβητούμενη Απόσταση Frechet Inception (FID) και η Απόσταση Πυρήνα Inception (KID), μαζί με το Ποσοστό Σωστών Κλειδιών (PCKh@0.5).
Στις ποσοτικές αξιολογήσεις, το EVA3D προηγείται σε όλες τις μετρήσεις σε τέσσερα σύνολα δεδομένων:

Ποσοτικά αποτελέσματα.
Οι ερευνητές σημειώνουν ότι το EVA3D επιτυγχάνει το χαμηλότερο ποσοστό σφάλματος για την απόδοση γεωμετρίας, ένα κρίσιμο παράγοντα σε ένα έργο αυτού του είδους. Επίσης, παρατηρούν ότι το σύστημά τους μπορεί να ελέγξει τη γενεσιουργημένη στάση και να επιτύχει υψηλότερες βαθμολογίες PCKh@0.5, σε αντίθεση με το EG3D, την einzige ανταγωνιστική μέθοδο που σημείωσε υψηλότερα σε μία κατηγορία.
Το EVA3D λειτουργεί φυσικά στην τώρα-τυπική ανάλυση 512x512px, αν και θα μπορούσε να κλιμακωθεί εύκολα και αποτελεσματικά σε υψηλή ανάλυση με την προσθήκη επιπλέον στρωμάτων, όπως έχει κάνει η Google πρόσφατα με την προσφορά βίντεο κειμένου-προς-βίντεο 1024 ανάλυσης Imagen Video.
Η μέθοδος δεν είναι χωρίς περιορισμούς. Το έγγραφο σημειώνει ότι η ενεργοποίηση SIREN μπορεί να προκαλέσει κυκλικά αρτεφάκτα, τα οποία θα μπορούσαν να αντιμετωπιστούν σε μελλοντικές εκδόσεις με τη χρήση μιας εναλλακτικής βασικής αναπαράστασης, όπως το EG3D, σε συνδυασμό με einen 2D αποκωδικοποιητή. Επιπλέον, είναι δύσκολο να προσαρμοστεί το SMPL ακριβώς στα δεδομένα μόδας. Τέλος, το σύστημα δεν μπορεί να φιλοξενήσει εύκολα μεγαλύτερα και πιο ρευστά είδη ενδυμάτων, όπως μεγάλες φούστες; τα είδη ενδυμάτων αυτού του τύπου παρουσιάζουν τον ίδιο τύπο ρευστής δυναμικής που κάνει τη δημιουργία νευρωνικά-αποδοθέντων μαλλιών ένα τόσο μεγάλο πρόβλημα. Πιθανότατα, μια κατάλληλη λύση θα μπορούσε να βοηθήσει να αντιμετωπιστούν και τα δύο ζητήματα.
Πρώτη δημοσίευση 12ης Οκτωβρίου 2022.
















