Η γωνία του Anderson
Νευρωνική Απόδοση: Πόσο Χαμηλά Μπορείτε Να Πάνε Όροι Εισόδου;

Χθες, κάποιο εξαιρετικό νέο έργο στη νευρωνική σύνθεση εικόνων drew την προσοχή και τη φαντασία του διαδικτύου, καθώς ερευνητές της Intel αποκάλυψαν μια νέα μέθοδο για την ενίσχυση του ρεαλισμού των συνθετικών εικόνων.
Το σύστημα, όπως φαίνεται σε ένα βίντεο από την Intel, παρεμβαίνει直接 στην εικόνα pipeline για το βιντεοπαιχνίδι Grand Theft Auto V και αυτομάτως ενισχύει τις εικόνες μέσω ενός αλγορίθμου σύνθεσης εικόνων που έχει εκπαιδευτεί σε ένα συνελικτικό νευρωνικό δίκτυο (CNN), χρησιμοποιώντας πραγματικές εικόνες από το Mapillary dataset, και αντικαθιστώντας τις λιγότερο ρεαλιστικές φωτισμούς και υφές του κινητήρα παιχνιδιού GTA.

Commenters, σε μια ευρεία γκάμα αντιδράσεων σε κοινότητες όπως το Reddit και το Hacker News, υποθέτουν όχι μόνο ότι η νευρωνική απόδοση αυτού του τύπου θα μπορούσε να αντικαταστήσει αποτελεσματικά την λιγότερο φωτορεαλιστική έξοδο των παραδοσιακών κινητήρων παιχνιδιών και VFX-επίπεδο CGI, αλλά ότι αυτή η διαδικασία θα μπορούσε να επιτευχθεί με πολύ βασικότερη είσοδο από αυτή που επίδειξε η Intel στο ντεμό GTA5 — δημιουργώντας ‘πρωκτο’ proxy εισόδους με εξαιρετικά ρεαλιστικές εξόδους.
Ζευγαρωμένα Δεδομένα
Το αρχή έχει επιδειχθεί από μια νέα γενιά GAN και encoder/decoder συστημάτων τα τελευταία τρία χρόνια, όπως το GauGAN της NVIDIA, το οποίο παράγει φωτορεαλιστικές εικόνες τοπίων από χονδρές πινελιές.
Εфективικά, αυτή η αρχή αντιστρέφει τη συμβατική χρήση της σεμαντικής διαίρεσης στην υπολογιστική όραση από μια παθητική μέθοδο που επιτρέπει στα συστήματα μηχανών να αναγνωρίζουν και να απομονώνουν παρατηρούμενα αντικείμενα σε μια δημιουργική είσοδο, όπου ο χρήστης ‘ζωγραφίζει’ μια ψευδή σεμαντική διαίρεση χάρτη και το σύστημα παράγει εικόνες που είναι συνεπείς με τις σχέσεις που καταλαβαίνει από την ταξινόμηση και τη διαίρεση ενός συγκεκριμένου τομέα, όπως το τοπίο.

Ένα πλαίσιο μάθησης μηχανής εφαρμόζει σεμαντική διαίρεση σε διάφορες εξωτερικές σκηνές, παρέχοντας το αρχιτεκτονικό παράδειγμα που επιτρέπει την ανάπτυξη διαδραστικών συστημάτων, όπου ο χρήστης ζωγραφίζει ένα σεμαντικό μπλοκ διαίρεσης και το σύστημα γεμίζει το μπλοκ με κατάλληλες εικόνες από ένα dataset συγκεκριμένου τομέα, όπως το σύνολο οδικής θέας της Γερμανίας Mapillary, που χρησιμοποιείται στο ντεμό GTA5 της Intel. Πηγή: http://ais.informatik.uni-freiburg.de/publications/papers/valada17icra.pdf
Συστήματα σύνθεσης εικόνων με ζευγαρωμένα δεδομένα λειτουργούν συσχετίζοντας σεμαντικές ετικέτες σε δύο datasets: ένα πλούσιο και πλήρες σύνολο εικόνων, είτε παραγόμενο από πραγματικές εικόνες (όπως το σύνολο Mapillary που χρησιμοποιείται για την ενίσχυση του GTA5 στη ντεμό της Intel) είτε από συνθετικές εικόνες, όπως εικόνες CGI.

Παραδείγματα ζευγαρωμένων δεδομένων για ένα σύστημα σύνθεσης εικόνων που σχεδιάζεται για τη δημιουργία νευρωνικών αναπαραστάσεων χαρακτήρων από άσχημες σκιτσές. Πηγή: https://www.youtube.com/watch?v=miLIwQ7yPkA
Εξωτερικοί περιβάλλοντες είναι σχετικά απλοί όταν δημιουργούνται ζευγαρωμένες μετασχηματισμοί αυτού του τύπου, επειδή οι προεξοχές είναι συνήθως πολύ περιορισμένες, η τοπογραφία έχει einen περιορισμένο εύρος μεταβλητότητας που μπορεί να καλυφθεί πλήρως σε ένα σύνολο δεδομένων, και δεν πρέπει να αντιμετωπίσουμε τη δημιουργία τεχνητών ανθρώπων ή τη διαπραγμάτευση του Uncanny Valley (ακόμη).
Αναστροφή Χαρτών Διαίρεσης
Η Google έχει αναπτύξει μια κινούμενη έκδοση του σχήματος GauGAN, που ονομάζεται Infinite Nature, ικανή να ‘ολοκληρώνει’ συνεχείς και ατελείωτες φανταστικές τοπιογραφίες μεταφράζοντας ψευδείς σεμαντικές χάρτες σε φωτορεαλιστικές εικόνες μέσω του συστήματος SPADE της NVIDIA:

Πηγή: https://www.youtube.com/watch?v=oXUf6anNAtc
Ωστόσο, το Infinite Nature χρησιμοποιεί μια εικόνα ως σημείο εκκίνησης και χρησιμοποιεί το SPADE μόνο για να ζωγραφίσει τα λείπαντα τμήματα σε διαδοχικές καρέ, ενώ το SPADE δημιουργεί μετασχηματισμούς εικόνων απευθείας από χάρτες διαίρεσης.
Είναι αυτή η ικανότητα που φαίνεται να έχει εξεγερθεί τους θαυμαστές του συστήματος Intel Image Enhancement – η δυνατότητα να παράγει πολύ υψηλής ποιότητας φωτορεαλιστικές εικόνες, ακόμη και σε πραγματικό χρόνο (τελικά), από εξαιρετικά χονδρές εισόδους.
Αντικατάσταση Υφών και Φωτισμού με Νευρωνική Απόδοση
Στην περίπτωση της εισόδου GTA5, κάποιοι έχουν αναρωτηθεί αν οποιαδήποτε από τις υπολογιστικά δαπανηρές διαδικασίες και bitmap υφών και φωτισμού από την έξοδο του κινητήρα παιχνιδιού θα είναι πραγματικά απαραίτητο σε μελλοντικά συστήματα νευρωνικής απόδοσης, ή αν θα ήταν δυνατό να μετατρέψουν χαμηλής ανάλυσης, wireframe-επίπεδο είσοδο σε φωτορεαλιστικά βίντεο που ξεπερνούν τις ικανότητες σκιών, υφών και φωτισμού των κινητήρων παιχνιδιών, δημιουργώντας υπερ-ρεαλιστικές σκηνές από ‘placeholder’ proxy εισόδους.
Μожет φαίνεται προφανές ότι οι γεννημένες από το παιχνίδι πτυχές όπως οι ανακλάσεις, οι υφές και άλλα είδη λεπτομερειών περιβάλλοντος είναι απαραίτητες πηγές πληροφοριών για ένα σύστημα νευρωνικής απόδοσης του τύπου που επίδειξε η Intel. Ωστόσο, έχει περάσει κάποιο χρόνος από τότε που το UNIT της NVIDIA (UNsupervised Image-to-image Translation Networks) επίδειξε ότι μόνο ο τομέας είναι σημαντικός, και ότι ακόμη και εκτενείς πτυχές όπως ‘νύχτα ή μέρα’ είναι ουσιαστικά ζητήματα που πρέπει να αντιμετωπιστούν από τη μεταφορά στυλ:
Σε όρους απαιτούμενης εισόδου, αυτό потенτικά αφήνει τον κινητήρα παιχνιδιού να παράγει μόνο τη βασική γεωμετρία και τις προσομοιώσεις φυσικής,既然 το σύστημα νευρωνικής απόδοσης μπορεί να ζωγραφίσει όλα τα άλλα χαρακτηριστικά με τη σύνθεση της επιθυμητής εικόνας από το συλλεγμένο σύνολο δεδομένων, χρησιμοποιώντας σεμαντικές χάρτες ως στρώμα ερμηνείας.

Το σύστημα της Intel βελτιώνει μια πλήρως ολοκληρωμένη και αποδοθείσα καρέ από το GTA5, προσθέτοντας διαίρεση και αξιολογημένες χάρτες βάθους — δύο πτυχές που θα μπορούσαν потенτικά να παρέχονται απευθείας από einen stripped-down κινητήρα παιχνιδιού. Πηγή: https://www.youtube.com/watch?v=P1IcaBn3ej0
Η προσέγγιση νευρωνικής απόδοσης της Intel περιλαμβάνει την ανάλυση πλήρως αποδοθέντων καρέ από τα буφέρ του GTA5, και το σύστημα νευρωνικής έχει το επιπλέον βάρος της δημιουργίας τόσο των χαρτών βάθους όσο και των χαρτών διαίρεσης.既然 οι χάρτες βάθους είναι 암PLICITLY διαθέσιμοι σε παραδοσιακές 3D pipelines (και είναι λιγότερο απαιτητικοί να παραχθούν από τις υφές, ray-tracing ή global illumination), μπορεί να είναι μια καλύτερη χρήση των πόρων να αφήσουμε τον κινητήρα παιχνιδιού να χειρίζεται αυτούς.
Stripped-Down Είσοδος Για Ένα Σύστημα Νευρωνικής Απόδοσης
Η τρέχουσα υλοποίηση του δικτύου βελτίωσης εικόνας της Intel, συνεπώς, μπορεί να περιλαμβάνει πολλές περιττές κύκλους υπολογισμού,既然 ο κινητήρας παιχνιδιού παράγει υπολογιστικά δαπανηρές υφές και φωτισμό που το σύστημα νευρωνικής απόδοσης δεν χρειάζεται πραγματικά. Το σύστημα φαίνεται να έχει σχεδιαστεί με αυτόν τον τρόπο όχι επειδή αυτή είναι απαραίτητα η βέλτιστη προσέγγιση, αλλά επειδή είναι ευκολότερο να προσαρμόσετε ένα σύστημα νευρωνικής απόδοσης σε μια υπάρχουσα pipeline παρά να δημιουργήσετε einen νέο κινητήρα παιχνιδιού που είναι βελτιστοποιημένος για μια προσέγγιση νευρωνικής απόδοσης.
Η πιο οικονομική χρήση των πόρων σε ένα σύστημα παιχνιδιών αυτού του τύπου θα μπορούσε να είναι η πλήρης ανακατανομή της GPU από το σύστημα νευρωνικής απόδοσης, με την stripped-down proxy είσοδο να χειρίζεται από τον CPU.
Επιπλέον, ο κινητήρας παιχνιδιού θα μπορούσε εύκολα να παράγει αντιπροσωπευτικές χάρτες διαίρεσης από μόνος του, απενεργοποιώντας όλα τα σκιάνση και φωτισμό στην έξοδό του. Επίσης, θα μπορούσε να παρέχει βίντεο σε μια πολύ χαμηλότερη ανάλυση από αυτή που συνήθως απαιτείται από αυτόν,既然 το βίντεο θα χρειαζόταν μόνο να είναι ευρέως αντιπροσωπευτικό του περιεχομένου, με υψηλής ανάλυσης λεπτομέρειες να χειρίζονται από το σύστημα νευρωνικής, απελευθερώνοντας ακόμη περισσότερους τοπικούς πόρους υπολογισμού.
Η Προηγούμενη Εργασία της Intel ISL με Διαίρεση>Εικόνα
Η άμεση μετάφραση διαίρεσης σε φωτορεαλιστικά βίντεο είναι πολύ μακριά από την υποθετική. Το 2017, η Intel ISL, οι δημιουργοί της χθεσινής φουρίας, κυκλοφόρησαν αρχική έρευνα ικανή να εκτελεί αστική βίντεο σύνθεση απευθείας από σεμαντική διαίρεση.

Η εργασία της Intel ISL με διαίρεση σε εικόνα από το 2017. Πηγή: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis
Στην ουσία, αυτή η αρχική πipeline του 2017 έχει απλώς επεκταθεί για να ταιριάζει στην πλήρως αποδοθείσα έξοδο του GTA5.
Νευρωνική Απόδοση σε VFX
Η νευρωνική απόδοση από τεχνητούς χάρτες διαίρεσης φαίνεται επίσης να είναι μια υποσχόμενη τεχνολογία για VFX, με τη δυνατότητα να μεταφράζει απευθείας πολύ βασικά βίντεο απευθείας σε ολοκληρωμένα οπτικά εφέ, δημιουργώντας domain-συγκεκριμένα σύνολα δεδομένων που λαμβάνονται είτε από μοντέλα είτε από συνθετικές (CGI) εικόνες.


Ένα υποθετικό σύστημα νευρωνικής απόδοσης, όπου εκτεταμένη κάλυψη κάθε στόχου αντικειμένου αφηγείται σε ένα συνεισφέρων σύνολο δεδομένων, και όπου τεχνητοί χάρτες διαίρεσης χρησιμοποιούνται ως βάση για πλήρους ανάλυσης φωτορεαλιστικών εξόδων. Πηγή: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Η ανάπτυξη και υιοθέτηση τέτοιων συστημάτων θα μεταφέρει το κέντρο της καλλιτεχνικής προσπάθειας από μια ερμηνευτική σε μια αντιπροσωπευτική ροή εργασίας, και θα ανυψώσει την domain-οδηγούμενη συλλογή δεδομένων από einen υποστηρικτικό σε einen κεντρικό ρόλο στις οπτικές τέχνες.
Το άρθρο ενημερώθηκε στις 4:55 μ.μ. για να προστεθεί υλικό σχετικά με την έρευνα της Intel ISL του 2017.














