Η γωνία του Anderson
Συνεπής Επεξεργασία Βίντεο με Εφαρμογή Κειμένου

Ενώ η επαγγελματική κοινότητα των οπτικών εφέ ενδιαφέρεται – και μερικές φορές cảm thấy немного απειλημένη – από τις νέες καινοτομίες στη σύνθεση εικόνων και βίντεο, η έλλειψη χρονικής συνέχειας στα περισσότερα έργα επεξεργασίας βίντεο με βάση τον AI οδηγεί πολλές από αυτές τις προσπάθειες στην “ψυχεδελική” σφαίρα, με λαμπερές και ταχέως μεταβαλλόμενες υφές και δομές, ασυνεπείς εφέ και το είδος της груβής τεχνολογικής διαχείρισης που θυμίζει την φωτοχημική εποχή των οπτικών εφέ.
Εάν θέλετε να αλλάξετε κάτι πολύ συγκεκριμένο σε ένα βίντεο που δεν ανήκει στο πεδίο των deepfakes (δηλαδή, επιβάλλοντας μια νέα ταυτότητα σε υφιστάμενο βίντεο ενός ατόμου), οι περισσότερες από τις τρέχουσες λύσεις λειτουργούν υπό πολύ αυστηρά όρια, όσον αφορά την ακρίβεια που απαιτείται για παραγωγή υψηλής ποιότητας οπτικών εφέ.
Μια εξαίρεση είναι η συνεχιζόμενη εργασία μιας χαλαρής ένωσης ακαδημαϊκών από το Ινστιτούτο Επιστημών Weizmann. Το 2021, τρεις από τους ερευνητές του, σε συνεργασία με την Adobe, ανακοίνωσαν μια νέα μέθοδο για την αποσύνθεση βίντεο και την επιβολή μιας συνεχούς εσωτερικής χαρτογράφησης – ένα στρωματωμένο νευρωνικό άτλας – σε ένα συνθέσιμο αποτέλεσμα, πλήρες με κανάλια αλφάβητου και χρονικά συνεκτικά αποτελέσματα.

Από το έγγραφο του 2021: μια εκτίμηση της πλήρης διαδρομής του δρόμου στο αρχικό clip επεξεργάζεται μέσω ενός νευρωνικού δικτύου με τρόπο που παραδοσιακά θα απαιτούσε εκτεταμένη rotoscoping και match-moving.既然 τα στοιχεία του φόντου και του προσώπου χειρίζονται από διαφορετικά δίκτυα, οι μάσκες είναι πραγματικά ‘αυτόματες’. Πηγή: https://layered-neural-atlases.github.io/
Αν και ανήκει κάπου στο πεδίο της οπτικής ροής στις διαδικασίες VFX, ο στρωματωμένος άτλας δεν έχει άμεσο αντίστοιχο στις παραδοσιακές διαδικασίες CGI,既然 αποτελεί ουσιαστικά einen ‘χρονικό χάρτη υφής’ που μπορεί να παραχθεί και να επεξεργαστεί μέσω παραδοσιακών μεθόδων λογισμικού. Στη δεύτερη εικόνα της εικονογράφησης παραπάνω, το φόντο της επιφάνειας του δρόμου αντιπροσωπεύεται (εικονικά) σε όλη τη διάρκεια του βίντεο. Η αλλαγή της βασικής εικόνας (τρίτη εικόνα από αριστερά στην εικονογράφηση παραπάνω) παράγει μια συνεχής αλλαγή στο φόντο.
Οι εικόνες του ‘ανοικτού’ άτλαντα παραπάνω αντιπροσωπεύουν μόνο μεμονωμένα ερμηνευμένα кадράκια. Συνεχείς αλλαγές σε οποιοδήποτε στόχο кадράκια χαρτογραφούνται πίσω στο αρχικό кадράκι, διατηρώντας οποιαδήποτε απαραίτητη κάλυψη και άλλα απαραίτητα εφέ σκηνής, όπως σκιές ή ανακλάσεις.
Η βασική αρχιτεκτονική χρησιμοποιεί ένα Multilayer Perceptron (MLP) για να αντιπροσωπεύσει τους ανοικτούς άτλαντες, κανάλια αλφάβητου και χαρτογραφήσεις, όλα από τα οποία βελτιστοποιούνται σε συναρτήσει, και εντελώς σε ένα 2D χώρο, αποφεύγοντας NeRF-στυλ προηγούμενες γνώσεις γεωμετρικών σημείων, χαρτών βάθους, και παρόμοιων CGI-στυλ επιπλοκών.
Ο αναφορά άτλας των μεμονωμένων αντικειμένων μπορεί επίσης να αλλάξει με τρόπο που είναι αξιόπιστο:

Συνεχής αλλαγή σε ένα κινούμενο αντικείμενο υπό το πλαίσιο του 2021. Πηγή: https://www.youtube.com/watch?v=aQhakPFC4oQ
Ουσιαστικά, το σύστημα του 2021 συνδυάζει την ευθυγράμμιση γεωμετρίας, match-moving, χαρτογράφηση, re-texturizing και rotoscoping σε μια διακριτή νευρωνική διαδικασία.
Text2Live
Οι τρεις αρχικοί ερευνητές του εγγράφου του 2021, μαζί με την NVIDIA Research, είναι μεταξύ των συντελεστών μιας νέας καινοτομίας στην τεχνική που συνδυάζει τη δύναμη των στρωματωμένων άτλαντων με τον τύπο της κειμενο-καθοδηγούμενης τεχνολογίας CLIP που έχει επιστρέψει στην προεξοχή αυτή την εβδομάδα με την έκδοση του πλαισίου DALL-E 2.
Η νέα αρχιτεκτονική, με τίτλο Text2Live, επιτρέπει στον τελικό χρήστη να δημιουργήσει τοπικές επεξεργασίες σε πραγματικό περιεχόμενο βίντεο με βάση κειμενο-προωθήσεις:


Δύο παραδείγματα επεξεργασίας προσώπου. Για καλύτερη ανάλυση και ορισμό, επισκεφθείτε τα αρχικά βίντεο στο https://text2live.github.io/sm/pages/video_results_atlases.html
Το Text2Live προσφέρει σημασιολογική και υψηλά τοπική επεξεργασία χωρίς τη χρήση ενός προ-εκπαιδευμένου γεννήτορα, χρησιμοποιώντας μια εσωτερική βάση δεδομένων που είναι συγκεκριμένη για το clip βίντεο που επηρεάζεται.

Μετασχηματισμοί φόντου και προσώπου (αντικειμένου) υπό το Text2Live. Πηγή: https://text2live.github.io/sm/pages/video_results_atlases.html
Η τεχνική δεν απαιτεί μάσκες που παρέχονται από τον χρήστη, όπως μια τυπική διαδικασία rotoscoping ή green-screen, αλλά αντίθετα εκτιμά χαρτογραφήσεις σχετικότητας μέσω μιας τεχνικής bootstrapping που βασίζεται σε έρευνα του 2021 από το Τμήμα Επιστήμης Υπολογιστών του Πανεπιστημίου του Τελ Αβίβ και την Facebook AI Research (FAIR).

Χαρτογραφήσεις που παράγονται μέσω ενός μοντέλου προσοχής γενικής μεταφόρμασης.
Το νέο έγγραφο έχει τον τίτλο Text2LIVE: Text-Driven Layered Image and Video Editing. Η αρχική ομάδα του 2021 ενώνεται με τον Omer Bar-Tal του Ινστιτούτου Weizmann και τον Yoni Kasten της NVIDIA Research.
Αρχιτεκτονική
Το Text2Live αποτελείται από einen γεννήτορα που έχει εκπαιδευτεί σε μια seule είσοδο εικόνας και στόχους κειμένου. Ένα μοντέλο CLIP που έχει προ-εκπαιδευτεί σε 400 εκατομμύρια ζευγάρια κειμένου/εικόνας παρέχει σχετιζόμενη οπτική υλική από την οποία οι μετασχηματισμοί του χρήστη possono ερμηνευτεί.

Ο γεννήτορας δέχεται μια είσοδο εικόνας (κадράκι) και εξοδεύει ένα στόχο στρώμα RGBA που περιέχει πληροφορίες χρώματος και διαφάνειας. Αυτό το στρώμα συνθέτει στο αρχικό βίντεο με πρόσθετες αυξήσεις.

Το κανάλι αλφάβητου στο γεννημένο στρώμα RGBA παρέχει μια εσωτερική συνθέτηση χωρίς ανάγκη παραδοσιακών διαδικασιών που涉ρούν λογισμικό βασισμένο σε pixel, όπως το After Effects.
Με την εκπαίδευση σε εσωτερικές εικόνες που σχετίζονται με το στόχο βίντεο ή εικόνας, το Text2Live αποφεύγει την ανάγκη είτε να αντιστρέψει την είσοδο εικόνας στο latent χώρο ενός Generative Adversarial Network (GAN), μια πρακτική που είναι ακόμη μακράν από την ακρίβεια που απαιτείται για τις απαιτήσεις επεξεργασίας βίντεο παραγωγής, είτε να χρησιμοποιήσει ένα μοντέλο Diffusion που είναι πιο ακριβές και ρυθμιζόμενο, αλλά δεν μπορεί να διατηρήσει πιστότητα στο στόχο βίντεο.

Ποικιλία μετασχηματισμών με βάση προωθήσεις από το Text2Live.
Προηγούμενες προσεγγίσεις έχουν χρησιμοποιήσει μεθόδους που βασίζονται στη διάδοση ή προσεγγίσεις που βασίζονται στην οπτική ροή.既然 αυτές οι τεχνικές είναι σε κάποιο βαθμό βασισμένες σε кадράκια, καμία από αυτές δεν είναι ικανή να δημιουργήσει μια συνεχής χρονική εμφάνιση αλλαγών στο εξοδευμένο βίντεο. Ένας νευρωνικός στρωματωμένος άτλας, αντίθετα, παρέχει ένα ενιαίο χώρο στον οποίο να αντιμετωπιστούν αλλαγές, οι οποίες μπορούν να παραμείνουν πιστές στην αλλαγή που έχει δεσμευτεί καθώς το βίντεο προχωρά.

Χωρίς ‘σπάσιμο’ ή τυχαίες εικασίες: το Text2Live λαμβάνει μια ερμηνεία της κειμενο-προώθησης ‘rusty jeep’ και την εφαρμόζει μια φορά στον νευρωνικό στρωματωμένο άτλαντα του αυτοκινήτου στο βίντεο, αντί να επανεκκινεί την μετασχηματισμό για κάθε ερμηνευμένο кадράκι.

Διαδικασία συνθέσεως του Text2Live για τη συνεχή μετασχηματισμό ενός Jeep σε ένα ρυπογόνο απομεινάρι.
Το Text2Live είναι πιο κοντά σε μια επαναστατική καινοτομία στην AI-βασισμένη σύνθεση, παρά στην πλούσια περιοχή κειμένου-εικόνας που έχει προσελκύσει τόσο την προσοχή αυτή την εβδομάδα με την δεύτερη γενιά του πλαισίου DALL-E της OpenAI (η οποία μπορεί να ενσωματώσει στόχους εικόνων ως μέρος της μετασχηματιστικής διαδικασίας, αλλά παραμένει περιορισμένη στην ικανότητά της να επεμβαίνει άμεσα σε μια φωτογραφία, εκτός από την цензуρα των πηγαίων δεδομένων εκπαίδευσης και την επιβολή φίλτρων, που έχουν σχεδιαστεί για να αποτρέψουν την κακοποίηση του χρήστη).
Αντίθετα, το Text2Live επιτρέπει στον τελικό χρήστη να εξαγάγει έναν άτλαντα και να τον επεξεργαστεί σε μια seule διαδικασία σε περιβάλλοντα υψηλής ελέγχου pixel-βασισμένα, όπως το Photoshop (και ενδεχομένως ακόμη και πιο αφηρημένα πλαίσια σύνθεσης εικόνας, όπως το NeRF), πριν να τον επαναφέρει σε ένα σωστά προσανατολισμένο περιβάλλον που δεν βασίζεται σε 3D εκτίμηση ή CGI-βασισμένες προσεγγίσεις.
Επιπλέον, το Text2Live, όπως ισχυρίζονται οι συγγραφείς, είναι το πρώτο συγκρίσιμο πλαίσιο που επιτυγχάνει μάσκες και σύνθεση σε εντελώς αυτόματο τρόπο.
Πρώτη δημοσίευση 7ης Απριλίου 2022.












