Η γωνία του Anderson
Γιατί τα Συστήματα Γενετικών Βίντεο Δεν Μπορούν να Δημιουργήσουν Πλήρεις Ταινίες;

Η έλευση και η πρόοδος των γενετικών βίντεο AI έχει οδηγήσει πολλούς απλούς παρατηρητές να προβλέψουν ότι η μηχανική μάθηση θα αποδείξει τον θάνατο της κινηματογραφικής βιομηχανίας όπως την γνωρίζουμε – αντίθετα,單οι δημιουργοί θα μπορούν να δημιουργήσουν ταινίες του Χόλιγουντ στο σπίτι, είτε σε τοπικά είτε σε cloud-based συστήματα GPU.
Είναι αυτό δυνατό; Ακόμη και αν είναι δυνατό, είναι εύκαιρο, όπως πολλοί πιστεύουν;
Ότι τα άτομα θα μπορούν τελικά να δημιουργήσουν ταινίες, με τη μορφή που τις γνωρίζουμε, με συνεπείς χαρακτήρες, αφηγηματική συνέχεια και πλήρη φωτορεαλισμό, είναι bastante πιθανό – και ίσως ακόμη και αναπόφευκτο.
Ωστόσο, υπάρχουν beberapa πραγματικά θεμελιώδεις λόγοι για τους οποίους αυτό δεν είναι πιθανό να συμβεί με τα συστήματα βίντεο που βασίζονται σε Latent Diffusion Models.
Αυτό το τελευταίο γεγονός είναι σημαντικό, επειδή, αυτή τη στιγμή, αυτή η κατηγορία περιλαμβάνει κάθε δημοφιλές σύστημα text-to-video (T2) και image-to-video (I2V) που είναι διαθέσιμο, συμπεριλαμβανομένων Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (και, όσο μπορούμε να διακρίνουμε, την επικείμενη λειτουργία βίντεο του Adobe Firefly); μεταξύ πολλών άλλων.
Εδώ, εξετάζουμε την προοπτική αληθινών πλήρως αυτοτελών παραγωγών gen-AI, δημιουργημένων από άτομα, με συνεπείς χαρακτήρες, κινηματογράφηση και οπτικά εφέ τουλάχιστον στο ίδιο επίπεδο με την τρέχουσα κατάσταση της τέχνης στο Χόλιγουντ.
Ας δούμε μερικά από τα μεγαλύτερα πρακτικά εμπόδια στα προκλήματα που εμπλέκονται.
1: Δεν Μπορείτε να Πάρει μια Ακριβή Σκηνή
Η αφηγηματική ασυνέπεια είναι το μεγαλύτερο από αυτά τα εμπόδια. Το γεγονός είναι ότι κανένα από τα τρέχοντα συστήματα γενετικών βίντεο δεν μπορεί να δημιουργήσει μια πραγματικά ακριβή ‘συνέχεια’ σκηνής*.
Αυτό οφείλεται στο ότι το denoising diffusion model στη καρδιά αυτών των συστημάτων βασίζεται σε τυχαίο θόρυβο, και αυτή η βασική αρχή δεν είναι εύκολη στην ερμηνεία του ίδιου περιεχομένου δύο φορές (δηλαδή, από διαφορετικές γωνίες, ή αναπτύσσοντας την προηγούμενη σκηνή σε μια συνέχεια που διατηρεί τη συνέχεια με την προηγούμενη σκηνή).
Όταν χρησιμοποιούνται κείμενα προτροπών, μόνα τους ή μαζί με ανεβαμένα ‘seed’ εικόνες (πολυμορφικό εισαγόμενο), τα tokens που προέρχονται από την προτροπή θα ελιχθούν σε σημασιολογικά-κατάλληλο περιεχόμενο από τον εκπαιδευμένο latent χώρο του μοντέλου.
Ωστόσο, περαιτέρω εμποδισμένο από τον ‘τυχαίο θόρυβο’ παράγοντα, δεν θα το κάνει ποτέ με τον ίδιο τρόπο δύο φορές.
Αυτό σημαίνει ότι οι ταυτότητες των ανθρώπων στο βίντεο θα έχουν την τάση να μετατοπιστούν, και τα αντικείμενα και τα περιβάλλοντα δεν θα ταιριάζουν με την αρχική σκηνή.
Αυτό είναι το λόγο για τον οποίο τα ιογενή κλιπ που απεικονίζουν εξαιρετικά οπτικά και Hollywood-επίπεδο εξόδου έχουν την τάση να είναι είτε μονές σκηνές, είτε μια ‘συνέχεια’ του μοντάζ της ικανότητας του συστήματος, όπου κάθε σκηνή έχει διαφορετικούς χαρακτήρες και περιβάλλοντα.
Απόσπασμα από ένα γενετικό AI μοντάζ από Marco van Hylckama Vlieg – πηγή: https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/
Η έννοια σε αυτές τις συλλογές από ad hoc βίντεο γενετικών (που μπορεί να είναι δόλια στην περίπτωση εμπορικών συστημάτων) είναι ότι το υποκείμενο σύστημα μπορεί να δημιουργήσει συνεχείς και συνεπείς αφηγήσεις.
Η αναλογία που εκμεταλλεύεται εδώ είναι ένα trailer ταινίας, το οποίο περιλαμβάνει μόνο ένα ή δύο λεπτά από την ταινία, αλλά δίνει στο κοινό λόγο να πιστεύουν ότι η ολόκληρη ταινία υπάρχει.
Τα μόνο συστήματα που προσφέρουν αφηγηματική συνέχεια σε ένα μοντέλο διάχυσης είναι αυτά που παράγουν στατικές εικόνες. Αυτά περιλαμβάνουν το ConsiStory της NVIDIA και διάφορα έργα στη научική βιβλιογραφία, όπως το TheaterGen, το DreamStory και το StoryDiffusion.

Δύο παραδείγματα ‘στατικών’ αφηγηματικής συνέχειας, από πρόσφατα μοντέλα: Πηγές: https://research.nvidia.com/labs/par/consistory/ και https://arxiv.org/pdf/2405.01434
Θεωρητικά, θα μπορούσατε να χρησιμοποιήσετε μια καλύτερη εκδοχή τέτοιων συστημάτων (κανένα από τα παραπάνω δεν είναι πραγματικά συνεπές) για να δημιουργήσετε μια σειρά από εικόνες-βίντεο, που θα μπορούσαν να συνδεθούν σε μια ακολουθία.
Στην τρέχουσα κατάσταση της τέχνης, αυτή η προσέγγιση δεν παράγει πιθανές συνεχείς σκηνές· και, σε κάθε περίπτωση, έχουμε ήδη απομακρύνθει από το όνειρο του auteur με την προσθήκη ενός επιπέδου πολυπλοκότητας.
Μπορούμε, επιπλέον, να χρησιμοποιήσουμε Low Rank Adaptation (LoRA) μοντέλα, ειδικά εκπαιδευμένα σε χαρακτήρες, πράγματα ή περιβάλλοντα, για να διατηρήσουμε καλύτερη συνέχεια μεταξύ σκηνών.
Ωστόσο, αν ένας χαρακτήρας επιθυμεί να εμφανιστεί σε ένα νέο κοστούμι, ένα εντελώς νέο LoRA θα πρέπει συνήθως να εκπαιδευτεί που ενσωματώνει τον χαρακτήρα ντυμένο με αυτόν τον τρόπο (αν και υπο-εννοιες όπως ‘κόκκινο φόρεμα’ μπορούν να εκπαιδευτούν σε μεμονωμένα LoRAs, μαζί με κατάλληλες εικόνες, δεν είναι πάντα εύκολες στην εργασία με αυτά).
Αυτό προσθέτει σημαντική πολυπλοκότητα, ακόμη και σε μια σκηνή έναρξης σε μια ταινία, όπου ένας άνθρωπος βγαίνει από το κρεβάτι, βάζει ένα ρόμπα, γαυγίζει, κοιτάζει από το παράθυρο του υπνοδωματίου και πηγαίνει στο μπάνιο για να ξυρίσει τα δόντια του.
Μια τέτοια σκηνή, που περιλαμβάνει περίπου 4-8 σκηνές, μπορεί να γυριστεί σε ένα πρωινό με συμβατικές μεθόδους κινηματογράφησης· στην τρέχουσα κατάσταση της τέχνης στα γενετικά AI, αυτό потенτικά αντιπροσωπεύει εβδομάδες εργασίας, πολλαπλά εκπαιδευμένα LoRAs (ή άλλα συστήματα) και σημαντική ποσότητα μετα-επεξεργασίας
Εναλλακτικά, μπορεί να χρησιμοποιηθεί βίντεο-προς-βίντεο, όπου κοινό ή CGI βίντεο μετατρέπεται μέσω κειμένων-προτροπών σε εναλλακτικές ερμηνείες. Το Runway προσφέρει τέτοιο σύστημα, για παράδειγμα.
CGI (αριστερά) από Blender, ερμηνευμένο σε μια πειραματική διαδικασία βίντεο-προς-βίντεο με τη βοήθεια του Runway από τον Mathieu Visnjevec – Πηγή: https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/
Υπάρχουν δύο προβλήματα εδώ: είστε ήδη στην διαδικασία δημιουργίας του βασικού υλικού, οπότε ήδη κάνετε την ταινία δύο φορές, ακόμη και αν χρησιμοποιείτε ένα συνθετικό σύστημα όπως το MetaHuman της UnReal.
Αν δημιουργήσετε CGI μοντέλα (όπως στην κλιπ παραπάνω) και τα χρησιμοποιήσετε σε μια μετατροπή βίντεο-προς-εικόνα, η συνέχεια τους μεταξύ σκηνών δεν μπορεί να εξαρτηθεί.
Αυτό οφείλεται στο ότι τα μοντέλα διάχυσης βίντεο δεν βλέπουν το ‘μεγάλο πλάνο’ – αντίθετα, δημιουργούν μια νέα καρέ βάσει προηγουμένων καρέ/ων, και, σε ορισμένες περιπτώσεις, λαμβάνουν υπόψη ένα κοντινό μελλοντικό καρέ· αλλά, για να συγκρίνουμε τη διαδικασία με ένα παιχνίδι σκακιού, δεν μπορούν να σκεφτούν ‘δέκα κινήσεις μπροστά’ και δεν μπορούν να θυμηθούν δέκα κινήσεις πίσω.
Δεύτερον, ένα μοντέλο διάχυσης θα συνεχίσει να αγωνίζεται για να διατηρήσει μια συνεπή εμφάνιση μεταξύ σκηνών, ακόμη και αν περιλαμβάνει πολλαπλά LoRAs για χαρακτήρα, περιβάλλον και στυλ φωτισμού, για τους λόγους που αναφέρθηκαν στην αρχή αυτής της ενότητας.
2: Δεν Μπορείτε να Επεξεργαστείτε μια Σκηνή Εύκολα
Αν απεικονίσετε einen χαρακτήρα που περπατάει στο δρόμο χρησιμοποιώντας παλιές μεθόδους CGI, και αποφασίσετε ότι θέλετε να αλλάξετε κάποιο аспект της σκηνής, μπορείτε να điều chỉnh το μοντέλο και να το render ξανά.
Αν είναι μια πραγματική σκηνή, απλώς επαναφέρετε και γυρίστε την ξανά, με τις αντίστοιχες αλλαγές.
Ωστόσο, αν παράγετε μια γενετική AI σκηνή που σας αρέσει, αλλά θέλετε να αλλάξετε ένα аспект της, μπορείτε να το κάνετε μόνο μέσω επίπονης μετα-επεξεργασίας μεθόδων που έχουν αναπτυχθεί τα τελευταία 30-40 χρόνια: CGI, rotoscoping, modeling και matting – όλες εργασίες που απαιτούν πολύ χρόνο και είναι ακριβές.
Ο τρόπος με τον οποίο λειτουργούν τα μοντέλα διάχυσης, απλώς αλλαγή ενός аспекту μιας κειμενικής προτροπής (ακόμη και σε μια πολυμορφική προτροπή, όπου παρέχετε μια πλήρη πηγή εικόνας) θα αλλάξει πολλαπλά аспект της παραγόμενης εξόδου, οδηγώντας σε ένα παιχνίδι προτροπής ‘whack-a-mole’.
3: Δεν Μπορείτε να Εξαρτηθείτε από τους Νόμους της Φυσικής
Παραδοσιακές μεθόδους CGI προσφέρουν eine ποικιλία από αλγοριθμικά φυσικά-βασισμένα μοντέλα που μπορούν να προσομοιώσουν πράγματα όπως ρευστοδυναμική, κινηματική αερίου, αντίστροφη κινηματική (η ακριβής μοντελοποίηση της ανθρώπινης κίνησης), κίνησης υφάσματος, εκρήξεις και διάφορα άλλα φαινόμενα του πραγματικού κόσμου.
Ωστόσο, τα μοντέλα διάχυσης, όπως έχουμε δει, έχουν σύντομη μνήμη και επίσης περιορισμένο εύρος motion priors (παραδείγματα τέτοιων ενεργειών, που περιλαμβάνονται στη βάση δεδομένων εκπαίδευσης) για να βασιστεί.
Σε μια παλαιότερη εκδοχή της σελίδας του OpenAI για το σύστημα Sora, η εταιρεία παραδέχτηκε ότι το Sora έχει περιορισμούς σε αυτόν τον τομέα (αν και αυτό το κείμενο έχει αφαιρεθεί πλέον):
‘[Sora] μπορεί να αγωνιστεί για να προσομοιώσει τη φυσικήの一 phức tạp σκηνή, και μπορεί να μην κατανοήσει συγκεκριμένες περιπτώσεις αιτίας και αποτελέσματος (για παράδειγμα: ένα μπισκότο μπορεί να μην δείξει ένα σημάδι μετά από έναν χαρακτήρα που το δαγκώνει).
‘Το μοντέλο μπορεί επίσης να συγχύσει χωρικές λεπτομέρειες που περιλαμβάνονται σε μια προτροπή, όπως να διακρίνει αριστερά από δεξιά, ή να αγωνιστεί με ακριβείς περιγραφές γεγονότων που αναπτύσσονται με το χρόνο, όπως συγκεκριμένες траекторίες κάμερας.’
Η πρακτική χρήση των API-βασισμένων γενετικών βίντεο συστημάτων αποκαλύπτει παρόμοιους περιορισμούς στην απεικόνιση ακριβούς φυσικής. Ωστόσο, ορισμένα κοινά φυσικά φαινόμενα, όπως εκρήξεις, φαίνεται να είναι καλύτερα αναπαρασταμένα στις βάσεις δεδομένων εκπαίδευσής τους.
Ορισμένα motion prior embeddings, είτε εκπαιδευμένα στο γενετικό μοντέλο είτε τροφοδοτημένα από μια πηγή βίντεο, χρειάζονται χρόνο για να ολοκληρωθούν (όπως ένας άνθρωπος που εκτελεί μια σύνθετη και μη επαναλαμβανόμενη χορευτική σειρά σε ένα περίπλοκο κοστούμι) και, ξανά, το μοντέλο διάχυσης με την μυωπία προσοχής είναι πιθανό να μετατρέψει το περιεχόμενο (προσωπογραφία, λεπτομέρειες κοστουμιού, κ.λπ.) μέχρι να ολοκληρωθεί η κίνηση. Ωστόσο, τα LoRAs μπορούν να μετριάσουν αυτό, μέχρι ένα σημείο.
Επίδραση σε Μετα-Επεξεργασία
Υπάρχουν άλλα ελαττώματα στα καθαρά ‘μονά’ AI βίντεο γενετικών, όπως η δυσκολία που έχουν στην απεικόνιση ταχύτατων κινήσεων, και το γενικότερο και πιο επικείμενο πρόβλημα απόκτησης χρονικής συνέχειας στην έξοδο βίντεο.
Επιπλέον, η δημιουργία συγκεκριμένων προσωπογραφικών επιδόσεων είναι σχεδόν ένα ζήτημα τύχης στα γενετικά βίντεο, όπως και η lip-sync για διάλογο.
Σε cả τις περιπτώσεις, η χρήση συστημάτων όπως LivePortrait και AnimateDiff γίνεται όλο και πιο δημοφιλής στη κοινότητα VFX,既然 αυτό επιτρέπει την τοποθέτηση τουλάχιστον ευρείας προσωπογραφικής έκφρασης και lip-sync σε υπάρχοντα γενετικά βίντεο.
Παράδειγμα μεταφοράς έκφρασης (ωδήγηση βίντεο στο κάτω αριστερό) που επιβάλλεται σε ένα στόχο βίντεο με LivePortrait. Το βίντεο είναι από Generative Z TunisiaGenerative. Δείτε την πλήρη εκδοχή σε καλύτερη ποιότητα στο https://www.linkedin.com/posts/genz-tunisia_digitalcreation-liveportrait-aianimation-activity-7240776811737972736-uxiB/?
Επιπλέον, μια ποικιλία σύνθετων λύσεων, που περιλαμβάνουν εργαλεία όπως το Stable Diffusion GUI ComfyUI και την επαγγελματική εφαρμογή σύνθεσης και χειρισμού Nuke, καθώς και χειρισμό χώρου latents, επιτρέπουν στους επαγγελματίες VFX να αποκτήσουν μεγαλύτερο έλεγχο над την προσωπογραφική έκφραση και διάθεση.
Αν και περιγράφει τη διαδικασία της προσωπογραφικής animation στο ComfyUI ως ‘βάναυσο’, ο επαγγελματίας VFX Francisco Contreras έχει αναπτύξει μια τέτοια διαδικασία, η οποία επιτρέπει την επιβολή lip phonemes και άλλων аспектών προσωπογραφικής/κεφαλής απεικόνισης
Η σταθερή διάχυση, με τη βοήθεια μιας διαδικασίας ComfyUI που βασίζεται στο Nuke, επέτρεψε στον επαγγελματία VFX Francisco Contreras να αποκτήσει ασυνήθιστο έλεγχο над προσωπογραφικούς аспектούς. Για το πλήρες βίντεο, σε καλύτερη ανάλυση, μεταβείτε στο https://www.linkedin.com/feed/update/urn:li:activity:7243056650012495872/
Συμπέρασμα
Κανένα από αυτά τα στοιχεία δεν είναι ευνοϊκά για την προοπτική ενός seul χρήστη που παράγει συνεπείς και φωτορεαλιστικές ταινίες-μπλοκμπάστερ, με πραγματιστικές διαλόγους, lip-sync, επιδόσεις, περιβάλλοντα και συνέχεια.
Επιπλέον, τα εμπόδια που περιγράφηκαν εδώ, τουλάχιστον σε σχέση με τα μοντέλα γενετικών βίντεο διάχυσης, δεν είναι απαραίτητα λύσιμα ‘κάθε στιγμή’ τώρα, παρά τις σχολιαστικές και τα μέσα ενημέρωσης που κάνουν αυτή την περίπτωση. Οι περιορισμοί που περιγράφηκαν φαίνεται να είναι εγγενείς στην αρχιτεκτονική.
Στην έρευνα της γενετικής/synthesis, όπως και σε όλες τις επιστημονικές έρευνες, εξαιρετικές ιδέες περιστασιακά μας εκπλήσσουν με το δυναμικό τους, μόνο για να αποκαλύψουν τα θεμελιώδη τους περιορισμοί με περαιτέρω έρευνα.
Στον χώρο της γενετικής/synthesis, αυτό έχει ήδη συμβεί με τα Generative Adversarial Networks (GANs) και Neural Radiance Fields (NeRF), τα οποία τελικά αποδείχθηκαν πολύ δύσκολα να instrumentalize σε εύρωστα εμπορικά συστήματα, παρά τα χρόνια της ακαδημαϊκής έρευνας προς αυτόν τον στόχο. Αυτές οι τεχνολογίες εμφανίζονται τώρα πιο συχνά ως συστατικά σε εναλλακτικές αρχιτεκτονικές.
Πολύ όπως οι κινηματογραφικές εταιρείες μπορεί να ελπίζουν ότι η εκπαίδευση σε νομίμως αδειοδοτημένα κινηματογραφικά καταλόγους θα μπορούσε να καταργήσει τους καλλιτέχνες VFX, η AI στην πραγματικότητα προσθέτει ρόλους στην εργατική δύναμη αυτή τη στιγμή.
Αν τα συστήματα βίντεο διάχυσης μπορούν πραγματικά να μετατραπούν σε αφηγηματικά συνεπείς και φωτορεαλιστικές γεννήτριες ταινιών, ή αν όλη η υπόθεση είναι απλώς μια αλχημεία, θα πρέπει να γίνει σαφές μέσα στα επόμενα 12 μήνες.
Μожет να χρειαζόμαστε μια εντελώς νέα προσέγγιση· ή μπορεί να είναι ότι η Gaussian Splatting (GSplat), η οποία αναπτύχθηκε στις αρχές της δεκαετίας του ’90 και έχει πρόσφατα ξεκινήσει στον χώρο της σύνθεσης εικόνων, αντιπροσωπεύει μια πιθανή εναλλακτική λύση για τα μοντέλα βίντεο διάχυσης.
Αφού η GSplat χρειάστηκε 34 χρόνια για να αναδυθεί, είναι πιθανό ότι παλαιότεροι ανταγωνιστές όπως NeRF και GANs – και ακόμη και τα μοντέλα διάχυσης – είναι ακόμη να έχουν την ημέρα τους.
* Αν και η λειτουργία AI Storyboard του Kaiber προσφέρει αυτή τη λειτουργικότητα, τα αποτελέσματα που έχω δει δεν είναι παραγωγής ποιότητας.
Ο Martin Anderson είναι ο πρώην επικεφαλής του ερευνητικού περιεχομένου της metaphysic.ai
Πρώτη δημοσίευση Δευτέρα, 23 Σεπτεμβρίου 2024












