Η γωνία του Anderson

Προσθήκη Διαλόγου σε Πραγματικά Βίντεο με AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Montage of subjects from the demonstration video-clips for FacEDiT. Source: https://facedit.github.io/

Ένα νέο πλαίσιο AI μπορεί να ξαναγράψει, να αφαιρέσει ή να προσθέσει τα λόγια ενός ατόμου σε βίντεο χωρίς να χρειάζεται να ξαναγυρίσει, σε ένα ενιαίο σύστημα από άκρο σε άκρο.

 

Τρεις χρόνια πριν, το διαδίκτυο θα είχε εκπληχθεί από οποιοδήποτε ένα από τα 20-30 πλαίσια βίντεο-αλλοιωτικών AI που δημοσιεύονται σε ακαδημαϊκούς πόρους εβδομαδιαίως· όπως είναι, αυτό το δημοφιλές είδος έρευνας έχει τώρα γίνει τόσο πλούσιο ώστε να συνιστά σχεδόν ένα άλλο κλάδο του ‘AI Slop’, και καλύπτω πολύ λιγότερες από αυτές τις κυκλοφορίες από ό,τι θα έκανα δύο ή τρία χρόνια πριν.

Ωστόσο, μια τρέχουσα κυκλοφορία σε αυτή τη γραμμή έπιασε το μάτι μου· ένα ολοκληρωμένο σύστημα που μπορεί να παρέμβει σε πραγματικά βίντεο και να τοποθετήσει νέο λόγο στο υπάρχον βίντεο (αντί να δημιουργήσει ένα ολόκληρο γεννητικό κλιπ από ένα πρόσωπο ή κάδρα, το οποίο είναι πολύ πιο συνηθισμένο).

Στα παρακάτω παραδείγματα, τα οποία επεξεργάστηκα μαζί από πολλά δείγματα βίντεο που είναι διαθέσιμα στην ιστοσελίδα του έργου, βλέπουμε πρώτα το πραγματικό αρχικό κλιπ και στη συνέχεια, κάτω από αυτό, τον επιβαλλόμενο λόγο AI στη μέση του κλιπ, συμπεριλαμβανομένης της σύνθεσης φωνής και συγχρονισμού χειλιών·

Κάντε κλικ για αναπαραγωγή. Τοπική επεξεργασία με ραφή – μια από τις πολλές modalities που προσφέρονται από το FacEDiT. Παρακαλώ αναφερθείτε στην πηγή ιστοσελίδας για καλύτερη ανάλυση. Πηγή – https://facedit.github.io/

Αυτή η προσέγγιση είναι μια από τις τρεις που αναπτύχθηκαν για τη νέα μέθοδο, αυτή με τίτλο ‘τοπική επεξεργασία με ραφή’, και αυτή που ενδιαφέρει περισσότερο τους συγγραφείς (όπως και εμένα). Ουσιαστικά, το κλιπ επεκτείνεται χρησιμοποιώντας ένα από τα μεσαία кадρά ως σημείο εκκίνησης για νέα ερμηνεία AI, και το επόμενο (πραγματικό) кадρό ως στόχο που το γεννητικό κλιπ πρέπει να προσεγγίσει. Στα κλιπ που φαίνονται παραπάνω, αυτά τα ‘σπέρματα’ και ‘στόχοι’ кадρά είναι αντιπροσωπευμένα από το πάνω βίντεο που σταματάει ενώ το τροποποιημένο βίντεο κάτω από αυτό παρέχει γεννητική συμπλήρωση.

Οι συγγραφείς πλαισιώνουν αυτήν την προσέγγιση σύνθεσης προσώπου και φωνής ως την πρώτη πλήρως ολοκληρωμένη μέθοδο από άκρο σε άκρο για επεξεργασία βίντεο AI αυτού του είδους, παρατηρώντας το δυναμικό ενός πλήρως ανεπτυγμένου πλαισίου όπως αυτό για την παραγωγή τηλεόρασης και κινηματογράφου·

‘Οι σκηνοθέτες και οι παραγωγοί μέσων ενημέρωσης συχνά πρέπει να αναθεωρήσουν συγκεκριμένα μέρη των ηχογραφημένων βίντεο – ίσως ένα λόγο ήταν λανθασμένος ή το σενάριο άλλαξε μετά τη γύρισή του. Για παράδειγμα, στην εικονική σκηνή από Titanic (1997) όπου η Ρόζι λέει, “Δεν θα αφήσω ποτέ να φύγει, Τζακ,” ο σκηνοθέτης μπορεί να αποφασίσει αργότερα ότι πρέπει να είναι “Δεν θα ξεχάσω ποτέ εσένα, Τζακ”.

‘Παραδοσιακά, τέτοιες αλλαγές απαιτούν την επανάληψη της ολόκληρης σκηνής, η οποία είναι δαπανηρή και χρονοβόρα. Η σύνθεση προσώπου ομιλίας προσφέρει một πρακτική εναλλακτική λύση, αυτοματοποιώντας την τροποποίηση της κίνησης του προσώπου για να ταιριάζει με τον αναθεωρημένο λόγο, εξαλείφοντας την ανάγκη για επανάληψη.

Αν και οι παρεμβάσεις AI αυτού του είδους μπορεί να αντιμετωπίσουν πολιτιστικές ή βιομηχανικές αντιδράσεις, μπορεί επίσης να συνιστώνται ένα νέο είδος λειτουργικότητας σε συστήματα VFX και εργαλειοθήκες που οδηγούνται από ανθρώπους. Σε κάθε περίπτωση, για το παρόν, οι προκλήσεις είναι αυστηρά τεχνικές.

Εκτός από την επέκταση ενός κλιπ μέσω πρόσθετου διαλόγου AI, το νέο σύστημα μπορεί επίσης να τροποποιήσει τον υπάρχοντα λόγο·

Κάντε κλικ για αναπαραγωγή. Ένα παράδειγμα αλλαγής υπάρχοντος διαλόγου αντί να εισάγετε πρόσθετο διάλογο. Παρακαλώ αναφερθείτε στην πηγή ιστοσελίδας για καλύτερη ανάλυση.

Κατάσταση Τέχνης

Δεν υπάρχουν τώρα πλήρως ολοκληρωμένα συστήματα που προσφέρουν αυτήν την ικανότητα σύνθεσης· αν και ένας αυξανόμενος αριθμός πλατφορμών AI γεννητικών μπορεί να παράγει ήχο, και διάφορα άλλα πλαίσια μπορούν να δημιουργήσουν deepfaked ήχο, τώρα πρέπει να δημιουργηθεί ένα αρκετά περίπλοκο pipeline από διάφορα αρχιτεκτονικά και τεχνάσματα για να παρέμβει σε πραγματικά βίντεο με τον τρόπο που το νέο σύστημα – με τίτλο FacEDiT – μπορεί να επιτύχει.

Το σύστημα χρησιμοποιεί Diffusion Transformers (DiT) σε συνδυασμό με Flow Matching για να δημιουργήσει κίνηση προσώπου που προϋποθέτει τις περιβάλλουσες (περιεκτικές) κινήσεις και τον ήχο. Το σύστημα αξιοποιεί υπάρχοντα δημοφιλή πακέτα που ασχολούνται με την ανακατασκευή προσώπου, συμπεριλαμβανομένων LivePortrait (πρόσφατα αναλήφθηκε από την Kling).

Εκτός από αυτήν τη μέθοδο, δεδομένου ότι η προσέγγισή τους είναι η πρώτη που ολοκληρώνει αυτές τις προκλήσεις σε μια seule λύση, οι συγγραφείς έχουν δημιουργήσει ένα νέο benchmark με τίτλο FacEDiTBench, μαζί με beberapa εντελώς νέους μετρητές αξιολόγησης που είναι κατάλληλοι για αυτήν την πολύ συγκεκριμένη εργασία.

Το νέο έργο έχει τίτλο FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling, και προέρχεται από τέσσερις ερευνητές από το Pohang University of Science and Technology (POSTECH ), Korea Advanced Institute of Science & Technology (KAIST), και The University of Texas at Austin.

Μέθοδος

Το FacEDiT εκπαιδεύεται για να ανακατασκευάσει την κίνηση του προσώπου μαθαίνοντας πώς να συμπληρώσει τα λείπουντα μέρη της απόδοσης του ηθοποιού, με βάση την περιβάλλουσα κίνηση και τον ήχο. Όπως φαίνεται στο σχήμα παρακάτω, αυτή η διαδικασία επιτρέπει στο μοντέλο να λειτουργήσει ως gap-filler κατά τη διάρκεια της εκπαίδευσης, προβλέποντας κινήσεις προσώπου που ταιριάζουν με τη φωνή ενώ παραμένουν συνεπείς με το αρχικό βίντεο·

Επισκόπηση του συστήματος FacEDiT, που δείχνει πώς η κίνηση του προσώπου μαθαίνεται μέσω αυτο-επιβλεπόμενης συμπλήρωσης κατά τη διάρκεια της εκπαίδευσης, καθοδηγούμενη από τον επεξεργασμένο λόγο κατά την εύρεση, και τελικά αποδίδεται πίσω στο βίντεο με την επαναχρησιμοποίηση της εμφάνισης του αρχικού βίντεο, αντικαθιστώντας μόνο την προϋποθετημένη κίνηση.

Επισκόπηση του συστήματος FacEDiT, που δείχνει πώς η κίνηση του προσώπου μαθαίνεται μέσω αυτο-επιβλεπόμενης συμπλήρωσης κατά τη διάρκεια της εκπαίδευσης, καθοδηγούμενη από τον επεξεργασμένο λόγο κατά την εύρεση, και τελικά αποδίδεται πίσω στο βίντεο με την επαναχρησιμοποίηση της εμφάνισης του αρχικού βίντεο, αντικαθιστώντας μόνο την προϋποθετημένη κίνηση. Πηγή

Κατά τη διάρκεια της εύρεσης, η ίδια αρχιτεκτονική υποστηρίζει δύο διαφορετικά αποτελέσματα, ανάλογα με το πόσο του βίντεο είναι μασκαρεμένο· μερικές επεξεργασίες, όπου μόνο μια φράση αλλάζει και το υπόλοιπο παραμένει αμετάβλητο· ή πλήρης γεννήτρια πρότασης, όπου νέα κίνηση συνθέτει εντελώς από την αρχή.

Το μοντέλο εκπαιδεύεται μέσω flow matching, το οποίο αντιμετωπίζει τις επεξεργασίες βίντεο ως一种 είδους διαδρομή μεταξύ δύο εκδόσεων της κίνησης του προσώπου.

Αντί να μαθαίνει να μαντεύει πώς θα πρέπει να φαίνεται ένα επεξεργασμένο πρόσωπο από την αρχή, το flow matching μαθαίνει να κινείται σταδιακά και ομαλά μεταξύ ενός θορυβώδους αναπληρωτή και της σωστής κίνησης. Για να διευκολύνει αυτό, το σύστημα αντιπροσωπεύει την κίνηση του προσώπου ως ένα συμπαγές σύνολο αριθμών που εξάγονται από κάθε кадρό χρησιμοποιώντας μια έκδοση του προαναφερθέντος συστήματος LivePortrait (βλέπε σχήμα παραπάνω).

Αυτοί οι διανυσματικοί φορείς σχεδιάζονται για να περιγράψουν εκφράσεις και στάση κεφαλής χωρίς entangling ταυτότητα, ώστε οι αλλαγές λόγου να μπορούν να τοποθετηθούν χωρίς να επηρεάζουν την γενική εμφάνιση του ατόμου.

Εκπαίδευση FacEDiT

Για να εκπαιδευτεί το FacEDiT, κάθε κλιπ βίντεο χωρίστηκε σε μια σειρά από στιγμιότυπα κίνησης προσώπου, και κάθε кадρό ζευγαρώθηκε με το αντίστοιχο τμήμα ήχου. Τυχαία μέρη των δεδομένων κίνησης ήταν στη συνέχεια κρυμμένα, και το μοντέλο ζητήθηκε να μαντέψει πώς θα έπρεπε να φαίνονται αυτά τα λείπουντα κινήματα, χρησιμοποιώντας τόσο τον λόγο όσο και την περιβάλλουσα αμασκένη κίνηση ως контекст.

Επειδή τα μασκαρεμένα διαστήματα και οι θέσεις τους ποικίλλουν από ένα παράδειγμα εκπαίδευσης στο επόμενο, το μοντέλο μαθαίνει σταδιακά πώς να χειρίζεται τόσο μικρές εσωτερικές επεξεργασίες, όσο και μεγαλύτερες κενές, για πλήρη γεννήτρια πρότασης, ανάλογα με το πόσο πληροφορίες λαμβάνει.

Το Diffusion Transformer του συστήματος μαθαίνει να ανακτά μασκαρεμένη κίνηση βελτιώνοντας θορυβώδεις εισόδους με την πάροδο του χρόνου. Αντί να εισάγει τον λόγο και την κίνηση στο μοντέλο όλα μαζί, ο ήχος εισάγεται σε κάθε μπλοκ επεξεργασίας μέσω cross-attention, βοηθώντας το σύστημα να ταιριάζει τις κινήσεις των χειλιών με μεγαλύτερη ακρίβεια με τον ήχο.

Για να διατηρηθεί η πραγματικότητα σε όλες τις επεξεργασίες, η προσοχή είναι προκατειλημμένη προς τους γειτονικούς кадρούς παρά σε ολόκληρη τη χρονοσειρά, αναγκάζοντας το μοντέλο να επικεντρωθεί στην τοπική συνέχεια και να αποτρέψει τρεμόπαιγμα ή αλλαγές κίνησης στα σύνορα των τροποποιημένων περιοχών. Οι θέσεις των εμβυθών (οι οποίες λένε στο μοντέλο πού εμφανίζεται κάθε кадρός στη σειρά) βοηθούν επίσης το μοντέλο να διατηρήσει τη φυσική χρονολογική ροή και контекστ.

Κατά τη διάρκεια της εκπαίδευσης, το σύστημα μαθαίνει να προβλέπει λείπουντα κίνηση προσώπου ανακατασκευάζοντας μασκαρεμένα διαστήματα με βάση τον λόγο και την περιβάλλουσα αμασκένη κίνηση. Κατά τη διάρκεια της εύρεσης, η ίδια διαμόρφωση χρησιμοποιείται, αλλά με τα μασκαρεμένα τώρα καθοδηγούμενα από τις επεξεργασίες στο λόγο.

Όταν μια λέξη ή φράση εισάγεται, αφαιρείται ή αλλάζει, το σύστημα τοποθετεί την επηρεασμένη περιοχή, την μασκαρεύει και αναγεννά κίνηση που ταιριάζει με τον νέο ήχο. Η πλήρης γεννήτρια πρότασης αντιμετωπίζεται ως μια ειδική περίπτωση, όπου η ολόκληρη περιοχή μασκαρεύεται και συνθέτει από την αρχή.

Δεδομένα και Τεστ

Το σκελετό του συστήματος αποτελείται από 22 στρώματα για τον Diffusion Transformer, το καθένα με 16 κεφαλές προσοχής και διαστάσεις feedforward 1024 και 2024px. Οι χαρακτηριστικές κίνησης και εμφάνισης εξάγονται χρησιμοποιώντας παγωμένα στοιχεία του συστήματος LivePortrait, και ο ήχος κωδικοποιείται μέσω WavLM και τροποποιείται χρησιμοποιώντας VoiceCraft.

Ένας αφοσιωμένος προβολικός όρος χαρτογραφεί τις 786-διαστάσεις χαρακτηριστικές του ήχου στο.latent χώρο του DiT, με μόνο το DiT και τα προβολικά modules εκπαιδευμένα από την αρχή.

Η εκπαίδευση πραγματοποιήθηκε υπό τον AdamW βελτιστοποιητή με στόχο ρυθμό μάθησης 1e‑4, για 1 εκατομμύριο βήματα, σε δύο A6000 GPUs (καθένα με 48GB VRAM), σε συνολικό μέγεθος batch οκτώ.

FacEDiTBench

Η συλλογή δεδομένων FacEDiTBench περιέχει 250 παραδείγματα, το καθένα με ένα κλιπ βίντεο του αρχικού και επεξεργασμένου λόγου, και τις μεταγραφές και για τα δύο. Τα βίντεο προέρχονται από τρεις πηγές, με 100 κλιπ από HDTF, 100 από Hallo3, και 50 από CelebV-Dub. Κάθε ένα ελέγχθηκε χειροκίνητα για να επιβεβαιωθεί ότι τόσο ο ήχος όσο και το βίντεο ήταν αρκετά καθαρά για αξιολόγηση.

Το GPT‑4o χρησιμοποιήθηκε για να αναθεωρήσει κάθε μεταγραφή για να δημιουργήσει γραμματικά έγκυρες επεξεργασίες. Αυτές οι αναθεωρημένες μεταγραφές, μαζί με τον αρχικό λόγο,傳 fueron pasado στο VoiceCraft για να παράγουν νέο ήχο· και σε κάθε στάδιο, τόσο η μεταγραφή όσο και ο γεννημένος ήχος αξιολογήθηκαν χειροκίνητα για ποιότητα.

Κάθε δείγμα επισημαίνεται με τον τύπο της επεξεργασίας, τη χρονική στιγμή της αλλαγής, και το μήκος του τροποποιημένου διαστήματος, και οι επεξεργασίες ταξινομήθηκαν ως εισάγοντας, αφαιρώντας, ή αντικαθιστώντας. Ο αριθμός των λέξεων που άλλαξαν κυμαινόταν από σύντομες επεξεργασίες 1 έως 3 λέξεων, μεσαίες επεξεργασίες 4 έως 6 λέξεων, και μεγαλύτερες επεξεργασίες 7 έως 10 λέξεων.

Τρεις προσαρμοσμένοι μετρητές ορίστηκαν για να αξιολογήσουν την ποιότητα της επεξεργασίας. Φωτομετρική συνέχεια, για να μετρήσει πόσο καλά η φωτισμός και το χρώμα ενός επεξεργασμένου τμήματος συνδυάζονται με το περιβάλλων βίντεο, συγκρίνοντας διαφορές σε επίπεδο pixel στα σύνορα· κίνηση συνέχεια, για να αξιολογήσει τη συνέχεια της κίνησης του προσώπου, μετρώντας αλλαγές στην οπτική ροή σε επεξεργασμένα και μη επεξεργασμένα кадρά· και διατήρηση ταυτότητας, για να εκτιμήσει εάν η εμφάνιση του υποκειμένου παραμένει συνεπής μετά την επεξεργασία, συγκρίνοντας εμβυθώντα προσώπου από την αρχική και τη γεννημένη ακολουθία χρησιμοποιώντας το ArcFace μοντέλο αναγνώρισης προσώπου.

Τεστ

Το μοντέλο δοκιμής εκπαιδεύτηκε σε υλικό από τις τρεις ανωτέρω αναφερθείσες συλλογές δεδομένων, που συνολικά περιέχουν περίπου 200 ώρες βίντεο περιεχομένου, συμπεριλαμβανομένων vlogs και ταινιών, καθώς και υψηλής ανάλυσης βίντεο στο YouTube.

Για να αξιολογήσει την επεξεργασία προσώπου ομιλίας, χρησιμοποιήθηκε το FacEDiTBench, μαζί με το HDTF test split, το οποίο έχει γίνει ένα πρότυπο για αυτήν την σειρά εργασιών.

Επειδή δεν υπήρχαν άμεσα συγκρίσιμα συστήματα που μπορούσαν να ενσωματώσουν这一 είδους λειτουργικότητα από άκρο σε άκρο, οι συγγραφείς επέλεξαν μια ποικιλία από πλαίσια που αναπαράγουν τουλάχιστον κάποια από την στόχο λειτουργικότητα, και θα μπορούσαν να λειτουργήσουν ως βασικές γραμμές· συγκεκριμένα, KeyFace; EchoMimic; EchoMimicV2; Hallo; Hallo2; Hallo3; V-Express; AniPortrait; και SadTalker.

Διάφοροι καθιερωμένοι μετρητές χρησιμοποιήθηκαν επίσης για να αξιολογήσουν την ποιότητα της γεννήτριας και της επεξεργασίας, με την ακρίβεια συγχρονισμού χειλιών να αξιολογείται μέσω SyncNet, αναφέροντας τόσο τον απόλυτο σφάλμα μεταξύ κινήσεων χειλιών και ήχου (LSE-D) όσο και ένα βαθμό εμπιστοσύνης (LSE-C); Fréchet Video Distance (FVD) ποσοτικοποιώντας πόσο ρεαλιστικό φαίνεται το βίντεο στο σύνολό του· και Learned Perceptual Similarity Metrics (LPIPS), μετρώντας την αισθητηριακή ομοιότητα μεταξύ των γεννημένων και των αρχικών καδρών.

Για την επεξεργασία, όλοι οι μετρητές εκτός από το LPIPS εφαρμόστηκαν μόνο στο τροποποιημένο τμήμα· για τη γεννήτρια, ολόκληρο το βίντεο αξιολογήθηκε, με την συνέχεια των συνόρων εξαιρουμένης.

Κάθε μοντέλο ζητήθηκε να συνθέσει ένα ταιριαστό τμήμα βίντεο, το οποίο στη συνέχεια ενσωματώθηκε στο αρχικό κλιπ (οι ερευνητές σημειώνουν ότι αυτή η μέθοδος συχνά εισάγει ορατές ασυνέχειες, όπου το επεξεργασμένο τμήμα συναντά το περιβάλλων υλικό). Μια δεύτερη προσέγγιση επίσης δοκιμάστηκε, στην οποία ολόκληρο το βίντεο αναγεννήθηκε από τον τροποποιημένο ήχο – αλλά αυτό απέτυχε να διατηρήσει την αρχική απόδοση·

Σύγκριση της απόδοσης επεξεργασίας μεταξύ συστημάτων που σχεδιάστηκαν αρχικά για τη γεννήτρια προσώπου ομιλίας, με το FacEDiT να υπερέχει σε όλα τα βασικά μετρητές, επιτυγχάνοντας χαμηλότερο σφάλμα συγχρονισμού χειλιών (LSE-D), υψηλότερη εμπιστοσύνη συγχρονισμού (LSE-C), ισχυρότερη διατήρηση ταυτότητας (IDSIM), μεγαλύτερη αισθητηριακή ρεαλιστικότητα (FVD), και ομαλότερες μεταβάσεις через τα σύνορα επεξεργασίας (Pcontinuity, Mcontinuity). Οι στήλες με σκιάνωση υπογραμμίζουν τα κρίσιμα κριτήρια για την αξιολόγηση της ποιότητας των συνόρων· οι τολμηπές και υπογραμμισμένες τιμές δείχνουν τα καλύτερα και δεύτερα καλύτερα αποτελέσματα, αντίστοιχα

Σύγκριση της απόδοσης επεξεργασίας μεταξύ συστημάτων που σχεδιάστηκαν αρχικά για τη γεννήτρια προσώπου ομιλίας, με το FacEDiT να υπερέχει σε όλα τα βασικά μετρητές, επιτυγχάνοντας χαμηλότερο σφάλμα συγχρονισμού χειλιών (LSE-D), υψηλότερη εμπιστοσύνη συγχρονισμού (LSE-C), ισχυρότερη διατήρηση ταυτότητας (IDSIM), μεγαλύτερη αισθητηριακή ρεαλιστικότητα (FVD), και ομαλότερες μεταβάσεις через τα σύνορα επεξεργασίας (Pcontinuity, Mcontinuity). Οι στήλες με σκιάνωση υπογραμμίζουν τα κρίσιμα κριτήρια για την αξιολόγηση της ποιότητας των συνόρων· οι τολμηπές και υπογραμμισμένες τιμές δείχνουν τα καλύτερα και δεύτερα καλύτερα αποτελέσματα, αντίστοιχα

Σχετικά με αυτά τα αποτελέσματα, οι συγγραφείς σχολιάζουν·

‘Το μοντέλο μας υπερέχει σημαντικά τις υφιστάμενες μεθόδους στην εργασία επεξεργασίας. Επιτυγχάνει ισχυρή συνέχεια συνόρων και υψηλή διατήρηση ταυτότητας, αποδεικνύοντας την ικανότητά του να διατηρεί τη χρονολογική και οπτική συνέχεια κατά την επεξεργασία. Επιπλέον, η υπεροχή του στη ακρίβεια συγχρονισμού χειλιών και η χαμηλή τιμή FVD αντανακλούν τη ρεαλιστικότητα του συνθετικού βίντεο.’

Κάντε κλικ για αναπαραγωγή. Αποτελέσματα, συναρμολογημένα από τον συγγραφέα από τα δημοσιευμένα βίντεο στην υποστηρικτική ιστοσελίδα του έργου. Παρακαλώ αναφερθείτε στην πηγή ιστοσελίδας για καλύτερη ανάλυση.

Επιπλέον, μια μελέτη ανθρώπων διεξήχθη για να αξιολογήσει την αντιλαμβανόμενη ποιότητα τόσο στην επεξεργασία όσο και στη γεννήτρια.

Για κάθε σύγκριση, οι συμμετέχοντες έβλεπαν έξι βίντεο και τα κατηγοριοποιούσαν με βάση την tổngική ποιότητα, λαμβάνοντας υπόψη την ακρίβεια συγχρονισμού χειλιών, τη φυσικότητα και τη ρεαλιστικότητα της κίνησης κεφαλής· στις δοκιμές επεξεργασίας, οι συμμετέχοντες επίσης αξιολόγησαν την ομαλότητα των μεταβάσεων μεταξύ των επεξεργασμένων και μη επεξεργασμένων τμημάτων·

Μέσες βαθμολογίες που ανατέθηκαν από τους ανθρώπινους αξιολογητές, όπου το χαμηλότερο σημαίνει καλύτερο. Στην επεξεργασία και τη γεννήτρια, οι συμμετέχοντες αξιολόγησαν πόσο φυσικό και συγχρονισμένο φαίνονταν τα βίντεο. Για την επεξεργασία, επίσης αξιολόγησαν πόσο ομαλή ήταν η μετάβαση μεταξύ των επεξεργασμένων και μη επεξεργασμένων τμημάτων. Οι τολμηπές και υπογραμμισμένες αριθμοί δείχνουν τις δύο καλύτερες βαθμολογίες.

Μέσες βαθμολογίες που ανατέθηκαν από τους ανθρώπινους αξιολογητές, όπου το χαμηλότερο σημαίνει καλύτερο. Στην επεξεργασία και τη γεννήτρια, οι συμμετέχοντες αξιολόγησαν πόσο φυσικό και συγχρονισμένο φαίνονταν τα βίντεο. Για την επεξεργασία, επίσης αξιολόγησαν πόσο ομαλή ήταν η μετάβαση μεταξύ των επεξεργασμένων και μη επεξεργασμένων τμημάτων. Οι τολμηπές και υπογραμμισμένες αριθμοί δείχνουν τις δύο καλύτερες βαθμολογίες.

Στη μελέτη, το FacEDiT κατατάχθηκε συνεχώς υψηλότερα από τους ανθρώπινους αξιολογητές με μια σαφή προβάδισμα, τόσο για την ποιότητα επεξεργασίας όσο και για την ομαλότητα της μετάβασης, και επίσης έλαβε ισχυρές βαθμολογίες στη γεννήτρια, υποδεικνύοντας ότι τα μετρούμενα πλεονεκτήματά του μεταφράζονται σε αντιλαμβανόμενες προτιμήσεις.

Λόγω έλλειψης χώρου, παραπέμπουμε τον αναγνώστη στην πηγή εργασία για περαιτέρω λεπτομέρειες των μελετών αφαίρεσης και των πρόσθετων δοκιμών που διεξήχθησαν και αναφέρθηκαν στην νέα εργασία. Στην πραγματικότητα, πρωτοποριακές ερευνητικές προτάσεις αυτού του είδους αγωνίζονται να παράγουν σημαντικά αποτελέσματα σε τμήματα δοκιμών,既然 το βασικό προσφέρον είναι αναπόφευκτα μια πιθανή βάση για μεταγενέστερη εργασία.

Συμπέρασμα

Ακόμη και για την εύρεση, συστήματα όπως αυτό μπορεί να απαιτούν σημαντικούς υπολογιστικούς πόρους κατά τη διάρκεια της εύρεσης, καθιστώντας δύσκολο για τους τελικούς χρήστες – εδώ, προφανώς, εργαστήρια VFX – να διατηρήσουν το έργο σε τοπικούς πόρους. Έτσι, οι προσεγγίσεις που μπορούν να προσαρμοστούν σε πραγματικούς τοπικούς πόρους θα είναι πάντα προτιμότερες από τους παρόχους, οι οποίοι είναι υπό νομική υποχρέωση να προστατεύουν το υλικό και την γενική πνευματική ιδιοκτησία των πελατών τους.

Αυτό δεν σημαίνει να κριτικάρω την νέα προσφορά, η οποία μπορεί να λειτουργήσει τέλεια υπό quantized βάρη ή άλλες βελτιώσεις, και η οποία είναι η πρώτη προσφορά του είδους που με ελκύει πίσω σε αυτήν την οδό της έρευνας σε khá πολύ καιρό.

 

Δημοσιεύθηκε για πρώτη φορά την Τετάρτη, 17 Δεκεμβρίου, 202. Επεξεργάστηκε στις 20.10 EET, την ίδια μέρα, για επιπλέον χώρο στο πρώτο σώμα παραγράφου.

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]