Η γωνία του Anderson

Ο δρόμος προς καλύτερη επεξεργασία βίντεο με AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

Ο ερευνητικός τομέας της σύνθεσης βίντεο και εικόνας παρουσιάζει τακτικά αρχιτεκτονικές επεξεργασίας βίντεο και, τους τελευταίους εννέα μήνες, τέτοιες προσεγγίσεις εμφανίζονται ακόμη συχνότερα. Ωστόσο, οι περισσότερες αντιπροσωπεύουν μόνο σταδιακές βελτιώσεις σε σχέση με την τρέχουσα τεχνολογία, καθώς οι βασικές προκλήσεις παραμένουν σημαντικές.

Ωστόσο, μια νέα συνεργασία μεταξύ Κίνας και Ιαπωνίας αυτή την εβδομάδα έχει παραγάγει κάποια παραδείγματα που αξίζει να εξεταστούν πιο στενά, ακόμη και αν δεν είναι απαραίτητα ένα ορόσημο έργο.

Στο παρακάτω απόσπασμα βίντεο (από τον ιστότοπο του έργου, ο οποίος ενδέχεται να επιβαρύνει τον browser σας) βλέπουμε ότι, παρόλο που το σύστημα δεν διαθέτει δυνατότητες deepfake στην τρέχουσα διαμόρφωσή του, μεταβάλλει με πειστικό και ουσιαστικό τρόπο την ταυτότητα της νεαρής γυναίκας στην εικόνα, με βάση μια μάσκα βίντεο (κάτω αριστερά):

Κάντε κλικ για αναπαραγωγή. Με βάση τη μάσκα σημασιολογικής τμηματοποίησης που εμφανίζεται κάτω αριστερά, η αρχική γυναίκα (πάνω αριστερά) μετατρέπεται σε μια αισθητά διαφορετική ταυτότητα, παρόλο που η διαδικασία δεν επιτυγχάνει την ανταλλαγή ταυτότητας που υποδεικνύεται στην προτροπή. Πηγή: https://yxbian23.github.io/project/video-painter/ (Σημειώστε ότι, κατά τη συγγραφή, ο ιστότοπος με την αυτόματη αναπαραγωγή και τα πολλά βίντεο είχε την τάση να προκαλεί διακοπή λειτουργίας του browser.) Για καλύτερη ανάλυση και περισσότερες λεπτομέρειες, ανατρέξτε στα πρωτότυπα βίντεο, εφόσον είναι διαθέσιμα, ή στα παραδείγματα του βίντεο επισκόπησης του έργου: https://www.youtube.com/watch?v=HYzNfsD3A0s

Η επεξεργασία με μάσκες αυτού του είδους είναι καθιερωμένη στα στατικά μοντέλα λανθάνουσας διάχυσης, με εργαλεία όπως το ControlNet. Ωστόσο, η διατήρηση της συνέπειας του φόντου στο βίντεο είναι πολύ δυσκολότερη, ακόμη και όταν οι περιοχές της μάσκας προσφέρουν δημιουργική ευελιξία στο μοντέλο, όπως φαίνεται παρακάτω:

Κάντε κλικ για αναπαραγωγή. Μια αλλαγή είδους, με τη νέα μέθοδο VideoPainter. Παρακαλούμε να αναφερθείτε στα πηγαία βίντεο, αν μπορείτε να τα αποκτήσετε, για καλύτερη ανάλυση και λεπτομέρεια, ή να ελέγξετε τα παραδείγματα στο βίντεο επισκόπησης του έργου στο https://www.youtube.com/watch?v=HYzNfsD3A0s

Οι συγγραφείς εξετάζουν τη μέθοδό τους σε σχέση τόσο με την αρχιτεκτονική BrushNet της Tencent (την οποία παρουσιάσαμε πέρυσι) όσο και με το ControlNet. Και οι δύο χρησιμοποιούν αρχιτεκτονική διπλού κλάδου, ικανή να διαχωρίζει τη διατήρηση του φόντου από τη δημιουργία του προσκηνίου.

Ωστόσο, η άμεση εφαρμογή αυτής της μεθόδου στην ιδιαίτερα παραγωγική προσέγγιση Diffusion Transformer (DiT), που προτάθηκε με το Sora της OpenAI, δημιουργεί ιδιαίτερες προκλήσεις, όπως σημειώνουν οι συγγραφείς:

«Η άμεση εφαρμογή της αρχιτεκτονικής των BrushNet και ControlNet σε video DiT παρουσιάζει αρκετές προκλήσεις. Πρώτον, δεδομένων της ισχυρής παραγωγικής βάσης και του μεγάλου μεγέθους του Video DiT, η αντιγραφή ολόκληρου ή του μισού κορμού του Video DiT ως κωδικοποιητή περιβάλλοντος θα ήταν περιττή και υπολογιστικά απαγορευτική.»

«Δεύτερον, σε αντίθεση με τον αμιγώς συνελικτικό κλάδο ελέγχου του BrushNet, τα token του DiT στις καλυμμένες περιοχές περιέχουν εγγενώς πληροφορίες φόντου λόγω της καθολικής προσοχής, γεγονός που δυσκολεύει τη διάκριση μεταξύ καλυμμένων και μη καλυμμένων περιοχών στους κορμούς DiT.»

«Τέλος, το ControlNet δεν εισάγει χαρακτηριστικά σε όλα τα επίπεδα, περιορίζοντας τον πυκνό έλεγχο του φόντου στις εργασίες inpainting.»

Επομένως, οι ερευνητές έχουν αναπτύξει μια προσέγγιση plug-and-play με τη μορφή ενός διπλού-κλάδου πλαισίου με τίτλο VideoPainter.

Το VideoPainter προσφέρει ένα πλαίσιο inpainting βίντεο διπλού κλάδου, το οποίο ενισχύει τα προεκπαιδευμένα DiT με έναν ελαφρύ κωδικοποιητή περιβάλλοντος. Ο κωδικοποιητής αντιστοιχεί μόλις στο 6% των παραμέτρων του κορμού, κάτι που, σύμφωνα με τους συγγραφείς, καθιστά την προσέγγιση αποδοτικότερη από τις συμβατικές μεθόδους.

Το μοντέλο προτείνει τρεις βασικές καινοτομίες: έναν απλοποιημένο κωδικοποιητή περιβάλλοντος δύο επιπέδων για αποτελεσματική καθοδήγηση του φόντου, ένα σύστημα επιλεκτικής ενσωμάτωσης χαρακτηριστικών που διαχωρίζει τα token καλυμμένων και μη καλυμμένων περιοχών και μια τεχνική επαναδειγματοληψίας της ταυτότητας της περιοχής inpainting, η οποία διατηρεί τη συνέπεια της ταυτότητας σε μεγάλες ακολουθίες βίντεο.

Παγώνοντας τόσο το προεκπαιδευμένο DiT όσο και τον κωδικοποιητή περιβάλλοντος και εισάγοντας έναν ID-Adapter, το VideoPainter διασφαλίζει ότι τα token των περιοχών inpainting από προηγούμενα κλιπ διατηρούνται σε όλο το βίντεο, περιορίζοντας το τρεμόπαιγμα και τις ασυνέπειες.

Το πλαίσιο έχει επίσης σχεδιαστεί για συμβατότητα plug-and-play, ώστε να ενσωματώνεται απρόσκοπτα σε υπάρχουσες ροές δημιουργίας και επεξεργασίας βίντεο.

Για να υποστηρίξουν το έργο, το οποίο χρησιμοποιεί το CogVideo-5B-I2V ως παραγωγική μηχανή, οι συγγραφείς δημιούργησαν, όπως αναφέρουν, το μεγαλύτερο έως σήμερα σύνολο δεδομένων για inpainting βίντεο. Η συλλογή VPData περιλαμβάνει περισσότερα από 390.000 κλιπ, συνολικής διάρκειας άνω των 886 ωρών. Ανέπτυξαν επίσης το σχετικό πλαίσιο αξιολόγησης VPBench.

Κάντε κλικ για αναπαραγωγή. Στα παραδείγματα του ιστότοπου του έργου βλέπουμε τις δυνατότητες τμηματοποίησης που υποστηρίζονται από τη συλλογή VPData και τη σουίτα δοκιμών VPBench. Για καλύτερη ανάλυση και περισσότερες λεπτομέρειες, ανατρέξτε στα πρωτότυπα βίντεο, εφόσον είναι διαθέσιμα, ή στα παραδείγματα του βίντεο επισκόπησης του έργου: https://www.youtube.com/watch?v=HYzNfsD3A0s

Το νέο έργο έχει τίτλο VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control, και προέρχεται από επτά συγγραφείς στο Tencent ARC Lab, το Chinese University of Hong Kong, το University of Tokyo, και το University of Macau.

Εκτός από τον ιστότοπο του έργου, οι συγγραφείς έχουν επίσης κυκλοφορήσει μια πιο προσιτή επισκόπηση στο YouTube, καθώς και μια σελίδα στο Hugging Face.

Μέθοδος

Η διαδικασία δημιουργίας της VPData περιλαμβάνει συλλογή, επισημείωση, διαχωρισμό, επιλογή και δημιουργία λεζαντών:

Σχήμα της διαδικασίας δημιουργίας του συνόλου δεδομένων. Πηγή: https://arxiv.org/pdf/2503.05639

Σχήμα της διαδικασίας δημιουργίας του συνόλου δεδομένων. Πηγή: https://arxiv.org/pdf/2503.05639

Οι πηγαίες συλλογές που χρησιμοποιήθηκαν για αυτήν τη συλλογή προήλθαν από Videvo και Pexels, με μια αρχική συλλογή περίπου 450.000 βίντεο.

Στο στάδιο της προεπεξεργασίας χρησιμοποιήθηκαν πολλές βιβλιοθήκες και μέθοδοι: το πλαίσιο Recognize Anything παρείχε επισημείωση βίντεο ανοικτού συνόλου για τον εντοπισμό των κύριων αντικειμένων, το Grounding Dino εντόπισε τα πλαίσια οριοθέτησης γύρω από αυτά και το πλαίσιο Segment Anything Model 2 (SAM 2) μετέτρεψε τις αδρές επιλογές σε μάσκες τμηματοποίησης υψηλής ποιότητας.

Για τη διαχείριση των μεταβάσεων μεταξύ σκηνών και τη διατήρηση της συνέπειας στο inpainting βίντεο, το VideoPainter χρησιμοποιεί το PySceneDetect, το οποίο εντοπίζει και χωρίζει τα κλιπ σε φυσικά σημεία αλλαγής, αποφεύγοντας τις απότομες μετατοπίσεις που συχνά προκύπτουν όταν το ίδιο αντικείμενο παρακολουθείται από διαφορετικές γωνίες. Τα κλιπ χωρίστηκαν σε τμήματα δέκα δευτερολέπτων και όσα είχαν διάρκεια μικρότερη των έξι δευτερολέπτων απορρίφθηκαν.

Για την επιλογή των δεδομένων εφαρμόστηκαν τρία κριτήρια φιλτραρίσματος: αισθητική ποιότητα, η οποία αξιολογήθηκε με το Laion-Aesthetic Score Predictor, ένταση κίνησης, η οποία μετρήθηκε μέσω οπτικής ροής με το RAFT, και ασφάλεια περιεχομένου, η οποία επαληθεύτηκε με το Safety Checker του Stable Diffusion.

Ένας σημαντικός περιορισμός των υπαρχόντων συνόλων δεδομένων τμηματοποίησης βίντεο είναι η έλλειψη λεπτομερών κειμενικών επισημειώσεων, οι οποίες είναι απαραίτητες για την καθοδήγηση των παραγωγικών μοντέλων:

Οι ερευνητές τονίζουν την έλλειψη video-λεζάντων σε συγκρίσιμες συλλογές.

Οι ερευνητές τονίζουν την έλλειψη video-λεζάντων σε συγκρίσιμες συλλογές.

Γι’ αυτό, η διαδικασία επιμέλειας δεδομένων του VideoPainter αξιοποιεί διάφορα κορυφαία μοντέλα όρασης και γλώσσας, μεταξύ των οποίων το CogVLM2 και το ChatGPT-4o, για τη δημιουργία λεζαντών από βασικά καρέ και λεπτομερών περιγραφών των καλυμμένων περιοχών.

Το VideoPainter ενισχύει τα προεκπαιδευμένα DiT εισάγοντας έναν προσαρμοσμένο, ελαφρύ κωδικοποιητή περιβάλλοντος, ο οποίος διαχωρίζει την εξαγωγή του περιβάλλοντος φόντου από τη δημιουργία του προσκηνίου, όπως φαίνεται επάνω δεξιά στο ακόλουθο διάγραμμα:

Εννοιολογικό διάγραμμα του VideoPainter. Ο κωδικοποιητής περιβάλλοντος επεξεργάζεται θορυβώδεις λανθάνουσες αναπαραστάσεις, μάσκες μειωμένης ανάλυσης και λανθάνουσες αναπαραστάσεις καλυμμένου βίντεο μέσω VAE, ενσωματώνοντας μόνο token φόντου στο προεκπαιδευμένο DiT. Ο ID Resample Adapter διατηρεί τη συνέπεια της ταυτότητας μεταξύ των κλιπ.

Εννοιολογικό διάγραμμα του VideoPainter. Ο κωδικοποιητής περιβάλλοντος διαχωρίζει την επεξεργασία του φόντου, ενώ ο ID Resample Adapter διατηρεί τη συνέπεια της ταυτότητας μεταξύ των κλιπ.

Αντί να επιβαρύνει τον κορμό με περιττή επεξεργασία, ο κωδικοποιητής λειτουργεί με μια απλοποιημένη είσοδο: συνδυασμό θορυβώδους λανθάνουσας αναπαράστασης, λανθάνουσας αναπαράστασης καλυμμένου βίντεο (που εξάγεται μέσω ενός μεταβλητού αυτοκωδικοποιητή, ή VAE) και μασκών μειωμένης ανάλυσης.

Η θορυβώδης λανθάνουσα αναπαράσταση παρέχει το περιβάλλον δημιουργίας, ενώ η λανθάνουσα αναπαράσταση του καλυμμένου βίντεο ευθυγραμμίζεται με την υπάρχουσα κατανομή του DiT, βελτιώνοντας τη συμβατότητα.

Αντί να αντιγράφει μεγάλα τμήματα του μοντέλου, όπως συνέβαινε σύμφωνα με τους συγγραφείς σε προηγούμενες εργασίες, το VideoPainter ενσωματώνει μόνο τα δύο πρώτα επίπεδα του DiT. Τα εξαγόμενα χαρακτηριστικά επανεισάγονται στο παγωμένο DiT με δομημένο τρόπο ανά ομάδες: τα χαρακτηριστικά των πρώτων επιπέδων ενημερώνουν το πρώτο μισό του μοντέλου, ενώ τα μεταγενέστερα βελτιώνουν το δεύτερο μισό.

Επιπλέον, ένας μηχανισμός επιλεκτικής χρήσης token διασφαλίζει ότι επανενσωματώνονται μόνο χαρακτηριστικά που σχετίζονται με το φόντο, αποτρέποντας τη σύγχυση μεταξύ καλυμμένων και μη καλυμμένων περιοχών. Σύμφωνα με τους συγγραφείς, έτσι το VideoPainter διατηρεί το φόντο με υψηλή πιστότητα και βελτιώνει παράλληλα την αποδοτικότητα του inpainting στο προσκήνιο.

Οι συγγραφείς σημειώνουν ότι η μέθοδός τους υποστηρίζει διάφορες τεχνικές στιλιζαρίσματος, συμπεριλαμβανομένης της δημοφιλούς Low Rank Adaptation (LoRA).

Δεδομένα και Δοκιμές

Το VideoPainter εκπαιδεύτηκε με το μοντέλο CogVideo-5B-I2V και το αντίστοιχο μοντέλο μετατροπής κειμένου σε βίντεο. Η επιμελημένη συλλογή VPData χρησιμοποιήθηκε σε ανάλυση 480 × 720 px, με ρυθμό μάθησης 1 × 10-5.

Ο ID Resample Adapter εκπαιδεύτηκε για 2.000 βήματα και ο κωδικοποιητής περιβάλλοντος για 80.000 βήματα, με τον βελτιστοποιητή AdamW. Η εκπαίδευση πραγματοποιήθηκε σε δύο στάδια με 64 GPU NVIDIA V100, αν και η εργασία δεν διευκρινίζει αν διέθεταν 16 ή 32 GB VRAM.

Για την αξιολόγηση, το Davis χρησιμοποιήθηκε για τυχαίες μάσκες και το VPBench των συγγραφέων για μάσκες τμηματοποίησης.

Το σύνολο δεδομένων VPBench περιλαμβάνει αντικείμενα, ζώα, ανθρώπους, τοπία και ποικίλες εργασίες και καλύπτει τέσσερις ενέργειες: προσθήκη, αφαίρεση, αλλαγή και ανταλλαγή. Η συλλογή περιλαμβάνει 45 βίντεο διάρκειας έξι δευτερολέπτων και εννέα βίντεο μέσης διάρκειας 30 δευτερολέπτων.

Χρησιμοποιήθηκαν οκτώ μετρικές. Για τη διατήρηση των καλυμμένων περιοχών, οι συγγραφείς χρησιμοποίησαν τον λόγο κορυφής σήματος προς θόρυβο (PSNR), τη μετρική μαθημένης αντιληπτικής ομοιότητας (LPIPS), τον δείκτη δομικής ομοιότητας (SSIM) και το μέσο απόλυτο σφάλμα (MAE).

Για την ευθυγράμμιση με το κείμενο, οι ερευνητές χρησιμοποίησαν τη CLIP Similarity τόσο για την αξιολόγηση της σημασιολογικής απόστασης μεταξύ της λεζάντας ενός κλιπ και του αντιληπτού περιεχομένου του όσο και για την αξιολόγηση της ακρίβειας των καλυμμένων περιοχών.

Για την αξιολόγηση της συνολικής ποιότητας των παραγόμενων βίντεο χρησιμοποιήθηκε η Fréchet Video Distance (FVD).

Για την ποσοτική σύγκριση του inpainting βίντεο, οι συγγραφείς συνέκριναν το σύστημά τους με τις προηγούμενες προσεγγίσεις ProPainter, COCOCO και Cog-Inp (CogVideoX). Η δοκιμή περιλάμβανε inpainting στο πρώτο καρέ ενός κλιπ με μοντέλα inpainting εικόνας και στη συνέχεια χρήση ενός κορμού μετατροπής εικόνας σε βίντεο (I2V) για τη διάδοση των αποτελεσμάτων μέσω ανάμειξης λανθανουσών αναπαραστάσεων, σύμφωνα με μέθοδο που προτάθηκε σε εργασία του 2023 από το Ισραήλ.

Καθώς ο ιστότοπος του έργου δεν είναι πλήρως λειτουργικός την ώρα της γραφής, και καθώς το βίντεο του έργου στο YouTube μπορεί να μην περιλαμβάνει όλα τα παραδείγματα που συμπεριλαμβάνονται στον ιστότοπο του έργου, είναι κάπως δύσκολο να βρεθούν βίντεο παραδείγματα που είναι πολύ συγκεκριμένα για τα αποτελέσματα που περιγράφονται στην εργασία. Επομένως, θα δείξουμε μερικά στατικά αποτελέσματα που εμφανίζονται στην εργασία, και θα κλείσουμε το άρθρο με κάποια επιπλέον βίντεο παραδείγματα που κατόρθωσα να εξαγάγω από τον ιστότοπο του έργου.

Ποσοτική σύγκριση του VideoPainter με ProPainter, COCOCO, και Cog-Inp στο VPBench (μάσκες διαίρεσης) και Davis (τυχαίες μάσκες). Μετρικές καλύπτουν τη διατήρηση περιοχών μάσκας, την ευθυγράμμιση κειμένου, και την ποιότητα βίντεο. Κόκκινο = καλύτερο, Μπλε = δεύτερο καλύτερο.

Ποσοτική σύγκριση του VideoPainter με ProPainter, COCOCO, και Cog-Inp στο VPBench (μάσκες διαίρεσης) και Davis (τυχαίες μάσκες). Μετρικές καλύπτουν τη διατήρηση περιοχών μάσκας, την ευθυγράμμιση κειμένου, και την ποιότητα βίντεο. Κόκκινο = καλύτερο, Μπλε = δεύτερο καλύτερο.

Από αυτά τα ποιοτικά αποτελέσματα, οι συγγραφείς σχολιάζουν:

«Στο VPBench με μάσκες τμηματοποίησης, τα ProPainter και COCOCO παρουσιάζουν τη χειρότερη επίδοση στις περισσότερες μετρικές, κυρίως επειδή το πρώτο δεν μπορεί να συμπληρώσει πλήρως καλυμμένα αντικείμενα και η αρχιτεκτονική ενός κλάδου του δεύτερου δυσκολεύεται να εξισορροπήσει τη διατήρηση του φόντου με τη δημιουργία του προσκηνίου.»

«Στο Davis με τυχαίες μάσκες, το ProPainter βελτιώνεται αξιοποιώντας μερικές πληροφορίες φόντου. Ωστόσο, το VideoPainter επιτυγχάνει την καλύτερη επίδοση τόσο στις μάσκες τμηματοποίησης —για βίντεο τυπικής και μεγάλης διάρκειας— όσο και στις τυχαίες μάσκες, χάρη στην αρχιτεκτονική διπλού κλάδου που διαχωρίζει αποτελεσματικά τη διατήρηση του φόντου από τη δημιουργία του προσκηνίου.»

Οι συγγραφείς παρουσιάζουν στατικά παραδείγματα ποιοτικών δοκιμών, από τα οποία εμφανίζουμε μια επιλογή παρακάτω. Σε όλες τις περιπτώσεις, παρακαλούμε να αναφερθείτε στον ιστότοπο του έργου και στο βίντεο του YouTube για καλύτερη ανάλυση.

Μια σύγκριση με μεθόδους inpainting σε προηγούμενα πλαισια.

Μια σύγκριση με μεθόδους inpainting σε προηγούμενα πλαισια.

 

Κάντε κλικ για αναπαραγωγή. Παραδείγματα που συγχωνεύθηκαν από εμάς από τα ‘results’ βίντεο στον ιστότοπο του έργου.

Σχετικά με αυτόν τον ποιοτικό γύρο αξιολόγησης του inpainting βίντεο, οι συγγραφείς σχολιάζουν:

«Το VideoPainter παρουσιάζει σταθερά εξαιρετικά αποτελέσματα ως προς τη συνοχή και την ποιότητα του βίντεο, καθώς και την ευθυγράμμιση με τη λεζάντα. Το ProPainter, ειδικότερα, αδυνατεί να δημιουργήσει πλήρως καλυμμένα αντικείμενα, επειδή βασίζεται μόνο στη διάδοση των pixel του φόντου και όχι στη δημιουργία νέου περιεχομένου.»

«Παρότι το COCOCO προσφέρει βασική λειτουργικότητα, δεν διατηρεί συνεπή ταυτότητα στις περιοχές inpainting —με ασυνεπείς εμφανίσεις σκαφών και απότομες αλλαγές εδάφους— επειδή η αρχιτεκτονική ενός κλάδου προσπαθεί να εξισορροπήσει τη διατήρηση του φόντου με τη δημιουργία του προσκηνίου.»

«Το Cog-Inp επιτυγχάνει βασικά αποτελέσματα inpainting. Ωστόσο, η αδυναμία της λειτουργίας ανάμειξης να εντοπίσει τα όρια της μάσκας οδηγεί σε σημαντικά οπτικά τεχνουργήματα.»

«Επιπλέον, το VideoPainter μπορεί να δημιουργήσει συνεκτικά βίντεο διάρκειας άνω του ενός λεπτού, διατηρώντας τη συνέπεια της ταυτότητας μέσω της επαναδειγματοληψίας ID.»

Οι ερευνητές δοκίμασαν επίσης την ικανότητα του VideoPainter να εμπλουτίζει τις λεζάντες και να βελτιώνει έτσι τα αποτελέσματα, συγκρίνοντας το σύστημα με τα UniEdit, DiTCtrl και ReVideo.

Αποτελέσματα επεξεργασίας βίντεο ενάντια σε τρεις προηγούμενες προσεγγίσεις.

Αποτελέσματα επεξεργασίας βίντεο ενάντια σε τρεις προηγούμενες προσεγγίσεις.

Οι συγγραφείς σχολιάζουν:

«Τόσο στα βίντεο τυπικής όσο και μεγάλης διάρκειας του VPBench, το VideoPainter επιτυγχάνει ανώτερη επίδοση, ξεπερνώντας ακόμη και το end-to-end ReVideo. Η επιτυχία οφείλεται στην αρχιτεκτονική διπλού κλάδου, η οποία συνδυάζει εξαιρετική διατήρηση του φόντου και δημιουργία του προσκηνίου, διατηρεί υψηλή πιστότητα στις μη επεξεργασμένες περιοχές και ευθυγραμμίζει τις επεξεργασμένες περιοχές με τις οδηγίες. Η επαναδειγματοληψία της ταυτότητας της περιοχής inpainting διατηρεί επίσης τη συνέπεια της ταυτότητας στα βίντεο μεγάλης διάρκειας.»

Παρότι η εργασία περιλαμβάνει στατικά ποιοτικά παραδείγματα για αυτή τη μετρική, δεν είναι ιδιαίτερα διαφωτιστικά. Για τον λόγο αυτό, παραπέμπουμε στα ποικίλα παραδείγματα των βίντεο που δημοσιεύτηκαν για το έργο.

Τέλος, πραγματοποιήθηκε μελέτη χρηστών, στην οποία τριάντα άτομα αξιολόγησαν 50 τυχαία επιλεγμένα αποτελέσματα από τα υποσύνολα VPBench και επεξεργασίας. Η αξιολόγηση επικεντρώθηκε στη διατήρηση του φόντου, την ευθυγράμμιση με την προτροπή και τη συνολική ποιότητα του βίντεο.

Αποτελέσματα από τη μελέτη χρηστών για το VideoPainter.

Αποτελέσματα από τη μελέτη χρηστών για το VideoPainter.

Οι συγγραφείς δηλώνουν:

«Το VideoPainter ξεπέρασε σημαντικά τις υπάρχουσες μεθόδους αναφοράς, επιτυγχάνοντας υψηλότερα ποσοστά προτίμησης σε όλα τα κριτήρια αξιολόγησης και στις δύο εργασίες.»

Παραδέχονται, ωστόσο, ότι η ποιότητα των αποτελεσμάτων του VideoPainter εξαρτάται από το βασικό μοντέλο, το οποίο μπορεί να δυσκολεύεται με σύνθετη κίνηση και φυσική. Παρατηρούν επίσης ότι η απόδοση υποβαθμίζεται όταν οι μάσκες είναι χαμηλής ποιότητας ή οι λεζάντες δεν είναι σωστά ευθυγραμμισμένες.

Συμπέρασμα

Το VideoPainter φαίνεται να αποτελεί αξιόλογη προσθήκη στη βιβλιογραφία. Όπως συμβαίνει με πολλές πρόσφατες λύσεις, έχει σημαντικές υπολογιστικές απαιτήσεις. Επιπλέον, αρκετά από τα παραδείγματα που επιλέχθηκαν για τον ιστότοπο του έργου απέχουν πολύ από τα καλύτερα αποτελέσματα. Θα είχε επομένως ενδιαφέρον να δούμε το πλαίσιο να συγκρίνεται με μελλοντικές εργασίες και με ένα ευρύτερο φάσμα προηγούμενων προσεγγίσεων.

 

* Αξίζει να σημειωθεί ότι ο όρος «επεξεργασία βίντεο» εδώ δεν σημαίνει «συναρμολόγηση διαφορετικών κλιπ σε μια ακολουθία», όπως χρησιμοποιείται παραδοσιακά, αλλά την άμεση αλλαγή ή τροποποίηση του εσωτερικού περιεχομένου υπαρχόντων κλιπ με τεχνικές μηχανικής μάθησης.

Πρώτη δημοσίευση Δευτέρα, 10 Μαρτίου 2025. Ενημερώθηκε Σάββατο, 25 Ιουλίου 2026 για να αντικαταστήσει βίντεο.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai