Η γωνία του Anderson
Αφαιρώντας Αντικείμενα Από Βίντεο Με Περισσότερη Αποδοτικότητα Με Τη Βοήθεια Του Μηχανικού Μάθησης

Νέα έρευνα από την Κίνα αναφέρει αποτελέσματα στο επίπεδο του κράτους της τέχνης – καθώς και μια εντυπωσιακή βελτίωση στην αποδοτικότητα – για ένα νέο σύστημα βίντεο inpainting που μπορεί να αφαιρέσει με επιδεξιότητα αντικείμενα από βίντεο.

Το χαρτοφυλάκιο του αλεξίπτωτου αφαιρείται από τη νέα διαδικασία. Δείτε το αρχικό βίντεο για καλύτερη ανάλυση και περισσότερα παραδείγματα. Πηγή: https://www.youtube.com/watch?v=N–qC3T2wc4
Η τεχνική, που ονομάζεται Πλαίσιο από Άκρο σε Άκρο για Flow-Guided βίντεο Inpainting (E2FGVI), είναι επίσης ικανή να αφαιρέσει νερόσημα και διάφορα άλλα είδη αποκρύψεων από περιεχόμενο βίντεο.

Το E2FGVI υπολογίζει προβλέψεις για περιεχόμενο που βρίσκεται πίσω από αποκρύψεις, επιτρέποντας την αφαίρεση ακόμη και αξιοσημείωτων και ανυπέρβλητων νερόσημων. Πηγή: https://github.com/MCG-NKU/E2FGVI
(Για να δείτε περισσότερα παραδείγματα σε καλύτερη ανάλυση, επισκεφθείτε το βίντεο)
Αν και το μοντέλο που παρουσιάζεται στο δημοσιευμένο έγγραφο εκπαιδεύτηκε σε βίντεο 432px x 240px (συνήθως χαμηλές εισαγωγικές μεγέθη, περιορισμένες από τον διαθέσιμο χώρο GPU έναντι βέλτιστων μεγεθών δειγμάτων και άλλων παραγόντων), οι συγγραφείς έχουν κυκλοφορήσει E2FGVI-HQ, το οποίο μπορεί να χειριστεί βίντεο σε αυθαίρετη ανάλυση.
Ο κώδικας για την τρέχουσα έκδοση είναι διαθέσιμος στο GitHub, ενώ η έκδοση HQ, που κυκλοφόρησε την περασμένη Κυριακή, μπορεί να κατεβαστεί από Google Drive και Baidu Disk.

Το παιδί παραμένει στη φωτογραφία.
Το E2FGVI μπορεί να επεξεργαστεί βίντεο 432×240 σε 0,12 δευτερόλεπτα ανά καρέ σε ένα Titan XP GPU (12GB VRAM), και οι συγγραφείς αναφέρουν ότι το σύστημα λειτουργεί δεκαπέντε φορές γρηγορότερα από τις προηγούμενες μεθόδους που βασίζονται σε οπτικό ροή.

Ένας παίκτης τένις κάνει μια απροσδόκητη έξοδο.
Επιβεβαιώθηκε σε τυπικές βάσεις δεδομένων για αυτόν τον υποτομέα της έρευνας σύνθεσης εικόνων, η νέα μέθοδος ήταν σε θέση να υπερβεί τους ανταγωνιστές της και σε ποιοτικές και ποσοτικές αξιολογήσεις.

Δοκιμές ενάντια σε προηγούμενες προσεγγίσεις. Πηγή: https://arxiv.org/pdf/2204.02663.pdf
Το έγγραφο έχει τον τίτλο Προς Ένα Πλαίσιο από Άκρο σε Άκρο για Flow-Guided βίντεο Inpainting, και είναι μια συνεργασία μεταξύ τεσσάρων ερευνητών από το Πανεπιστήμιο Nankai, μαζί με έναν ερευνητή από την Hisilicon Technologies.
Τι Λείπει Στη Φωτογραφία
Εκτός από τις προφανείς εφαρμογές για οπτικά εφέ, η υψηλής ποιότητας βίντεο inpainting είναι πιθανό να γίνει μια βασική οριστική λειτουργία για νέες τεχνολογίες σύνθεσης εικόνων και αλλοίωσης εικόνων που βασίζονται σε AI.
Αυτό είναι ιδιαίτερα το caso για εφαρμογές αλλοίωσης σώματος στη μόδα, και άλλες πλαισια που επιδιώκουν να ‘λιγοστέψουν’ ή να αλλοιώσουν σε άλλους τρόπους τις σκηνές σε εικόνες και βίντεο. Σε τέτοιες περιπτώσεις, είναι απαραίτητο να ‘γεμίσουμε’ το επιπλέον φόντο που εκτίθεται από τη σύνθεση.

Από ένα πρόσφατο έγγραφο, ένας αλγόριθμος ‘ανασχεδιασμού’ του σώματος έχει ανατεθεί να γεμίσει το φόντο που αποκαλύπτεται όταν το αντικείμενο αναδιαμορφώνεται. Εδώ, η ελλειπή περιοχή αντιπροσωπεύεται από το κόκκινο περίγραμμα που κατέλαβε ο (πραγματικός, βλέπε εικόνα αριστερά) πιο γεμάτος άνθρωπος. Βασισμένο σε υλικό από https://arxiv.org/pdf/2203.10496.pdf
Συνεκτικός Οπτικός Ροή
Ο οπτικός ροή (OF) έχει γίνει μια βασική τεχνολογία στην ανάπτυξη της αφαίρεσης αντικειμένων από βίντεο. Όπως ένας άτλας, ο οπτικός ροή παρέχει μια χαρτογραφική αναπαράσταση μιας χρονολογικής ακολουθίας. Συχνά χρησιμοποιείται για τη μέτρηση της ταχύτητας σε πρωτοβουλίες υπολογιστικής όρασης, ο οπτικός ροή μπορεί επίσης να ενεργοποιήσει τη συνεκτική inpainting, όπου το σύνολο της εργασίας μπορεί να θεωρηθεί σε μια seule διαδικασία, αντί για τη ‘Disney-στυλ’ ‘per-frame’ προσοχή, η οποία οδηγεί αναπόφευκτα σε χρονολογική ασυνέχεια.
Οι μέθοδοι inpainting βίντεο μέχρι σήμερα έχουν επικεντρωθεί σε μια τρι-σταδιακή διαδικασία: πλήρωση ροής, όπου το βίντεο χαρτογραφείται ουσιαστικά σε μια διακριτή και εξερεύνητη οντότητα; πρόωρη διάδοση, όπου οι τρύπες στα ‘διεφθαρμένα’ βίντεο γεμίζονται με τη διεύθυνση των pixel; και υποψία περιεχομένου (εφεύρεση pixel που είναι οικεία σε πολλούς από εμάς από deepfakes και πλαισια κειμένου-εικόνας όπως η σειρά DALL-E) όπου το εκτιμώμενο ‘λείπουν’ περιεχόμενο εφευρέθηκε και εισάγεται στο βίντεο.
Η κεντρική καινοτομία του E2FGVI είναι να συνδυάσει αυτά τα τρία στάδια σε ένα σύστημα από άκρο σε άκρο, απομακρύνοντας την ανάγκη για χειροκίνητες επιχειρήσεις στο περιεχόμενο ή τη διαδικασία.

Το έγγραφο παρατηρεί ότι η ανάγκη για χειροκίνητη παρέμβαση απαιτεί ότι οι παλαιότερες διαδικασίες δεν επωφελούνται από einen GPU, καθιστώντας τις πολύ χρονοβόρες. Από το έγγραφο*:
‘Λαμβάνοντας το DFVI ως παράδειγμα, η ολοκλήρωση ενός βίντεο με μέγεθος 432 × 240 από DAVIS, το οποίο περιέχει περίπου 70 καρέ, χρειάζεται περίπου 4 λεπτά, το οποίο είναι απαράδεκτο στις περισσότερες πραγματικές εφαρμογές. Εκτός από τα παραπάνω μειονεκτήματα, η χρήση μόνο ενός προ-εκπαιδευμένου δικτύου inpainting εικόνας στη στάδιο της υποψίας περιεχομένου αγνοεί τις σχέσεις περιεχομένου μεταξύ χρονολογικών γειτόνων, οδηγώντας σε ασυνεπές γεννημένο περιεχόμενο στα βίντεο.’
Συνδυάζοντας τα τρία στάδια της inpainting βίντεο, το E2FGVI είναι σε θέση να αντικαταστήσει το δεύτερο στάδιο, την πρόωρη διάδοση, με τη διάδοση χαρακτηριστικών. Σε τις πιο τμήματικές διαδικασίες των προηγούμενων έργων, τα χαρακτηριστικά δεν είναι τόσο εκτενώς διαθέσιμα, επειδή κάθε στάδιο είναι σχετικά ερμητικό, και η ροή εργασίας μόνο ημι-αυτόματη.
Επιπλέον, οι ερευνητές έχουν επινοήσει einen χρονολογικό εστιακό μετασχηματιστή για το στάδιο της υποψίας περιεχομένου, ο οποίος λαμβάνει υπόψη όχι μόνο τους άμεσους γείτονες των pixel στη τρέχουσα καρέ (δηλαδή τι συμβαίνει σε这一 μέρος της καρέ στην προηγούμενη ή επόμενη εικόνα), αλλά και τους μακρινούς γείτονες που είναι πολλά καρέ μακριά, και θα επηρεάσουν τη συνεκτική επίδραση οποιασδήποτε εργασίας που εκτελείται στο βίντεο ως σύνολο.
Το νέο χαρακτηριστικό-κεντρικό τμήμα της ροής εργασίας είναι σε θέση να επωφεληθεί από περισσότερες διαδικασίες επιπέδου χαρακτηριστικών και μαθητέας δειγμάτων, ενώ ο καινοτόμος εστιακός μετασχηματιστής του έργου, σύμφωνα με τους συγγραφείς, επεκτείνει το μέγεθος των εστιακών παραθύρων ‘από 2D σε 3D’.
Δοκιμές και Δεδομένα
Για να δοκιμάσουν το E2FGVI, οι ερευνητές αξιολόγησαν το σύστημα ενάντια σε δύο δημοφιλείς βάσεις δεδομένων αντικειμένου βίντεο: YouTube-VOS, και DAVIS. Το YouTube-VOS διαθέτει 3741 βίντεο εκπαίδευσης, 474 βίντεο επικύρωσης, και 508 βίντεο δοκιμής, ενώ το DAVIS διαθέτει 60 βίντεο εκπαίδευσης, και 90 βίντεο δοκιμής.
Το E2FGVI εκπαιδεύτηκε στο YouTube-VOS και αξιολογήθηκε και στις δύο βάσεις δεδομένων. Κατά τη διάρκεια της εκπαίδευσης, οι μάσκες αντικειμένων (οι πράσινες περιοχές στις εικόνες παραπάνω, και το συνοδευτικό βίντεο του YouTube) δημιουργήθηκαν για να προσομοιώσουν την ολοκλήρωση βίντεο.
Για μετρικές, οι ερευνητές υιοθέτησαν Peak signal-to-noise ratio (PSNR), Structural similarity (SSIM), Video-based Fréchet Inception Distance (VFID), και Flow Warping Error – το τελευταίο για να μετρήσει τη χρονολογική σταθερότητα στο επηρεασμένο βίντεο.
Οι προηγούμενες αρχιτεκτονικές ενάντια στις οποίες το σύστημα δοκιμάστηκε ήταν VINet, DFVI, LGTSM, CAP, FGVC, STTN, και FuseFormer.

Από το τμήμα ποσοτικών αποτελεσμάτων του εγγράφου. Οι βέλοι προς τα πάνω και προς τα κάτω υποδεικνύουν ότι υψηλότερα ή χαμηλότερα νούμερα είναι καλύτερα, αντίστοιχα. Το E2FGVI επιτυγχάνει τα καλύτερα σκορ σε όλους τους τομείς. Οι μέθοδοι αξιολογούνται σύμφωνα με το FuseFormer, αν και το DFVI, VINet και FGVC δεν είναι συστήματα από άκρο σε άκρο, καθιστώντας αδύνατο να εκτιμηθούν οι FLOPs τους.
Εκτός από το να επιτύχει τα καλύτερα σκορ ενάντια σε όλες τις ανταγωνιστικές μεθόδους, οι ερευνητές διεξήγαγαν μια ποιοτική μελέτη χρηστών, στην οποία βίντεο που μετατράπηκαν με πέντε αντιπροσωπευτικές μεθόδους εμφανίστηκαν ατομικά σε είκοσι εθελοντές, οι οποίοι ζητήθηκαν να τα αξιολογήσουν σε σχέση με την ποιότητα εικόνας.

Ο κατακόρυφος άξονας αντιπροσωπεύει το ποσοστό των συμμετεχόντων που προτίμησαν την έξοδο του E2FGVI σε σχέση με την ποιότητα εικόνας.
Οι συγγραφείς σημειώνουν ότι παρά την ομόφωνη προτίμηση για τη μέθοδό τους, ένα από τα αποτελέσματα, το FGVC, δεν ανταποκρίνεται στα ποσοτικά αποτελέσματα, και προτείνουν ότι αυτό υποδηλώνει ότι το E2FGVI μπορεί, ψευδώς, να παράγει ‘περισσότερα οπτικά ευχάριστα αποτελέσματα’.
Σε σχέση με την αποδοτικότητα, οι συγγραφείς σημειώνουν ότι το σύστημά τους μειώνει σημαντικά τις πλωτές оперαcίες ανά δευτερόλεπτο (FLOPs) και τον χρόνο inference σε ένα Titan GPU στη βάση δεδομένων DAVIS, και παρατηρούν ότι τα αποτελέσματα δείχνουν ότι το E2FGVI τρέχει 15 φορές γρηγορότερα από τις μεθόδους που βασίζονται σε ροή.
Σημειώνουν:
‘[E2FGVI] κατέχει τις χαμηλότερες FLOPs σε σύγκριση με όλες τις άλλες μεθόδους. Αυτό υποδηλώνει ότι η προτεινόμενη μέθοδος είναι υψηλά αποτελεσματική για την inpainting βίντεο.’
*Η μετατροπή των εσωτερικών παραπομπών των συγγραφέων σε υπερσυνδέσμους.
Πρώτη δημοσίευση 19ης Μαΐου 2022.
Τροποποιήθηκε την Τρίτη 28ης Οκτωβρίου 2025, για να αφαιρεθεί η ελαττωματική ενσωμάτωση βίντεο και να τροποποιηθούν οι αναφορές στην ενσωματωμένη βίντεο στο σώμα του άρθρου.













