Η γωνία του Anderson

Αποκατάσταση Υπερ-Συμπιεσμένων Βίντεο Κοινωνικών Μέσων με Μαθηματική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Main image source: DALL-E 2

Νέα έρευνα από την Κίνα προσφέρει μια αποτελεσματική και καινοτόμο μέθοδο για την αποκατάσταση λεπτομερειών και ανάλυσης σε βίντεο που έχουν ανέβει από χρήστες και έχουν συμπιεστεί αυτόματα σε πλατφόρμες όπως το WeChat και το YouTube, για να σώσουν εύρος ζώνης και χώρο αποθήκευσης.

Σύγκριση της νέας μεθόδου με προηγούμενες προσεγγίσεις, όσον αφορά την ικανότητά της να αναλύσει με ακρίβεια τις λεπτομέρειες που έχουν απορριφθεί κατά τη διάρκεια της αυτόματης βελτιστοποίησης της πλατφόρμας κοινωνικών μέσων. Πηγή: https://arxiv.org/pdf/2208.08597.pdf

Σύγκριση της νέας μεθόδου με προηγούμενες προσεγγίσεις, όσον αφορά την ικανότητά της να αναλύσει με ακρίβεια τις λεπτομέρειες που έχουν απορριφθεί κατά τη διάρκεια της αυτόματης βελτιστοποίησης της πλατφόρμας κοινωνικών μέσων. Πηγή: https://arxiv.org/pdf/2208.08597.pdf

Αντίθετα με τις προηγούμενες μεθόδους που μπορούν να ανεβάσουν και να αναλύσουν βίντεο με βάση γενικά δεδομένα εκπαίδευσης, η νέα προσέγγιση αντλεί ένα χάρτη υποβάθμισης (DFM) για κάθε καρέ του συμπιεσμένου βίντεο – αποτελεσματικά, μια επισκόπηση των πιο ζημιωμένων ή υποβαθμισμένων περιοχών στο καρέ που έχουν προκύψει από τη συμπίεση.

Από τις νέες μελέτες απομόνωσης: δεύτερη από τα δεξιά, η αλήθεια για einen 'καθαρό' χάρτη υποβάθμισης (DFM); τρίτη από τα δεξιά, μια εκτίμηση της ζημιάς χωρίς τη χρήση DFM. Αριστερά, ένας πολύ πιο ακριβής χάρτης της ζημιάς με DFM.

Από τις νέες μελέτες απομόνωσης: δεύτερη από τα δεξιά, η αλήθεια για einen ‘καθαρό’ χάρτη υποβάθμισης (DFM); τρίτη από τα δεξιά, μια εκτίμηση της ζημιάς χωρίς τη χρήση DFM. Αριστερά, ένας πολύ πιο ακριβής χάρτης της ζημιάς με DFM.

Η διαδικασία αποκατάστασης, η οποία αξιοποιεί τα συννευρωνικά δίκτυα (CNN), μεταξύ άλλων τεχνολογιών, καθοδηγείται και εστιάζεται από τις πληροφορίες στο DFM, επιτρέποντας στην νέα μέθοδο να υπερβεί την απόδοση και την ακρίβεια των προηγούμενων προσεγγίσεων.

Η αλήθεια για τη διαδικασία αυτή προέκυψε από τους ερευνητές που ανέβασαν υψηλής ποιότητας βίντεο σε τέσσερις δημοφιλείς πλατφόρμες κοινωνικών μέσων, κατέβασαν τα συμπιεσμένα αποτελέσματα και ανέπτυξαν ένα πλήρως αυτόματο σύστημα που μπορεί να μάθει τις ζημιές και τις λεπτομέρειες που έχουν χαθεί, ώστε να μπορεί να εφαρμοστεί σε πολλές πλατφόρμες για να αποκαταστήσει τα βίντεο σε μια σχεδόν αρχική ποιότητα, με βάση πλήρως αντίθετα δεδομένα.

Παραδείγματα από το νέο σύνολο δεδομένων UVSSM.

Παραδείγματα από το νέο σύνολο δεδομένων UVSSM.

Το υλικό που χρησιμοποιήθηκε στην έρευνα έχει συλλεγεί σε ένα σύνολο δεδομένων HQ/LQ με τίτλο Βίντεο Χρηστών που Μοιράζονται στα Κοινωνικά Μέσα (UVSSM) και έχει γίνει διαθέσιμο για λήψη (κωδικός: rsqw) στο Baidu, για το όφελος των επόμενων ερευνητικών έργων που επιδιώκουν να αναπτύξουν νέες μεθόδους για την αποκατάσταση των βίντεο που έχουν συμπιεστεί από τις πλατφόρμες.

Μια σύγκριση μεταξύ δύο ισοδύναμων δειγμάτων HQ/LQ από το σύνολο δεδομένων UVSSM (δείτε τις παραπάνω συνδέσεις για τις αρχικές διευθύνσεις URL). Καθώς ακόμη και αυτό το παράδειγμα μπορεί να υπόκειται σε πολλαπλές στροφές συμπίεσης (εφαρμογή εικόνας, CMS, CDN, κ.λπ.), παρακαλούμε να αναφερθείτε στα πρωτότυπα δεδομένα για μια πιο ακριβή σύγκριση.

Μια σύγκριση μεταξύ δύο ισοδύναμων δειγμάτων HQ/LQ από το σύνολο δεδομένων UVSSM (δείτε τις παραπάνω συνδέσεις για τις αρχικές διευθύνσεις URL). Καθώς ακόμη και αυτό το παράδειγμα μπορεί να υπόκειται σε πολλαπλές στροφές συμπίεσης (εφαρμογή εικόνας, CMS, CDN, κ.λπ.), παρακαλούμε να αναφερθείτε στα πρωτότυπα δεδομένα για μια πιο ακριβή σύγκριση.

Ο κώδικας του συστήματος, που ονομάζεται Αποκατάσταση Βίντεο μέσω Προσαρμοσμένης Ανίχνευσης Υποβάθμισης (VOTES), έχει επίσης εκδοθεί στο GitHub, αν και η εφαρμογή του απαιτεί μια σειρά από εξαρτήσεις.

Το έγγραφο έχει τον τίτλο Αποκατάσταση Βίντεο Χρηστών που Μοιράζονται στα Κοινωνικά Μέσα και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο Σενζέν και έναν από το Τμήμα Ηλεκτρονικής και Πληροφορικής του Πολυτεχνείου του Χονγκ Κονγκ.

Από τα Λείψανα στα Fakta

Η ικανότητα να αποκαταστήσει την ποιότητα των βίντεο που έχουν συλλεγεί από το διαδίκτυο χωρίς την γενική, μερικές φορές υπεραπλή ‘οπτική’ λεπτομέρεια που παρέχουν προγράμματα όπως το Gigapixel (και τα περισσότερα από τα δημοφιλή ανοιχτά πακέτα παρόμοιου εύρους) θα μπορούσε να έχει επιπτώσεις στον τομέα της έρευνας της οπτικής ανίχνευσης.

Η έρευνα για τις τεχνολογίες οπτικής ανίχνευσης που βασίζονται σε βίντεο συχνά βασίζεται σε υλικό που έχει ληφθεί από πλατφόρμες όπως το YouTube και το Twitter, όπου οι μεθόδους συμπίεσης και τα codecs που χρησιμοποιούνται είναι στενά φυλαγμένα, δεν μπορούν να εξαχθούν εύκολα με βάση τα οπτικά σημάδια ή άλλες οπτικές ενδείξεις και μπορεί να αλλάξουν περιοδικά.

Τα περισσότερα από τα έργα που αξιοποιούν βίντεο που βρέθηκαν στο διαδίκτυο δεν ερευνούν συμπίεση και πρέπει να καταστήσουν τις διαθέσιμες ποιότητες των συμπιεσμένων βίντεο που προσφέρουν οι πλατφόρμες,既然 δεν έχουν πρόσβαση στις αρχικές υψηλής ποιότητας εκδόσεις που ανέβηκαν από τους χρήστες.

Επομένως, η ικανότητα να αποκαταστήσει πιστά μεγαλύτερη ποιότητα και ανάλυση σε τέτοια βίντεο, χωρίς να εισάγει κατωτέρω επιρροή από μη σχετικές τεχνολογίες οπτικής ανίχνευσης, θα μπορούσε να βοηθήσει να αποφευχθούν οι συχνές λύσεις και προσαρμογές που τα έργα της οπτικής ανίχνευσης πρέπει να κάνουν για τις υποβαθμισμένες πηγές βίντεο.

Αν και πλατφόρμες όπως το YouTube θα ανακοινώνουν περιστασιακά σημαντικές αλλαγές στον τρόπο με τον οποίο συμπιέζουν τα βίντεο των χρηστών (όπως VP9), καμία από αυτές δεν αποκαλύπτει σαφώς ολόκληρη τη διαδικασία ή τα ακριβή codecs και τις ρυθμίσεις που χρησιμοποιούνται για να σμικρύνουν τα υψηλής ποιότητας αρχεία που ανεβάζουν οι χρήστες.

Η επίτευξη βελτιωμένης ποιότητας εξόδου από ανέβασμα χρηστών έχει γίνει κάτι σαν Δρυϊδική τέχνη τα τελευταία δέκα χρόνια περίπου, με διάφορες (κυρίως ανεπιβεβαίωτες) ‘λύσεις’ που έρχονται και φεύγουν από τη μόδα.

Μέθοδος

Οι προηγούμενες προσεγγίσεις για την αποκατάσταση βίντεο με βάση τη μαθηματική μάθηση έχουν περιλαμβάνει γενική εξαγωγή χαρακτηριστικών, είτε ως μια προσέγγιση για την αποκατάσταση ενός καρέ είτε σε μια αρχιτεκτονική πολλαπλών καρέ που αξιοποιεί οπτική ροή (δηλαδή που λαμβάνει υπόψη τα γειτονικά και μεταγενέστερα καρέ κατά την αποκατάσταση ενός τρέχοντος καρέ).

Όλες αυτές οι προσεγγίσεις έχουν πρέπει να αντιμετωπίσουν το ‘μαύρο κουτί’ – το γεγονός ότι δεν μπορούν να εξετάσουν τις επιπτώσεις της συμπίεσης στις βασικές τεχνολογίες, γιατί δεν είναι σίγουρο ούτε τι είναι οι βασικές τεχνολογίες, ούτε πώς έχουν ρυθμιστεί για οποιοδήποτε συγκεκριμένο βίντεο που ανέβηκε από χρήστη.

Το VOTES, αντίθετα, επιδιώκει να εξαγάγει σημαντικά χαρακτηριστικά απευθείας από το αρχικό και το συμπιεσμένο βίντεο και να καθορίσει μοτίβα μετασχηματισμού που θα γενικευθούν στα πρότυπα πολλών πλατφόρμων.

Απλοποιημένη концептуαλική αρχιτεκτονική για VOTES.

Απλοποιημένη концепτουαλική αρχιτεκτονική για VOTES.

Το VOTES χρησιμοποιεί ένα ειδικά αναπτυγμένο模块 ανίχνευσης υποβάθμισης (DSM, δείτε την εικόνα παραπάνω) για να εξαγάγει χαρακτηριστικά σε блокς συσχετισμού. Πολλά καρέ περνούν στη συνέχεια σε ένα模块 εξαγωγής και συσχετίσεων χαρακτηριστικών (FEAM), με αυτά να στέλνονται σε ένα模块 ρύθμισης υποβάθμισης (DMM). Τέλος, το模块 ανακατασκευής εξόδου αποκαταστημένου βίντεο.

Δεδομένα και Πειράματα

Στη νέα εργασία, οι ερευνητές έχουν επικεντρώσει τις προσπάθειές τους στην αποκατάσταση βίντεο που έχουν ανέβει και ξανακατεβεί από την πλατφόρμα WeChat, αλλά ήταν ενδιαφερμένοι να διασφαλίσουν ότι το αποτέλεσμα θα μπορούσε να προσαρμοστεί σε άλλες πλατφόρμες.

Αποδείχθηκε ότι μια φορά που είχαν λάβει μια αποτελεσματική μέθοδο αποκατάστασης για βίντεο WeChat, η προσαρμογή της σε Bilibili, Twitter και YouTube χρειαζόταν μόνο 90 δευτερόλεπτα για ένα μόνο επεισόδιο για κάθε προσαρμοσμένο μοντέλο για κάθε πλατφόρμα (σε μια μηχανή που εκτελεί 4 NVIDIA Tesla P40 GPUs με συνολικό 96GB VRAM).

Η προσαρμογή του επιτυχούς μοντέλου WeChat σε άλλες πλατφόρμες κοινωνικών μέσων αποδείχθηκε αρκετά εύκολη. Εδώ βλέπουμε το VOTES να επιτυγχάνει σχεδόν άμεση ισότητα απόδοσης σε διάφορες πλατφόρμες, χρησιμοποιώντας το δικό τους σύνολο δεδομένων UVSSM και το σύνολο δεδομένων REDS (δείτε παρακάτω).

Η προσαρμογή του επιτυχούς μοντέλου WeChat σε άλλες πλατφόρμες κοινωνικών μέσων αποδείχθηκε αρκετά εύκολη. Εδώ βλέπουμε το VOTES να επιτυγχάνει σχεδόν άμεση ισότητα απόδοσης σε διάφορες πλατφόρμες, χρησιμοποιώντας το δικό τους σύνολο δεδομένων UVSSM και το σύνολο δεδομένων REDS (δείτε παρακάτω).

Για να πληρώσουν το σύνολο δεδομένων UVSSM, οι ερευνητές συγκέντρωσαν 264 βίντεο που κυμαίνονται μεταξύ 5-30 δευτερολέπτων, κάθε ένα με ρυθμό καρέ 30fps, πηγαίνοντας είτε απευθείας από κινητές κάμερες είτε από το διαδίκτυο. Τα βίντεο ήταν όλα είτε 1920 x 1080 είτε 1280 x 270 ανάλυσης.

Περιεχόμενο (δείτε την προηγούμενη εικόνα) περιλαμβάνει θέα city, τοπία, ανθρώπους και ζώα, μεταξύ πολλών άλλων θεμάτων, και είναι διαθέσιμο στο δημόσιο σύνολο δεδομένων μέσω της άδειας Creative Commons Attribution, επιτρέποντας επαναχρησιμοποίηση.

Οι συγγραφείς ανέβασαν 214 βίντεο στο WeChat χρησιμοποιώντας πέντε διαφορετικά είδη κινητών τηλεφώνων, λαμβάνοντας την προεπιλεγμένη ανάλυση βίντεο του WeChat 960×540 (εκτός αν το αρχικό βίντεο είναι ήδη μικρότερο από αυτές τις διαστάσεις), μεταξύ των πιο ‘ποινικών’ μετατροπών σε δημοφιλείς πλατφόρμες.

Πάνω-αριστερά, το αρχικό καρέ HQ με τρεις μεγεθυμένες περιοχές; πάνω-δεξιά, το ίδιο καρέ από μια πλατφόρμα-υποβαθμισμένη συμπιεσμένη έκδοση του ίδιου βίντεο; κάτω-αριστερά, η υπολογισμένη υποβάθμιση του συμπιεσμένου καρέ; και κάτω-δεξιά, η συνεπακόλουθη 'περιοχή εργασίας' για το VOTES να εστιάσει την προσοχή του.

Πάνω-αριστερά, το αρχικό καρέ HQ με τρεις μεγεθυμένες περιοχές; πάνω-δεξιά, το ίδιο καρέ από μια πλατφόρμα-υποβαθμισμένη συμπιεσμένη έκδοση του ίδιου βίντεο; κάτω-αριστερά, η υπολογισμένη υποβάθμιση του συμπιεσμένου καρέ; και κάτω-δεξιά, η συνεπακόλουθη ‘περιοχή εργασίας’ για το VOTES να εστιάσει την προσοχή του.

Για τις μεταγενέστερες συγκρίσεις με τις διαδικασίες μετατροπής άλλων πλατφόρμων, οι ερευνητές ανέβασαν 50 βίντεο όχι που περιλαμβάνονται στο αρχικό σύνολο των 214 στο Bilibili, YouTube και Twitter. Τα βίντεο είχαν αρχική ανάλυση 1280×270, με τα κατεβασμένα βίντεο να έχουν ανάλυση 640×360.

Αυτό φέρνει το σύνολο δεδομένων UVSSM σε ένα σύνολο 364 ζευγών αρχικών (HQ) και κοινών (LQ) βίντεο, με 214 στο WeChat και 50 σε κάθε एक από τις Bilibili, YouTube και Twitter.

Για τα πειράματα, 10 τυχαία βίντεο επιλέχθηκαν ως το σύνολο δοκιμών, τέσσερα ως το σύνολο επαλήθευσης και τα υπόλοιπα 200 ως το βασικό σύνολο εκπαίδευσης. Τα πειράματα διεξήχθησαν πέντε φορές με K-fold cross validation, με τα αποτελέσματα να μέσο-ορίζονται σε αυτές τις περιπτώσεις.

Στις δοκιμές για την αποκατάσταση βίντεο, το VOTES συγκρίθηκε με Spatio-Temporal Deformable Fusion (STDF). Για την ενίσχυση ανάλυσης, δοκιμάστηκε ενάντια στο Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA), και BasicVSR. Η μεθοδος COMISR της Google cũng περιλαμβάνεται, αν και δεν ταιριάζει με τον τύπο αρχιτεκτονικής των άλλων προηγούμενων έργων.

Οι μεθόδους δοκιμάστηκαν ενάντια στα σύνολα δεδομένων UVSS και REDS, με το VOTES να επιτυγχάνει τις υψηλότερες βαθμολογίες:

Οι συγγραφείς ισχυρίζονται ότι τα ποιοτικά αποτελέσματα επίσης δείχνουν την υπεροχή του VOTES ενάντια στα προηγούμενα συστήματα:

Καρέ βίντεο από το REDS που αποκαταστάθηκαν από αντίπαλες προσεγγίσεις. Ενδεικτική ανάλυση μόνο - δείτε το έγγραφο για την οριστική ανάλυση.

Καρέ βίντεο από το REDS που αποκαταστάθηκαν από αντίπαλες προσεγγίσεις. Ενδεικτική ανάλυση μόνο – δείτε το έγγραφο για την οριστική ανάλυση.

 

Πρώτη δημοσίευση 19ης Αυγούστου 2022.

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai