Η γωνία του Anderson

Ένα Βίντεο Codec Σχεδιασμένο για Ανάλυση AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Αν και η techno-thriller The Circle (2017) είναι περισσότερο ένα σχόλιο για τις ηθικές επιπτώσεις των κοινωνικών δικτύων παρά για τις πρακτικές της εξωτερικής ανάλυσης βίντεο, η απίστευτα μικρή κάμερα ‘SeeChange’ στο κέντρο της πλοκής είναι αυτό που πραγματικά ωθεί την ταινία στην κατηγορία ‘επιστημονικής φαντασίας’.

Η κάμερα/συσκευή επιτήρησης 'SeeChange' από την techno-thriller 'The Circle' (2017).

Η κάμερα/συσκευή επιτήρησης ‘SeeChange’ από την techno-thriller ‘The Circle’ (2017).

Ένα ασύρματο και ελεύθερο.device περίπου του μεγέθους ενός μεγάλου μαργαριταριού, δεν είναι η έλλειψη ηλιακών πάνελ ή η ανεπάρκεια του να τραβήξει ενέργεια από άλλες περιβαλλοντικές πηγές (όπως ραδιοκύματα) που κάνει τη SeeChange ένα απίθανο προοπτικό, αλλά το γεγονός ότι θα πρέπει να συμπιέζει βίντεο 24/7, σε όποια σπάνια φόρτιση είναι σε θέση να διατηρήσει.

Η ενέργεια των φτηνών αισθητήρων αυτού του τύπου είναι một βασική περιοχή έρευνας στην υπολογιστική όραση (CV) και ανάλυση βίντεο, ιδιαίτερα σε μη αστικές περιοχές όπου ο αισθητήρας θα πρέπει να εξασφαλίσει την μέγιστη απόδοση από πολύ περιορισμένες πηγές ενέργειας (μπαταρίες, ηλιακά κ.λπ.).

Στις περιπτώσεις όπου ένα τέτοιο edge IoT/CV device πρέπει να στείλει περιεχόμενο εικόνας σε einen κεντρικό сервер (συχνά μέσω συμβατικών δικτύων κινητής τηλεφωνίας), οι επιλογές είναι δύσκολες: είτε η συσκευή πρέπει να εκτελέσει κάποιο είδος ελαφριού νευρωνικού δικτύου τοπικά, για να στείλει μόνο βελτιστοποιημένα τμήματα σχετικών δεδομένων για επεξεργασία του διακομιστή, είτε πρέπει να στείλει ‘ανοητά’ βίντεο για την αξιολόγηση των συνδεδεμένων πόρων του cloud.

Though η ενεργοποίηση κίνησης μέσω event-based Smart Vision Sensors (SVS) μπορεί να μειώσει αυτό το επιπλέον κόστος, αυτή η ενεργοποίηση επίσης κοστίζει ενέργεια.

Κρατώντας την Εξουσία

Επιπλέον, ακόμη και με σπάνια ενεργοποίηση (δηλ. ένα πρόβατο περιστασιακά μπαίνει στην εικόνα), η συσκευή δεν έχει αρκετή ενέργεια για να στείλει γιγαμπάιτ ασυμπιεσμένου βίντεο, ούτε έχει αρκετή ενέργεια για να εκτελέσει συνεχώς δημοφιλείς κώδικες συμπίεσης βίντεο όπως ο H.264/5, οι οποίοι περιμένουν υλικό που είναι είτε συνδεδεμένο είτε όχι μακριά από την επόμενη συνεδρία φόρτισης.

Σωλήνες ανάλυσης βίντεο για τρεις τυπικές εργασίες υπολογιστικής όρασης. Η αρχιτεκτονική κωδικοποίησης βίντεο πρέπει να εκπαιδευτεί για την εργασία που έχει ανατεθεί, και συνήθως για το νευρωνικό δίκτυο που θα λάβει τα δεδομένα. Πηγή: https://arxiv.org/pdf/2204.12534.pdf

Σωλήνες ανάλυσης βίντεο για τρεις τυπικές εργασίες υπολογιστικής όρασης. Η αρχιτεκτονική κωδικοποίησης βίντεο πρέπει να εκπαιδευτεί για την εργασία που έχει ανατεθεί, και συνήθως για το νευρωνικό δίκτυο που θα λάβει τα δεδομένα. Πηγή: https://arxiv.org/pdf/2204.12534.pdf

Αν και ο ευρέως διαδεδομένος κώδικας H.264 έχει χαμηλότερη κατανάλωση ενέργειας από τον διάδοχό του H.265, έχει πολύ κακή αποδοτικότητα συμπίεσης. Ο διάδοχός του, H.265, έχει καλύτερη αποδοτικότητα συμπίεσης, αλλά υψηλότερη κατανάλωση ενέργειας. Ενώ ο ανοιχτός κώδικας VP9 του Google ξεπερνά και τους δύο σε κάθε περιοχή, απαιτεί υψηλότερες τοπικές υπολογιστικές πόρους, που παρουσιάζουν πρόσθετα προβλήματα σε ένα φτηνό αισθητήρα IoT.

Όσον αφορά την ανάλυση του ρεύματος τοπικά: μέχρι τη στιγμή που θα τρέξει κανείς ακόμη και το ελαφρύτερο τοπικό νευρωνικό δίκτυο, για να καθορίσει ποια πλαισιά είναι άξια να σταλεί στον διακομιστή, συχνά έχει ξοδέψει την ενέργεια που θα είχε σώσει αν είχε στείλει όλα τα πλαισιά.

Εξαγωγή μασκαρεμένων αναπαραστάσεων βοοειδών με einen αισθητήρα που είναι απίθανο να είναι συνδεδεμένος στο δίκτυο. Δαπανά την περιορισμένη του ικανότητα ενέργειας για τοπική σεμαντική διαίρεση με ένα ελαφρύ νευρωνικό δίκτυο, για να στείλει περιορισμένες πληροφορίες σε einen διακομιστή για περαιτέρω οδηγίες (εισάγοντας καθυστέρηση), ή για να στείλει 'ανοητά' δεδομένα (σπατάλώντας ενέργεια σε εύρος ζώνης); Πηγή: https://arxiv.org/pdf/1807.01972.pdf

Εξαγωγή μασκαρεμένων αναπαραστάσεων βοοειδών με einen αισθητήρα που είναι απίθανο να είναι συνδεδεμένος στο δίκτυο. Δαπανά την περιορισμένη του ικανότητα ενέργειας για τοπική σεμαντική διαίρεση με ένα ελαφρύ νευρωνικό δίκτυο, για να στείλει περιορισμένες πληροφορίες σε einen διακομιστή για περαιτέρω οδηγίες (εισάγοντας καθυστέρηση), ή για να στείλει ‘ανοητά’ δεδομένα (σπατάλώντας ενέργεια σε εύρος ζώνης); Πηγή: https://arxiv.org/pdf/1807.01972.pdf

Είναι σαφές ότι ‘στον αγρό’ οι projecτ υπολογιστικής όρασης χρειάζονται αφοσιωμένους κώδικες συμπίεσης βίντεο που είναι βελτιστοποιημένοι για τις απαιτήσεις συγκεκριμένων νευρωνικών δικτύων σε συγκεκριμένες και διαφορετικές εργασίες, όπως σεμαντική διαίρεση, ανίχνευση κλειδιών (ανάλυση κίνησης ανθρώπων) και ανίχνευση αντικειμένων, μεταξύ άλλων πιθανών τελικών χρήσεων.

Αν μπορείτε να πετύχετε την ιδανική σχέση μεταξύ συμπίεσης βίντεο και ελάχιστης μετάδοσης δεδομένων, είστε ένα βήμα πιο κοντά στη SeeChange, και την ικανότητα να αναπτύξετε φτηνές δίκτυα αισθητήρων σε μη φιλικές περιβάλλοντα.

AccMPEG

Νέα έρευνα από το Πανεπιστήμιο του Σικάγου μπορεί να έχει κάνει ένα βήμα πιο κοντά σε έναν τέτοιο κώδικα, με τη μορφή AccMPEG – ενός καινούργιου πλαισίου κωδικοποίησης και ροής βίντεο που λειτουργεί με χαμηλή καθυστέρηση, υψηλή ακρίβεια για διακομιστές Deep Neural Networks (DNNs), και που έχει εξαιρετικά χαμηλές τοπικές υπολογιστικές απαιτήσεις.

Αρχιτεκτονική του AccMPEG. Πηγή: https://arxiv.org/pdf/2204.12534.pdf

Αρχιτεκτονική του AccMPEG. Πηγή: https://arxiv.org/pdf/2204.12534.pdf

Το σύστημα είναι σε θέση να κάνει οικονομίες πάνω από προηγούμενες μεθόδους, αξιολογώντας το βαθμό στον οποίο κάθε 16x16px macroblock είναι πιθανό να επηρεάσει την ακρίβεια του διακομιστή DNN. Προηγούμενες μεθόδους έχουν, αντίθετα, γενικά αξιολογηθεί αυτή την ακρίβεια με βάση κάθε pixel σε μια εικόνα ή να εκτελέσουν ηλεκτρικά ακριβές τοπικές εργασίες για να αξιολογηθούν ποιες περιοχές της εικόνας μπορεί να είναι πιο ενδιαφέρουσες.

Στο AccMPEG, αυτή η ακρίβεια εκτιμάται σε ένα προσαρμοσμένο μοντέλο που ονομάζεται AccGrad, το οποίο μετρά τους τρόπους με τους οποίους η ποιότητα κωδικοποίησης του macroblock είναι πιθανό να επηρεάσει την τελική χρήση, όπως ένα διακομιστής DNN που προσπαθεί να μετρήσει ανθρώπους, να εκτελέσει σκελετική εκτίμηση στην κίνηση ανθρώπων ή άλλες κοινές εργασίες υπολογιστικής όρασης.

Όταν ένα πλαισίο βίντεο εισέρχεται στο σύστημα, το AccMPEG αρχικά το επεξεργάζεται μέσω ενός φθηνού μοντέλου επιλογής ποιότητας, με τίτλο AccModel. Οι περιοχές που δεν είναι πιθανό να συνεισφέρουν στις χρήσιμες υπολογίσεις του διακομιστή DNN είναι ουσιαστικά βαρύ φορτίο, και πρέπει να σημειωθούν για κωδικοποίηση στην χαμηλότερη δυνατή ποιότητα, σε αντίθεση με τις σαλεμένες περιοχές, οι οποίες πρέπει να σταλούν σε καλύτερη ποιότητα.

Αυτή η διαδικασία παρουσιάζει τρεις προκλήσεις: μπορεί η διαδικασία να εκτελεστεί αρκετά γρήγορα για να επιτύχει αποδεκτή καθυστέρηση χωρίς να χρησιμοποιηθούν ενεργοβόρες τοπικές υπολογιστικές πόρους; Μπορεί να καθοριστεί μια βέλτιστη σχέση μεταξύ ρυθμού καρέ και ποιότητας; Και μπορεί να εκπαιδευτεί ένα μοντέλο γρήγορα για ένα μεμονωμένο διακομιστή DNN;

Εκπαίδευση Λογιστικής

Ιδανικά, ένας κώδικας υπολογιστικής όρασης θα πρέπει να έχει προ-εκπαιδευτεί σε συνδεδεμένα συστήματα στις ακριβείς απαιτήσεις ενός συγκεκριμένου νευρωνικού δικτύου. Το μοντέλο AccGrad, ωστόσο, μπορεί να εξαχθεί απευθείας από ένα DNN με μόνο δύο προώθησεις, με εξοικονόμηση δέκα φορές την τυπική επιβάρυνση.

Το AccMPEG εκπαιδεύει το AccGrad για μόλις 15 επαναλήψεις των τριών προώθησεων через το τελικό DNN, και μπορεί να επανα-εκπαιδευτεί ‘ζωντανά’ χρησιμοποιώντας την τρέχουσα κατάσταση του μοντέλου ως πρότυπο, τουλάχιστον για παρόμοιες εργασίες CV.

Το AccModel χρησιμοποιεί το προ-εκπαιδευμένο MobileNet-SSD εξαγωγέα χαρακτηριστικών, κοινό σε φτηνές περιφερειακές συσκευές. Σε μια ταχύτητα 12 GFLOPS, το μοντέλο χρησιμοποιεί μόνο ένα τρίτο των τυπικών προσεγγίσεων ResNet18. Εκτός από τη σταθμισμένη ομαλοποίηση και ενεργοποίηση, η αρχιτεκτονική αποτελείται μόνο από στρωΜΑΤΙΚούς συνδεσμούς, και η υπολογιστική της επιβάρυνση είναι ανάλογη με το μέγεθος του πλαισίου.

Το AccGrad αφαιρεί την ανάγκη για τελική εύρεση DNN, βελτιώνοντας την εγκατάσταση.

Το AccGrad αφαιρεί την ανάγκη για τελική εύρεση DNN, βελτιώνοντας την εγκατάσταση.

Ρυθμός Καρέ

Η αρχιτεκτονική εκτελείται βέλτιστα στα 10fps, το οποίο θα την καθιστά κατάλληλη για σκοπούς όπως η γεωργική παρακολούθηση, η επιτήρηση της υποβάθμισης κτιρίων, η ανάλυση κυκλοφορίας από ψηλά και η σκελετική εύρεση στην κίνηση ανθρώπων, ωστόσο, πολύ γρήγορα κινούμενα σενάρια, όπως η κυκλοφορία από χαμηλά (αυτοκινήτων ή ανθρώπων), και άλλες καταστάσεις στις οποίες οι υψηλές ταχύτητες καρέ είναι ωφέλιμες, δεν είναι κατάλληλες για αυτήν την προσέγγιση.

Μέρος της μεθοδικής οικονομίας της αρχιτεκτονικής έγκειται στην υπόθεση ότι γειτονικά macroblocks είναι πιθανό να είναι παρόμοιας αξίας, μέχρι το σημείο όπου ένα macroblock πέφτει κάτω από την εκτιμώμενη ακρίβεια. Οι περιοχές που λαμβάνονται με αυτήν την προσέγγιση είναι πιο σαφώς οριοθετημένες και μπορούν να υπολογιστούν με μεγαλύτερη ταχύτητα.

Βελτίωση Απόδοσης

Οι ερευνητές έτρεξαν το σύστημα σε μια πλακέτα Jetson Nano αξίας 60 δολαρίων με ένα μονό 128-πυρήνα GPU Maxwell, και διάφορες άλλες φτηνές ισοδύναμες. Χρησιμοποιήθηκε το OpenVINO για να αντισταθμίσει κάποια από τις ενεργειακές απαιτήσεις των πολύ σπάνιων τοπικών DNNs στα CPUs.

Το AccModel είχε αρχικά εκπαιδευτεί εκτός σύνδεσης σε einen διακομιστή με 8 GeForce RTX 2080S GPUs. Αν και αυτό είναι ένα φοβερό σύνολο υπολογιστικής δύναμης για την αρχική εκπαίδευση του μοντέλου, η ελαφριά επανα-εκπαίδευση που το σύστημα καθιστά δυνατή, και ο τρόπος με τον οποίο ένα μοντέλο μπορεί να ρυθμιστεί σε ορισμένα παραμέτρα ανεκτικότητας σε διάφορα DNNs που επιτίθενται σε παρόμοιες εργασίες, σημαίνει ότι το AccMPEG μπορεί να αποτελέσει μέρος ενός συστήματος που χρειάζεται ελάχιστη επίβλεψη στον αγρό.

 

Πρώτη δημοσίευση 1ης Μαΐου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]