Η γωνία του Anderson
Ένα εργαλείο σήμανσης εικόνων βασισμένο στο πρόγραμμα περιήγησης για συνόλους δεδομένων οπτικής ανίχνευσης

Ερευνητές από τη Φινλανδία έχουν αναπτύξει ένα εργαλείο σήμανσης εικόνων βασισμένο στο πρόγραμμα περιήγησης, με σκοπό τη βελτίωση της ευκολίας και της ταχύτητας των χρονοβόρων διαδικασιών σήμανσης εικόνων για συνόλους δεδομένων οπτικής ανίχνευσης. Εγκατεστημένο ως επέκταση ανεξάρτητη από το λειτουργικό σύστημα για τους πιο δημοφιλείς κινητήρες προγράμματος περιήγησης, το νέο εργαλείο επιτρέπει στους χρήστες να «σημάνουν ενώ περιηγούνται ελεύθερα», αντί να χρειάζεται να τοποθετήσουν μια συνεδρία σήμανσης σε ένα αφιερωμένο περιβάλλον ή να εκτελέσουν κώδικα πελάτη και άλλες ειδικές περιπτώσεις.
Με τον τίτλο BRIMA (Εργαλείο Σήμανσης Εικόνων με Χαμηλή Επίβαρυνση για Πρόγραμμα Περιήγησης), το σύστημα αναπτύχθηκε στο Πανεπιστήμιο του Γιουβάσκουλα. Αφαιρεί την ανάγκη να συλλέξουν και να συνθέσουν συνόλους δεδομένων σε τοπικά ή απομακρυσμένα καταλόγους και μπορεί να ρυθμιστεί για να εξαγάγει χρήσιμα δεδομένα από τους διάφορους παραμέτρους δεδομένων που είναι διαθέσιμες σε οποιαδήποτε δημόσια πλατφόρμα.

BRIMA σε λειτουργία. Πηγή: https://arxiv.org/pdf/2107.06351.pdf
Με αυτόν τον τρόπο, το BRIMA (το οποίο θα παρουσιαστεί στο ICIP 2021, όταν ο κώδικας θα είναι επίσης διαθέσιμος) απομακρύνει τους πιθανούς εμποδιστές που μπορούν να εμφανιστούν όταν αυτόματες διαδικασίες σκραπινγκ του ιστότοπου αποκλείονται μέσω διευθύνσεων IP ή άλλων μεθόδων και εμποδίζονται από τη συλλογή δεδομένων – μια tình huống που πρόκειται να γίνει πιο συχνή καθώς η προστασία IP γίνεται όλο και πιο σημαντική, όπως έχει γίνει πρόσφατα με το εργαλείο γεννήτριας κώδικα της Microsoft, Copilot.
Καθώς το BRIMA προορίζεται αποκλειστικά για σήμανση από ανθρώπους, η χρήση του είναι επίσης λιγότερο πιθανό να ενεργοποιήσει άλλους τύπους εμποδίων, όπως προκλήσεις CAPTCHA ή άλλα αυτόματα συστήματα που προορίζονται για το αποκλεισμό αλγορίθμων συλλογής δεδομένων.
Προσαρμοστικές Ικανότητες Συλλογής Δεδομένων
Το BRIMA εφαρμόζεται μέσω μιας επέκτασης Firefox ή μιας επέκτασης Chrome στα Windows, OSX ή Linux και μπορεί να ρυθμιστεί για να λάβει σημαντικά δεδομένα με βάση σημεία δεδομένων που μια συγκεκριμένη πλατφόρμα μπορεί να επιλέξει να εκθέσει. Για παράδειγμα, όταν σημάνετε εικόνες στο Google Street View, το σύστημα μπορεί να λάβει υπόψη την προοπτική και τη γωνία της οπτικής και να καταγράψει την ακριβή γεωγραφική τοποθεσία του αντικειμένου που υποδεικνύεται από τον χρήστη.

Το BRIMA δοκιμάστηκε τον Σεπτέμβριο του 2020 από τους δημιουργούς του, κατά τη διάρκεια της συνεργασίας σε μια crowdsourced πρωτοβουλία για τη δημιουργία ενός συνόλου δεδομένων ανίχνευσης αντικειμένων για αντικείμενα CCTV (βίντεο επιτήρησης που τοποθετούνται σε δημόσιους χώρους ή είναι ορατά από δημόσιους χώρους).
Το σύστημα αποτελείται από μια ελαφριά εγκατάσταση JavaScript πελάτη σε μορφή επέκτασης προγράμματος περιήγησης και από μια πλευρά διακομιστή που λαμβάνει και συνθέτει τα δεδομένα σήμανσης. Αναφορές υλοποιήσεων της εγκατάστασης πλευράς διακομιστή γράφτηκαν σε Python και PHP με Flask και Swagger/OpenAPI, αλλά οι ερευνητές τονίζουν ότι η κεντρική αρχιτεκτονική επεξεργασίας μπορεί εύκολα να μεταφερθεί σε άλλες γλώσσες και ρυθμίσεις.
Η επέκταση προγράμματος περιήγησης και ο διακομιστής επικοινωνούν μέσω αιτημάτων RESTful API και HTTP/XHR, με τα δεδομένα πελάτη να αποστέλλονται σε μορφή JSON που είναι συμβατή με MS COCO. Αυτό σημαίνει ότι τα δεδομένα είναι αμέσως χρησιμοποιήσιμα με πολλές από τις πιο δημοφιλείς πλατφόρμες ανίχνευσης αντικειμένων, συμπεριλαμβανομένων διαφόρων back-end για TensorFlow, όπως η Detectron2 της Facebook και η CenterMask2.
Εργαλεία Ειδικά για Έργα
Παρά τη γενική φύση του BRIMA, μπορεί να ρυθμιστεί σε πολύ συγκεκριμένες ρυθμίσεις συλλογής δεδομένων, συμπεριλαμβανομένης της επιβολής μενού αναπτύγματος και άλλων τύπων εισαγωγής”context” που σχετίζονται με một συγκεκριμένο τομέα. Στην εικόνα παρακάτω βλέπουμε ότι ένα μενού αναπτύγματος που σχετίζεται με πληροφορίες κάμερας έχει γραφτεί στο BRIMA, ώστε μια ομάδα σημάνσεων να μπορεί να παρέχει λεπτομερείς και σχετικές πληροφορίες για το έργο.

Αυτή η πρόσθετη εργαλειοποίηση μπορεί να ρυθμιστεί τοπικά. Η επέκταση επίσης διαθέτει εύκολη εγκατάσταση και ρυθμιζόμενες συντομεύσεις πληκτρολογίου, μαζί με στοιχεία διεπαφής χρήστη με χρωματική κωδικοποίηση.
Το έργο βασίζεται σε eine σειρά από προσπάθειες τα τελευταία χρόνια για τη βελτίωση της ευκολίας της σήμανσης εικόνων για δεδομένα του ιστότοπου ή δημόσιες πλατφόρμες. Το εργαλείο PhotoStuff, που υποστηρίζεται από το DARPA, προσφέρει σήμανση εικόνων μέσω αφιερωμένης πύλης ιστού και μπορεί να εκτελεστεί στο σεμαντικό ιστό ή ως αυτόνομη εφαρμογή· το 2004 το Πανεπιστήμιο του Μπέρκλεϊ πρότεινε Σήμανση εικόνων σε κινητό τηλέφωνο, το οποίο βασίστηκε σε μεταδεδομένα λόγω των περιορισμών της κάλυψης δικτύου και των περιορισμών της οθόνης της εποχής· το έργο LabelMe του MIT το 2005 επίσης approached τη σήμανση εικόνων βασισμένη στο πρόγραμμα περιήγησης, με έμφαση σε εργαλεία MATLAB;
Από την κυκλοφορία του το 2015, το πλαίσιο Python/QT LabelImg έχει κερδίσει δημοτικότητα σε crowdsourced προσπάθειες σήμανσης, με μια αφιερωμένη τοπική εγκατάσταση. Ωστόσο, οι ερευνητές του BRIMA παρατηρούν ότι το LabelImg επικεντρώνεται στα πρότυπα PascalVOC και YOLO, δεν υποστηρίζει τη μορφή JSON MS COCO και αποφεύγει εργαλεία περιγράμματος πολυγώνου υπέρ απλών περιοχών σύλληψης ορθογωνίου (που θα απαιτήσουν μεταγενέστερη τομείς).












