Η γωνία του Anderson
Ανίχνευση Επαφής Ματιών από τη Στάση του Σώματος με τη Βοήθεια του Μηχανικού Μάθησης

Ερευνητές από τη Γαλλία και την Ελβετία έχουν αναπτύξει ένα σύστημα υπολογιστικής όρασης που μπορεί να εκτιμήσει εάν ένα άτομο κοιτάζει απευθείας στην κάμερα ενός συστήματος τεχνητής νοημοσύνης, βασισμένο αποκλειστικά στον τρόπο με τον οποίο το άτομο στέκεται ή κινείται.
Το νέο πλαίσιο χρησιμοποιεί πολύ αναγωγικές πληροφορίες για να κάνει αυτή την αξιολόγηση, με τη μορφή σημειολογικών σημείων (βλέπε εικόνα παρακάτω), αντί να προσπαθήσει να αναλύσει κυρίως τη θέση των ματιών σε εικόνες προσώπων. Αυτό καθιστά τη μεθόδο ανίχνευσης πολύ ελαφριά και ευέλικτη, σε σύγκριση με πιο δεδομένα-εντατικές αρχιτεκτονικές ανίχνευσης αντικειμένων, όπως το YOLO.

Το νέο πλαίσιο αξιολογεί εάν ένα άτομο στο δρόμο κοιτάζει την κάμερα του συστήματος AI, βασισμένο αποκλειστικά στη διάταξη του σώματός του. Εδώ, τα άτομα που突ηθούν με πράσινο είναι πιθανό να κοιτάζουν την κάμερα, ενώ αυτά που突ηθούν με κόκκινο είναι πιθανό να κοιτάζουν μακριά. Πηγή: https://arxiv.org/pdf/2112.04212.pdf
Αν και το έργο мотивείται από την ανάπτυξη καλύτερων συστημάτων ασφαλείας για αυτόνομα οχήματα, οι συγγραφείς του νέου εγγράφου παραδέχονται ότι μπορεί να έχει πιο γενικές εφαρμογές σε άλλους κλάδους, παρατηρώντας ‘ακόμη και σε έξυπνες πόλεις, η ανίχνευση επαφής ματιών μπορεί να είναι χρήσιμη για να κατανοηθούν καλύτερα οι συμπεριφορές των πεζών, π.χ. να αναγνωριστούν που είναι η προσοχή τους ή ποια δημόσια σήματα κοιτάζουν’.
Για να βοηθήσει την περαιτέρω ανάπτυξη αυτού και των επόμενων συστημάτων, οι ερευνητές έχουν συγκεντρώσει ένα νέο και綜οτικό σύνολο δεδομένων που ονομάζεται LOOK, το οποίο αντιμετωπίζει trực tiếp τις συγκεκριμένες προκλήσεις της ανίχνευσης επαφής ματιών σε τυχαίες σκηνές, όπως σκηνές δρόμου που αντιλαμβάνονται από την κάμερα ενός αυτόνομου οχήματος ή καθημερινές σκηνές πλήθους μέσω των οποίων ένα ρομπότ μπορεί να χρειαστεί να ναυτιλήσει και να σεβαστεί τη διαδρομή των πεζών.

Αποτελέσματα από το πλαίσιο, με ‘κοιτάζοντας’ αναγνωρισμένα με πράσινο.
Η έρευνα έχει τον τίτλο Διαβάζουν οι Πεζοί; Ανίχνευση Επαφής Ματιών στο Άγριο, και προέρχεται από τέσσερις ερευνητές στο ερευνητικό πρόγραμμα Visual Intelligence for Transportation (VITA) στην Ελβετία, και έναν στο Sorbonne Université.
Αρχιτεκτονική
Περισσότερη προηγούμενη εργασία σε αυτόν τον τομέα έχει επικεντρωθεί στην προσοχή του οδηγού, χρησιμοποιώντας μηχανικό μάθηση για να αναλύσει την έξοδο των καμερών που κοιτάζουν τον οδηγό, και βασίζεται σε μια σταθερή, σταθερή και κοντινή θέα του οδηγού – ένα προνόμιο που είναι απίθανο να είναι διαθέσιμο στις συχνά χαμηλής ανάλυσης καμερών τηλεόρασης, όπου τα άτομα μπορεί να είναι πολύ μακριά για να αναλύσουν τη διάταξη των ματιών τους, και όπου άλλες εμποδισμοί (όπως γυαλιά ηλίου) επίσης εμποδίζουν.
Περισσότερο κεντρικό στο πρόγραμμα του έργου, οι εξωτερικές κάμερες των αυτόνομων οχημάτων δεν θα είναι απαραίτητα σε μια βέλτιστη σκηνή, καθιστώντας τις ‘χαμηλού επιπέδου’ πληροφορίες κλειδιών ιδανικές ως βάση για ένα πλαίσιο ανάλυσης βλέμματος. Τα συστήματα αυτόνομων οχημάτων χρειάζονται έναν πολύ ανταποκρικτικό και αστραπιαίο τρόπο για να κατανοήσουν εάν ένας πεζός – ο οποίος μπορεί να βγει από το πεζοδρόμιο στη διαδρομή του αυτοκινήτου – έχει δει το AV. Σε μια τέτοια κατάσταση, η καθυστέρηση θα μπορούσε να σημαίνει τη διαφορά μεταξύ ζωής και θανάτου.
Η modulaire αρχιτεκτονική που αναπτύχθηκε από τους ερευνητές λαμβάνει μια (συνήθως) πλήρη εικόνα του σώματος ενός ατόμου από την οποία εξάγονται 2D αρθρώσεις σε μια βάση, σκελετική μορφή.

Η αρχιτεκτονική του νέου γαλλο-ελβετικού συστήματος ανίχνευσης επαφής ματιών.
Η στάση κανονικοποιείται για να αφαιρέσει πληροφορίες σχετικά με τον άξονα Y, για να δημιουργηθεί μια ‘πλατιά’ αναπαράσταση της στάσης που τη θέτει σε ισότητα με τις χιλιάδες γνωστές στάσεις που έχουν μάθει από το αλγόριθμο (οι οποίες έχουν επίσης ‘πλατιάσει’), και τις σχετικές δυαδικές σημαίες/ετικέτες (π.χ. 0: Δεν Κοίταζει ή 1: Κοίταζει).
Η στάση συγκρίνεται με τις εσωτερικές γνώσεις του αλγορίθμου σχετικά με το πόσο καλά η στάση αυτή αντιστοιχεί σε εικόνες άλλων πεζών που έχουν αναγνωριστεί ως ‘κοιτάζοντας την κάμερα’ – σημειώσεις που έγιναν χρησιμοποιώντας ειδικά εργαλεία φυλλομετρητή που αναπτύχθηκαν από τους συγγραφείς για τους εργαζόμενους του Amazon Mechanical Turk που συμμετείχαν στην ανάπτυξη του συνόλου δεδομένων LOOK.
Κάθε εικόνα στο LOOK υποβέθηκε σε σχολαστική εξέταση από τέσσερις εργαζόμενους του AMT, και μόνο εικόνες όπου τρεις από τους τέσσερις συμφωνούσαν στο αποτέλεσμα συμπεριλήφθηκαν στην τελική συλλογή.
Η πληροφορία κροπ head, η οποία είναι το κεντρικό σημείο πολλής προηγούμενης εργασίας, είναι μεταξύ των λιγότερο αξιόπιστων δεικτών βλέμματος σε τυχαίες αστικές σκηνές, και ενσωματώνεται ως προαιρετική ροή δεδομένων στην αρχιτεκτονική όπου η ποιότητα και η κάλυψη είναι επαρκής για να υποστηρίξει μια απόφαση σχετικά με το εάν το άτομο κοιτάζει την κάμερα ή όχι. Σε περίπτωση πολύ μακρινών ατόμων, αυτό δεν θα είναι χρήσιμη πληροφορία.
Δεδομένα
Οι ερευνητές απέκτησαν το LOOK από διάφορα προηγούμενα σύνολα δεδομένων που δεν είναι κατάλληλα για αυτήν την εργασία. Τα μόνο δύο σύνολα δεδομένων που μοιράζονται άμεσα το πεδίο του έργου είναι JAAD και PIE, και το καθένα έχει περιορισμούς.
Το JAAD είναι μια προσφορά του 2017 από το Πανεπιστήμιο του Γιορκ στο Τορόντο, που περιέχει 390.000 etiquetted παραδείγματα πεζών, συμπεριλαμβανομένων κουτιών και αναλυτικών στοιχείων συμπεριφοράς. Από αυτά, μόνο 17.000 etiquetted ως Κοιτάζοντας τον οδηγό (δηλαδή την κάμερα εγώ). Το σύνολο δεδομένων περιλαμβάνει 346 κλιπ 30fps που τρέχουν σε 5-10 δευτερόλεπτα βίντεο καμερών οχήματος που καταγράφηκαν στη Βόρεια Αμερική και την Ευρώπη. Το JAAD έχει υψηλό ποσοστό επαναλήψεων, και ο συνολικός αριθμός μοναδικών πεζών είναι μόνο 686.
Το πιο πρόσφατο (2019) PIE, από το Πανεπιστήμιο του Γιορκ στο Τορόντο, είναι παρόμοιο με το JAAD, στο ότι περιλαμβάνει βίντεο 30fps από καμερές οχήματος, αυτή τη φορά από έξι ώρες οδήγησης στο κέντρο του Τορόντο, το οποίο αποδίδει 700.000 etiquetted πεζούς και 1.842 μοναδικούς πεζούς, από τους οποίους μόνο 180 κοιτάζουν την κάμερα.
Αντίθετα, οι ερευνητές για το νέο έγγραφο συγκέντρωσαν τα πιο κατάλληλα δεδομένα από τρία προηγούμενα σύνολα δεδομένων αυτόνομων οχημάτων: KITTI, JRDB, και NuScenes, αντίστοιχα από το Ινστιτούτο Τεχνολογίας της Καρλσρούης στη Γερμανία, το Στάνφορντ και το Πανεπιστήμιο του Μόνας στην Αυστραλία, και ένα παλιό spin-off του MIT Nutonomy.
Αυτή η επιλογή οδήγησε σε ένα ευρύ και διαφορετικό σύνολο καπνών από τέσσερις πόλεις – Βοστώνη, Σιγκαπούρη, Τύμπιγκεν και Παλό Αλτό. Με περίπου 8000 etiquetted προοπτικές πεζών, οι συγγραφείς υποστηρίζουν ότι το LOOK είναι το πιο διαφορετικό σύνολο δεδομένων για ανίχνευση επαφής ματιών ‘στο άγριο’.
Εκπαίδευση και Αποτελέσματα
Η εξαγωγή, η εκπαίδευση και η αξιολόγηση πραγματοποιήθηκαν όλα σε ένα μόνο NVIDIA GeForce GTX 1080ti με 11gb VRAM, που λειτουργεί σε einen Intel Core i7-8700 CPU που τρέχει σε 3.20GHz.
Οι συγγραφείς βρήκαν ότι η μέθοδός τους βελτιώνει τις βάσεις SOTA τουλάχιστον 5%, αλλά και ότι τα μοντέλα που εκπαιδεύτηκαν στο JAAD γενικεύουν πολύ καλά σε μη είδικα δεδομένα, μια σκηνή που δοκιμάστηκε με την ανάμιξη ενός συνόλου δεδομένων.
Καθώς η δοκιμή που πραγματοποιήθηκε ήταν σύνθετη και έπρεπε να προβλέψει για μοντέλα με βάση το κροπ (ενώ η απομόνωση και το κροπ του προσώπου δεν είναι κεντρικά στο νέο πρόγραμμα), δείτε το έγγραφο για λεπτομερή αποτελέσματα.

Αποτελέσματα για την μέση ακρίβεια (AP) ως ποσοστό και συνάρτηση του ύψους του κουτιού σε pixels για δοκιμή στο σύνολο δεδομένων JAAD, με τα αποτελέσματα των συγγραφέων σε έντονα.
Οι ερευνητές έχουν κυκλοφορήσει τον κώδικά τους δημόσια, με το σύνολο δεδομένων διαθέσιμο εδώ, και τον κώδικα στο GitHub.
Οι συγγραφείς καταλήγουν με την ελπίδα ότι η δουλειά τους θα εμπνεύσει περαιτέρω ερευνητικές προσπάθειες σε αυτό που περιγράφουν ως ένα ‘σπουδαίο αλλά παραμελημένο θέμα’
JAAD dataset, με τα αποτελέσματα των συγγραφέων σε έντονα.[/caption] Οι ερευνητές έχουν κυκλοφορήσει τον κώδικά τους δημόσια, με το σύνολο δεδομένων διαθέσιμο εδώ, και τον κώδικα στο GitHub. Οι συγγραφείς καταλήγουν με την ελπίδα ότι η δουλειά τους θα εμπνεύσει περαιτέρω ερευνητικές προσπάθειες σε αυτό που περιγράφουν ως ένα ‘σπουδαίο αλλά παραμελημένο θέμα’.












