Η γωνία του Anderson
Ένας ‘Ερευνητής’ AI Μπορεί Να Αναγνωρίσει Λιγότερο Γνωστούς Ανθρώπους Από Πολλαπλά Πηγές

Ερευνητές στο Πανεπιστήμιο του Οξφόρδου έχουν αναπτύξει ένα σύστημα που ενεργοποιείται από τον AI, το οποίο μπορεί να αναγνωρίσει συνολικά άτομα σε βίντεο, πραγματοποιώντας ερευνες τύπου ντετέκτιβ, σε πολλαπλά πεδία, σχετικά με το ποιος μπορεί να είναι, από το контέκστ και από μια ποικιλία δημόσιων δευτερευουσών πηγών, συμπεριλαμβανομένης της αντιστοίχισης ηχητικών πηγών με οπτικό υλικό από το διαδίκτυο.
Αν και η έρευνα επικεντρώνεται στην αναγνώριση δημόσιων προσωπικοτήτων, όπως άτομα που εμφανίζονται σε τηλεοπτικά προγράμματα και ταινίες, η αρχή της αναγνώρισης ταυτότητας από το контέκστ είναι θεωρητικά εφαρμόσιμη σε οποιονδήποτε έχει το πρόσωπο, τη φωνή ή το όνομα που εμφανίζεται σε διαδικτυακές πηγές.
Στην πραγματικότητα, η μελέτη ορίζει τη φήμη ως άτομα με πολλές εικόνες του εαυτού τους στο διαδίκτυο ως δημόσιους.
Στα Βίντεο
Οι ερευνητές από την Ομάδα Οπτικής Γεωμετρίας του Τμήματος Μηχανικής Επιστήμης του Οξφόρδου περιγράφουν την ανθρώπινη ερευνητική προσέγγιση που ενέπνευσε το έργο:
‘Φανταστείτε ότι παρακολουθείτε ένα βίντεο και συναντάτε ένα νέο άτομο. Για να το αναγνωρίσετε με βεβαιότητα, θα ψάχνατε πρώτα για ενδείξεις του ονόματος τους, είτε στο βίντεο, όπως κείμενο στην οθόνη, το όνομά τους να αναφέρεται σε ομιλία, ή σε μια λίστα μελών από ένα αρχείο στο διαδίκτυο. Στη συνέχεια, θα βρείτε κάποια απόδειξη για να επιβεβαιώσετε ότι το όνομα είναι σωστό, αναζητώντας το άτομο στο διαδίκτυο.’
Η μεθοδολογία που προτείνεται από τη μελέτη είναι πλήρως αυτοματοποιημένη και εξαλείφει mọi πρόσθετη χειροκίνητη επισήμανση (εκτός από εκείνη που πραγματοποιήθηκε από τους παρόχους των διαδικτυακών πηγών). Το σύστημα αποδείχθηκε επίσης ότι λειτουργεί καλά σε τρεις μη σχετιζόμενες βάσεις δεδομένων χωρίς την ανάγκη για προσαρμογή τομέα.
Συζητώντας την εφαρμογή του έργου, οι ερευνητές σημειώνουν την εκθετική αύξηση των μη επισημασμένων, αδιαφανών δεδομένων βίντεο και την ανάγκη για νέα συστήματα που μπορούν να εξαγάγουν πληροφορίες ταυτότητας από αυτά χωρίς ακριβές ανθρώπινες αναnotations:
‘[Η] καθαρή κλίμακα των δεδομένων, σε συνδυασμό με την έλλειψη σχετικών μεταδεδομένων, καθιστά την ευρετηρίαση, την ανάλυση και την πλοήγηση του περιεχομένου một ολοένα και πιο δύσκολο έργο. Η εξάρτηση από πρόσθετες, χειροκίνητες ανθρώπινες αναnotations δεν είναι πλέον βιώσιμη και χωρίς αποτελεσματικό τρόπο να πλοηγήσουμε αυτά τα βίντεο, αυτή η τράπεζα γνώσεων είναι σε μεγάλο βαθμό απρόσιτη.’
Ένας μηχανισμός ευρετηρίας αυτού του είδους ανοίγει την πιθανότητα για υπερσύνδεσμους αποτελεσμάτων αναζήτησης που φτάνουν απευθείας σε ένα σημείο στο βίντεο όπου εμφανίζεται το αντικείμενο αναζήτησης, όπως φαίνεται στο proof-of-concept web search που παρέχεται από το έργο.

Το σύστημα του Οξφόρδου επιτρέπει την αναζήτηση εμφανίσεων ενός αναγνωρισμένου ατόμου. Το αποτέλεσμα αναζήτησης οδηγεί τον θεατή απευθείας στο σημείο στο βίντεο όπου εμφανίζεται το αναγνωρισμένο άτομο και το βίντεο μπορεί να παιχθεί από εκεί. Πηγή: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Ένας από τους τρόπους με τους οποίους το σύστημα αναγνωρίζει ‘λιγότερο γνωστά’ άτομα είναι από το контέκστ της σύνδεσής τους με άλλους. Συνεπώς, ο μηχανισμός αναζήτησης είναι καλά εξοπλισμένος για την αναζήτηση πολλαπλών ταυτοτήτων που εμφανίζονται στο ίδιο βίντεο:
Μέγα και Μικρό Ψάρι
Το σύστημα αρχικά αντιμετωπίζει το ‘εύκολο’ ψάρι – άτομα των οποίων τα πρόσωπα είναι τόσο καλά ευρετηριασμένα σε δημόσιες πηγές δικτύου, ώστε η αναγνώριση τους είναι σχετικά εύκολη, αντιστοιχώντας μεταδεδομένα ή OCR’d κείμενο σε βίντεο με δημόσιες πηγές δεδομένων όπως λίστες του IMDB. Το AI-ερμηνευμένο κείμενο σε υποτιτλους βίντεο, πίστεις και άλλες μορφές ραστρικού κειμένου σε βίντεο επίσης αξιοποιείται για την αναγνώριση.

Οι υποψήφιοι για αναζήτηση possono να auto-ανακαλυφθούν από το σύστημα, με βάση την οπτική αναγνώριση χαρακτήρων του ραστρικού κειμένου ή του πραγματικού κειμένου σε άλλες πηγές, όπως λίστες καστ. Έτσι, τα άτομα μπορούν να ευρετηριαστούν αυτόματα χωρίς προηγούμενες ερωτήσεις που τρέχουν με τα ονόματά τους από ατομικούς τελικούς χρήστες και χωρίς προηγούμενη συμμετοχή σε AI-ενεργοποιημένα κοινωνικά δίκτυα. Πηγή: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Όπου η συντριπτική πλειοψηφία των εικόνων και βίντεο στο διαδίκτυο επιβεβαιώνει την ταυτότητα του ατόμου, η έρευνα επιβεβαιώνει μια ταυτότητα. Αλλά όπου το άτομο είναι πιο ασήμαντο, χρησιμοποιούνται άλλες μεθόδους, συμπεριλαμβανομένης της ηχητικής από τις pistes βίντεο, η οποία μπορεί να χρησιμοποιηθεί ως επιβεβαιωτική επιβεβαίωση μιας ταυτότητας. Αν και δεν καλύπτεται από το έργο, λογικά δεν υπάρχει τίποτα που να εμποδίζει ένα πλαίσιο αυτού του είδους να χρησιμοποιήσει επίσης καθαρές πηγές ήχου, καθώς και συνιστώσες ήχου σε βίντεο.
Ένα Αυτο-Προπαγανδιστικό Πανοπτικό της Ταυτότητας
Εκτός από τη δημιουργία υποψήφιων ονομάτων από ραστρικό ή καθαρό κείμενο, τεχνολογίες αναγνώρισης ομιλίας χρησιμοποιούνται στο έργο του Οξφόρδου για να αναγνωρίσουν ονόματα που αναφέρονται μόνο ομιλώντας σε ηχητικό περιεχόμενο. Έτσι, μια ταυτότητα μπορεί να αρχικοποιηθεί από ένα ή δύο άτομα που αναφέρουν ένα τρίτο άτομο που δεν είναι παρόν.
Το σύστημα του Οξφόρδου εισάγει ένα προστατευτικό μέτρο, το οποίο απαιτεί ο υποψήφιος να εμφανίζεται στη βάση δεδομένων του IMDB, αλλά η αφαίρεση αυτής της αυθαίρετης προϋπόθεσης διευρύνει σημαντικά τις δυνατότητες του συστήματος, поскольку βασίζεται αποκλειστικά σε διαδικτυακά πηγές.

Επομένως, με συνδυασμό πηγών, συμπεριλαμβανομένων ονομάτων που προέρχονται από ραστρικό κείμενο, πραγματικό κείμενο, ομιλίες-αναφορές και πολύ περιορισμένο οπτικό υλικό, γίνεται δυνατή η αναγνώριση ατόμων με χαμηλή οπτική παρουσία στο δίκτυο.
Τεχνολογικά, γίνεται επίσης δυνατή η δημιουργία ενός προφίλ ενός ατόμου, στο οποίο δεν έχει ακόμη συνδεθεί εικόνα ή βίντεο, αλλά μπορεί να συνδεθεί με εικόνα ή βίντεο όταν άλλες παράμετροι συσχετίζονται με μια νεοεισαχθείσα πηγή βίντεο.
Δεδομένα Τεστ
Οι ερευνητές χρησιμοποίησαν τρεις βάσεις δεδομένων για να αξιολογήσουν την αποτελεσματικότητα του συστήματος: MediaEval, η οποία διαθέτει Creative Commons κοινωνικά μέσα και κοινότητα εικόνων (συμπεριλαμβανομένων Wikipedia και Flickr) που καταγράφηκαν μεταξύ 2010-2015, τη δική τους βάση δεδομένων Sherlock του 2017, η οποία διαθέτει αναノταρισμένα δεδομένα βίντεο από την moderne προσαρμογή του Conan Doyle, και μια νέα βάση δεδομένων βίντεο του BBC που δημιουργήθηκε ειδικά για το έργο, η οποία χρησιμοποιεί αναノταρισμένα νέα βίντεο από το BBC.

Το σύστημα επιτυγχάνει σε ένα ευρύ φάσμα περιβαλλόντων βάσεων δεδομένων, συμπεριλαμβανομένων περιπτώσεων όπου το πρόσωπο είναι καλυμμένο από ανακλάσεις ή σκότος.
Η διαδικασία επίσης αξιοποιεί ζωντανούς καταλόγους αναζήτησης.
Τα αποτελέσματα για το σύστημα παρήγαγαν υψηλή ακρίβεια σε όλα τα τρία μοντέλα. Σε περίπτωση της βάσης δεδομένων Sherlock, οι ερευνητές ήταν έκπληκτοι να βρουν ότι το νέο σύστημα βελτίωσε 3-6% έναντι μιας προηγούμενης μεθόδου που χρησιμοποιούσε μηχανές διανύσματος υποστήριξης (SVMs) σε einen πολυ-τρόπο分类, ακόμη και αν ο πλησιέστερος ταξινομητής που χρησιμοποιήθηκε στη νέα εργασία ήταν ένα λιγότερο ισχυρό εργαλείο.
Επιβεβαιώσεις
Οι περισσότερες από τις ηθικές ή πρακτικές περιορισμοί στο έργο του Οξφόρδου είναι αυτο-επιβεβεβαιωμένες από τους ερευνητές, όπως η ορισμός της ‘φήμης’ από την απαίτηση ότι οι ανακαλυφθείσες ταυτότητες έχουν παρουσία στη βάση δεδομένων του IMDB, και με το τεστ του συστήματος μόνο ενάντια σε καθιερωμένες ακαδημαϊκές βάσεις δεδομένων που σεβούνται την άδεια Creative Commons.
Ωστόσο, η βασική αρχιτεκτονική του έργου απεικονίζει μια γενική μέθοδο για να αναγνωρίσει ‘λιγότερο γνωστά’ άτομα που έχουν χαμηλή ή μηδενική οπτική παρουσία στο διαδίκτυο (αφού μια απλή αναφορά του ονόματος μπορεί να δημιουργήσει ένα token ταυτότητας που μπορεί να αναπτυχθεί με τον καιρό, όπως απαιτείται), αλλά και να δημιουργήσει ένα πλέγμα ατόμων που οδηγείται από τίποτα άλλο παρά από αναδρομική και μηχανική περιέργεια, παρά από ζήτηση ή από την ρητή παρουσία επισήμανων δεδομένων (όπως ανεβάσεις φωτογραφιών σε κοινωνικά δίκτυα που περιέχουν μεταδεδομένα PII).
Το έργο δεν χρησιμοποιεί δεδομένα geolocation ή άλλα είδη ευρέως διαθέσιμων μεταδεδομένων που μπορεί να βρεθούν σε συνεισφέρουσες επιβεβαιωτικές εγγράφους, όπως γεωγραφικές πληροφορίες τοποθεσίας που ενσωματώνονται από προεπιλογή σε ανεβάσεις σε κοινωνικά δίκτυα (όπου αυτά δεν αφαιρούνται ως προτίμηση χρήστη). Ωστόσο, δεν υπάρχει φανερή εμπόδιο να χρησιμοποιηθούν τέτοιες πρόσθετες διαστάσεις δεδομένων για να ενισχύσουν την επιβεβαιωτική διαδικασία.
Εάν οι αποκλίσεις (ταυτότητες που έχουν σχεδόν μηδενική παρουσία, εκτός από το γεγονός ότι δεν είναι καταχωρημένες στη βάση δεδομένων του IMDB) κοπούν με τρόπο που είναι κοινός σε έργα μηχανικής μάθησης, τέτοιες ελάχιστες πληροφορίες μπορούν να αναγνωρίσουν αποτελεσματικά ένα άγνωστο άτομο παρά αν ήταν διαθέσιμες μεγαλύτερες ποσότητες αντιπροσωπευτικών πληροφοριών γι’ αυτό.
Διαθεσιμότητα
Οι ερευνητές του Οξφόρδου έχουν ενσωματώσει τη λειτουργικότητα του έργου σε einen μηχανισμό αναζήτησης τύπου Google, ο οποίος μπορεί να κατεβάσει και να εγκατασταθεί σε ένα τοπικό μηχάνημα μέσω Docker (αν και οι οδηγίες εγκατάστασης για το Μάιο 2021 περιέχουν παλαιά πληροφορίες για μια απαίτηση εργαλείων Docker, η οποία μπορεί να εμποδίσει τη διαδικασία).
Δεν υπάρχει φανερά ζωντανή διαδικτυακή έκδοση που καλύπτει την εφαρμογή του έργου σε όλες τις τρεις βάσεις δεδομένων, αν και τα αποτελέσματα για τη βάση δεδομένων του BBC μπορούν να αναζητηθούν ελεύθερα στο http://zeus.robots.ox.ac.uk/bbc_search/.














