Kąt Andersona
Sztuczna inteligencja “detektyw” może identyfikować mało znane osoby z wielu źródeł

Naukowcy z Uniwersytetu Oksfordzkiego opracowali system wykorzystujący sztuczną inteligencję, który może kompleksowo identyfikować osoby w filmach, prowadząc śledztwo w stylu detektywistycznym, aby ustalić, kim mogą być, na podstawie kontekstu i różnych publicznie dostępnych źródeł, w tym dopasowywania źródeł audio z materiałem wizualnym z Internetu.
Chociaż badania koncentrują się na identyfikacji osób publicznych, takich jak osoby pojawiające się w programach telewizyjnych i filmach, zasadę wnioskowania tożsamości z kontekstu można teoretycznie zastosować do każdego, którego twarz, głos lub imię pojawia się w źródłach online.
W rzeczywistości definicja sławy w artykule nie jest ograniczona do pracowników branży rozrywkowej, ponieważ naukowcy oświadczają: “Oznaczamy ludzi, którzy mają wiele zdjęć siebie online jako znanych“.
Bezpośrednio do wideo
Naukowcy z Oksfordzkiej Grupy Geometrii Wizualnej na Wydziale Nauk Inżynieryjnych opisują podejście inspirowane stylem śledczym, które stało się podstawą ich pracy:
‘Wyobraź sobie, że oglądasz film i spotykasz nową osobę. Aby ją pewnie zidentyfikować, najpierw szukałbyś wskazówek dotyczących jej imienia, takich jak tekst na ekranie, jej imię wymienione w rozmowie lub w liście obsady z internetowego archiwum. Następnie mogłbyś znaleźć dowody, aby potwierdzić, że to imię jest poprawne, wyszukując tę osobę w Internecie.’
Metodologia proponowana w artykule jest całkowicie zautomatyzowana i eliminuje wszelkie dodatkowe ręczne oznaczanie (z wyjątkiem tych, które zostały wykonane przez dostawców źródeł online). System został również udowodniony, że działa dobrze w trzech niezwiązanych ze sobą zbiorach danych bez potrzeby adaptacji domenowej.
Omawiając zastosowanie pracy, naukowcy zwracają uwagę na wykładniczy wzrost nieoznaczonych, nieprzezroczystych danych wideo oraz potrzebę nowych systemów, które mogą wywnioskować informacje o tożsamości bez drogich, prowadzonych przez ludzi adnotacji:
‘[Sam] rozmiar danych, w połączeniu z brakiem odpowiednich metadanych, sprawia, że indeksowanie, analizowanie i nawigowanie po tej treści staje się coraz trudniejszym zadaniem. Uwzględnianie dodatkowych, ręcznych adnotacji przez ludzi nie jest już wykonalne, a bez skutecznego sposobu nawigacji po tych filmach, ta baza wiedzy jest w dużej mierze niedostępna.’
Silnik indeksujący tego rodzaju otwiera możliwość wyników wyszukiwania, które prowadzą bezpośrednio do punktu w filmie, w którym pojawia się osoba wyszukiwana, jak to zostało zademonstrowane w proof-of-concept wyszukiwarki internetowej dostarczonej przez projekt.

System Oksfordzki pozwala na wyszukiwanie wystąpień zidentyfikowanej osoby. Wynik wyszukiwania prowadzi widza bezpośrednio do punktu w filmie, w którym pojawia się zidentyfikowana osoba, a film można odtwarzać od tego punktu. Źródło: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Jednym ze sposobów, w jaki system identyfikuje “nieznane” osoby, jest kontekst ich związku z innymi. W związku z tym, silnik wyszukiwania jest dobrze przygotowany do wyszukiwania wielu tożsamości pojawiających się w tym samym filmie:
Wielkie i małe ryby
System najpierw zajmuje się “niskimi owocami” – ludźmi, których twarze są tak dobrze zindeksowane w publicznie dostępnych sieciach, że identyfikacja jest względnie trywialna, poprzez dopasowywanie metadanych lub OCR’d tekstu w filmach do publicznych źródeł danych, takich jak listy IMDB. Tekst interpretowany przez AI w napisach, kredytach i innych formach rastrowego tekstu w filmie jest również wykorzystywany do identyfikacji.

Nazwy kandydatów do wyszukiwania mogą być automatycznie odkrywane przez system, na podstawie rozpoznawania optycznego tekstu rastrowego lub rzeczywistego tekstu w innych źródłach, takich jak listy obsady. Dzięki temu ludzie mogą być indeksowani automatycznie bez potrzeby wcześniejszych zapytań dotyczących ich nazwisk przez indywidualnych użytkowników, oraz bez wcześniejszego udziału w sieciach społecznościowych z obsługą AI. Źródło: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Gdzie zdecydowanie potwierdzają tożsamość osoby, dochodzenie potwierdza tożsamość. Ale gdzie osoba jest mniej znana, stosuje się inne metody, w tym dźwięk z nagrania, który może służyć jako potwierdzenie tożsamości. Chociaż nie jest to objęte pracą, logicznie nie ma nic, co mogłoby powstrzymać ramy tego rodzaju przed wykorzystaniem czystych źródeł audio, a także składników audio w filmie.
Samopowtarzalny panoptikon tożsamości
Oprócz generowania nazw kandydatów z rastrowego lub czystego tekstu, technologie rozpoznawania mowy są wykorzystywane w projekcie Oksfordzkim do rozpoznawania nazw, które są po prostu wymawiane w treści audio. Dzięki temu tożsamość może być zainicjowana przez jedną lub dwie osoby, które wymieniają trzecią osobę, która nie jest obecna.
Zabezpieczeniem, które projekt Oksfordzki wprowadza, jest to, że kandydat musi pojawić się w bazie danych IMDB, ale usunięcie tego arbitralnego warunku znacznie rozszerza potencjalny zakres możliwości systemu, ponieważ opiera się wyłącznie na źródłach sieciowych.

Dlatego, dzięki połączeniu źródeł, w tym nazw pochodzących z rastrowego tekstu, rzeczywistego tekstu, wzmianek opartych na mowie i bardzo ograniczonego materiału wizualnego, staje się możliwe identyfikowanie osób o niskim poziomie obecności w sieci.
Technicznie jest również możliwe zbudowanie profilu osoby, do której nie jest jeszcze przypisany żaden obraz lub film, ale do której można ostatecznie dodać obraz lub film, gdy inne czynniki korelują z nowo spożytkowanym źródłem wideo.
Zestawy danych testowych
Naukowcy wykorzystali trzy zestawy danych, aby ocenić skuteczność systemu: MediaEval, który zawiera Creative Commons społecznościowe i wspólnotowe zasoby obrazowe (w tym Wikipedia i Flickr) przechwycone między 2010-2015; własny zestaw danych Oksfordzkiej grupy z 2017 roku Sherlock, który zawiera adnotowane dane wideo z popularnej nowoczesnej adaptacji postaci Conan Doyle’a; oraz nowy zestaw danych filmów BBC stworzony specjalnie dla projektu, który wykorzystuje różne adnotowane nagrania informacyjne z BBC.

System działa poprawnie w różnych środowiskach zestawów danych, w tym w sytuacjach, w których twarz jest zakryta przez odbicia lub ciemność.
Proces wykorzystuje również rankingi wyszukiwania obrazów na żywo.
Wyniki systemu wykazały wysoką dokładność we wszystkich trzech modelach. W przypadku zestawu danych Sherlock naukowcy byli zaskoczeni, gdy stwierdzili, że nowy system poprawił wyniki o 3-6% w porównaniu z poprzednią metodą, która wykorzystywała maszyny wektorowe (SVM) w klasyfikatorze wielodrogowym, pomimo że klasyfikator najbliższego sąsiada użyty w nowej pracy jest mniej potężnym narzędziem.
Wnioski
Większość ograniczeń etycznych lub praktycznych w projekcie Oksfordzkim jest narzucana przez samych naukowców, takich jak definicja “sławy” przez wymóg, że odkryte tożsamości mają obecność w IMDB, oraz testowanie systemu wyłącznie przeciwko ustanowionym akademickim zestawom danych, które szanują licencje Creative Commons.
Jednakże podstawowa architektura projektu przedstawia ogólną metodę nie tylko identyfikacji “nieznanych” osób, które mają niską lub zerową obecność wizualną w Internecie (ponieważ sama wzmianka o nazwie może spowodować powstanie tokena tożsamości, który może być rozwijany w czasie), ale także tworzenie macierzy osób, które są napędzane przez mechaniczną ciekawość, a nie przez popyt lub przez jawne występowanie oznaczonych danych (takich jak metadane PII w uploadach zdjęć na sieciach społecznościowych).
Projekt nie wykorzystuje danych geolokalizacyjnych ani innych szeroko dostępnych metadanych, które mogą być znalezione w dokumentach korygujących, takich jak informacje o lokalizacji geograficznej wbudowane domyślnie w uploady na sieciach społecznościowych (jeśli nie są usuwane jako preferencja użytkownika). Jednak nie ma widocznego przeszkody w wykorzystaniu takich dodatkowych wymiarów danych, aby wzmocnić proces korygujący.
Gdziekolwiek są to “wyjątki” (tożsamości, które mają prawie zero obecności, oprócz braku listy w IMDB) w sposób, który jest powszechny w projektach z użyciem maszyny, takie minimalne informacje mogą skuteczniej identyfikować nieznaną osobę niż gdyby dostępna była większa ilość reprezentatywnych informacji o niej. Jeśli wyjątki są tym, czego szukasz (tj. osoby o małym śladzie sieciowym), rzadkie dane mogą być bardzo wskazujące.
Dostępność
Naukowcy z Oksfordu zawarli funkcjonalność projektu w silniku wyszukiwania w stylu Google, który można pobrać i zainstalować na lokalnej maszynie za pomocą Docker (chociaż instrukcje instalacji z maja 2021 roku zawierają nieaktualne informacje dotyczące wymagań narzędzi Docker, co może utrudnić proces).
Wygląda na to, że nie ma wersji online, która obejmuje wdrożenie projektu we wszystkich trzech zestawach danych, chociaż wyniki dla zestawu danych BBC mogą być swobodnie sprawdzane pod adresem http://zeus.robots.ox.ac.uk/bbc_search/.














