Andersonův úhel

‘Detektivní’ AI může identifikovat málo známé lidi z více zdrojů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Oxfordské univerzity vyvinuli systém s umělou inteligencí, který může komplexně identifikovat lidi ve videích pomocí detektivních, multi-doménových vyšetřování, aby zjistili, kdo by mohli být, z kontextu a z různých veřejně dostupných sekundárních zdrojů, včetně shody audio zdrojů s vizuálním materiálem z internetu.

Přestože se výzkum zaměřuje na identifikaci veřejných osobností, jako jsou lidé, kteří se objevují v televizních programech a filmech, princip odvozování identity z kontextu je teoreticky aplikovatelný na kohokoli, jehož tvář, hlas nebo jméno se objevuje v online zdrojích.

Skutečně, článek sám definuje slávu jako lidi s mnoha obrázky sami sebe online jako slavné.

Přímo na video

Výzkumníci z Oxfordské skupiny pro vizuální geometrii na katedře inženýrství popsali lidský styl vyšetřování, který inspiroval práci:

‘Představte si, že sledujete video a potkáte novou osobu. Abyste ji mohli s jistotou identifikovat, budete nejdříve hledat nápovědu o jejím jménu, buď ve videu, jako je text na obrazovce, její jméno je zmíněno v řeči, nebo v seznamu členů z internetového archivu. Poté můžete najít nějaké důkazy, aby jste potvrdili, že toto jméno je správné, hledáním osoby online.’

Metodika navržená v článku je zcela automatizovaná a eliminuje veškeré další manuální označování (s výjimkou těch, která provedli poskytovatelé online zdrojů). Systém byl také prokázán jako funkční napříč třemi nesouvisejícími datovými soubory bez potřeby doménové adaptace.

Při diskusi o aplikaci práce výzkumníci zmínili exponenciální růst nelabelovaných, neprůhledných videodat a potřebu nových systémů, které mohou odvodit informaci o identitě z nich bez drahých lidských anotací:

‘[Čistá] velikost dat, spojená s nedostatkem relevantních metadat, činí indexování, analýzu a navigaci v tomto obsahu stále obtížnější úkolem. Spoléhání se na další, manuální lidské anotace již není proveditelné, a bez efektivní cesty, jak procházet tyto videa, je tato banka znalostí z velké části nepřístupná.’

Indexovací motor této povahy otevírá možnost pro odkazy na výsledky vyhledávání, které přímo směřují na bod ve videu, kde se objeví hledaná osoba, jak je demonstrováno v proof-of-concept vyhledávacím nástroji poskytnutém projektem.

Oxfordský systém umožňuje vyhledávání instancí identifikované osoby. Výsledek vyhledávání vede diváka přímo na bod ve videu, kde se objeví identifikovaná osoba, a video lze poté přehrávat z tohoto bodu.

Oxfordský systém umožňuje vyhledávání instancí identifikované osoby. Výsledek vyhledávání vede diváka přímo na bod ve videu, kde se objeví identifikovaná osoba, a video lze poté přehrávat z tohoto bodu. Source: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/

Jednou z možností, jak systém identifikuje ‘neznámé’ osoby, je kontext jejich asociace s ostatními. V důsledku toho je vyhledávací stroj dobře vybaven pro vyhledávání více identit, které se objevují ve stejném videu:

Velké a malé ryby

Systém se nejprve zaměřuje na ‘nízké visící ovoce’ – lidi, jejichž tváře jsou tak dobře indexovány v veřejných zdrojích, že identifikace je relativně triviální, shodou metadat nebo OCR textu ve videích proti veřejným datovým zdrojům, jako jsou seznamy IMDB. AI interpretovaný text ve videích, titulkách a dalších formách rastrového textu ve videu je také využíván k identifikaci.

Kandidátní jména pro vyhledávání lze automaticky objevit systémem na základě optické charakterové rozpoznávání rastrového textu nebo skutečného textu v jiných zdrojích. Takže lidé mohou být indexováni automaticky bez předchozích dotazů spuštěných proti jejich jménům jednotlivými uživateli.

Kandidátní jména pro vyhledávání lze automaticky objevit systémem na základě optické charakterové rozpoznávání (OCR) rastrového textu nebo skutečného textu v jiných zdrojích, jako jsou herecké seznamy. Takže lidé mohou být indexováni automaticky bez předchozích dotazů spuštěných proti jejich jménům jednotlivými uživateli a bez předchozí účasti v AI-podporovaných sociálních sítích. Source: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf

Kde převažující síťové obrázky a videa potvrzují identitu osoby, vyšetřování potvrzuje identitu. Ale kde je osoba více neznámá, jsou použity jiné metody, včetně audio z videí, které lze použít jako potvrzující potvrzení identity. Přestože není pokryto v práci, logicky není nic, co by bránilo rámcové povaze tohoto druhu také využívat čisté audio zdroje, stejně jako audio komponenty ve videu.

Samo-propagující se identifikační panoptikon

Kromě generování kandidátních jmen z rastrového nebo skutečného textu jsou v Oxfordském projektu použity technologie rozpoznávání řeči k rozpoznání jmen, která jsou pouze mluvená v audio obsahu. Takže identita může být inicializována jedním nebo dvěma lidmi, kteří zmíní třetí osobu, která není přítomna.

Bezpečnostní opatření, které Oxfordský projekt zavádí, je, že kandidát musí být uveden v databázi IMDB, ale odstranění tohoto libovolného ustanovení podstatně rozšiřuje potenciální rozsah schopností systému, protože se zcela spoléhá na webové zdroje.

Takže s kombinací zdrojů, včetně jmen odvozených z rastrového textu, skutečného textu, mluvnických zmínek a velmi omezeného vizuálního materiálu, je možné identifikovat osoby s nízkou vizuální sítí.

Technicky je také možné vytvořit profil osoby, ke které nebyla dosud přidružena žádná obrazová nebo video stopa, ale ke které lze později přidružit obraz nebo video, když jiné faktory korelují s nově přijatým video zdrojem.

Testovací datové soubory

Výzkumníci použili tři datové soubory k vyhodnocení účinnosti systému: MediaEval, který obsahuje Creative Commons sociální média odvozené a komunitní obrazové zdroje (včetně Wikipedie a Flickr) zachycené mezi lety 2010-2015; Oxfordskou skupinu vlastního datasetu z roku 2017 Sherlock, který obsahuje anotovaná videa z populární moderní adaptace Conan Doyleovy klasické postavy; a nový dataset BBC videí vytvořený speciálně pro projekt, který používá různé anotované zpravodajské záběry z BBC.

Systém se osvědčil napříč širokým spektrem datových prostředí, včetně případů, kdy je tvář zakryta odrazy nebo tmou.

Systém se osvědčil napříč širokým spektrem datových prostředí, včetně případů, kdy je tvář zakryta odrazy nebo tmou.

Proces také využívá živé image vyhledávací žebříčky.

Výsledky systému vyprodukovaly vysokou přesnost napříč třemi modely. V případě datasetu Sherlock výzkumníci byli překvapeni, že nový systém zlepšil 3-6% oproti předchozí metodě, která používala podpůrné vektorové stroje (SVM) v multi-way klasifikátoru, přestože nejbližší sousední klasifikátor použitý v nové práci je méně výkonným nástrojem.

Implikace

Většina etických nebo praktických omezení v Oxfordském projektu jsou samy o sobě stanoveny výzkumníky, jako je definice ‘slávy’ požadavkem, že identifikované identity mají přítomnost v IMDB, a testováním systému pouze proti zavedeným akademickým datovým souborům, které respektují Creative Commons licencování.

Avšak základní architektura projektu znázorňuje obecnou metodu, nejen identifikaci ‘neznámých’ osob, které mají nízkou nebo žádnou vizuální přítomnost na internetu (protože pouhé zmínění jména může spustit identifikační token, který lze vyvinout v čase, jak je nutné), ale také vytvořit matici osob, která je řízena pouze rekursivní a mechanickou zvědavostí, spíše než poptávkou nebo explicitní přítomností označených dat (jako jsou uploady fotografií na sociálních sítích, které obsahují PII metadata).

Projekt neobsahuje geolokační data nebo jiné formy široce dostupných metadat, které by mohly být nalezeny v přispívajících dokumentech, jako je geografická lokalizace informací vložených do uploadů na sociálních sítích (kde tyto nejsou odstraněny jako uživatelská preference). Avšak neexistuje žádný zjevný překážka použití těchto dalších dimenzí dat k posílení procesu korelace.

Kde jsou outliery (identity, které mají téměř žádnou přítomnost, kromě toho, že nejsou uvedeny v IMDB) ořezány (způsob, který je běžný v projektech strojového učení), taková minimální informace může vlastně účinněji identifikovat neznámou osobu, než by se stalo, kdyby byla k dispozici větší množství reprezentativních informací o nich. Pokud jsou outliery přesně to, co hledáte (tj. osoby s malou sítí stop), řídká data mohou být vysoce indikativní.

Dostupnost

Oxfordští výzkumníci zabalili funkčnost projektu do vyhledávacího nástroje, který lze stáhnout a nainstalovat na lokální stroj pomocí Dockeru (ačkoli instrukce pro instalaci z května 2021 obsahují zastaralé informace pro požadavek Docker Tools, které mohou proces zkomplikovat).

Neexistuje žádný živý online vyhledávací nástroj, který pokrývá implementaci projektu napříč všemi třemi datovými soubory, ačkoli výsledky pro dataset BBC news lze volně dotazovat na http://zeus.robots.ox.ac.uk/bbc_search/.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai