Погляд Anderson
‘Детектив’ штучний інтелект може ідентифікувати маловідомих людей з кількох джерел

Дослідники Оксфордського університету розробили систему, що використовує штучний інтелект для ідентифікації людей у відео шляхом проведення детективних розслідувань у кількох областях, щоб з’ясувати, хто вони можуть бути, виходячи з контексту та з різноманітних публічно доступних вторинних джерел, включаючи зіставлення аудіо-джерел з візуальним матеріалом з інтернету.
Хоча дослідження зосереджується на ідентифікації публічних осіб, таких як люди, що з’являються на телевізійних програмах і фільмах, принцип висновку ідентичності з контексту теоретично застосовний до будь-кого, чий обличчя, голос або ім’я з’являється в онлайн-джерелах.
Насправді, у статті власне визначення слави не обмежується працівниками шоу-бізнесу, оскільки дослідники заявляють: “Ми позначаємо людей з багатьма зображеннями себе в інтернеті як відомих“.
Прямо до відео
Дослідники з Оксфордської групи візуальної геометрії Відділу інженерних наук описують людський підхід до розслідування, який надихнув цю роботу:
‘Представіть, що ви дивитеся відео і зустрічаєте нового человека. Щоб впевнено ідентифікувати його, ви спочатку шукатимете підказки про його ім’я в відео, наприклад текст на екрані, його ім’я, яке згадується в розмові, або в списку учасників з інтернет-архіву. Ви можете потім знайти деякі докази, щоб підтвердити, що це ім’я правильне, шукаючи людину в інтернеті.’
Методологія, запропонована в статті, повністю автоматизована і виключає будь-яке додаткове ручне маркування (окрім тих, що були виконані постачальниками онлайн-джерел). Система також була доведена до ефективної роботи в трьох не пов’язаних між собою наборах даних без необхідності домен-адаптації.
Обговорюючи застосування роботи, дослідники відзначають експоненційний рост не позначених, не прозорих відео-даних і необхідність нових систем, які можуть вивести інформацію про ідентичність з них без дорогих людських анотацій:
‘[Чиста] масштабність даних, у поєднанні з відсутністю відповідних метаданих, робить індексування, аналіз і навігацію цього контенту все більш складною задачею. Спрямування на додаткове ручне людське анотування вже не є можливим, і без ефективного способу навігації цих відео, цей банк знань є в основному недоступним.’
Такий індексний двигун відкриває можливість для гіперпосилань у результатах пошуку, які приходять безпосередньо до точки у відео, де з’являється об’єкт пошуку, як це демонструється в доведенні концепції веб-пошуку, наданому проєктом.

Система Оксфорду дозволяє шукати випадки ідентифікованої людини. Результат пошуку приводить глядача безпосередньо до точки у відео, де з’являється ідентифікована людина, і відео можна потім програти з цієї точки. Джерело: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Одним із способів, яким система ідентифікує “маловідомих” людей, є контекст їхньої асоціації з іншими. Таким чином, пошукова система добре обладнана для пошуку кількох ідентичностей, що з’являються в одному відео:
Велика і мала риба
Система спочатку займається “низько висячими плодами” – людьми, чиї обличчя так добре індексовані в публічних мережевих ресурсах, що ідентифікація їх відносно тривіальна, зіставляючи метадані або текст, отриманий за допомогою OCR у відео, проти публічних даних, таких як списки IMDB. Текст, інтерпретований штучним інтелектом у відео-підписах, титрах і інших формах растрізованого тексту у відео, також використовується для ідентифікації.

Кандидати на пошук можуть бути автоматично виявлені системою на основі оптичного розпізнавання тексту (OCR) або фактичного тексту в інших джерелах, таких як списки акторів. Таким чином, людей можна індексувати автоматично без будь-яких попередніх запитів до їхніх імен окремими користувачами, і без попередньої участі в штучно інтелектних соціальних мережах. Джерело: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Коли переважаючі мережеві зображення та відео підтверджують ідентичність людини, розслідування підтверджує ідентичність. Але коли людина більш маловідома, використовуються інші методи, включаючи аудіо з відео-треків, яке можна використовувати як підтвердження ідентичності. Хоча це не розглянуто в роботі, логічно немає нічого, що зупиняє таку систему від використання чистих аудіо-джерел, а також аудіо-компонентів у відео.
Самопідтримуючий паноптикон ідентичності
Крім генерації кандидатських імен з растрізованого або чистого тексту, технології розпізнавання мови використовуються в Оксфордському проєкті для розпізнавання імен, які просто вимовляються в аудіо-контенті. Таким чином, ідентичність може бути ініціалізована однією чи двома людьми, які просто згадують третю людину, яка не присутня.
Захист, який вводить Оксфордський проєкт, полягає в тому, що кандидат повинен бути присутнім у базі даних IMDB, але видалення цього довільного обмеження значно розширює потенційні можливості системи, оскільки вона залежить повністю від веб-ресурсів.

Отже, з комбінацією джерел, включаючи імена, отримані з растрізованого тексту, фактичного тексту, мовлення та дуже обмеженого візуального матеріалу, стає можливим ідентифікувати людей з низьким візуальним інтернет-присутністю.
Технічно також стає можливим створити профіль людини, до якої ще не було прикріплено жодного зображення або відео, але до якої можна прикріпити зображення або відео, коли інші фактори корелюють з новим джерелом відео.
Тестові набори даних
Дослідники використали три набори даних для оцінки ефективності системи: MediaEval, який містить ресурси соціальних медіа, похідні від Creative Commons і спільноти, захоплені між 2010-2015 роками; власний набір даних Оксфордської групи Sherlock 2017 року, який містить анотовані відео-дані з популярної сучасної адаптації класичного персонажа Конана Дойла; і новий набір даних відео BBC, створений спеціально для проєкту, який використовує анотовані відео-новини з BBC.

Система успішно працює в різних середовищах наборів даних, включаючи випадки, коли обличчя закрито відблисками або темрявою.
Процес також використовує рейтинги живого пошуку зображень.
Результати системи показали високу точність у всіх трьох моделях. У випадку набору даних Sherlock дослідники були здивовані, знайшовши, що нова система покращила результат на 3-6% порівняно з попереднім методом, який використовував машини опорних векторів (SVM) у багатоваріантному класифікаторі, хоча найближчий класифікатор, використаний у новій роботі, є менш потужним інструментом.
Вплив
Більшість етичних або практичних обмежень в Оксфордському проєкті самі накладені дослідниками, такими як визначення “слави” як вимоги до відкритої присутності в IMDB, і тестування системи лише проти встановлених академічних наборів даних, які поважають ліцензію Creative Commons.
Однак, суттєва архітектура проєкту зображує загальний метод не тільки ідентифікації “маловідомих” людей, які мають низьку або нульову візуальну присутність в інтернеті (оскільки просте згадування імені може створити ідентифікатор, який можна розвинути в часі за необхідністю), але й створення матриці людей, яка керується не чим іншим, як рекурсивною і механічною цікавістю, а не запитом або явною присутністю позначених даних (таких як завантаження фотографій у соціальні мережі, які містять метадані PII).
Проєкт не використовує геолокаційні дані або інші форми широко доступних метаданих, які можуть бути знайдені в супровідних підтверджуючих документах, таких як географічна інформація про місце розташування, вкладена за замовчуванням у завантаження до соціальних мереж (де ці дані не видалені як уподобання користувача). Однак немає жодної очевидної перешкоди для використання таких додаткових вимірів даних для посилення процесу підтвердження.
Хоча Оксфордський проєкт обрізає аутлієри (ідентичності, які мають майже нульову присутність, крім того, що не перелічені в IMDB) у спосіб, загальний для проєктів машинного навчання, така мінімальна інформація може бути більш ефективно ідентифікувати невідому людину, ніж якщо було б доступно більше представницької інформації про неї. Якщо аутлієри саме те, що ви шукаєте (тобто люди з низьким мережевим слідом), розріджені дані можуть бути дуже показовими.
Доступність
Дослідники Оксфорду закріпили функціональність проєкту в пошуковому двигуні типу Google, який можна завантажити і встановити на локальну машину через Docker (хоча інструкції з установки для статті травня 2021 року містять застарілу інформацію про вимоги до інструментів Docker, що може ускладнити процес).
Немає явної онлайн-версії, яка охоплює реалізацію проєкту по всіх трьох наборах даних, хоча результати для набору даних відео BBC можна безкоштовно досліджувати на http://zeus.robots.ox.ac.uk/bbc_search/.














