Взгляд Anderson
‘Детектив’ ИИ может идентифицировать малоизвестных людей из нескольких источников

Исследователи из Оксфордского университета разработали систему, оснащенную ИИ, которая может комплексно идентифицировать людей в видеороликах, проводя детективные, многообластные расследования, чтобы определить, кто они могут быть, исходя из контекста и из различных публично доступных вторичных источников, включая сопоставление аудиоисточников с визуальным материалом из интернета.
Хотя исследования сосредоточены на идентификации публичных деятелей, таких как люди, появляющиеся на телевизионных программах и в фильмах, принцип вывода идентификации из контекста теоретически применим к любому, чье лицо, голос или имя появляется в онлайн-источниках.
Действительно, в статье дано собственное определение славы, которое не ограничивается работниками шоу-бизнеса, поскольку исследователи заявляют: ‘Мы обозначаем людей с множеством изображений себя в интернете как знаменитых‘.
Прямо к видео
Исследователи из Визуальной геометрической группы Оксфордского университета, факультет инженерных наук, описывают человеческий подход к расследованию, который вдохновил эту работу:
‘Представьте, что вы смотрите видео и встречаете нового человека. Чтобы уверенно определить его, вы сначала ищете подсказки о его имени, либо в видео, такое как текст на экране, его имя, упомянутое в речи, либо в списке актеров из интернет-архива. Затем вы можете найти некоторое доказательство, чтобы подтвердить, что это имя правильное, найдя человека в интернете.’
Методология, предложенная в статье, полностью автоматизирована и исключает все дополнительные ручные пометки (за исключением тех, которые были выполнены поставщиками онлайн-источников). Система также была доказана как хорошо работающая на трех не связанных между собой наборах данных без необходимости доменной адаптации.
Обсуждая применение работы, исследователи отмечают экспоненциальный рост неотмеченных, непрозрачных видеоданных и необходимость новых систем, которые могут получить информацию об идентификации из них без дорогостоящих человеческих аннотаций:
‘[Чистый] масштаб данных, в сочетании с отсутствием соответствующих метаданных, делает индексирование, анализ и навигацию по этому контенту все более трудной задачей. Полагаться на дополнительные ручные человеческие аннотации больше не является возможным, и без эффективного способа навигации по этим видео этот банк знаний в значительной степени недоступен.’
Двигатель индексирования такого рода открывает возможность для гиперссылок в результатах поиска, которые прибывают прямо к моменту в видео, где появляется предмет поиска, как это продемонстрировано в концепции веб-поиска, предоставленной проектом.

Система Оксфорда позволяет искать случаи выявления человека. Результат поиска ведет зрителя прямо к моменту в видео, где появляется выявленный человек, и видео можно проиграть с этого момента. Источник: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Одним из способов, которыми система идентифицирует ‘малоизвестных’ людей, является контекст их связи с другими. Следовательно, поисковый движок хорошо оснащен для поиска нескольких идентификаторов, появляющихся в одном видео:
Большие и маленькие рыбы
Система изначально решает ‘легкие задачи’ – людей, чьи лица так хорошо проиндексированы в публичных сетевых ресурсах, что их идентификация относительно тривиальна, сопоставляя метаданные или текст, полученный с помощью OCR, в видео с публичными данными, такими как списки IMDB. Текст, интерпретированный ИИ, в видео-подписях, титрах и других формах растрового текста в видео, также используется для идентификации.

Кандидаты для поиска могут быть автоматически обнаружены системой на основе оптического распознавания текста или фактического текста в других источниках, таких как списки актеров. Таким образом, люди могут быть проиндексированы автоматически без каких-либо предварительных запросов, выполненных по их именам отдельными пользователями, и без предварительного участия в ИИ-оснащенных социальных сетях. Источник: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Где подавляющее количество изображений и видео в интернете подтверждает идентификацию человека, расследование подтверждает идентификацию. Но где человек более малоизвестен, используются другие методы, включая аудио, взятые из видеотреков, которые могут быть использованы в качестве подтверждающего подтверждения идентификации. Хотя это не рассматривается в работе, логически нет ничего, что мешает такой рамке также использовать чистые аудиоисточники, а также аудиокомпоненты видео.
Самоподдерживающийся паноптикон идентификации
Помимо генерации кандидатов для поиска из растрового или чистого текста, технологии распознавания речи используются в проекте Оксфорда для распознавания имен, которые просто произносятся в аудиоконтенте. Таким образом, идентификация может быть инициализирована одним или двумя людьми, просто упомянувшим третьего человека, который не присутствует.
Защитный механизм, который вводит проект Оксфорда, заключается в том, что кандидат должен присутствовать в базе данных IMDB, но удаление этого произвольного ограничения значительно расширяет потенциальные возможности системы, поскольку она опирается исключительно на веб-ресурсы.

Следовательно, с помощью комбинации источников, включая имена, полученные из растрового текста, фактического текста, речевых упоминаний и ограниченного визуального материала, становится возможным идентифицировать людей с низким визуальным присутствием в сети.
Технически также становится возможным создать профиль человека, которому еще не присвоен образ или видео, но к которому можно присвоить изображение или видео, когда другие факторы коррелируют с новым видеоисточником.
Тестовые наборы данных
Исследователи использовали три набора данных для оценки эффективности системы: MediaEval, который включает ресурсы социальных сетей Creative Commons и общественные изображения (включая Википедию и Flickr), полученные между 2010-2015 годами; собственный набор данных Sherlock группы Оксфорда 2017 года, который включает помеченные видеоданные из популярной современной адаптации классического персонажа Конан Дойла; и новый набор данных видео BBC, созданный специально для проекта, который использует различные помеченные новостные кадры BBC.

Система успешно работает в различных средах наборов данных, включая случаи, когда лицо закрывается отражениями или темнотой.
Процесс также использует рейтинги живого поиска изображений.
Результаты, полученные системой, показали высокую точность на всех трех моделях. В случае набора данных Sherlock исследователи были удивлены, обнаружив, что новая система улучшила результат на 3-6% по сравнению с предыдущим методом, который использовал машины опорных векторов в многостороннем классификаторе, хотя классификатор ближайшего соседа, использованный в новой работе, является менее мощным инструментом.
Последствия
Большинство этических или практических ограничений в проекте Оксфорда являются самоназначенными исследователями, такими как определение ‘славы’ как требования наличия идентификации в IMDB, и тестирование системы исключительно против установленных академических наборов данных, которые уважают лицензии Creative Commons.
Однако основная архитектура проекта изображает общий метод не только идентификации ‘малоизвестных’ людей, которые имеют низкое или нулевое визуальное присутствие в интернете (поскольку упоминание имени может создать идентификатор, который может быть разработан со временем по мере необходимости), но и создания матрицы людей, которая управляется не спросом или явным присутствием помеченных данных, а рекурсивным и механическим любопытством.
Проект не использует геолокационные данные или другие формы широко доступных метаданных, которые могут быть найдены в подтверждающих документах, таких как географическая информация, встроенная по умолчанию в загрузки социальных сетей (где эти данные не удалены в качестве предпочтения пользователя). Однако нет видимого препятствия для использования таких дополнительных измерений данных для укрепления процесса подтверждения.
Хотя проект Оксфорда обрезает аутлиеры (идентификации, которые имеют почти нулевое присутствие, помимо того, что не перечислены в IMDB) так, как это принято в проектах машинного обучения, такая минимальная информация может более эффективно идентифицировать неизвестного человека, чем если бы было доступно больше представительной информации о нем. Если аутлиеры – это именно то, что вы ищете (т.е. люди с небольшим сетевым следом), скудные данные могут быть высокоиндикативными.
Доступность
Исследователи Оксфорда инкапсулировали функциональность проекта в поисковый движок, похожий на Google, который можно скачать и установить на локальной машине через Docker (хотя инструкции по установке для статьи мая 2021 года в настоящее время содержат устаревшую информацию для требования инструментов Docker, что может препятствовать процессу).
Кажется, нет живой онлайн-версии, которая охватывает реализацию проекта на всех трех наборах данных, хотя результаты для набора данных новостей BBC можно свободно опросить по адресу http://zeus.robots.ox.ac.uk/bbc_search/.














