Ángulo de Anderson
Un ‘Detective’ de IA puede identificar a personas oscuras a partir de múltiples fuentes

Investigadores de la Universidad de Oxford han desarrollado un sistema habilitado por IA que puede identificar de manera integral a las personas en los videos mediante investigaciones de estilo detective, multidominio, sobre quiénes podrían ser, a partir del contexto y de una variedad de fuentes secundarias públicamente disponibles, incluyendo la coincidencia de fuentes de audio con material visual de Internet.
Aunque la investigación se centra en la identificación de figuras públicas, como personas que aparecen en programas de televisión y películas, el principio de inferir la identidad a partir del contexto es teóricamente aplicable a cualquier persona cuyo rostro, voz o nombre aparezca en fuentes en línea.
De hecho, la investigación define la fama como no limitada a los trabajadores del espectáculo, con los investigadores declarando ‘Denotamos a las personas con muchas imágenes de sí mismas en línea como famosas‘.
Directo al video
Los investigadores, del Grupo de Geometría Visual de la Universidad de Oxford, del Departamento de Ciencias de la Ingeniería, describen el enfoque de investigación de estilo humano que ha inspirado el trabajo:
‘Imagina que estás viendo un video y encuentras a una nueva persona. Para identificarla con confianza, primero buscarías pistas de su nombre, ya sea en el video, como texto en la pantalla, su nombre mencionado en el discurso, o en una lista de miembros del elenco de una archivo de Internet. Luego, podrías encontrar alguna evidencia para verificar que este nombre es correcto, buscando a la persona en línea.’
La metodología propuesta por el documento es completamente automatizada y elimina todas las etiquetas manuales adicionales (descontando cualquier etiqueta realizada por los proveedores de las fuentes en línea). El sistema también demostró funcionar bien en tres conjuntos de datos no relacionados sin necesidad de adaptación de dominio.
Al discutir la aplicación del trabajo, los investigadores señalan el crecimiento exponencial de datos de video no etiquetados y opacos, y la necesidad de nuevos sistemas que puedan derivar información de identidad de ellos sin anotaciones manuales costosas:
‘La escala de los datos, junto con la falta de metadatos relevantes, hace que indexar, analizar y navegar por este contenido sea una tarea cada vez más difícil. Confiar en anotaciones manuales adicionales ya no es factible, y sin una forma efectiva de navegar por estos videos, este banco de conocimientos es en gran medida inaccesible.’
Un motor de indexación de este tipo abre la posibilidad de enlaces de resultados de búsqueda que llegan directamente a un punto en el video donde aparece el sujeto de la búsqueda, como se demuestra en la búsqueda web de prueba proporcionada por el proyecto.

El sistema de Oxford permite una búsqueda de instancias de una persona identificada. El resultado de la búsqueda lleva al espectador directamente al punto en el video donde aparece la persona identificada, y el video se puede reproducir desde ese punto. Fuente: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Una de las formas en que el sistema identifica a personas ‘oscuras’ es por el contexto de su asociación con otros. En consecuencia, el motor de búsqueda está bien equipado para buscar múltiples identidades que aparecen en el mismo video:
Peces grandes y pequeños
El sistema inicialmente aborda la ‘fruta colgada’ – personas cuyos rostros están tan bien indexados en recursos de red pública que identificarlos es relativamente trivial, mediante la coincidencia de metadatos o texto OCR en videos con recursos de datos públicos como listas de IMDB. El texto interpretado por IA en subtítulos de video, créditos y otras formas de texto rasterizado en video también se utiliza para hacer la identificación.

Los nombres de los candidatos para la búsqueda pueden ser descubiertos automáticamente por el sistema, en función del reconocimiento óptico de caracteres (OCR) de texto rasterizado, o de texto real en otras fuentes, como listas de reparto. Así, las personas pueden ser indexadas automáticamente sin que se hayan realizado consultas previas en sus nombres por parte de los usuarios individuales, y sin participación previa en redes sociales habilitadas para IA. Fuente: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Donde las imágenes y los videos que enfrentan la red confirman abrumadoramente la identidad de la persona, la investigación afirma una identidad. Pero donde la persona es más oscura, se utilizan otros métodos, incluyendo el audio tomado de las pistas de video, que se puede utilizar como confirmación corrobora de una identidad. Aunque no se cubre en el trabajo, lógicamente no hay nada que impida que un marco de este tipo también utilice fuentes de audio puro, así como componentes de audio en video.
Un panóptico de identidad auto-propagante
Además de generar nombres de candidatos a partir de texto rasterizado o puro, las tecnologías de reconocimiento de voz se utilizan en el proyecto de Oxford para reconocer nombres que se mencionan en contenido de audio. Así, una identidad puede inicializarse con que solo una o dos personas mencionen a una tercera persona que no está presente.
La salvaguarda que introduce el proyecto de Oxford es que el candidato debe aparecer en la base de datos de IMDB, pero eliminar esta estipulación arbitraria amplía considerablemente el alcance potencial de las capacidades del sistema, ya que depende enteramente de recursos extraíbles de la web.

Por lo tanto, con una combinación de fuentes que incluyen nombres derivados de texto rasterizado, texto real, menciones basadas en el habla y material visual muy limitado, es posible identificar a individuos con una presencia de red visual baja.
Técnicamente, también es posible construir un perfil de un individuo al que aún no se ha asociado una imagen o video, pero al que se puede asociar una imagen o video cuando otros factores se correlacionan con una nueva fuente de video.
Conjuntos de datos de prueba
Los investigadores utilizaron tres conjuntos de datos para evaluar la efectividad del sistema: MediaEval, que presenta recursos de medios sociales derivados de Creative Commons y capturados entre 2010-2015; el conjunto de datos Sherlock del grupo de Oxford de 2017, que presenta datos de video anotados de la adaptación moderna de la BBC del personaje clásico de Conan Doyle; y un nuevo conjunto de datos de videos de la BBC creado específicamente para el proyecto, que utiliza noticias anotadas de la BBC.

El sistema tiene éxito en una amplia gama de entornos de conjunto de datos, incluyendo ocasiones en las que el rostro está oculto por reflejos o oscuridad.
El proceso también utiliza clasificaciones de búsqueda de imágenes en vivo.
Los resultados del sistema produjeron una alta precisión en los tres modelos. En el caso del conjunto de datos de Sherlock, los investigadores se sorprendieron al encontrar que el nuevo sistema mejoró un 3-6% sobre un método anterior que utilizaba máquinas de vectores de soporte (SVM) en un clasificador de múltiples vías, a pesar de que el clasificador de vecino más cercano utilizado en el nuevo trabajo es una herramienta menos poderosa.
Implicaciones
La mayoría de las limitaciones éticas o prácticas en el proyecto de Oxford son autoimpuestas por los investigadores, como definir la ‘fama’ por el requisito de que las identidades descubiertas tengan una presencia en la base de datos de IMDB, y al probar el sistema únicamente contra conjuntos de datos académicos establecidos que respetan la licencia de Creative Commons.
Sin embargo, la arquitectura esencial del proyecto describe un método genérico para identificar no solo a personas ‘oscuras’ que tienen una presencia visual baja o cero en Internet (ya que una mera mención de un nombre puede generar un token de identidad que se puede desarrollar con el tiempo según sea necesario), sino también para crear una matriz de individuos que se impulsa por nada más que curiosidad recursiva y mecánica, en lugar de por demanda o por la presencia explícita de datos etiquetados (como subidas de fotos a redes sociales que contienen metadatos de información personal).
El proyecto no utiliza datos de geolocalización ni otros tipos de metadatos ampliamente disponibles que podrían encontrarse en documentos corrobora, como información de ubicación geográfica incrustada por defecto en subidas a redes sociales (donde estos no se eliminan como preferencia del usuario). Sin embargo, no hay obstáculo aparente para utilizar tales dimensiones adicionales de datos para fortalecer el proceso corrobora.
Mientras que el proyecto de Oxford elimina a los extraños (identidades que tienen casi cero presencia, además de no estar incluidas en la base de datos de IMDB) de una manera común en proyectos de aprendizaje automático, esta información mínima puede identificar de manera más efectiva a una persona desconocida de lo que sucedería si hubiera una cantidad mayor de información representativa sobre ella. Si los extraños son exactamente lo que se busca (es decir, individuos con poca huella de red), los datos dispersos pueden ser muy indicativos.
Disponibilidad
Los investigadores de Oxford han encapsulado la funcionalidad del proyecto en un motor de búsqueda similar a Google que se puede descargar e instalar en una máquina local a través de Docker (aunque las instrucciones de instalación para el documento de mayo de 2021 contienen información obsoleta para un requisito de herramientas de Docker, lo que puede obstaculizar el proceso).
Apparentemente no hay una versión en línea que cubra la implementación del proyecto en los tres conjuntos de datos, aunque los resultados para el conjunto de datos de noticias de la BBC se pueden interrogar libremente en http://zeus.robots.ox.ac.uk/bbc_search/.














