Ángulo de Anderson

Las ‘Rutas Secretas’ que Pueden Evitar el Reconocimiento de Peatones

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

Una nueva colaboración de investigación entre Israel y Japón sostiene que los sistemas de detección de peatones poseen debilidades inherentes, lo que permite a personas bien informadas evadir los sistemas de reconocimiento facial navegando por rutas cuidadosamente planificadas a través de áreas donde las redes de vigilancia son menos efectivas.

Con la ayuda de footage público de Tokio, Nueva York y San Francisco, los investigadores desarrollaron un método automatizado para calcular dichas rutas, basado en los sistemas de reconocimiento de objetos más populares que probablemente se utilicen en las redes públicas.

Las tres intersecciones utilizadas en el estudio: Shibuya Crossing en Tokio, Japón; Broadway, Nueva York; y Castro District, San Francisco. Fuente: https://arxiv.org/pdf/2501.15653

Las tres intersecciones utilizadas en el estudio: Shibuya Crossing en Tokio, Japón; Broadway, Nueva York; y Castro District, San Francisco. Fuente: https://arxiv.org/pdf/2501.15653

Por este método, es posible generar mapas de calor de confianza que demarcan áreas dentro de la alimentación de la cámara donde los peatones son menos propensos a proporcionar un reconocimiento facial positivo:

A la derecha, vemos el mapa de calor de confianza generado por el método de los investigadores. Las áreas rojas indican baja confianza, y una configuración de postura, pose de la cámara y otros factores que probablemente obstaculicen el reconocimiento facial.

A la derecha, vemos el mapa de calor de confianza generado por el método de los investigadores. Las áreas rojas indican baja confianza, y una configuración de postura, pose de la cámara y otros factores que probablemente obstaculicen el reconocimiento facial.

En teoría, dicho método podría ser instrumentalizado en una aplicación consciente de la ubicación, o en alguna otra plataforma para difundir los caminos menos “amigables” para el reconocimiento desde A hasta B en cualquier ubicación calculada.

El nuevo artículo propone tal metodología, titulada Técnica de Privacidad Mejorada Basada en Ubicación (L-PET); también propone una contramedida titulada Umbral Adaptativo Basado en Ubicación (L-BAT), que esencialmente ejecuta exactamente las mismas rutinas, pero luego utiliza la información para reforzar y mejorar las medidas de vigilancia, en lugar de idear formas de evitar ser reconocido; y en muchos casos, tales mejoras no serían posibles sin una mayor inversión en la infraestructura de vigilancia.

El artículo establece, por lo tanto, una posible guerra tecnológica de escalada entre aquellos que buscan optimizar sus rutas para evitar la detección y la capacidad de los sistemas de vigilancia para hacer un uso completo de las tecnologías de reconocimiento facial.

Los métodos anteriores para evitar la detección son menos elegantes que este, y se centran en enfoques adversarios, como TnT Attacks, y el uso de patrones impresos para confundir al algoritmo de detección.

El trabajo de 2019 'Engañando a las cámaras de vigilancia automatizadas: parches adversarios para atacar la detección de personas' demostró un patrón impreso adversario capaz de convencer a un sistema de reconocimiento de que no se detecta a una persona, permitiendo una especie de 'invisibilidad'. Fuente: https://arxiv.org/pdf/1904.08653

El trabajo de 2019 ‘Engañando a las cámaras de vigilancia automatizadas: parches adversarios para atacar la detección de personas’ demostró un patrón impreso adversario capaz de convencer a un sistema de reconocimiento de que no se detecta a una persona, permitiendo una especie de ‘invisibilidad’. Fuente: https://arxiv.org/pdf/1904.08653

Los investigadores detrás del nuevo artículo observan que su enfoque requiere menos preparación, sin necesidad de crear artículos de vestimenta adversarios (ver imagen arriba).

El artículo se titula Técnica de Privacidad Mejorada para Evadir la Detección por Cámaras de Video de la Calle sin Usar Accesorios Adversarios, y proviene de cinco investigadores de la Universidad Ben-Gurión del Néguev y Fujitsu Limited.

Método y Pruebas

De acuerdo con trabajos anteriores como Adversarial Mask, AdvHat, parches adversarios, y otros trabajos similares, los investigadores asumen que el “atacante” peatón conoce qué sistema de detección de objetos se utiliza en la red de vigilancia. Esto no es una suposición irrazonable, debido a la adopción generalizada de sistemas de código abierto de última generación como YOLO en sistemas de vigilancia de empresas como Cisco y Ultralytics (actualmente la fuerza impulsora central en el desarrollo de YOLO).

El artículo también asume que el peatón tiene acceso a una transmisión en vivo en Internet fija en las ubicaciones que se van a calcular, lo cual, de nuevo, es una suposición razonable en la mayoría de los lugares que probablemente tengan una intensidad de cobertura.

Sitios como 511ny.org ofrecen acceso a muchas cámaras de vigilancia en el área de NYC. Fuente: https://511ny.or

Sitios como 511ny.org ofrecen acceso a muchas cámaras de vigilancia en el área de NYC. Fuente: https://511ny.or

Además de esto, el peatón necesita acceso al método propuesto, y a la escena en sí (es decir, las intersecciones y rutas en las que se va a establecer una “ruta segura”).

Para desarrollar L-PET, los autores evaluaron el efecto del ángulo del peatón en relación con la cámara; el efecto de la altura de la cámara; el efecto de la distancia; y el efecto del momento del día. Para obtener la verdad, fotografiaron a una persona en los ángulos 0°, 45°, 90°, 135°, 180°, 225°, 270° y 315°.

Observaciones de verdad realizadas por los investigadores.

Observaciones de verdad realizadas por los investigadores.

Repitieron estas variaciones en tres alturas de cámara diferentes (0,6 m, 1,8 m, 2,4 m), y con condiciones de iluminación variadas (mañana, tarde, noche y condiciones de “laboratorio”).

Alimentando este metraje a los detectores de objetos Faster R-CNN y YOLOv3, encontraron que la confianza del objeto depende de la agudeza del ángulo del peatón, la distancia del peatón, la altura de la cámara y las condiciones de iluminación*.

Luego probaron una gama más amplia de detectores de objetos en el mismo escenario: Faster R-CNN; YOLOv3; SSD; DiffusionDet; y RTMDet.

Los autores declaran:

‘Encontramos que los cinco arquitectos de detectores de objetos están afectados por la posición del peatón y la luz ambiental. Además, encontramos que para tres de los cinco modelos (YOLOv3, SSD y RTMDet) el efecto persiste a través de todos los niveles de luz ambiental.’

Para ampliar el alcance, los investigadores utilizaron metraje tomado de cámaras de tráfico públicamente disponibles en tres ubicaciones: Shibuya Crossing en Tokio, Broadway en Nueva York y el Castro District en San Francisco.

Cada ubicación proporcionó entre cinco y seis grabaciones, con aproximadamente cuatro horas de metraje por grabación. Para analizar el rendimiento de la detección, se extrajo un cuadro cada dos segundos y se procesó utilizando un detector de objetos Faster R-CNN. Para cada píxel en los cuadros obtenidos, el método estimó la confianza promedio de los cuadros de detección de “persona” presentes en ese píxel.

‘Encontramos que en las tres ubicaciones, la confianza del detector de objetos varió dependiendo de la ubicación de las personas en el cuadro. Por ejemplo, en el metraje de Shibuya Crossing, hay grandes áreas de baja confianza más alejadas de la cámara, así como más cerca de la cámara, donde un poste parcialmente obstaculiza a los peatones que pasan.’

El método L-PET es esencialmente este procedimiento, argumentablemente “armado” para obtener una ruta a través de un área urbana que sea menos probable que resulte en que el peatón sea reconocido con éxito.

Por el contrario, L-BAT sigue el mismo procedimiento, con la diferencia de que actualiza las puntuaciones en el sistema de detección, creando un bucle de retroalimentación diseñado para obviar el enfoque de L-PET y hacer que las “áreas ciegas” del sistema sean más efectivas.

(En términos prácticos, sin embargo, mejorar la cobertura basada en mapas de calor obtenidos requeriría más que solo una actualización de la cámara que se sienta en la posición esperada; basado en los criterios de prueba, incluyendo la ubicación, requeriría la instalación de cámaras adicionales para cubrir las áreas descuidadas – por lo tanto, se podría argumentar que el método L-PET escala esta particular “guerra fría” en un escenario muy costoso de hecho)

La confianza promedio de detección de peatones para cada píxel, en diferentes marcos de detectores, en el área observada de Castro Street, analizada en cinco videos. Cada video se grabó en diferentes condiciones de iluminación: amanecer, día, atardecer y dos ajustes de noche distintos. Los resultados se presentan por separado para cada escenario de iluminación.

La confianza promedio de detección de peatones para cada píxel, en diferentes marcos de detectores, en el área observada de Castro Street, analizada en cinco videos. Cada video se grabó en diferentes condiciones de iluminación: amanecer, día, atardecer y dos ajustes de noche distintos. Los resultados se presentan por separado para cada escenario de iluminación.

Después de convertir la representación de matriz basada en píxeles en una representación gráfica adecuada para la tarea, los investigadores adaptaron el algoritmo de Dijkstra para calcular rutas óptimas para que los peatones naveguen a través de áreas con detección de vigilancia reducida.

En lugar de encontrar la ruta más corta, el algoritmo se modificó para minimizar la confianza de detección, tratando las regiones de alta confianza como áreas con un “costo” más alto. Esta adaptación permitió al algoritmo identificar rutas que pasan por puntos ciegos o zonas de baja detección, guiando efectivamente a los peatones a lo largo de rutas con visibilidad reducida para los sistemas de vigilancia.

Una visualización que muestra la transformación del mapa de calor de la escena de una matriz basada en píxeles a una representación basada en gráficos.

Una visualización que muestra la transformación del mapa de calor de la escena de una matriz basada en píxeles a una representación basada en gráficos.

Los investigadores evaluaron el impacto del sistema L-BAT en la detección de peatones con un conjunto de datos construido a partir de las grabaciones de cuatro horas de tráfico peatonal público. Para poblar la colección, se procesó un cuadro cada dos segundos utilizando un detector de objetos SSD.

De cada cuadro, se seleccionó un cuadro delimitador que contenía una persona detectada como una muestra positiva, y otra área aleatoria sin personas detectadas se utilizó como una muestra negativa. Estas muestras gemelas formaron un conjunto de datos para evaluar dos modelos Faster R-CNN – uno con L-BAT aplicado, y otro sin.

El rendimiento de los modelos se evaluó comprobando con qué precisión identificaban muestras positivas y negativas: un cuadro delimitador que se superponía con una muestra positiva se consideró un verdadero positivo, mientras que un cuadro delimitador que se superponía con una muestra negativa se etiquetó como falso positivo.

Las métricas utilizadas para determinar la confiabilidad de la detección de L-BAT fueron Área bajo la Curva (AUC); tasa de verdaderos positivos (TPR); tasa de falsos positivos (FPR); y confianza promedio de verdaderos positivos. Los investigadores afirman que el uso de L-BAT mejoró la confianza de detección mientras mantenía una alta tasa de verdaderos positivos (aunque con un ligero aumento en falsos positivos).

Al concluir, los autores señalan que el enfoque tiene algunas limitaciones. Una es que los mapas de calor generados por su método son específicos de un momento del día. Aunque no lo explican, esto indicaría que se necesitaría un enfoque más amplio y de varios niveles para tener en cuenta el momento del día en una implementación más flexible.

También observan que los mapas de calor no se transferirán a diferentes arquitecturas de modelos, y están vinculados a un modelo de detector de objetos específico. Dado que el trabajo propuesto es esencialmente una prueba de concepto, también se podrían desarrollar arquitecturas más hábiles para remediar esta deuda técnica.

Conclusión

Cualquier nuevo método de ataque para el que la solución es “pagar por nuevas cámaras de vigilancia” tiene alguna ventaja, ya que expandir las redes de cámaras cívicas en áreas altamente vigiladas puede ser políticamente desafiante, así como representar un gasto cívico notable que generalmente necesitará un mandato de votante.

Quizás la pregunta más grande planteada por el trabajo es ‘¿Utilizan los sistemas de vigilancia de código cerrado marcos de código abierto de última generación como YOLO?’. Esto, por supuesto, es imposible de saber, ya que los fabricantes de los sistemas propietarios que alimentan muchas redes de cámaras estatales y cívicas (al menos en los EE. UU.) argumentarían que divulgar tal uso podría abrirlos a ataques.

No obstante, la migración de la IT gubernamental y el código propietario interno a código global y de código abierto sugeriría que cualquiera que pruebe la afirmación de los autores con (por ejemplo) YOLO podría golpear la lotería de inmediato.

 

* Normalmente incluiría resultados de tabla relacionados cuando se proporcionan en el artículo, pero en este caso la complejidad de las tablas del artículo las hace poco iluminadoras para el lector casual, y un resumen es por lo tanto más útil.

Publicado por primera vez el martes 28 de enero de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai