Ángulo de Anderson

Determinar el alcance de la vigilancia por video a través de los datos de Google Street View

mm
Añade Unite.AI a tus fuentes preferidas en Google

La cobertura continua de Google Street View de las vías del mundo representa posiblemente el registro visual más completo, coherente y consistente de la sociedad global, con la excepción de países que imponen prohibiciones a los vehículos de recolección de datos de la empresa de búsqueda.

Como contribuyente que genera ingresos para la infraestructura de Google Maps, el panóptico de Google Street View es una rica veta de datos para el análisis de aprendizaje automático. Además de su tendencia a capturar involuntariamente actos delictivos, se ha utilizado para estimar el ingreso regional a partir de la calidad de los coches en las imágenes de Google Street View, evaluar la vegetación en entornos urbanos, identificar postes de servicios públicos, clasificar edificios y estimar la composición demográfica de los barrios de EE. UU., entre muchas otras iniciativas.

Estadísticas limitadas sobre la difusión de cámaras de vigilancia en los Estados Unidos

A pesar del amplio uso de los datos de Google Maps para iniciativas de aprendizaje automático socialmente conscientes, hay muy pocos conjuntos de datos basados en Street View que incluyen ejemplos etiquetados de cámaras de vigilancia. El conjunto de datos Mapillary Vistas es uno de los pocos disponibles que ofrecen esta funcionalidad, aunque incluye menos de 20 cámaras de video públicas etiquetadas en los Estados Unidos.

Much de la infraestructura de vigilancia por video en EE. UU. solo se cruza con el Estado cuando las autoridades solicitan imágenes de corroboración después de incidentes locales que pueden haber sido grabados. Más allá de las regulaciones de zonificación, y en el contexto de leyes de privacidad permisivas que no abordan la vigilancia privada de espacios públicos, no hay marco administrativo federal que pueda proporcionar estadísticas sólidas sobre el número de cámaras públicas en EE. UU.

Los datos anecdóticos y las encuestas limitadas sostienen que la difusión de cámaras de video en EE. UU. puede ser similar a la de China, pero no es fácil de probar.

Identificar cámaras de video en imágenes de Google Street View

Considerando esta falta de datos disponibles, los investigadores de la Universidad de Stanford han realizado un estudio sobre la prevalencia, frecuencia y distribución de las cámaras de video públicas que se pueden identificar en las imágenes de Google Street View.

Los investigadores crearon un marco de detección de cámaras que evaluó 1,6 millones de imágenes de Google Street View en 10 ciudades importantes de EE. UU. y seis ciudades más en Asia y Europa.

En orden descendente de densidad de cámaras, Boston encabeza la lista de ciudades de EE. UU. examinadas en la investigación, con una densidad reciente o actual de 0,63 y un total de 1.600 cámaras. A pesar de esto, la ciudad de Nueva York tiene muchas más cámaras (10.100) dispersas sobre una mayor área. Fuente: https://arxiv.org/pdf/2105.01764.pdf

En orden descendente de densidad de cámaras, Boston encabeza la lista de ciudades de EE. UU. examinadas en la investigación, con una densidad reciente o actual de 0,63 y un total de 1.600 cámaras. A pesar de esto, la ciudad de Nueva York tiene muchas más cámaras (10.100) dispersas sobre una mayor área. Fuente: https://arxiv.org/pdf/2105.01764.pdf

De las ciudades de EE. UU., Boston tiene la mayor densidad de cámaras identificadas, mientras que la ciudad de Nueva York tiene la mayor número de cámaras, con 10.100, dispersas sobre una mayor distancia. En Asia, Tokio tiene un total estimado de 21.700 cámaras, pero Seúl tiene un número menor de cámaras (13.900) concentradas de manera más densa. Aunque se identificaron 13.000 cámaras para las imágenes de Street View de Londres, París supera esto tanto en términos de colocaciones identificadas (13.000) como de densidad de cobertura.

Los investigadores observan que la densidad de las cámaras varía ampliamente entre los barrios y zonas de las ciudades.

Densidad de cámaras de vigilancia en ciudades de EE. UU., según la investigación de Stanford en 2021

Entre otros factores limitantes para la precisión de la encuesta (que abordaremos a continuación), los investigadores observan que las cámaras en áreas residenciales son tres veces más difíciles de identificar que aquellas colocadas en parques públicos, zonas industriales y zonas de uso mixto – probablemente porque el efecto disuasivo es cada vez más objetable o controvertido en zonas residenciales, lo que hace que los emplazamientos camuflados o discretos sean más probables.

Tomando en consideración las ciudades estudiadas en Europa y Asia, Seúl ocupa el primer lugar como el entorno urbano más vigilado, con París no muy lejos.

Densidad de cámaras de vigilancia en ciudades de EE. UU., Asia y Europa, según la investigación de Stanford.

Donde una zona tiene una mayoría de residentes étnicos o minoritarios definida por el censo, la frecuencia de las colocaciones de cámaras aumenta notablemente, incluso con todos los factores atenuantes considerados por los investigadores de Stanford.

La frecuencia de las cámaras de vigilancia aumenta en proporción directa con el aumento de la demografía minoritaria en un barrio, según la investigación de Stanford.

La frecuencia de las cámaras de vigilancia aumenta en proporción directa con el aumento de la demografía minoritaria en un barrio, según la investigación de Stanford.

La investigación se llevó a cabo en dos períodos de tiempo, 2011-2015 y 2016-2020. Aunque los datos muestran un crecimiento consistente y a veces anormal de la colocación de cámaras de vigilancia durante el período de nueve años, los investigadores sugieren que esta proliferación de cámaras de vigilancia puede haber alcanzado un ‘plato temporal’.

Metodología

Los investigadores inicialmente compilaron dos conjuntos de datos de las imágenes de Street View, uno de los cuales no presentaba colocaciones de cámaras de video, y generaron máscaras de segmentación para estos. Un modelo de segmentación se entrenó en estos conjuntos de datos contra un conjunto de datos de validación (de San Francisco – ver ‘Factores limitantes’ a continuación).

Luego, el modelo de salida se ejecutó contra imágenes de Street View aleatorias, con todas las detecciones de cámaras positivas confirmadas por humanos y eliminadas las falsas positivas.

Izquierda, la imagen cruda de Google Street View. A continuación, la máscara de segmentación adaptada. Tercero, una identificación de cámara algorítmica. Derecha, una colocación verificada por humanos.

Izquierda, la imagen cruda de Google Street View. A continuación, la máscara de segmentación adaptada. Tercero, una identificación de cámara algorítmica. Derecha, una colocación verificada por humanos.

Finalmente, el marco calculó el ángulo de visión de las cámaras involucradas para estimar la extensión de la cobertura, recopilada contra las huellas de los edificios involucrados y las especificaciones de la red vial.

Otros datos contribuyentes para esta matriz incluyeron especificaciones de edificios de OpenStreetMap, y el uso de mapas del censo de EE. UU. para garantizar que el estudio se limitara a los límites administrativos de cada ciudad. Además, el proyecto utilizó datos de ubicación de cámaras de San Francisco de un estudio de la Electronic Frontier Foundation (EFF), con las imágenes de Google Street View accedidas a través de la Static API.

Los investigadores estimaron la cobertura calculando el ángulo de visión de las cámaras de Google Street View contra los datos de OpenStreetMap.

Los investigadores estimaron la cobertura calculando el ángulo de visión de las cámaras de Google Street View contra los datos de OpenStreetMap.

Factores limitantes

Los investigadores reconocen varios factores limitantes que deben considerarse al revisar los resultados.

En primer lugar, que las cámaras identificadas por el sistema de aprendizaje automático fueron verificadas o negadas por revisión humana, y que esta revisión es un proceso falible.

En segundo lugar, el estudio se limitó a la resolución disponible de las imágenes de Street View, lo que restringió a los investigadores a identificar cámaras colocadas dentro de los 30 metros de la POV. Esto no solo significa que algunas cámaras pueden haber sido ‘inventadas’ a través de una resolución limitada, sino que muchas fuera de este alcance (como cámaras de alto nivel, colocaciones ocultas y microcámaras en accesorios de timbre) probablemente no fueron identificadas.

Finalmente, estimar el recuerdo del modelo específico de la ciudad puede ser un factor limitante en la precisión de los resultados, ya que la ciudad de San Francisco, donde la frecuencia de las cámaras de vigilancia ya había sido etiquetada en un trabajo anterior de la EFF, se aplicó a otras jurisdicciones para hacer que el estudio fuera factible.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai