Andersons vinkel

De ‘hemmelige ruter’ som kan forstyrre gjenkjenning av fotgjengere

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

En ny forsknings­samarbeid mellom Israel og Japan hevder at systemer for gjenkjenning av fotgjengere har innebygde svakheter, som gjør det mulig for godt informerte personer å unngå ansiktsgjenkjenning ved å navigere nøye planlagte ruter gjennom områder der overvåkings­nettverk er minst effektive.

Med hjelp av offentlig tilgjengelig film­materiale fra Tokyo, New York og San Francisco, utviklet forskerne en automatisert metode for å beregne slike ruter, basert på de mest populære gjenkjenningssystemer som sannsynligvis er i bruk i offentlige nettverk.

De tre kryssningene som ble brukt i studien: Shibuya Crossing i Tokyo, Japan; Broadway, New York; og Castro District, San Francisco. Kilde: https://arxiv.org/pdf/2501.15653

De tre kryssningene som ble brukt i studien: Shibuya Crossing i Tokyo, Japan; Broadway, New York; og Castro District, San Francisco. Kilde: https://arxiv.org/pdf/2501.15653

Med denne metoden er det mulig å generere tillitskart som avgrenser områder innenfor kamera­strømmen der fotgjengere er minst sannsynlig å gi en positiv gjenkjenningstreffer:

Til høyre ser vi tillitskartet generert av forskernes metode. De røde områdene indikerer lav tillit, og en konfigurasjon av holdning, kamera­posisjon og andre faktorer som sannsynligvis vil hindre gjenkjenning.

Til høyre ser vi tillitskartet generert av forskernes metode. De røde områdene indikerer lav tillit, og en konfigurasjon av holdning, kamera­posisjon og andre faktorer som sannsynligvis vil hindre gjenkjenning.

I teorien kunne en slik metode være instrumental i en lokal­basert app eller en annen type plattform for å formidle de minst ‘gjenkjenning­vennlige’ ruter fra A til B i noen beregnede lokasjoner.

Den nye artikkelen foreslår en slik metode, kalt Location-based Privacy Enhancing Technique (L-PET); den foreslår også en mot­tillak kalt Location-Based Adaptive Threshold (L-BAT), som i praksis kjører de samme rutinene, men så bruker informasjonen til å forsterke og forbedre overvåkings­tiltakene, i stedet for å finne måter å unngå å bli gjenkjent; og i mange tilfeller ville slike forbedringer ikke være mulig uten ytterligere investeringer i overvåkings­infrastrukturen.

Artikkelen setter dermed opp en potensiell teknologisk eskalering mellom de som søker å optimalisere sine ruter for å unngå oppdaging og evnen til overvåkings­systemer til å gjøre fullt bruk av gjenkjenningsteknologier.

Tidligere metoder for å forstyrre oppdaging er mindre elegante enn dette, og sentrerer seg rundt mot­standsfylte tilnærminger, som TnT-angrep, og bruk av trykte mønster for å forvirre gjenkjenning­algoritmen.

Arbeidet fra 2019 'Fooling automated surveillance cameras: adversarial patches to attack person detection' demonstrerte et mot­standsfylt trykt mønster som kunne overbevise et gjenkjenningssystem om at ingen person var detektert, og tillot en type 'usynlighet'. Kilde: https://arxiv.org/pdf/1904.08653

Arbeidet fra 2019 ‘Fooling automated surveillance cameras: adversarial patches to attack person detection’ demonstrerte et mot­standsfylt trykt mønster som kunne overbevise et gjenkjenningssystem om at ingen person var detektert, og tillot en type ‘usynlighet. Kilde: https://arxiv.org/pdf/1904.08653

Forskerne bak den nye artikkelen observerer at deres tilnærming krever mindre forberedelse, med ingen behov for å utvikle mot­standsfylte bærbare gjenstander (se bildet over).

Den artikkelen har tittelen En privatlivs­forbedringsteknikk for å unngå oppdaging av gate­video­kameraer uten å bruke mot­standsfylte tilbehør, og kommer fra fem forskere fra Ben-Gurion University of the Negev og Fujitsu Limited.

Metode og tester

I samsvar med tidligere arbeid som Adversarial Mask, AdvHat, mot­standsfylte mønster, og andre lignende arbeid, antar forskerne at fotgjengeren ‘angriperen’ kjenner til hvilket objekt­gjenkjenningssystem som brukes i overvåkings­nettverket. Dette er faktisk ikke et urimelig antagelse, på grunn av den vidt utbredte bruken av åpen kilde­kodete systemer som YOLO i overvåkings­systemer fra selskaper som Cisco og Ultralytics (nåværende sentral drivkraft i YOLO-utviklingen).

Artikkelen antar også at fotgjengeren har tilgang til en direkte­strømming på internettet som er rettet mot de lokasjoner som skal beregnes, som igjen er en rimelig antagelse i de fleste steder som sannsynligvis har en intensitet av dekning.

Nettsteder som 511ny.org tilbyr tilgang til mange overvåkings­kameraer i NYC-området. Kilde: https://511ny.or

Nettsteder som 511ny.org tilbyr tilgang til mange overvåkings­kameraer i NYC-området. Kilde: https://511ny.or

Bortsett fra dette, trenger fotgjengeren tilgang til den foreslåtte metoden, og til scenen selv (dvs. kryssningene og rutene hvor en ‘sikker’ rute skal etableres).

For å utvikle L-PET, evaluerte forfatterne effekten av fotgjengerens vinkel i forhold til kameraet; effekten av kamera­høyde; effekten av avstand; og effekten av tid på dagen. For å få tak i grunn­sannheten, fotograferte de en person i vinklene 0°, 45°, 90°, 135°, 180°, 225°, 270° og 315°.

Grunn­sannhets­observasjoner utført av forskerne.

Grunn­sannhets­observasjoner utført av forskerne.

De gjentok disse variasjonene ved tre forskjellige kamera­høyder (0,6 m, 1,8 m, 2,4 m), og med varierende lys­forhold (morgen, ettermiddag, natt og ‘lab’-forhold).

De matet denne film­materialet til Faster R-CNN og YOLOv3 objekt­detektorer, og fant at tilliten til objektet avhenger av skarpheten av vinkelen til fotgjengeren, fotgjengerens avstand, kamera­høyden og lys­forholdene*.

Forfatterne testet deretter en bredere rekke objekt­detektorer i samme scenario: Faster R-CNN; YOLOv3; SSD; DiffusionDet; og RTMDet.

Forfatterne slår fast:

‘Vi fant at alle fem objekt­detektor­arkitekturer er påvirket av fotgjengerens posisjon og omgivelses­lys. I tillegg fant vi at for tre av de fem modellene (YOLOv3, SSD og RTMDet) effekten varer gjennom alle omgivelses­lys­nivåer.’

For å utvide omfanget, brukte forskerne film­materiale tatt fra offentlig tilgjengelige trafikk­kameraer i tre lokasjoner: Shibuya Crossing i Tokyo, Broadway i New York og Castro District i San Francisco.

Hver lokasjon tilbød mellom fem og seks opptak, med omtrent fire timers film­materiale per opptak. For å analysere oppdaging­ytelse, ble én ramme ekstrahert hver andre sekund, og prosessert ved hjelp av en Faster R-CNN objekt­detektor. For hver piksel i de resulterende rammer, estimerte metoden den gjennomsnittlige tilliten til ‘person’-oppdagingens avgrensningssystemer som var til stede i den pikselen.

‘Vi fant at i alle tre lokasjoner, var tilliten til objekt­detektoren avhengig av menneskenes posisjon i rammen. For eksempel, i Shibuya Crossing-film­materialet, er det store områder med lav tillit både lengre unna kameraet og nærmere kameraet, hvor en stolpe delvis skjuler forbipasserende fotgjengere.’

L-PET-metoden er i praksis denne prosessen, som kan kalles ‘våpenisert’ for å få en rute gjennom et urbant område som er minst sannsynlig å resultere i at fotgjengeren blir suksessfullt gjenkjent.

I motsetning til dette, følger L-BAT samme prosess, med forskjellen at den oppdaterer poengene i oppdagingssystemet, og skaper en tilbakemeldings­løkke designet for å motvirke L-PET-tilnærmingen og gjøre ‘blinde områder’ i systemet mer effektive.

(I praksis, imidlertid, ville forbedring av dekning basert på oppnådde tillitskart kreve mer enn bare en oppgradering av kameraet som sitter i den forventede posisjonen; basert på testkriteriene, inkludert lokasjon, ville det kreve installasjon av ekstra kameraer for å dekke de forneglete områdene – derfor kunne det argumenteres for at L-PET-metoden eskalerer denne spesielle ‘kalde krigen’ til en svært kostbar scenario)

Den gjennomsnittlige fotgjenger­oppdaging­tilliten for hver piksel, over diverse detektor­rammeverk, i det observerte området av Castro Street, analysert over fem videoer. Hver video ble innspilt under forskjellige lys­forhold: sol­oppgang, dagtid, sol­nedgang og to forskjellige natt­innstillinger. Resultatene presenteres separat for hvert lys­scenario.

Den gjennomsnittlige fotgjenger­oppdaging­tilliten for hver piksel, over diverse detektor­rammeverk, i det observerte området av Castro Street, analysert over fem videoer. Hver video ble innspilt under forskjellige lys­forhold: sol­oppgang, dagtid, sol­nedgang og to forskjellige natt­innstillinger. Resultatene presenteres separat for hvert lys­scenario.

Etter å ha konvertert den piksel­baserte matrise­representasjonen til en graf­representasjon egnet for oppgaven, tilpasset forskerne Dijkstra-algoritmen for å beregne optimale ruter for fotgjengere til å navigere gjennom områder med redusert overvåkings­oppdaging.

I stedet for å finne den korteste ruten, ble algoritmen modifisert for å minimere oppdaging­tillit, og behandlet høytillits­områder som områder med høyere ‘kostnad’. Denne tilpasningen tillot algoritmen å identifisere ruter som passerer gjennom blinde flekker eller lav­oppdaging­soner, og guidet fotgjengere langs ruter med redusert synlighet for overvåkings­systemer.

En visualisering som viser omformingen av scenens tillitskart fra en piksel­basert matrise til en graf­basert representasjon.

En visualisering som viser omformingen av scenens tillitskart fra en piksel­basert matrise til en graf­basert representasjon.

Forskerne evaluerte effekten av L-BAT-systemet på fotgjenger­oppdaging med en datasett bygget fra de ovennevnte fire­timers­opptakene av offentlig fotgjenger­trafikk. For å populerer samlingen, ble én ramme prosessert hver andre sekund ved hjelp av en SSD-objekt­detektor.

Fra hver ramme ble én avgrensningssystem­boks valgt som inneholdt en detektert person som en positiv prøve, og et tilfeldig område uten detekterte personer som en negativ prøve. Disse tvilling­prøvene dannet en datasett for å evaluere to Faster R-CNN-modeller – én med L-BAT anvendt, og én uten.

Ytelsen til modellene ble vurdert ved å sjekke hvor nøyaktig de identifiserte positive og negative prøver: en avgrensningssystem­boks som overlappet en positiv prøve, ble betraktet som en sant positiv, mens en avgrensningssystem­boks som overlappet en negativ prøve, ble merket som en falsk positiv.

Målinger som ble brukt for å bestemme oppdaging­påliteligheten til L-BAT, var areal under kurven (AUC); sant positiv rate (TPR); falsk positiv rate (FPR); og gjennomsnittlig sant positiv tillit. Forskerne hevder at bruk av L-BAT forbedret oppdaging­tillit samtidig som den opprettholdt en høy sant positiv rate (om enn med en liten økning i falske positive).

I slutten observerer forfatterne at tilnærmingen har noen begrensninger. En av dem er at tillitskartene generert av deres metode er spesifikke for en bestemt tid på dagen. Selv om de ikke utdyper det, ville dette indikere at en større, multi­nivå­tilnærming ville være nødvendig for å håndtere tid på dagen i en mer fleksibel utbredelse.

De observerer også at tillitskartene ikke vil overføres til forskjellige modell­arkitekturer, og er knyttet til en bestemt objekt­detektor­modell. Ettersom arbeidet som er foreslått, er i praksis et bevis­konsept, kunne mer avanserte arkitekturer også bli utviklet for å løse denne tekniske gjelden.

Konklusjon

Enhver ny angreps­metode som løsningen er ‘å betale for nye overvåkings­kameraer’, har en fordel, ettersom utvidelse av sivile kamera­nettverk i høyt overvåkede områder kan være politisk utfordrende, samt representere en betydelig sivil utgift som vanligvis vil trenge en velger­mandat.

Kanskje det største spørsmålet som arbeidet stiller, er ‘Bruker lukkede overvåkings­systemer åpen kilde­kodete SOTA-rammeverk som YOLO?’}. Dette er, naturligvis, umulig å vite, ettersom produsentene av de proprietære systemene som driver så mange statlige og sivile kamera­nettverk (i alle fall i USA), ville argumentere for at å avsløre en slik bruk kunne åpne dem opp for angrep.

Likevel ville migreringen av statlige IT- og interne proprietære kode til globale og åpen kilde­kodete kode, antyde at noen som tester forfatternes påstand med (for eksempel) YOLO, kanskje ville treffe jackpot umiddelbart.

 

* Jeg ville normalt inkludere relaterte tabell­resultater når de er tilgjengelige i artikkelen, men i dette tilfelle gjør kompleksiteten i artikkelen sine tabeller dem uproduktive for den alminnelige leseren, og en oppsummering er derfor mer nyttig.

Først publisert tirsdag, 28. januar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai