Andersons hoek

De ‘geheime routes’ die voetgangersherkenningssystemen kunnen dwarsbomen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
ChatGPT-4o: Variation on prompt: ‘a 1792x1024 feature image depicting an orthogonal ariel view looking down on NYC's 42nd street area. Most of the image should have a blue hue, but within the sidewalk areas there should be red-tinted pathways indicated, like a kind of map route. Make it like The Sims.’

Een nieuwe onderzoeks samenwerking tussen IsraÃŦl en Japan beweert dat voetgangersdetectiesystemen inherente zwakheden hebben, waardoor goed geÃŊnformeerde personen facial recognition systemen kunnen ontwijken door zorgvuldig geplande routes te nemen door gebieden waar surveillancenetwerken het minst effectief zijn.

Met behulp van openbaar beschikbare beelden van Tokyo, New York en San Francisco, ontwikkelden de onderzoekers een geautomatiseerde methode om dergelijke paden te berekenen, op basis van de meest populaire objectherkenningssystemen die waarschijnlijk in gebruik zijn in openbare netwerken.

De drie kruispunten die in de studie zijn gebruikt: Shibuya Crossing in Tokyo, Japan; Broadway, New York; en Castro District, San Francisco. Bron: https://arxiv.org/pdf/2501.15653

De drie kruispunten die in de studie zijn gebruikt: Shibuya Crossing in Tokyo, Japan; Broadway, New York; en Castro District, San Francisco. Bron: https://arxiv.org/pdf/2501.15653

Met deze methode is het mogelijk om confidence heatmaps te genereren die gebieden binnen de camerabeelden aanduiden waar voetgangers het minst waarschijnlijk een positieve facial recognition hit zullen geven:

Rechts zien we de confidence heatmap gegenereerd door de methode van de onderzoekers. De rode gebieden geven lage betrouwbaarheid aan, en een configuratie van houding, camerapositie en andere factoren die waarschijnlijk de facial recognition zullen belemmeren.

Rechts zien we de confidence heatmap gegenereerd door de methode van de onderzoekers. De rode gebieden geven lage betrouwbaarheid aan, en een configuratie van houding, camerapositie en andere factoren die waarschijnlijk de facial recognition zullen belemmeren.

In theorie zou een dergelijke methode instrumentaliseerd kunnen worden in een locatie-gevoelige app, of een ander soort platform om de minst ‘herkenning-vriendelijke’ routes van A naar B in elke berekende locatie te verspreiden.

Het nieuwe artikel stelt een dergelijke methodologie voor, getiteld Location-based Privacy Enhancing Technique (L-PET); het stelt ook een tegenmaatregel voor, getiteld Location-Based Adaptive Threshold (L-BAT), die essentieel dezelfde routines uitvoert, maar dan gebruikt om de surveillance-maatregelen te versterken en te verbeteren, in plaats van manieren te vinden om herkend te worden; en in veel gevallen zouden dergelijke verbeteringen niet mogelijk zijn zonder verdere investeringen in de surveillancenetwerken.

Het artikel zet dus een potentieel technologische escalatieoorlog op tussen degenen die proberen hun routes te optimaliseren om detectie te vermijden en de capaciteit van surveillancesystemen om facial recognition technologieÃŦn volledig te gebruiken.

Vorige methoden om detectie te ontwijken zijn minder elegant dan deze, en richten zich op adversarial benaderingen, zoals TnT Attacks, en het gebruik van geprinte patronen om de detectie-algoritme te verwarren.

Het werk van 2019 'Fooling automated surveillance cameras: adversarial patches to attack person detection' toonde een adversarial geprint patroon aan dat in staat was om een herkenningsysteem te overtuigen dat er geen persoon werd gedetecteerd, waardoor een soort 'onzichtbaarheid' ontstond. Bron: https://arxiv.org/pdf/1904.08653

Het werk van 2019 ‘Fooling automated surveillance cameras: adversarial patches to attack person detection’ toonde een adversarial geprint patroon aan dat in staat was om een herkenningsysteem te overtuigen dat er geen persoon werd gedetecteerd, waardoor een soort ‘onzichtbaarheid’ ontstond. Bron: https://arxiv.org/pdf/1904.08653

De onderzoekers achter het nieuwe artikel merken op dat hun benadering minder voorbereiding vereist, met geen noodzaak om adversarial draagbare items (zie afbeelding hierboven) te ontwikkelen.

Het artikel heeft de titel Een Privacy Enhancing Technique om detectie te vermijden door straatvideo-camera’s zonder het gebruik van adversarial accessoires, en komt van vijf onderzoekers van Ben-Gurion Universiteit van de Negev en Fujitsu Limited.

Methode en tests

In overeenstemming met eerdere werken zoals Adversarial Mask, AdvHat, adversarial patches, en verschillende andere soortgelijke uitgaven, gaan de onderzoekers ervan uit dat de voetganger ‘aanvaller’ weet welk objectdetectiesysteem in het surveillancenetwerk wordt gebruikt. Dit is eigenlijk geen onredelijke veronderstelling, vanwege de wijdverbreide adoptie van state-of-the-art open source systemen zoals YOLO in surveillancesystemen van bedrijven als Cisco en Ultralytics (momenteel de centrale driving force in YOLO-ontwikkeling).

Het artikel gaat er ook van uit dat de voetganger toegang heeft tot een live stream op internet die is gericht op de locaties die moeten worden berekend, wat, opnieuw, een redelijke veronderstelling is in de meeste plaatsen die waarschijnlijk een intensiteit van dekking hebben.

Sites zoals 511ny.org bieden toegang tot veel surveillanc-camera's in het NYC-gebied. Bron: https://511ny.or

Sites zoals 511ny.org bieden toegang tot veel surveillanc-camera’s in het NYC-gebied. Bron: https://511ny.or

Behalve dit, heeft de voetganger toegang nodig tot de voorgestelde methode, en tot de scÃĻne zelf (d.w.z. de kruispunten en routes waarin een ‘veilige’ route moet worden vastgesteld).

Om L-PET te ontwikkelen, hebben de auteurs het effect van de voetgangerhoek in relatie tot de camera onderzocht; het effect van camerahoogte; het effect van afstand; en het effect van de tijd van de dag. Om grondwaarheid te verkrijgen, hebben ze een persoon gefotografeerd bij de hoeken 0°, 45°, 90°, 135°, 180°, 225°, 270° en 315°.

Grondwaarheid observaties uitgevoerd door de onderzoekers.

Grondwaarheid observaties uitgevoerd door de onderzoekers.

Ze herhaalden deze variaties bij drie verschillende camerahoogtes (0,6 m, 1,8 m, 2,4 m), en met variabele lichtomstandigheden (ochtend, middag, avond en ‘lab’-omstandigheden).

Door deze beelden te voeden aan de Faster R-CNN en YOLOv3 objectdetectoren, vonden ze dat de betrouwbaarheid van het object afhankelijk is van de scherpte van de hoek van de voetganger, de afstand van de voetganger, de camerahoogte en de weers-/lichtomstandigheden*.

De auteurs testten vervolgens een bredere reeks objectdetectoren in hetzelfde scenario: Faster R-CNN; YOLOv3; SSD; DiffusionDet; en RTMDet.

De auteurs verklaren:

‘We vonden dat alle vijf objectdetectie-architecturen worden beÃŊnvloed door de positie van de voetganger en omgevingslicht. Bovendien vonden we dat voor drie van de vijf modellen (YOLOv3, SSD en RTMDet) het effect door alle omgevingslichtniveaus heen blijft bestaan.’

Om de reikwijdte uit te breiden, gebruikten de onderzoekers beelden die zijn opgenomen met openbaar beschikbare verkeerscamera’s in drie locaties: Shibuya Crossing in Tokyo, Broadway in New York en de Castro District in San Francisco.

Elke locatie leverde tussen de vijf en zes opnames op, met ongeveer vier uur aan beelden per opname. Om de detectieprestaties te analyseren, werd ÃĐÃĐn frame per twee seconden geÃŦxtraheerd en verwerkt met een Faster R-CNN-objectdetector. Voor elk pixel in de verkregen frames schatte de methode de gemiddelde betrouwbaarheid van de ‘persoon’-detectie-begrenzingsvakken die in dat pixel aanwezig waren.

‘We vonden dat in alle drie de locaties de betrouwbaarheid van de objectdetector varieerde afhankelijk van de locatie van personen in het kader. Bijvoorbeeld, in de beelden van Shibuya Crossing, zijn er grote gebieden met lage betrouwbaarheid verder weg van de camera, evenals dichter bij de camera, waar een paal gedeeltelijk passerende voetgangers verduistert.’

De L-PET-methode is in wezen deze procedure, die kan worden ‘bewapend’ om een route door een stedelijk gebied te verkrijgen die het minst waarschijnlijk zal resulteren in een succesvolle herkenning van de voetganger.

Door contrast, volgt L-BAT dezelfde procedure, met het verschil dat het de scores in het detectiesysteem bijwerkt, waardoor een feedbacklus ontstaat die is ontworpen om de L-PET-aanpak te verhinderen en de ‘blinde gebieden’ van het systeem effectiever te maken.

(In praktische zin, echter, zou het verbeteren van de dekking op basis van de verkregen heatmaps meer vereisen dan alleen een upgrade van de camera in de verwachte positie; op basis van de testcriteria, waaronder locatie, zou het de installatie van extra camera’s vereisen om de verwaarloosde gebieden te dekken – het kan dus worden betoogd dat de L-PET-methode deze specifieke ‘koude oorlog’ escalerend maakt tot een zeer kostbare situatie inderdaad)

De gemiddelde voetgangerdetectiebetrouwbaarheid voor elk pixel, over diverse detectiekaders, in het geobserveerde gebied van Castro Street, geanalyseerd over vijf video's. Elke video werd opgenomen onder verschillende lichtomstandigheden: zonsopgang, dag, zonsondergang en twee verschillende nachtinstellingen. De resultaten worden afzonderlijk gepresenteerd voor elk lichtscenario.

De gemiddelde voetgangerdetectiebetrouwbaarheid voor elk pixel, over diverse detectiekaders, in het geobserveerde gebied van Castro Street, geanalyseerd over vijf video’s. Elke video werd opgenomen onder verschillende lichtomstandigheden: zonsopgang, dag, zonsondergang en twee verschillende nachtinstellingen. De resultaten worden afzonderlijk gepresenteerd voor elk lichtscenario.

Door het pixel-gebaseerde matrix-representatie om te zetten in een grafische representatie die geschikt is voor de taak, pasten de onderzoekers de Dijkstra-algoritme aan om optimale routes voor voetgangers te berekenen om door gebieden met verminderde surveillancedetectie te navigeren.

In plaats van de kortste route te vinden, werd het algoritme aangepast om de detectiebetrouwbaarheid te minimaliseren, waarbij hoge-betrouwbaarheidsgebieden werden behandeld als gebieden met hogere ‘kosten’. Deze aanpassing stelde het algoritme in staat om routes te identificeren die door blinde vlekken of lage-detectiezones gaan, waardoor voetgangers effectief langs routes met verminderde zichtbaarheid voor surveillancesystemen worden geleid.

Een visualisatie die de transformatie van de scÃĻne's heatmap van een pixel-gebaseerde matrix naar een grafische representatie weergeeft.

Een visualisatie die de transformatie van de scÃĻne’s heatmap van een pixel-gebaseerde matrix naar een grafische representatie weergeeft.

De onderzoekers evalueerden de impact van het L-BAT-systeem op voetgangerdetectie met een dataset die is opgebouwd uit de eerder genoemde vier uur durende opnames van openbaar voetgangersverkeer. Om de collectie te vullen, werd ÃĐÃĐn frame per twee seconden verwerkt met een SSD-objectdetector.

Uit elk frame werd ÃĐÃĐn begrenzingsvak geselecteerd dat een gedetecteerde persoon bevatte als een positieve steekproef, en een andere willekeurige gebied zonder gedetecteerde personen werd gebruikt als een negatieve steekproef. Deze tweelingsteekproeven vormden een dataset voor het evalueren van twee Faster R-CNN-modellen – ÃĐÃĐn met L-BAT toegepast, en ÃĐÃĐn zonder.

De prestaties van de modellen werden beoordeeld door te controleren hoe nauwkeurig ze positieve en negatieve steekproeven identificeerden: een begrenzingsvak dat een positieve steekproef overlapt, werd beschouwd als een ware positief; een begrenzingsvak dat een negatieve steekproef overlapt, werd gelabeld als een valse positief.

Metrische gegevens die werden gebruikt om de detectiereliabiliteit van L-BAT te bepalen, waren Area Under the Curve (AUC); ware positieve rate (TPR); valse positieve rate (FPR); en gemiddelde ware positieve betrouwbaarheid. De onderzoekers beweren dat het gebruik van L-BAT de detectiebetrouwbaarheid verbeterde, terwijl het een hoge ware positieve rate (hoewel met een lichte toename van valse positieven) handhaafde.

Als afsluiting merken de auteurs op dat de benadering enkele beperkingen heeft. Een daarvan is dat de door hun methode gegenereerde heatmaps specifiek zijn voor een bepaald tijdstip van de dag. Hoewel ze hier niet verder op ingaan, zou dit aangeven dat een grotere, meerlagige benadering nodig zou zijn om rekening te houden met het tijdstip van de dag in een meer flexibele inzet.

Ze merken ook op dat de heatmaps niet overdraagbaar zijn naar verschillende modelarchitecturen en zijn gekoppeld aan een specifiek objectdetectiemodel. Aangezien het voorgestelde werk in wezen een proof-of-concept is, kunnen meer geavanceerde architectuurontwerpen ook worden ontwikkeld om deze technische schuld te herstellen.

Conclusie

Elke nieuwe aanvals methode waarvoor de oplossing ‘betalen voor nieuwe surveillanc-camera’s’ is, heeft enig voordeel, omdat het uitbreiden van civiele cameranetwerken in sterk bewaakte gebieden politiek uitdagend kan zijn, evenals een aanzienlijke civiele uitgave die doorgaans een kiezersmandaat nodig heeft.

Misschien is de grootste vraag die door het werk wordt gesteld ‘Gebruiken gesloten surveillancesystemen open source SOTA-kaders zoals YOLO?’. Dit is, natuurlijk, onmogelijk te weten, omdat de makers van de propriÃŦtaire systemen die zoveel staat- en civiele cameranetwerken (ten minste in de VS) aandrijven, zouden beweren dat het bekendmaken van een dergelijk gebruik hen mogelijk aanvallen zou openstellen.

Nonetheless, de migratie van overheids-IT en in-house propriÃŦtaire code naar wereldwijde en open source code zou suggereren dat iedereen die de bewering van de auteurs test (bijvoorbeeld met YOLO) mogelijk meteen de jackpot zou winnen.

 

* Ik zou normaal gesproken gerelateerde tabelresultaten opnemen wanneer ze in het artikel worden verstrekt, maar in dit geval maken de complexiteit van de tabellen van het artikel ze onduidelijk voor de gewone lezer, en is een samenvatting daarom meer bruikbaar.

Eerst gepubliceerd op dinsdag 28 januari 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]