Andersons hoek
De ‘geheime routes’ die voetgangersherkenningssystemen kunnen dwarsbomen

Een nieuwe onderzoeks samenwerking tussen IsraÃŦl en Japan beweert dat voetgangersdetectiesystemen inherente zwakheden hebben, waardoor goed geÃŊnformeerde personen facial recognition systemen kunnen ontwijken door zorgvuldig geplande routes te nemen door gebieden waar surveillancenetwerken het minst effectief zijn.
Met behulp van openbaar beschikbare beelden van Tokyo, New York en San Francisco, ontwikkelden de onderzoekers een geautomatiseerde methode om dergelijke paden te berekenen, op basis van de meest populaire objectherkenningssystemen die waarschijnlijk in gebruik zijn in openbare netwerken.

De drie kruispunten die in de studie zijn gebruikt: Shibuya Crossing in Tokyo, Japan; Broadway, New York; en Castro District, San Francisco. Bron: https://arxiv.org/pdf/2501.15653
Met deze methode is het mogelijk om confidence heatmaps te genereren die gebieden binnen de camerabeelden aanduiden waar voetgangers het minst waarschijnlijk een positieve facial recognition hit zullen geven:

Rechts zien we de confidence heatmap gegenereerd door de methode van de onderzoekers. De rode gebieden geven lage betrouwbaarheid aan, en een configuratie van houding, camerapositie en andere factoren die waarschijnlijk de facial recognition zullen belemmeren.
In theorie zou een dergelijke methode instrumentaliseerd kunnen worden in een locatie-gevoelige app, of een ander soort platform om de minst âherkenning-vriendelijkeâ routes van A naar B in elke berekende locatie te verspreiden.
Het nieuwe artikel stelt een dergelijke methodologie voor, getiteld Location-based Privacy Enhancing Technique (L-PET); het stelt ook een tegenmaatregel voor, getiteld Location-Based Adaptive Threshold (L-BAT), die essentieel dezelfde routines uitvoert, maar dan gebruikt om de surveillance-maatregelen te versterken en te verbeteren, in plaats van manieren te vinden om herkend te worden; en in veel gevallen zouden dergelijke verbeteringen niet mogelijk zijn zonder verdere investeringen in de surveillancenetwerken.
Het artikel zet dus een potentieel technologische escalatieoorlog op tussen degenen die proberen hun routes te optimaliseren om detectie te vermijden en de capaciteit van surveillancesystemen om facial recognition technologieÃŦn volledig te gebruiken.
Vorige methoden om detectie te ontwijken zijn minder elegant dan deze, en richten zich op adversarial benaderingen, zoals TnT Attacks, en het gebruik van geprinte patronen om de detectie-algoritme te verwarren.

Het werk van 2019 âFooling automated surveillance cameras: adversarial patches to attack person detectionâ toonde een adversarial geprint patroon aan dat in staat was om een herkenningsysteem te overtuigen dat er geen persoon werd gedetecteerd, waardoor een soort âonzichtbaarheidâ ontstond. Bron: https://arxiv.org/pdf/1904.08653
De onderzoekers achter het nieuwe artikel merken op dat hun benadering minder voorbereiding vereist, met geen noodzaak om adversarial draagbare items (zie afbeelding hierboven) te ontwikkelen.
Het artikel heeft de titel Een Privacy Enhancing Technique om detectie te vermijden door straatvideo-cameraâs zonder het gebruik van adversarial accessoires, en komt van vijf onderzoekers van Ben-Gurion Universiteit van de Negev en Fujitsu Limited.
Methode en tests
In overeenstemming met eerdere werken zoals Adversarial Mask, AdvHat, adversarial patches, en verschillende andere soortgelijke uitgaven, gaan de onderzoekers ervan uit dat de voetganger âaanvallerâ weet welk objectdetectiesysteem in het surveillancenetwerk wordt gebruikt. Dit is eigenlijk geen onredelijke veronderstelling, vanwege de wijdverbreide adoptie van state-of-the-art open source systemen zoals YOLO in surveillancesystemen van bedrijven als Cisco en Ultralytics (momenteel de centrale driving force in YOLO-ontwikkeling).
Het artikel gaat er ook van uit dat de voetganger toegang heeft tot een live stream op internet die is gericht op de locaties die moeten worden berekend, wat, opnieuw, een redelijke veronderstelling is in de meeste plaatsen die waarschijnlijk een intensiteit van dekking hebben.

Sites zoals 511ny.org bieden toegang tot veel surveillanc-cameraâs in het NYC-gebied. Bron: https://511ny.or
Behalve dit, heeft de voetganger toegang nodig tot de voorgestelde methode, en tot de scÃĻne zelf (d.w.z. de kruispunten en routes waarin een âveiligeâ route moet worden vastgesteld).
Om L-PET te ontwikkelen, hebben de auteurs het effect van de voetgangerhoek in relatie tot de camera onderzocht; het effect van camerahoogte; het effect van afstand; en het effect van de tijd van de dag. Om grondwaarheid te verkrijgen, hebben ze een persoon gefotografeerd bij de hoeken 0°, 45°, 90°, 135°, 180°, 225°, 270° en 315°.

Grondwaarheid observaties uitgevoerd door de onderzoekers.
Ze herhaalden deze variaties bij drie verschillende camerahoogtes (0,6 m, 1,8 m, 2,4 m), en met variabele lichtomstandigheden (ochtend, middag, avond en âlabâ-omstandigheden).
Door deze beelden te voeden aan de Faster R-CNN en YOLOv3 objectdetectoren, vonden ze dat de betrouwbaarheid van het object afhankelijk is van de scherpte van de hoek van de voetganger, de afstand van de voetganger, de camerahoogte en de weers-/lichtomstandigheden*.
De auteurs testten vervolgens een bredere reeks objectdetectoren in hetzelfde scenario: Faster R-CNN; YOLOv3; SSD; DiffusionDet; en RTMDet.
De auteurs verklaren:
âWe vonden dat alle vijf objectdetectie-architecturen worden beÃŊnvloed door de positie van de voetganger en omgevingslicht. Bovendien vonden we dat voor drie van de vijf modellen (YOLOv3, SSD en RTMDet) het effect door alle omgevingslichtniveaus heen blijft bestaan.â
Om de reikwijdte uit te breiden, gebruikten de onderzoekers beelden die zijn opgenomen met openbaar beschikbare verkeerscameraâs in drie locaties: Shibuya Crossing in Tokyo, Broadway in New York en de Castro District in San Francisco.
Elke locatie leverde tussen de vijf en zes opnames op, met ongeveer vier uur aan beelden per opname. Om de detectieprestaties te analyseren, werd ÃĐÃĐn frame per twee seconden geÃŦxtraheerd en verwerkt met een Faster R-CNN-objectdetector. Voor elk pixel in de verkregen frames schatte de methode de gemiddelde betrouwbaarheid van de âpersoonâ-detectie-begrenzingsvakken die in dat pixel aanwezig waren.
âWe vonden dat in alle drie de locaties de betrouwbaarheid van de objectdetector varieerde afhankelijk van de locatie van personen in het kader. Bijvoorbeeld, in de beelden van Shibuya Crossing, zijn er grote gebieden met lage betrouwbaarheid verder weg van de camera, evenals dichter bij de camera, waar een paal gedeeltelijk passerende voetgangers verduistert.â
De L-PET-methode is in wezen deze procedure, die kan worden âbewapendâ om een route door een stedelijk gebied te verkrijgen die het minst waarschijnlijk zal resulteren in een succesvolle herkenning van de voetganger.
Door contrast, volgt L-BAT dezelfde procedure, met het verschil dat het de scores in het detectiesysteem bijwerkt, waardoor een feedbacklus ontstaat die is ontworpen om de L-PET-aanpak te verhinderen en de âblinde gebiedenâ van het systeem effectiever te maken.
(In praktische zin, echter, zou het verbeteren van de dekking op basis van de verkregen heatmaps meer vereisen dan alleen een upgrade van de camera in de verwachte positie; op basis van de testcriteria, waaronder locatie, zou het de installatie van extra cameraâs vereisen om de verwaarloosde gebieden te dekken â het kan dus worden betoogd dat de L-PET-methode deze specifieke âkoude oorlogâ escalerend maakt tot een zeer kostbare situatie inderdaad)

De gemiddelde voetgangerdetectiebetrouwbaarheid voor elk pixel, over diverse detectiekaders, in het geobserveerde gebied van Castro Street, geanalyseerd over vijf videoâs. Elke video werd opgenomen onder verschillende lichtomstandigheden: zonsopgang, dag, zonsondergang en twee verschillende nachtinstellingen. De resultaten worden afzonderlijk gepresenteerd voor elk lichtscenario.
Door het pixel-gebaseerde matrix-representatie om te zetten in een grafische representatie die geschikt is voor de taak, pasten de onderzoekers de Dijkstra-algoritme aan om optimale routes voor voetgangers te berekenen om door gebieden met verminderde surveillancedetectie te navigeren.
In plaats van de kortste route te vinden, werd het algoritme aangepast om de detectiebetrouwbaarheid te minimaliseren, waarbij hoge-betrouwbaarheidsgebieden werden behandeld als gebieden met hogere âkostenâ. Deze aanpassing stelde het algoritme in staat om routes te identificeren die door blinde vlekken of lage-detectiezones gaan, waardoor voetgangers effectief langs routes met verminderde zichtbaarheid voor surveillancesystemen worden geleid.

Een visualisatie die de transformatie van de scÃĻneâs heatmap van een pixel-gebaseerde matrix naar een grafische representatie weergeeft.
De onderzoekers evalueerden de impact van het L-BAT-systeem op voetgangerdetectie met een dataset die is opgebouwd uit de eerder genoemde vier uur durende opnames van openbaar voetgangersverkeer. Om de collectie te vullen, werd ÃĐÃĐn frame per twee seconden verwerkt met een SSD-objectdetector.
Uit elk frame werd ÃĐÃĐn begrenzingsvak geselecteerd dat een gedetecteerde persoon bevatte als een positieve steekproef, en een andere willekeurige gebied zonder gedetecteerde personen werd gebruikt als een negatieve steekproef. Deze tweelingsteekproeven vormden een dataset voor het evalueren van twee Faster R-CNN-modellen â ÃĐÃĐn met L-BAT toegepast, en ÃĐÃĐn zonder.
De prestaties van de modellen werden beoordeeld door te controleren hoe nauwkeurig ze positieve en negatieve steekproeven identificeerden: een begrenzingsvak dat een positieve steekproef overlapt, werd beschouwd als een ware positief; een begrenzingsvak dat een negatieve steekproef overlapt, werd gelabeld als een valse positief.
Metrische gegevens die werden gebruikt om de detectiereliabiliteit van L-BAT te bepalen, waren Area Under the Curve (AUC); ware positieve rate (TPR); valse positieve rate (FPR); en gemiddelde ware positieve betrouwbaarheid. De onderzoekers beweren dat het gebruik van L-BAT de detectiebetrouwbaarheid verbeterde, terwijl het een hoge ware positieve rate (hoewel met een lichte toename van valse positieven) handhaafde.
Als afsluiting merken de auteurs op dat de benadering enkele beperkingen heeft. Een daarvan is dat de door hun methode gegenereerde heatmaps specifiek zijn voor een bepaald tijdstip van de dag. Hoewel ze hier niet verder op ingaan, zou dit aangeven dat een grotere, meerlagige benadering nodig zou zijn om rekening te houden met het tijdstip van de dag in een meer flexibele inzet.
Ze merken ook op dat de heatmaps niet overdraagbaar zijn naar verschillende modelarchitecturen en zijn gekoppeld aan een specifiek objectdetectiemodel. Aangezien het voorgestelde werk in wezen een proof-of-concept is, kunnen meer geavanceerde architectuurontwerpen ook worden ontwikkeld om deze technische schuld te herstellen.
Conclusie
Elke nieuwe aanvals methode waarvoor de oplossing âbetalen voor nieuwe surveillanc-cameraâsâ is, heeft enig voordeel, omdat het uitbreiden van civiele cameranetwerken in sterk bewaakte gebieden politiek uitdagend kan zijn, evenals een aanzienlijke civiele uitgave die doorgaans een kiezersmandaat nodig heeft.
Misschien is de grootste vraag die door het werk wordt gesteld âGebruiken gesloten surveillancesystemen open source SOTA-kaders zoals YOLO?â. Dit is, natuurlijk, onmogelijk te weten, omdat de makers van de propriÃŦtaire systemen die zoveel staat- en civiele cameranetwerken (ten minste in de VS) aandrijven, zouden beweren dat het bekendmaken van een dergelijk gebruik hen mogelijk aanvallen zou openstellen.
Nonetheless, de migratie van overheids-IT en in-house propriÃŦtaire code naar wereldwijde en open source code zou suggereren dat iedereen die de bewering van de auteurs test (bijvoorbeeld met YOLO) mogelijk meteen de jackpot zou winnen.
Â
* Ik zou normaal gesproken gerelateerde tabelresultaten opnemen wanneer ze in het artikel worden verstrekt, maar in dit geval maken de complexiteit van de tabellen van het artikel ze onduidelijk voor de gewone lezer, en is een samenvatting daarom meer bruikbaar.
Eerst gepubliceerd op dinsdag 28 januari 2025












