Andersons vinkel

Optisk Adversarial Attack Kan Endre Meningen av Veiskilt

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere i USA har utviklet en adversarial attack mot evnen til maskinlæringsystemer til å tolke hva de ser riktig – inkludert kritiske elementer som veiskilt – ved å lyse mønsterlys på virkelige objekter. I ett eksperiment lyktes metoden i å endre mening av et “STOP”-veiskilt til et “30mph”-hastighetsbegrensningsskilt.

Perturbasjoner på et skilt, skapt ved å lyse mønsterlys på det, forvrir hvordan det tolkes i et maskinlæringsystem. Kilde: https://arxiv.org/pdf/2108.06247.pdf

Perturbasjoner på et skilt, skapt ved å lyse mønsterlys på det, forvrir hvordan det tolkes i et maskinlæringsystem. Kilde: https://arxiv.org/pdf/2108.06247.pdf

Forskningsarbeidet er titulert Optisk Adversarial Attack og kommer fra Purdue University i Indiana.

En optisk adversarial attack (OPAD), som foreslås i artikkelen, bruker strukturert belysning til å endre utseendet på målobjekter og krever bare en vanlig projektor, en kamera og en datamaskin. Forskerne var i stand til å gjennomføre både hvitboks- og svartboksangrep med denne metoden.

OPAD-innstillingen og de minimale forstyrrelsene (som mennesker knapt merker) som er tilstrekkelige til å forårsake en misklassifisering.

OPAD-innstillingen og de minimale forstyrrelsene (som mennesker knapt merker) som er tilstrekkelige til å forårsake en misklassifisering.

Oppsettet for OPAD består av en ViewSonic 3600 Lumens SVGA-projektor, en Canon T6i-kamera og en bærbar datamaskin.

Svartboks- og målrettede angrep

Hvitboksangrep er usannsynlige scenarier der en angriper kan ha direkte tilgang til en treningsmodellprosess eller til styringen av inndata. Svartboksangrep, på den andre siden, er vanligvis formulert ved å slutte hvordan en maskinlæringsmodell er sammensatt, eller i det minste hvordan den oppfører seg, ved å lage “skygge”-modeller og utvikle adversarial angrep som er designet til å fungere på den opprinnelige modellen.

Her ser vi mengden visuell forstyrrelse som er nødvendig for å narre klassifisatoren.

Her ser vi mengden visuell forstyrrelse som er nødvendig for å narre klassifisatoren.

I det siste tilfelle er ingen spesiell tilgang nødvendig, selv om slike angrep blir sterkt hjulpet av den omfattende bruken av åpne kildekode-biblioteker og databaser i nåværende akademisk og kommersiell forskning.

Alle OPAD-angrepene i den nye artikkelen er “målrettede” angrep, som spesifikt søker å endre hvordan bestemte objekter tolkes. Selv om systemet også har vist seg å være i stand til å oppnå generelle, abstrakte angrep, mener forskerne at en virkelig angriper ville ha et mer spesifikt disruptivt mål.

OPAD-angrepet er bare en virkelig versjon av det ofte forskede prinsippet om å injisere støy i bilder som skal brukes i datavisjonssystemer. Verdien av metoden er at man kan enkelt “prosjektere” forstyrrelsene på målobjektet for å utløse misklassifiseringen, mens det er vanskeligere å sikre at “Trojan horse”-bilder havner i treningsprosessen.

I tilfelle hvor OPAD var i stand til å påføre den hashet mening av “hastighet 30”-bildet i en datasett på et “STOP”-skilt, ble basisbildet oppnådd ved å belyse objektet jevnt med en intensitet på 140/255. Deretter ble projektor-kompensert belysning brukt som et prosjekt gradient descent-angrep.

Eksempler på OPAD-mis klassifiseringangrep.

Forskerne observerer at hovedutfordringen i prosjektet har vært å kalibrere og sette opp projektor-mekanismen så den oppnår en ren “forføring”, siden vinkler, optikk og flere andre faktorer er en utfordring for å utnytte.

I tillegg er metoden bare sannsynlig å fungere om natten. Hvis den åpenbare belysningen ville avsløre “haket” er også en faktor; hvis et objekt som et skilt allerede er belyst, må projektor kompensere for den belysningen, og mengden reflektert forstyrrelse må også være motstandskraftig mot billys. Det ser ut til å være et system som ville fungere best i urbane miljøer, der miljøbelysningen sannsynligvis er mer stabil.

Forskningsarbeidet bygger i praksis en ML-orientert iterasjon av Columbia Universitys 2004-forskning om å endre utseendet på objekter ved å projektere andre bilder på dem – et optisk eksperiment som mangler den ondsinnede potensialet til OPAD.

I testingen var OPAD i stand til å narre en klassifisator i 31 av 64 angrep – en suksessrate på 48%. Forskerne merker at suksessraten avhenger sterkt av typen objekt som angripes. Flekkete eller kurvede overflater (som henholdsvis en teddybjørn og en kopp) kan ikke gi nok direkte refleksivitet til å utføre angrepet. På den andre siden er bevisst refleksive flate overflater som veiskilt ideelle miljøer for en OPAD-forstyrrelse.

Åpne kildekode-angrepsflater

Alle angrepene ble gjennomført mot en bestemt samling av databaser: den tyske trafikkskiltgjenkjenning-databasen (GTSRB, kalt GTSRB-CNN i den nye artikkelen), som ble brukt til å trene modellen for et tilsvarende angreps-scenario i 2018; ImageNet VGG16-datasettet; og ImageNet Resnet-50-settet.

Så, er disse angrepene “bare teoretiske”, siden de er rettet mot åpne kildekode-databaser og ikke mot de proprietære, lukkede systemene i autonome kjøretøy? De ville være, hvis de største forskningsarmene ikke avhengig av den åpne kildekode-økosystemet, inkludert algoritmer og databaser, og i stedet arbeidet i hemmelighet for å produsere lukkede kildekode-databaser og uklare gjenkjenning-algoritmer.

Men generelt er det ikke slik det fungerer. Landmerke-databaser blir de målestokkene som alle fremgang (og anerkjennelse) måles mot, mens åpne kildekode-bilde-gjenkjenningssystemer som YOLO-serien går foran, gjennom felles globalt samarbeid, alle internt utviklede, lukkede systemer som er ment å fungere på lignende prinsipper.

Den åpne kildekode-exponeringen

Selv der dataene i et datavisjonsrammeverk til slutt vil bli erstattet med helt lukkede data, er vektene av de “tømte” modellene ofte kalibrert i de tidlige utviklingsstadiene av åpne kildekode-data som aldri vil bli helt forkastet – noe som betyr at de resulterende systemene potensielt kan bli mål for åpne kildekode-metoder.

I tillegg gjør avhengighet av en åpen kildekode-tilnærming til slike datavisjonssystemer det mulig for private selskaper å nyte seg, gratis, av grenete innovasjoner fra andre globale forskningsprosjekter, og legger til en finansiell incentiv til å holde arkitekturen åpen. Deretter kan de forsøke å lukke systemet bare på kommersialiseringspunktet, på et tidspunkt hvor en hel rekke av inferable åpne kildekode-målinger allerede er dypt innlejret i det.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai