Cybersikkerhed

Løsning af CAPTCHAs med maskinlæring til at aktivere Dark Web-forskning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et fælles akademisk forskningsprojekt fra USA har udviklet en metode til at omgå CAPTCHA-test, der rapporterer at overgå lignende stat-of-the-art maskinlæringssolutioner ved at bruge Generative Adversarial Networks (GANs) til at dekodere visuelt komplekse udfordringer.

Testen af det nye system mod de bedste nuværende rammer fandt, at deres metode opnår mere end 94,4% succes på en omhyggeligt kurateret realverdens benchmark-datasæt, og har vist sig i stand til at ‘eliminere menneskelig indblanding’ når det kommer til navigation på en højt CAPTCHA-beskyttet opkomende Dark Net-markedsplads, automatisk løsning af CAPTCHA-udfordringer på maksimalt tre forsøg.

Arkitektur for DW-GAN. Kilde: https://arxiv.org/pdf/2201.02799.pdf

Workflow for DW-GAN. Kilde: https://arxiv.org/pdf/2201.02799.pdf

Forfatterne påstår, at deres tilgang repræsenterer en gennembrud for cybersecurity-forskere, der traditionelt har måttet bære omkostningerne ved at forsyne mennesker-i-løkken til at manuelt løse CAPTCHAs, normalt via crowdsourcing-platforme som Amazon Mechanical Turk (AMT).

Hvis systemet kan vise sig at være tilpasningsdygtigt og robust, kan det yderligere bana vejen for mere automatiserede overvågningsystemer og for indeksering og web-scraping af TOR-netværk. Dette kunne muliggøre skalerbare og højvolumenanalyser samt udvikling af nye cybersecurity-tilgange og -teknikker, som hidtil har været hæmmet af CAPTCHA-brandmure.

Den artikel er titlen Counteracting Dark Web Text-Based CAPTCHA with Generative Adversarial Learning for Proactive Cyber Threat Intelligence, og kommer fra forskere ved University of Arizona, University of South Florida og University of Georgia.

Konsekvenser

Da systemet – kaldet Dark Web-GAN (DW-GAN, tilgængelig på GitHub) – åbenbart er så meget mere performant end sine forgængere, er der mulighed for, at det vil blive brugt som en generel metode til at overvinde (normalt mindre svære) CAPTCHA-materiale på standardwebben, enten i denne specifikke implementering eller baseret på de generelle principper, som den nye artikel beskriver. På grund af begrænsede lagringsmuligheder på GitHub er det dog i øjeblikket nødvendigt at kontakte den ledende forfatter Ning Zhang for at få adgang til dataene, der er knyttet til rammen.

Fordi DW-GAN har en ‘positiv’ mission for at bryde CAPTCHAs (ligesom TOR selv oprindeligt havde en positiv mission for at beskytte militærkommunikation og senere journalister), og fordi CAPTCHAs både er en legitim forsvar (ofte og kontroversielt brugt af den altomfattende CDN-gigant CloudFlare) og et favoritværktøj for illegitime dark web-markedspladser, er tilgangen åbenbart en ‘niveauerings’-teknologi.

Forfatterne selv indrømmer, at DW-GAN har bredere anvendelser:

‘[Selvom] denne studie primært er fokuseret på dark-web CAPTCHA som et mere udfordrende problem, forventes den foreslåede metode i denne studie at være anvendelig på andre typer CAPTCHA uden tab af generelhed.’

Det er sandsynligt, at DW-GAN eller et lignende system ville behøve at blive vidt og åbenlyst udbredt for at fremkalde, at dark web-markedspladser søger efter mindre maskin-resolvable løsninger, eller at de i hvert fald periodisk ændrer deres CAPTCHA-konfigurationer, en ‘kold krig’-scenario.

Motivationer

Som artiklen bemærker, er dark web den primære kilde til hacker-intelligence relateret til cyberangreb, som estimeres at koste den globale økonomi 10 billioner USD i 2025. Derfor forbliver onion-netværk et relativt sikkert miljø for illegitime dark net-samfund, som kan afvise besøgende ved forskellige metoder, herunder session-udløb, cookies og bruger-autentificering.

To typer af CAPTCHA, begge med forvirrende baggrunde og skråstillede bogstaver for at gøre dem mindre maskin-læsbare.

To typer af CAPTCHA, begge med forvirrende baggrunde og skråstillede bogstaver for at gøre dem mindre maskin-læsbare.

Men forfatterne bemærker, at ingen af disse forhindringer er så store som den række af CAPTCHAs, der punkterer browsing-oplevelsen i et ‘følsomt’ samfund:

‘Mens de fleste af disse foranstaltninger kan være effektivt omgået ved at implementere automatiserede modforanstaltninger i et crawler-program, er CAPTCHA den mest hindrende anti-crawling-foranstaltning på dark web, som ikke kan være let omgået på grund af høje kognitive evner, som ofte ikke er til stede i automatiseringsværktøjer’

Tekst-baserede CAPTCHAs er ikke den eneste tilgængelige mulighed; der er varianter, velkendte for mange af os, som udfordrer brugeren til at fortolke video, lyd og især billeder. Alligevel, som forfatterne bemærker, er tekst-baseret CAPTCHA i øjeblikket den valgte udfordring for dark web-markedspladser, og en naturlig startplads for at gøre TOR-netværk mere modtagelige for maskin-analyse.

Arkitektur

Selvom en tidligere tilgang fra Northwest University i Kina brugte Generative Adversarial Networks til at aflede funktionmønstre fra CAPTCHA-platforme, bemærker forfatterne af den nye artikel, at denne metode afhænger af fortolkning af en rasteriseret billede, snarere end en dybere undersøgelse af bogstaver genkendt i udfordringen; og at DW-GANs effektivitet ikke påvirkes af den variable længde af nonsens-ord (og tal) som normalt findes i dark web-CAPTCHAs.

DW-GAN bruger en fire-trins-rørledning: først indfanges billedet, og derefter fødes det til en baggrund-støjreduceringsmodul, der bruger en GAN, der er trænet på annoterede CAPTCHA-eksempler, og derfor kan skelne mellem bogstaver og den forstyrrede baggrund, de hviler på. De ekstraherede bogstaver filtreres derefter yderligere fra eventuel støj efter GAN-baseret ekstraktion.

Derefter udføres segmentering på den ekstraherede tekst, der derefter deles op i, hvad der synes at være bestanddele af bogstaver, ved hjælp af kontur-detektionsalgoritmer.

Tegn-segmentering isolerer pixel-gruppen og forsøger genkendelse med grænse-tegning.

Tegn-segmentering isolerer pixel-gruppen og forsøger genkendelse med grænse-tegning.

Til sidst undergår de ‘gættede’ tegn-segmenter karakter-genkendelse via et Convolutional Neural Network (CNN).

Sommetider kan tegn overlappe, en hyper-kerning, der er specifikt designet til at narre maskin-systemer. DW-GAN bruger derfor interval-baseret segmentering til at forbedre og isolere grænser, effektivt adskilende tegn. Da ordene normalt er nonsens, er der ingen semantisk kontekst til at hjælpe i denne proces.

Resultater

DW-GAN blev testet mod CAPTCHA-billeder fra tre forskellige dark web-datasæt, samt en populær CAPTCHA-syntetisator. De dark markeder, som billederne stammede fra, bestod af to carding-butikker, Rescator-1 og Rescator-2, og en ny samling fra en opkomende markedsplads kaldet Yellow Brick (som blev rapporteret at have forsvundet senere i kølvandet på nedlukningen af DarkMarket).

Eksempler på CAPTCHAs fra de tre datasæt, samt den åbne CAPTCHA-syntetisator.

Eksempler på CAPTCHAs fra de tre datasæt, samt den åbne CAPTCHA-syntetisator.

Ifølge forfatterne var dataene, der blev brugt til testen, anbefalet af Cyber Threat Intelligence (CTI)-eksperter på grund af deres vidt udbredelse på dark net-markeder.

Testen af hvert datasæt indebar udviklingen af en TOR-orienteret spider, der samlede 500 CAPTCHA-billeder, der herefter blev mærket og kurateret af CTI-rådgivere.

Tre eksperimenter blev udformet. Det første evaluerede den generelle CAPTCHA-besejrende præstation af DW-GAN mod standard SOTA-metoder. De rivaliserende metoder var billede-niveau CNN med forarbejdning, der indebar gråtone-konvertering, normalisering og gaussisk glatning, en fælles akademisk indsats fra Iran og Storbritannien; bogstav-niveau CNN med interval-baseret segmentering; og billede-niveau CNN, fra University of Oxford i Storbritannien.

Resultater fra DW-GAN for det første eksperiment, sammenlignet med tidligere stat-of-the-art-tilgange.

Resultater fra DW-GAN for det første eksperiment, sammenlignet med tidligere stat-of-the-art-tilgange.

Forskerne fandt, at DW-GAN var i stand til at forbedre tidligere resultater over hele linjen (se tabel ovenfor).

Det andet eksperiment var en ablations-studie, hvor forskellige komponenter af den aktive ramme blev fjernet eller deaktiveret for at afvise muligheden for, at eksterne eller sekundære faktorer påvirker resultaterne.

Resultater af ablations-studiet.

Resultater af ablations-studiet.

Også her fandt forfatterne, at deaktivering af nøgle-sektioner af arkitekturen reducerede DW-GANs præstation i næsten alle tilfælde (se tabel ovenfor).

Det tredje offline-eksperiment sammenlignede effikaciteten af DW-GAN mod en benchmark-billede-baseret metode og to bogstav-niveau-metoder for at bestemme, i hvilken udstrækning DW-GANs karakter-vurdering påvirkede dets nyttighed i tilfælde, hvor et nonsens-CAPTCHA-ord var en vilkårlig (snarere end forudbestemt) længde. I disse tilfælde var CAPTCHA-længden varierende mellem 4 og 7 tegn.

Til dette eksperiment brugte forfatterne et trænings-sæt på 50.000 CAPTCHA-billeder, med 5.000 reserveret til test i en typisk 90/10-split.

Også her overgik DW-GAN tidligere tilgange:

Live-test på en Dark Net-markedsplads

Til sidst blev DW-GAN deployeret mod den (dengang aktive) Yellow Brick dark net-markedsplads. Til dette test blev en TOR-webbrowser udviklet, der integrerede DW-GAN i dens browsing-kapaciteter, automatisk fortolkende CAPTCHA-udfordringer.

I dette scenario blev en CAPTCHA præsenteret for den automatiserede crawler for hver 15 HTTP-anmodninger i gennemsnit. Crawleren var i stand til at indekserer 1.831 ulovlige varer til salg på Yellow Brick, herunder 1.223 stof-relaterede produkter (herunder opioider og kokain), 44 hacking-pakker og ni falske dokument-scans. I alt var systemet i stand til at identificere 286 cybersecurity-relaterede varer, herunder 102 stjålne kreditkort og 131 stjålne login-oplysninger.

Forfatterne påstår, at DW-GAN var i alle tilfælde i stand til at knuse en CAPTCHA på tre eller færre forsøg, og at 76 minutters proces-tid var nødvendig for at tage hensyn til CAPTCHAs, der vogtede alle 1.831 produkter. Ingen mennesker var nødvendige for at gribe ind, og der opstod ingen endpoint-fejltilfælde.

Forfatterne bemærker opkomsten af udfordringer, der tilbyder en højere niveau af sofistikation end tekst-CAPTCHAs, herunder nogle, der synes at være modelleret over Turing-tests, og observerer, at DW-GAN kunne forbedres til at tilpasse sig disse nye tendenser, når de bliver populære.

 

*Completely Automated Public Turing test to tell Computers and Humans Apart

Først udgivet den 11. januar 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai