Andersonin kulma

CAPTCHAn ratkaiseminen koneoppimisella Dark Web -tutkimuksen mahdollistamiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Yhdysvaltalainen akateeminen tutkimushanke on kehittänyt menetelmän, jolla voidaan ohittaa CAPTCHA-testit, ja se ilmoittaa ylittäneensä vastaavat valtiotieteelliset koneoppimisen ratkaisut käyttämällä Generative Adversarial Networks (GAN) -verkkoja visuaalisten haasteiden purkuun.

Tutkijat testasivat uutta järjestelmää parhaimmillaan olevia kehyksiä vastaan ja totesivat, että heidän menetelmänsä saavutti yli 94,4 prosentin onnistumisprosentin huolellisesti kuratoidussa todellisessa benchmark-aineistossa, ja se osoittautui kykeneväksi “poistamaan ihmisen osallistumisen” suojattua Dark Net -markkinapaikkaa navigoidessaan, ratkaisemalla CAPTCHA-haasteet automaattisesti enintään kolmessa yrityksessä.

DW-GANin arkkitehtuuri. Lähde: https://arxiv.org/pdf/2201.02799.pdf

DW-GANin työkulku. Lähde: https://arxiv.org/pdf/2201.02799.pdf

Tutkijat väittävät, että heidän lähestymistapansa edustaa läpimurtoa kyberturvallisuuden tutkijoille, jotka ovat perinteisesti joutuneet kantamaan kustannukset ihmisten tarjoamisesta silmukohtaisesti ratkaisemaan CAPTCHAn, yleensä joukkorahoitusalustoilla, kuten Amazon Mechanical Turk (AMT).

Jos järjestelmä osoittautuu sopeutuvaksi ja kestäväksi, se voi edelleen mahdollistaa enemmän automaattisia valvontajärjestelmiä ja TOR-verkkojen indeksointia ja verkkokävijöiden seurantaa. Tämä voisi mahdollistaa suurten analyysien ja uusien kyberturvallisuuslähestymistapojen ja -tekniikoiden kehittämisen, jotka ovat olleet tähän asti rajoittuneita CAPTCHA-paloittajilla.

Tutkimusartikkeli on otsikoitu Counteracting Dark Web Text-Based CAPTCHA with Generative Adversarial Learning for Proactive Cyber Threat Intelligence, ja se on peräisin tutkijoilta Arizonan yliopistosta, Etelä-Floridan yliopistosta ja Georgian yliopistosta.

Seuraukset

Koska järjestelmä – jota kutsutaan Dark Web-GAN (DW-GAN, saatavilla GitHubissa) – on ilmeisesti paljon suorituskykyisempi kuin sen edeltäjät, on mahdollista, että sitä käytetään yleisenä menetelmänä ylittämään (yleensä vähemmän haasteellinen) CAPTCHA-aineisto standardiverkossa, joko tässä tietyssä toteutuksessa tai yleisten periaatteiden mukaisesti, jotka uusi artikkeli esittää. GitHubin tallennustilaa on kuitenkin rajoitetusti, joten on tällä hetkellä tarpeen olla yhteydessä johtavaan tekijään Ning Zhangiin, jotta voidaan hankkia frameworkiin liittyvät tiedot.

Koska DW-GANilla on “myönteinen” tehtävä CAPTCHAn murtamiseen (kuten TORilla itsessään alun perin oli myönteinen tehtävä sotilasviestintän suojaamiseen ja myöhemmin journalistien suojaamiseen), ja koska CAPTCHAt ovat sekä legitiimi puolustus (usein ja kiistanalaisesti käytetty laajasti CDN-jätti CloudFlare) ja epävirallisten Dark Web -markkinoiden suosima työkalu, lähestymistapa on väittävästi “tasapainottava” teknologia.

Tutkijat myöntävät itse, että DW-GANilla on laajempia sovelluksia:

‘[Vaikka] tämä tutkimus on pääasiassa keskittynyt Dark Web -CAPTCHAan haasteellisempana ongelmana, ehdotettu menetelmä tässä tutkimuksessa on odotettavissa sovellettavissa muihin CAPTCHA-tyyppeihin yleisyyden menettämättä.’

Oletettavasti DW-GAN tai vastaava järjestelmä tarvitsisi tulla laajasti ja näkyvästi levinneeksi herättääkseen Dark Web -markkinat etsimään vähemmän koneellisesti ratkaistavia ratkaisuja tai ainakin kehittääkseen CAPTCHA-konfiguraatioitaan aika aikaisin, “kylmän sodan” skenaario.

Motivaatio

Kuten artikkeli toteaa, Dark Web on ensisijainen lähde hakkeritiedustelulle koskien kyberhyökkäyksiä, jotka arvioidaan maksavan maailman taloudelle 10 biljoonaa dollaria vuoteen 2025 mennessä. Siksi sipuliverkot ovat suhteellisen turvallinen ympäristö laittomille Dark Net -yhteisöille, jotka voivat torjua hyökkääjiä useilla tavoilla, mukaan lukien istunnon aikakatkaisut, evästeet ja käyttäjän todennus.

Kaksi CAPTCHA-tyyppiä, jotka molemmat käyttävät häikäiseviä taustoja ja kallistettua kirjoitusta, jotta ne olisivat vähemmän koneellisesti luettavissa.

Kaksi CAPTCHA-tyyppiä, jotka molemmat käyttävät häikäiseviä taustoja ja kallistettua kirjoitusta, jotta ne olisivat vähemmän koneellisesti luettavissa.

Kuitenkin tutkijat toteavat, ettei mikään näistä esteistä ole yhtä suuri kuin CAPTCHAt, jotka ovat “herkkää” yhteisössä:

‘Vaikka useimmat näistä toimista voidaan tehokkaasti kiertää toteuttamalla automaattisia vastatoimia etanaohjelmassa, CAPTCHA on haitallisimpia vasta-etsintätoimia Dark Webissä, jota ei voida helposti kiertää korkeiden kognitiivisten kykyjen vuoksi, joita usein ei ole automaattisilla työkaluilla.’

Tekstipohjaiset CAPTCHAt eivät ole ainoita käytettävissä olevia vaihtoehtoja; on olemassa variantteja, joista moni meistä on tuttuja, jotka haastavat käyttäjää tulkitsemaan videoita, ääniä ja erityisesti kuvia. Kuitenkin, kuten tutkijat toteavat, tekstipohjainen CAPTCHA on tällä hetkellä haasteena Dark Web -markkinoiden valinta, ja luonnollinen lähtökohta tehdä TOR-verkot koneellisesti analysoitavammiksi.

Arkkitehtuuri

Vaikka aiempi lähestymistapa Kiinan Northwest-yliopistosta käytti Generative Adversarial Networksia johdattaakseen piirroskuvausmallit CAPTCHA-alustoilta, uuden artikkelin tutkijat toteavat, että tämä menetelmä perustuu rasteroitujen kuvien tulkintaan, eikä syvempään kirjaimien tunnistamiseen haasteessa; ja että DW-GANin tehokkuus ei ole vaikuttunut typerien sanojen (ja numeroiden) muuttuvan pituuden vuoksi, jotka ovat tyypillisiä Dark Web -CAPTCHAssa.

DW-GAN käyttää nelivaiheista putkea: ensin kuva otetaan talteen, ja sitten se syötetään taustan melunpoistomoduuliin, joka käyttää GANia, joka on koulutettu merkityillä CAPTCHA-näytteillä, ja joka on siten kykenevä erottamaan kirjaimet häirittävistä taustoista, joilla ne lepävät. Kirjaimet erotellaan edelleen melusta GAN-pohjaisen erottamisen jälkeen.

Seuraavaksi suoritetaan segmentointi erotetusta tekstistä, joka sitten jaetaan osiin, jotka näyttävät olevan perusmerkit, käyttäen reuna-anturialgoritmeja.

Merkkien segmentointi erottaa pikseliryhmän ja yrittää tunnistaa reunan jäljittämisen avulla.

Merkkien segmentointi erottaa pikseliryhmän ja yrittää tunnistaa reunan jäljittämisen avulla.

Lopuksi “arvatut” merkkisegmentit ovat alttiina merkintunnistukselle Convolutional Neural Networkin (CNN) kautta.

Joissain tapauksissa merkit voivat olla päällekkäin, hyper-kerning, joka on erityisesti suunniteltu pettämään konejärjestelmiä. DW-GAN käyttää siten väliaikaisia segmenttejä parantamaan ja erottamaan rajoja, erottaa tehokkaasti merkit. Koska sanat ovat yleensä järjettömiä, ei ole semanttista asiayhteyttä, joka voisi auttaa tässä prosessissa.

Tulokset

DW-GAN testattiin CAPTCHA-kuvia vastaan kolmesta eri Dark Web -aineistosta, sekä suositusta CAPTCHA-syntetisaattorista. Dark Web -markkinat, joista kuvat olivat peräisin, koostuivat kahdesta luottokorttikaupasta, Rescator-1 ja Rescator-2, sekä uudesta aineistosta uudesta Yellow Brick -markkinapaikasta (joka raportoitiin myöhemmin kadonneen DarkMarketin lopettamisen seurauksena).

Esimerkki CAPTCHAt kolmesta aineistosta, sekä avoimen lähdekoodin CAPTCHA-syntetisaattorista.

Esimerkki CAPTCHAt kolmesta aineistosta, sekä avoimen lähdekoodin CAPTCHA-syntetisaattorista.

Tutkijoiden mukaan testaukseen käytetty aineisto suositeltiin kyberturvallisuuden uhka-analyysin (CTI) asiantuntijoiden suosituksesta heidän laajan levinneisyytensä perusteella Dark Net -markkinoilla.

Testauksessa kehitettiin TOR-verkkoon keskittyvä hämähäkki, joka keräsi 500 CAPTCHA-kuvaa, jotka myöhemmin merkittiin ja kuratoitiin CTI-neuvonantajien toimesta.

Suoritettiin kolme kokeilua. Ensimmäinen arvioi DW-GANin yleistä CAPTCHA-ratkaisukykyä verrattuna standardi-SOTA-menetelmiin. Vastustajamenetelmät olivat kuva-tason CNN esikäsittelyllä, joka käsitteli harmaasävykonvertointia, normalisointia ja Gaussian sileää, yhteinen akateeminen ponnistus Iranista ja Yhdistyneestä Kuningaskunnasta; merkki-tason CNN väliaikaisella segmentoinnilla; ja kuva-tason CNN, Yhdistyneen Kuningaskunnan Oxfordin yliopistosta.

DW-GANin tulokset ensimmäisestä kokeilusta verrattuna aiempiin valtiotieteellisiin lähestymistapoihin.

DW-GANin tulokset ensimmäisestä kokeilusta verrattuna aiempiin valtiotieteellisiin lähestymistapoihin.

Tutkijat totesivat, että DW-GAN pystyi parantamaan aiempia tuloksia kaikilla mittareilla (ks. yllä oleva taulukko).

Toinen koe oli ablaatio, jossa poistettiin tai poistettiin aktiivisen kehyksen eri osia, jotta voidaan poissulkea ulkoisten tai toissijaisen tekijöiden vaikutus tuloksiin.

Ablaatiosuuden tulokset.

Ablaatiosuuden tulokset.

Myös tässä tapauksessa tutkijat totesivat, että avainosien poistaminen arkkitehtuurista vähensi DW-GANin suorituskykyä lähes kaikissa tapauksissa (ks. yllä oleva taulukko).

Kolmas offline-koe vertasi DW-GANin tehokkuutta kuvapohjaisen vertailumenetelmän ja kahden merkki-tason menetelmän kanssa, jotta voidaan määrittää, kuinka paljon DW-GANin merkintunnistus vaikuttaa sen hyödyllisyyteen tapauksissa, joissa CAPTCHA-sanalla on satunnainen (ei ennalta määritelty) pituus. Näissä tapauksissa CAPTCHA-pituus vaihteli 4-7 merkkiä.

Tässä kokeessa tutkijat käyttivät 50 000 CAPTCHA-kuvan koulutusjoukkoa, josta 5 000 varattiin testaamiseen tyypillisessä 90/10-jakautumisessa.

Myös tässä tapauksessa DW-GAN ylitti aiemmat lähestymistavat:

Live Test on a Dark Net Market

Lopuksi DW-GAN otettiin käyttöön (silloin toiminnassa olevalla) Yellow Brick Dark Net -markkinapaikalla. Tässä testissä kehitettiin TOR-selain, joka integroi DW-GANin selainominaisuuksiinsa, joka automaattisesti tulkitsi CAPTCHA-haasteita.

Tässä skenaariossa CAPTCHA esitettiin automaattiselle etanalle joka 15 HTTP-pyynnölle keskimäärin. Etana pystyi indeksoimaan 1 831 laitonta tuotetta myytäväksi Yellow Brickissä, mukaan lukien 1 223 huumausaineisiin liittyvää tuotetta (mukaan lukien opioidit ja kokaiini), 44 hakkeripakettia ja yhdeksän väärennettyä asiakirjaskannaus. Kaiken kaikkiaan järjestelmä pystyi tunnistamaan 286 kyberturvallisuuteen liittyvää tuotetta, mukaan lukien 102 varastettua luottokorttia ja 131 varastettua kirjautumistietoa. Tutkijat toteavat, että DW-GAN pystyi ratkaisemaan CAPTCHAn kolmessa tai vähemmässä yrityksessä, ja että 76 minuutin prosessointiaika oli tarpeen CAPTCHAn suojeluun kaikkien 1 831 tuotteen osalta. Ihmisten väliintuloa ei tarvittu, eikä tapahtunut päätepisteen virheilmoituksia.

Tutkijat huomauttavat, että haasteita, jotka tarjoavat suuremman tason monimutkaisuutta kuin tekstipohjaiset CAPTCHAt, mukaan lukien jotkut, jotka näyttävät mallinnetuilta Turingin testeistä, ja toteavat, että DW-GAN voisi olla parannettavissa näiden uusien suuntausten mukaisesti, kun ne tulevat suosituiksi.

 

*Täysin automaattinen julkinen Turingin testi, jolla voidaan erottaa tietokoneet ja ihmiset toisistaan

Julkaistu ensimmäisen kerran 11. tammikuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai