Kąt Andersona
Rozwiązywanie CAPTCH z użyciem uczenia maszynowego w celu umożliwienia badań nad ciemną siecią

Wspólny projekt badawczy z Stanów Zjednoczonych opracował metodę obejścia testów CAPTCHA*, która podobno przewyższa podobne rozwiązania oparte na uczeniu maszynowym, wykorzystując sieci przeciwstawne (GAN) do odczytywania wizualnie złożonych wyzwań.
Testowanie nowego systemu przeciwko najlepszym obecnie frameworkom wykazało, że metoda ta osiąga powodzenie na poziomie ponad 94,4% w starannie wyselekcjonowanym zbiorze danych z rzeczywistych przypadków, i okazała się w stanie “wyeliminować zaangażowanie ludzi” przy nawigowaniu na wysoko zabezpieczonej, nowo powstającej ciemnej sieci rynku, automatycznie rozwiązując wyzwania CAPTCHA w maksymalnie trzech próbach.
Autorzy twierdzą, że ich podejście reprezentuje przełom dla badaczy bezpieczeństwa cybernetycznego, którzy tradycyjnie musieli ponosić koszty dostarczania ludzi do ręcznego rozwiązywania CAPTCH, zwykle za pośrednictwem platform crowdsourcingowych, takich jak Amazon Mechanical Turk (AMT).
Jeśli system okaże się dostosowywalny i wytrzymały, może on dalej przyprowadzić drogę do bardziej zautomatyzowanych systemów nadzoru, oraz do indeksowania i wydobywania informacji z sieci TOR. Mogłoby to umożliwić analizy na dużą skalę i rozwój nowych podejść i technik bezpieczeństwa cybernetycznego, które do tej pory były ograniczone przez zapory CAPTCHA.
Artykuł artykuł nosi tytuł Przeciwdziałanie ciemnej sieci opartej na tekście CAPTCHA z użyciem generatywnych sieci przeciwstawnych do proaktywnej inteligencji zagrożeń cybernetycznych, i pochodzi od badaczy z Uniwersytetu Arizony, Uniwersytetu Florydy Południowej oraz Uniwersytetu Georgii.
Wnioski
Ponieważ system – zwany Dark Web-GAN (DW-GAN, dostępny na GitHub) – jest podobno znacznie bardziej wydajny niż jego poprzednicy, istnieje możliwość, że będzie on używany jako ogólna metoda do pokonania (zwykle mniej trudnych) materiałów CAPTCHA na standardowej sieci, albo w tej konkretniej implementacji, albo na podstawie ogólnych zasad przedstawionych w nowym artykule. Ze względu na ograniczoną pojemność na GitHub, jednakże, obecnie konieczne jest skontaktowanie się z głównym autorem Ning Zhang, aby uzyskać dane związane z ramą.
Ponieważ DW-GAN ma “pozytywną” misję rozwiązywania CAPTCH (podobnie jak sieć TOR miała pierwotnie pozytywną misję ochrony wojskowych komunikacji i później dziennikarzy), oraz ponieważ CAPTCHY są zarówno legitymowaną obroną (często i kontrowersyjnie używaną przez powszechnie znaną firmę CDN CloudFlare) i ulubionym narzędziem nielegalnych rynków ciemnej sieci, podejście to można uznać za “wyrównującą” technologię.
Autorzy sami przyznają, że DW-GAN ma szersze zastosowania:
‘[Chociaż] to badanie jest głównie skupione na ciemnej sieci CAPTCHA jako bardziej wyzwaniu, proponowana metoda w tym badaniu jest oczekiwana do zastosowania w innych typach CAPTCHA bez utraty ogólności.’
Prawdopodobnie DW-GAN, lub podobny system, musiałby się stać powszechnie i widocznie rozpowszechniony, aby skłonić rynki ciemnej sieci do poszukiwania mniej rozwiązywalnych rozwiązań, lub przynajmniej do ewolucji ich konfiguracji CAPTCHA okresowo, “zimnowojennego” scenariusza.
Motywacje
Jak zauważa artykuł, ciemna sieć jest głównym źródłem wywiadu hakera dotyczącego ataków cybernetycznych, które szacuje się na 10 bilionów dolarów USA do 2025 roku. Dlatego sieci cebuli pozostają stosunkowo bezpiecznym środowiskiem dla nielegalnych społeczności ciemnej sieci, które mogą odpychać intruzów różnymi metodami, w tym limitami sesji, ciasteczkami i uwierzytelnianiem użytkowników.

Dwa typy CAPTCHA, oba używające zakłócających tła i nachylonego druku, aby uczynić je mniej czytelnymi przez maszyny.
Jednak autorzy zauważają, że żadne z tych przeszkód nie są tak wielkie, jak seria CAPTCH, które punktują doświadczenie przeglądania w “wrażliwej” społeczności:
‘Podczas gdy większość tych środków może być skutecznie obejściowa przez wdrożenie zautomatyzowanych przeciwwagi w programie przeglądarki, CAPTCHA jest najbardziej hamującym środkiem przeciwko przeglądaniu w ciemnej sieci, który nie może być łatwo obejściowy ze względu na wysokie zdolności poznawcze, które często nie są posiadane przez narzędzia zautomatyzowane’
CAPTCHY oparte na tekście nie są jedyną dostępną opcją; istnieją warianty, znane wielu z nas, które wyzywają użytkownika do interpretacji wideo, audio, a szczególnie obrazów. Niemniej jednak, jak zauważają autorzy, CAPTCHA oparta na tekście jest obecnie wyzwaniem wybranym dla rynków ciemnej sieci, i naturalnym punktem startu, aby uczynić sieci TOR bardziej podatne na analizę maszynową.
Architektura
Chociaż poprzednie podejście z Northwest University w Chinach używało sieci przeciwstawnych do wywnioskowania wzorców funkcji z platform CAPTCHA, autorzy nowego artykułu zauważają, że ta metoda opiera się na interpretacji zrastrowanego obrazu, a nie głębszym badaniu liter rozpoznawanych w wyzwaniu; i że skuteczność DW-GAN nie jest wpływana przez zmienną długość słów nonsense, (i liczb) które są typowo spotykane w CAPTCH ciemnej sieci.
DW-GAN używa czterostopniowego potoku: najpierw obraz jest przechwycony, a następnie podawany do modułu denoising tła, który używa GAN, który został przeszkolony na przykładowych CAPTCH, i jest więc w stanie odróżnić litery od zakłóconego tła, na którym one spoczywają. Wyprowadzone litery są następnie dalej filtrowane z hałasu po ekstrakcji opartej na GAN.
Następnie, segmentacja jest wykonywana na wyprowadzonym tekście, który jest następnie rozbity na to, co wydaje się składającymi się znakami, przy użyciu algorytmów wykrywania konturów.

Segmentacja znaków izoluje grupę pikseli i próbuje rozpoznać ją z użyciem śledzenia granic.
W końcu, “zgadywane” segmenty znaków są poddawane rozpoznawaniu znaków za pomocą sieci neuronowej z wykorzystaniem funkcji (CNN).

Czasami znaki mogą nachodzić na siebie, co jest specjalnie zaprojektowane, aby oszukać systemy maszynowe. DW-GAN używa więc segmentacji opartej na interwale, aby poprawić i odizolować granice, skutecznie rozdzielając znaki. Ponieważ słowa są zwykle nonsense, nie ma kontekstu semantycznego, który mógłby pomóc w tym procesie.

Wyniki
DW-GAN został przetestowany przeciwko obrazom CAPTCHA z trzech różnych zbiorów danych z ciemnej sieci, a także popularnemu syntetyzatorowi CAPTCHA. Ciemne rynki, z których pochodziły obrazy, składały się z dwóch sklepów z kartami, Rescator-1 i Rescator-2, oraz nowego zestawu z powstającym rynkiem o nazwie Yellow Brick (który został później wyłączony w następstwie likwidacji DarkMarket).

Przykładowe CAPTCHY z trzech zbiorów danych, a także otwartego źródła syntetyzatora CAPTCHA.
Zgodnie z oświadczeniem autorów, dane użyte w teście zostały zalecone przez ekspertów ds. wywiadu zagrożeń cybernetycznych (CTI) na podstawie ich szerokiego rozpowszechnienia w ciemnej sieci.
Testowanie każdego zbioru danych obejmowało rozwinięcie pajęczaka TOR, który zbierał 500 obrazów CAPTCHA, które zostały następnie oznaczone i wyselekcjonowane przez doradców CTI.
Zostały opracowane trzy eksperymenty. Pierwszy ocenił ogólne osiągnięcia DW-GAN w pokonywaniu CAPTCHA w porównaniu ze standardowymi metodami SOTA. Rywalizujące metody były poziomem obrazu CNN z przetwarzaniem wstępnym, obejmującym konwersję na odcień szarości, normalizację i wygładzanie Gaussa, wspólny wysiłek akademicki z Iranu i Wielkiej Brytanii; poziomem znaku CNN z segmentacją opartą na interwale; i poziomem obrazu CNN, z Uniwersytetu Oksfordzkiego w Wielkiej Brytanii.

Wyniki z DW-GAN dla pierwszego eksperymentu, porównane z poprzednimi podejściami SOTA.
Badacze stwierdzili, że DW-GAN był w stanie poprawić wyniki w porównaniu z poprzednimi podejściami (patrz tabela powyżej).
Drugi eksperyment był badaniem ablacją, w którym różne składniki aktywnej ramy są usuwane lub wyłączane, aby wykluczyć możliwość, że zewnętrzne lub wtórne czynniki wpływają na wyniki.

Wyniki badania ablacją.
Tutaj również autorzy stwierdzili, że wyłączenie kluczowych sekcji architektury zmniejszyło wydajność DW-GAN w niemal wszystkich przypadkach (patrz tabela powyżej).
Trzeci eksperyment porównywał skuteczność DW-GAN z benchmarkową metodą opartą na obrazie i dwiema metodami opartymi na znakach, aby określić, w jakim stopniu ocena znaku DW-GAN wpływa na jego przydatność w przypadkach, w których słowo CAPTCHA nonsense jest arbitralnej (zamiast predefiniowanej) długości. W tych przypadkach długość CAPTCHA wahała się od 4 do 7 znaków.
Do tego eksperymentu autorzy użyli zbioru treningowego 50 000 obrazów CAPTCHA, z 5 000 zarezerwowanych do testowania w typowym podziale 90/10.
Tutaj również DW-GAN przewyższył poprzednie podejścia:

Test na żywo na rynku ciemnej sieci
W końcu, DW-GAN został wdrożony przeciwko (wówczas żywemu) rynkowi ciemnej sieci Yellow Brick. Do tego testu opracowano przeglądarkę TOR, która zintegrowała DW-GAN ze swoimi możliwościami przeglądania, automatycznie parsując wyzwania CAPTCHA.
W tym scenariuszu, CAPTCHA było przedstawiane automatycznemu pajęczakowi co 15 żądań HTTP, średnio. Pajęczak był w stanie zindeksować 1 831 nielegalnych przedmiotów do sprzedaży w Yellow Brick, w tym 1 223 produkty związane z narkotykami (w tym opioidami i kokainą), 44 pakiety hakowania, i dziewięć skanów fałszywych dokumentów. W sumie system był w stanie zidentyfikować 286 elementów związanych z bezpieczeństwem cybernetycznym, w tym 102 skradzione karty kredytowe i 131 skradzione dane logowania do kont. Wszystkie te czynności zostały wykonane bez konieczności interwencji ludzi i bez awarii punktu końcowego.
Autorzy zauważają, że pojawiają się wyzwania, które oferują wyższy poziom złożoności niż CAPTCHY oparte na tekście, w tym niektóre, które wydają się modelem na testach Turinga, i obserwują, że DW-GAN mógłby być ulepszony, aby dostosować się do tych nowych trendów, gdy staną się one popularne.
*Całkowicie zautomatyzowany publiczny test Turinga, aby odróżnić komputery i ludzi
Opublikowany po raz pierwszy 11 stycznia 2022.













