Kąt Andersona

Przewidywanie nowych domen spamowych za pomocą uczenia maszynowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Francji opracowali metodę identyfikacji nowo zarejestrowanych domen, które prawdopodobnie będą wykorzystywane w sposób “hit and run” przez wysyłających duże ilości spamu – czasem nawet przed wysłaniem jednego niechcianego e-maila.

Technika ta oparta jest na analizie sposobu, w jaki Sender Policy Framework (SPF), metoda weryfikacji pochodzenia e-maila, została ustawiona na nowo zarejestrowanych domenach.

Dzięki wykorzystaniu pasywnych czujników DNS (Domain Name System) od firmy Farsight z Seattle, naukowcy byli w stanie uzyskać dane DNS w czasie rzeczywistym dla rekordów TXT dla zakresu domen.

Wykorzystując algorytm wag klasy, pierwotnie opracowany do przetwarzania niezrównoważonych danych medycznych, a zaimplementowany w bibliotece scikit-learn do uczenia maszynowego w języku Python, naukowcy byli w stanie wykryć trzy czwarte domen spamowych w ciągu kilku chwil, lub nawet przed rozpoczęciem ich działania.

W artykule stwierdza się:

‘Z jednym żądaniem do rekordu TXT, wykrywamy 75% domen spamowych, możliwe, że nawet przed rozpoczęciem kampanii spamowej. Nasz schemat przynosi ważną szybkość reakcji: możemy wykryć spamery z dobrą wydajnością, nawet przed wysłaniem jakiegokolwiek e-maila i przed wzrostem ruchu DNS.’

Naukowcy twierdzą, że cechy wykorzystane w ich technice mogą być dodane do istniejących systemów wykrywania spamu, aby zwiększyć ich wydajność, bez dodatkowych obciążeń obliczeniowych, ponieważ system opiera się na danych SPF, które są biernie wnioskowane z danych DNS w czasie rzeczywistym, które są już wykorzystywane w różnych podejściach do problemu.

Artykuł pt. Wczesne wykrywanie domen spamowych z użyciem pasywnego DNS i SPF, pochodzi od trzech naukowców z Uniwersytetu w Grenoble.

Aktywność SPF

SPF jest zaprojektowany, aby uniknąć fałszerstwa adresów e-mail, poprzez weryfikację, czy zarejestrowany i upoważniony adres IP został użyty do wysłania e-maila.

W tym przykładzie SPF, 'Alice' wysyła nieszkodliwy e-mail do 'Bob', podczas gdy atakujący 'Mallory' próbuje podszyć się pod Alice. Obydwaj wysyłają pocztę z własnych domen, ale tylko serwer Alice jest zarejestrowany do wysyłania poczty Alice, więc fałszywa poczta Mallory'ego jest udaremniona, gdy jego fałszywa poczta nie przejdzie weryfikacji SPF.

W tym przykładzie SPF, ‘Alice’ wysyła nieszkodliwy e-mail do ‘Bob’, podczas gdy atakujący ‘Mallory’ próbuje podszyć się pod Alice. Obydwaj wysyłają pocztę z własnych domen, ale tylko serwer Alice jest zarejestrowany do wysyłania poczty Alice, więc fałszywa poczta Mallory’ego jest udaremniona, gdy jego fałszywa poczta nie przejdzie weryfikacji SPF. Źródło: https://arxiv.org/pdf/2205.01932.pdf

Inne metody weryfikacji e-mail obejmują DomainKeys Identified Mail (DKIM) podpisy, oraz Domain-based Message Authentication, Reporting, and Conformance (DMARC).

Wszystkie trzy metody muszą być zarejestrowane jako rekordy TXT (ustawienia konfiguracyjne) u rejestratora domeny dla autentycznego nadawcy.

Spam i spalanie

Spamerzy wykazują “sygnaturowe zachowanie” w tym zakresie. Ich intencją (lub przynajmniej skutkiem ich działań) jest “spalenie” reputacji domeny i jej adresów IP, wysyłając duże ilości spamu, aż do momentu, gdy zostaną podjęte działania przez dostawców sieciowych lub gdy adresy IP zostaną zarejestrowane w popularnych listach filtrów spamu, co sprawi, że będą one nieprzydatne dla bieżącego nadawcy (i problematyczne dla przyszłych właścicieli adresów IP).

Wąski okres czasu: czas, w godzinach, przed nową domeną spamową, która zostanie zbanowana i stanie się nieprzydatna przez SpamHaus i różne inne usługi monitorujące.

Wąski okres czasu: czas, w godzinach, przed nową domeną spamową, która zostanie zbanowana i stanie się nieprzydatna przez SpamHaus i różne inne usługi monitorujące.

Gdy lokalizacja domeny nie jest już praktyczna, spamerzy przechodzą do innych domen i usług, powtarzając procedurę z nowymi adresami IP i konfiguracjami.

Dane i metody

Domeny badane w ramach badań obejmują okres od maja do sierpnia 2021 roku, dostarczony przez Farsight. Uwzględniono tylko świeżo zarejestrowane domeny, ponieważ odpowiada to modus operandi uporczywych spamersów.

Lista domen została zbudowana na podstawie danych z ICANN Central Zone Data Service (CZDS). Informacje z listy SURBL i SpamHaus zostały wykorzystane do identyfikacji potencjalnie problematycznych nowych rejestracji domen w czasie rzeczywistym – chociaż autorzy przyznają, że nieidealna natura list spamu może prowadzić do przypadkowego zaklasyfikowania benignych domen jako potencjalnych źródeł masowej poczty.

Po przechwyceniu zapytań DNS TXT do nowo zarejestrowanych domen znalezionych w pasywnym strumieniu DNS, zachowano tylko zapytania z ważnymi danymi SPF, co dostarczyło podstawę dla algorytmów.

SPF ma wiele przydatnych cech; nowy artykuł stwierdza, że podczas gdy “niewinny” właściciele domen najczęściej wykorzystują mechanizm +include, spamerzy mają największe wykorzystanie (obecnie przestarzałej) +ptr funkcji.

Użycie reguł SPF przez spamery w porównaniu z użyciem standardowym.

Użycie reguł SPF przez spamery w porównaniu z użyciem standardowym.

Wyszukiwanie +ptr porównuje adres IP wysyłającego pocztę z rekordami istniejącymi dla skojarzenia tego adresu IP z nazwą hosta (tj. GoDaddy ). Jeśli nazwa hosta zostanie znaleziona, jej domena jest porównywana z domeną, która została najpierw użyta do odniesienia do rekordu SPF.

Spamerzy mogą wykorzystywać pozorną surowość +ptr, aby przedstawić się w bardziej wiarygodnym świetle, podczas gdy w rzeczywistości zasoby potrzebne do przeprowadzenia wyszukiwania +ptr w dużym stopniu powodują, że wiele dostawców pomija tę weryfikację.

W skrócie, sposób, w jaki spamerzy wykorzystują SPF, aby uzyskać okno możliwości przed rozpoczęciem “blast i burn” operacji, reprezentuje charakterystyczny podpis, który może być wnioskowany przez analizę maszynową.

Charakterystyczne relacje SPF dla domen spamowych.

Charakterystyczne relacje SPF dla domen spamowych.

Ponieważ spamerzy często przechodzą do bardzo bliskich zakresów IP i zasobów, naukowcy opracowali graf relacji, aby zbadać korelację między zakresami IP a domenami. Graf może być aktualizowany niemal w czasie rzeczywistym w odpowiedzi na nowe dane z SpamHaus i innych źródeł, stając się bardziej użyteczny i kompletny w czasie.

Naukowcy stwierdzają:

‘Badanie tych struktur może ujawnić potencjalne domeny spamowe. W naszym zestawie danych znaleźliśmy [struktury], w których dziesiątki domen wykorzystywały tę samą [regułę SPF] i większość z nich pojawiła się na listach spamu. Można więc przyjąć, że pozostałe domeny są prawdopodobnie jeszcze nie wykryte lub nieaktywne jako domeny spamowe.’

Wyniki

Naukowcy porównali opóźnienie wykrywania domen spamowych swojego podejścia z SpamHaus i SURBL w ciągu 50-godzinnego okresu. Stwierdzają, że dla 70% domen spamowych ich system był szybszy, chociaż przyznają, że 26% zidentyfikowanych domen spamowych pojawiło się na komercyjnych listach w ciągu następnej godziny. 30% domen było już na liście w momencie pojawienia się w pasywnym strumieniu DNS.

Autorzy twierdzą, że ich system osiągnął wynik F1 79% w stosunku do danych podstawowych na podstawie jednego zapytania DNS, podczas gdy konkurencyjne metody, takie jak Exposure, mogą wymagać tygodnia wstępnej analizy.

Stwierdzają:

‘Nasz schemat może być stosowany na wczesnych etapach cyklu życia domeny: korzystając z pasywnego (lub aktywnego) DNS, możemy uzyskać reguły SPF dla nowo zarejestrowanych domen i je natychmiast sklasyfikować, lub poczekać, aż wykryjemy zapytania TXT do tej domeny i udoskonalić klasyfikację, wykorzystując trudne do uniknięcia cechy czasowe.’

I kontynuują:

‘Nasz najlepszy klasyfikator wykrywa 85% domen spamowych, utrzymując wskaźnik fałszywych pozytywów poniżej 1%. Wyniki wykrywania są godne uwagi, biorąc pod uwagę, że klasyfikacja wykorzystuje tylko zawartość reguł SPF domen i ich relacje, oraz trudne do uniknięcia cechy oparte na ruchu DNS.

‘Wydajność klasyfikatorów pozostaje wysoka, nawet jeśli są one podane tylko statycznym cechom, które mogą być zebrane z jednego zapytania TXT (obserwowanego biernie lub aktywnie zapytanego).’

Aby zobaczyć prezentację nowej metody, obejrzyj zamieszczony poniżej film:

 

Pierwotnie opublikowane 5 maja 2022 r.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai