Unghiul lui Anderson

Anticiparea noilor domenii de spam prin învățare automată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din Franța au dezvoltat o metodă pentru identificarea domeniilor nou înregistrate care sunt susceptibile de a fi utilizate în mod “hit and run” de spammerii de volum mare – uneori, chiar înainte ca aceștia să trimită un singur e-mail nedorit.

Tehnica se bazează pe analiza modului în care Sender Policy Framework (SPF), o metodă de verificare a provenienței e-mailului, a fost configurat pe domenii nou înregistrate.

Mulțumită utilizării senzorilor DNS pasivi, cercetătorii au putut obține date DNS în timp real de la compania Farsight din Seattle, obținând astfel activitatea SPF pentru înregistrările TXT ale unui număr de domenii.

Utilizând un algoritm de greutate a clasei, inițial proiectat pentru procesarea datelor medicale dezechilibrate și implementat în biblioteca Python de învățare automată scikit-learn, cercetătorii au putut detecta trei sferturi din domeniile de spam aflate în așteptare, în momente sau chiar înainte de operațiunile lor.

Articolul afirmă:

‘Cu o singură solicitare la înregistrarea TXT, detectăm 75% din domeniile de spam, posibil înainte de începerea campaniei de spam. Astfel, schema noastră aduce o importantă viteză de reacție: putem detecta spammerii cu o bună performanță, chiar înainte de a trimite orice e-mail și înainte de a apărea o creștere a traficului DNS.’

Cercetătorii afirmă că caracteristicile utilizate în tehnica lor pot fi adăugate la sistemele existente de detectare a spamului pentru a crește performanța, fără a adăuga o sarcină computațională semnificativă, deoarece sistemul se bazează pe datele SPF inferate pasiv din fluxurile DNS în timp real, care sunt deja utilizate pentru abordări diferite ale problemei.

Articolul, intitulat Detectarea timpurie a domeniilor de spam cu DNS pasiv și SPF, provine de la trei cercetători de la Universitatea din Grenoble.

Activitate SPF

SPF este proiectat pentru a preveni spoofingul de adrese de e-mail, prin verificarea faptului că o adresă IP înregistrată și autorizată a fost utilizată pentru a trimite un e-mail.

În acest exemplu de SPF, 'Alice' trimite un e-mail benign către 'Bob', în timp ce atacatorul 'Mallory' încearcă să se deghizeze în Alice. Ambele trimit e-mailuri de la propriile domenii, dar doar serverul lui Alice este înregistrat pentru a trimite e-mailuri de la Alice, astfel încât e-mailul fals al lui Mallory este oprit atunci când verificarea SPF eșuează.

În acest exemplu de SPF, ‘Alice’ trimite un e-mail benign către ‘Bob’, în timp ce atacatorul ‘Mallory’ încearcă să se deghizeze în Alice. Ambele trimit e-mailuri de la propriile domenii, dar doar serverul lui Alice este înregistrat pentru a trimite e-mailuri de la Alice, astfel încât e-mailul fals al lui Mallory este oprit atunci când verificarea SPF eșuează. Sursă: https://arxiv.org/pdf/2205.01932.pdf

Alte metode de verificare a e-mailului includ semnături DomainKeys Identified Mail (DKIM) și autentificarea bazată pe domeniu, raportare și conformitate (DMARC).

Toate cele trei metode trebuie să fie înregistrate ca înregistrări TXT (setări de configurare) la registrarul de domeniu pentru domeniul de trimitere autentic.

Spam și ardere

Spammerii prezintă un comportament “de semnătură” în acest sens. Intenția lor (sau, cel puțin, efectul colateral al activităților lor) este de a “arde” reputația domeniului și a adreselor IP prin trimiterea de e-mailuri în masă până când fie furnizorii de rețea care vând aceste servicii iau măsuri; fie adresele IP asociate sunt înregistrate cu liste de spam populare, făcându-le inutile pentru expeditorul curent (și problematice pentru viitorii proprietari ai adreselor IP).

O fereastră îngustă de oportunitate: timpul, în ore, înainte ca un nou domeniu de spam să fie interzis și să devină inutil de către SpamHaus și alte servicii de monitorizare.

O fereastră îngustă de oportunitate: timpul, în ore, înainte ca un nou domeniu de spam să fie interzis și să devină inutil de către SpamHaus și alte servicii de monitorizare.

Când locația domeniului nu mai este practică, spammerii se mută la alte domenii și servicii, după cum este necesar, repetând procedura cu noi adrese IP și configurații.

Date și metode

Domeniile studiate pentru cercetare acoperă perioada de timp dintre mai și august 2021, furnizate de Farsight. Au fost luate în considerare doar domenii proaspăt înregistrate, deoarece acest lucru corespunde modului de operare al spammerului persistent.

Lista de domenii a fost creată pe baza datelor de la Serviciul de date central al ICANN (CZDS). Informațiile de la liste negre de la proiectele SURBL și SpamHaus au fost utilizate pentru a identifica în timp real domenii noi potențial problematice – deși autorii recunosc că natura imperfectă a listelor de spam poate duce la faptul că domenii benigne sunt categorisite accidental ca surse potențiale de e-mailuri în masă.

După capturarea cererilor DNS TXT către domeniile nou înregistrate găsite în fluxul DNS pasiv, au fost reținute doar cererile cu date SPF valabile, oferind adevărul pentru algoritm.

SPF are o serie de caracteristici utilizabile; noul articol a constatat că, în timp ce “benigni” deținători de domenii utilizează cel mai frecvent mecanismul +include, spammerii au cea mai mare utilizare a caracteristicii (acum învechite) +ptr.

Utilizarea regulilor SPF de către spammeri, comparativ cu utilizarea standard.

Utilizarea regulilor SPF de către spammeri, comparativ cu utilizarea standard.

O căutare +ptr compară adresa IP a expeditorului de e-mail cu orice înregistrări existente pentru o asociere între acea adresă IP și numele gazdă (de exemplu, GoDaddy ). Dacă numele gazdă este descoperit, domeniul său este comparat cu cel care a fost utilizat inițial pentru a face referire la înregistrarea SPF.

Spammerii pot exploata aparenta rigurozitate a +ptr pentru a se prezenta într-o lumină mai credibilă, atunci când, de fapt, resursele necesare pentru a efectua căutări +ptr la scară largă determină mulți furnizori să ocolească verificarea în totalitate.

În sinteză, modul în care spammerii utilizează SPF pentru a obține o fereastră de oportunitate înainte de a începe operațiunea “blast și burn” reprezintă o semnătură caracteristică care poate fi inferată prin analiză automată.

Relații caracteristice SPF pentru domenii de spam.

Relații caracteristice SPF pentru domenii de spam.

Deoarece spammerii se mută adesea la game de adrese IP și resurse foarte apropiate, cercetătorii au dezvoltat un grafic de relații pentru a explora corelația dintre gamele de adrese IP și domenii. Graficul poate fi actualizat aproape în timp real în funcție de noile date de la SpamHaus și alte surse, devenind mai util și complet pe parcursul timpului.

Cercetătorii afirmă:

‘Studiul acestor structuri poate evidenția potențiale domenii de spam. În setul nostru de date, am găsit [structuri] în care zeci de domenii au utilizat aceeași regulă SPF și majoritatea lor au apărut pe liste negre de spam. Prin urmare, este rezonabil să se presupună că domeniile rămase nu au fost încă detectate sau nu sunt încă active ca domenii de spam.’

Rezultate

Cercetătorii au comparat latența detectării domeniilor de spam a abordării lor cu cea a SpamHaus și SURBL pe o perioadă de 50 de ore. Ei raportează că, pentru 70% din domeniile de spam identificate, sistemul lor a fost mai rapid, deși admit că 26% din domeniile de spam identificate au apărut în liste negre comerciale în următoarea oră. 30% din domenii erau deja într-o listă neagră atunci când au apărut în fluxul DNS pasiv.

Autorii afirmă un scor F1 de 79% împotriva adevărului, pe baza unei singure cereri DNS, în timp ce metodele concurente, cum ar fi Exposure, pot necesita o săptămână de analiză preliminară.

Ei observă:

‘Schema noastră poate fi aplicată în stadiile incipiente ale ciclului de viață al unui domeniu: utilizând DNS pasiv (sau activ), putem obține reguli SPF pentru domenii nou înregistrate și le putem clasifica imediat, sau putem aștepta până când detectăm cereri TXT către acel domeniu și rafinăm clasificarea utilizând caracteristici temporale greu de evitat.’

Și continuă:

‘[Cel] mai bun clasificator detectează 85% din domeniile de spam, menținând o rată de fals pozitiv sub 1%. Rezultatele detectării sunt remarcabile, având în vedere că clasificarea utilizează doar conținutul regulilor SPF și relațiile lor, și caracteristici greu de evitat bazate pe traficul DNS.

‘Performanța clasificatorilor rămâne ridicată, chiar și atunci când li se oferă doar caracteristicile statice care pot fi colectate dintr-o singură cerere TXT (observată pasiv sau întrebată activ).’

Pentru a vedea o prezentare a noii metode, consultați videoul încorporat mai jos:

 

Publicat pentru prima dată pe 5 mai 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai