Andersons vinkel
Forutser nye spamdomener gjennom maskinlæring

Forskere fra Frankrike har utviklet en metode for å identifisere nyregistrerte domener som sannsynligvis vil bli brukt i en “hit and run”-aksjon av høyvolumsemailspammere – noen ganger, selv før spammerne har sendt ut ett uønsket e-post.
Teknikken er basert på analyse av måten Sender Policy Framework (SPF), en metode for å verifisere e-postproveniens, er konfigurert på nyregistrerte domener.
Takk til bruk av passiv DNS (Domain Name System)-sensore, kunne forskerne få nær sanntids DNS-data fra Seattle-baserte Farsight, som ga SPF-aktivitet for TXT-records for en rekke domener.
Ved å bruke en klassèvektalgoritme som opprinnelig var designet for å prosessere ubalansert medisinsk data, og implementert i scikit-learn maskinlærings-Python-bibliotek, kunne forskerne detektere tre firedeler av de ventende spamdomenene innen få øyeblikk, eller selv før de ble aktivert.
Artikkelen sier:
‘Med en enkelt forespørsel til TXT-records, detekterer vi 75% av spamdomenene, muligens før starten på spamkampanjen. Derfor bringer vårt system viktig reaksjonshastighet: vi kan detektere spammere med god ytelse, selv før noen e-post blir sendt og før det blir en økning i DNS-trafikken.’
Forskerne hevder at funksjonene som brukes i deres teknikk kan legges til eksisterende spamdeteksjonssystemer for å øke ytelsen, og uten å legge til betydelig beregningsoverhead, ettersom systemet er avhengig av SPF-data som passivt er inferert fra nær sanntids DNS-feeds som allerede er i bruk for andre tilnærminger til problemet.
Den artikkelen heter Tidlig deteksjon av spamdomener med passiv DNS og SPF, og kommer fra tre forskere ved Universitetet i Grenoble.
SPF-aktivitet
SPF er designet for å unngå spoofing av e-postadresser, ved å verifisere at en registrert og autorisert IP-adresse har blitt brukt til å sende en e-post.

I dette eksempelet på SPF, sender ‘Alice’ en harmløs e-post til ‘Bob’, mens angriperen ‘Mallory’ prøver åligne Alice. Begge sender e-post fra sine egne domener, men bare Alice’ server er registrert for å sende Alice’ e-post, så Mallorys spoof blir forhindret når hans falske e-post feiler SPF-verifisering. Kilde: https://arxiv.org/pdf/2205.01932.pdf
Andre metoder for e-postverifisering inkluderer DomainKeys Identified Mail (DKIM)-signaturer, og Domain-basert meldingsautentisering, rapportering og overensstemmelse (DMARC).
Alle tre metoder må registreres som TXT-records (konfigurasjonsinnstillinger) hos domeneregistrator for den autentiske sendedomener.
Spam og brenn
Spammere utviser ‘signaturatferd’ på denne måten. Deres intensjon (eller i alle fall den samlekteriske effekten av deres aktiviteter) er å ‘brenne’ ryktet til domenet og dens IP-adresser ved å sende ut masse-e-post til både aksjon blir tatt av nettverksleverandørene som selger disse tjenestene; eller de assosierte IP-adressene blir registrert med populære spamfilterlister, noe som gjør dem nytteløse for den nåværende senderen (og problematisk for fremtidige eiere av IP-adressene).

Et smalt vindu av mulighet: tiden, i timer, før en ny spamdome blir forbudt og gjort nytteløs av SpamHaus og andre overvåkningstjenester.
Når domenelokasjonen ikke lenger er praktisk, flytter spammere over til andre domener og tjenester etter behov, og gjentar prosessen med nye IP-adresser og konfigurasjoner.
Data og metoder
Domenene som ble studert for forskningen dekket tidsperioden mellom mai og august 2021, som ble levert av Farsight. Bare ferskt registrerte domener ble vurdert, siden dette samsvarer med modus operandi til den vedvarende spammere.
Domenlisten ble bygget over data fra ICANN Central Zone Data Service (CZDS). Blacklistinformasjon fra SURBL og SpamHaus-prosjektene ble brukt til å oppnå nær sanntidsidentifisering av potensielt problematiske nye domeneregistreringer – selv om forfatterne innrømmer at den uperfekte naturen til spamlistene kan føre til at harmløse domener blir kategorisert som potensielle kilder for masse-e-post.
Etter å ha fanget DNS-TXT-forespørsler til de nyregistrerte domenene funnet i den passive DNS-feeden, ble bare forespørsler med gyldige SPF-data beholdt, og ga grunnfakta for algoritmene.

SPF har en rekke brukbare funksjoner; den nye artikkelen har funnet at mens ‘harmløse’ domene-eiere vanligvis bruker +include-mekanismen, har spammere den høyeste bruken av den (nå avskaffede) +ptr-funksjonen.

SPF-regelbruk for spammere, sammenlignet med standardbruk.
En +ptr-oppslag sammenligner IP-adressen til den sendende e-posten med hva som finnes av poster for en assosiasjon mellom den IP-adressen og vertsnavnet (dvs. GoDaddy ). Hvis vertsnavnet blir oppdaget, blir dets domene sammenlignet med den som først ble brukt til å referere til SPF-posten.
Spammere kan utnytte den åpenbare rigor av +ptr til å presentere seg i et mer troverdig lys, når i virkeligheten ressursene som trengs for å utføre +ptr-oppslag på stor skala får mange leverandører til å hoppe over sjekken helt.
Kort sagt, måten spammere bruker SPF for å sikre et vindu av mulighet før ‘blast og brenn’-operasjonen begynner, representerer en karakteristisk signatur som kan bli inferert av maskinanalyse.

Karakteristiske SPF-relasjoner for spamdomener.
Ettersom spammere ofte flytter til svært nærliggende IP-områder og ressurser, utviklet forskerne en relasjonsgraf til å utforske korrelasjonen mellom IP-områder og domener. Grafen kan oppdateres nesten i sanntid som svar på nye data fra SpamHaus og andre kilder, og blir mer nyttig og fullstendig over tid.
Forskerne sier:
‘Studiet av disse strukturer kan høydepotensielle spamdomener. I vårt datasett fant vi [strukturer] hvor dusinvis av domener brukte samme [SPF]-regel, og majoriteten av dem dukket opp på spamblacklistene. Derfor er det rimelig å anta at de gjenværende domenene sannsynligvis ikke har blitt oppdaget eller er ikke ennå aktive spamdomener.’
Resultater
Forskerne sammenlignet spamdome-deteksjonsforsinkelsen til deres tilnærmning med SpamHaus og SURBL over en 50-timers periode. De rapporterer at for 70% av spamdomenene som ble identifisert, var deres eget system raskere, selv om de innrømmer at 26% av de identifiserte spamdomenene dukket opp i kommersielle blacklister i den påfølgende timen. 30% av domenene var allerede i en blacklist da de dukket opp i den passive DNS-feeden.
Forfatterne hevder en F1-poeng på 79% mot grunnfakta basert på en enkelt DNS-forespørsel, mens konkurrerende metoder som Exposure kan kreve en ukes forhåndsanalyse.
De observerer:
‘Vårt system kan bli brukt i tidlige stadier av en domene-livssyklus: ved å bruke passiv (eller aktiv) DNS, kan vi få SPF-regler for nyregistrerte domener og klassifisere dem umiddelbart, eller vente til vi detekterer TXT-forespørsler til domenet og finjustere klassifiseringen ved å bruke vanskelige å unngå temporale funksjoner.’
Og fortsetter:
‘[Vårt] beste klassifiseringssystem detekterer 85% av spamdomenene mens den holder en falsk positiv rate under 1%. Deteksjonsresultatene er bemerkelsesverdige gitt at klassifiseringen bare bruker innholdet av domenens SPF-regler og deres relasjoner, og vanskelige å unngå funksjoner basert på DNS-trafikk.
‘Ytelsen til klassifiseringsalgoritmene forblir høy, selv hvis de bare får de statiske funksjonene som kan samles fra en enkelt TXT-forespørsel (observert passivt eller aktivt forespurt).’
For å se en presentasjon om den nye metoden, se den innlejrede videoen nedenfor:
Først publisert 5. mai 2022.












