Andersons vinkel

Förutsägelse av nya spamdomäner genom maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Frankrike har utvecklat en metod för att identifiera nyligen registrerade domäner som sannolikt kommer att användas på ett “hit and run”-sätt av högvolymspammare – ibland till och med innan spammarna har skickat ut en oönskad e-post.

Metoden är baserad på analys av hur Sender Policy Framework (SPF), en metod för att verifiera e-postursprung, har konfigurerats för nyligen registrerade domäner.

Tack vare användningen av passiv DNS (Domain Name System)-sensorer kunde forskarna få nära realtids-DNS-data från det Seattle-baserade företaget Farsight, vilket gav SPF-aktivitet för TXT-poster för en rad domäner.

Med hjälp av en klassviktsalgoritm som ursprungligen utvecklades för att bearbeta obalanserade medicinska data, och som implementerats i scikit-learn-maskinlärningsbiblioteket för Python, kunde forskarna upptäcka tre fjärdedelar av de väntade spamdomänerna inom några ögonblick, eller till och med före deras verksamhet.

Artikeln säger:

‘Med en enda begäran till TXT-posten upptäcker vi 75% av spamdomänerna, möjligtvis innan spamkampanjen börjar. Vår schema ger därmed en viktig reaktionshastighet: vi kan upptäcka spammare med god prestanda, till och med innan någon e-post skickas och innan en topp i DNS-trafiken uppstår.’

Forskarna hävdar att de funktioner som används i deras teknik kan läggas till i befintliga spammadekteringssystem för att öka prestandan, och utan att lägga till betydande beräkningsöverhuvud, eftersom systemet förlitar sig på SPF-data som passivt kan härledas från nära realtids-DNS-flöden som redan används för olika tillvägagångssätt.

Den artikeln heter Tidig upptäckt av spamdomäner med passiv DNS och SPF och kommer från tre forskare vid Universitetet i Grenoble.

SPF-aktivitet

SPF är utformat för att undvika spoofning av e-postadresser, genom att verifiera att en registrerad och auktoriserad IP-adress har använts för att skicka en e-post.

I det här exemplet på SPF skickar 'Alice' en ofarlig e-post till 'Bob', medan angriparen 'Mallory' försöker imitera Alice. Båda skickar e-post från sina egna domäner, men bara Alices server är registrerad för att skicka Alices e-post, så Mallorys spoof misslyckas när hans fejk-e-post inte klarar SPF-verifieringen.

I det här exemplet på SPF skickar ‘Alice’ en ofarlig e-post till ‘Bob’, medan angriparen ‘Mallory’ försöker imitera Alice. Båda skickar e-post från sina egna domäner, men bara Alices server är registrerad för att skicka Alices e-post, så Mallorys spoof misslyckas när hans fejk-e-post inte klarar SPF-verifieringen. Källa: https://arxiv.org/pdf/2205.01932.pdf

Andra metoder för e-postverifiering inkluderar DomainKeys Identified Mail (DKIM)-signaturer och Domain-baserad meddelandeautentisering, rapportering och konformitet (DMARC).

Alla tre metoder måste registreras som TXT-poster (konfigurationsinställningar) hos domänregistreraren för den autentiska avsändardomänen.

Spam och brännskada

Spammare uppvisar ‘signaturbeteende’ i det här avseendet. Deras avsikt (eller, åtminstone, den sammanhängande effekten av deras aktiviteter) är att ‘bränna’ ryktet för domänen och dess IP-adresser genom att skicka ut massutskick tills antingen åtgärder vidtas av nätverksleverantörerna som säljer dessa tjänster, eller de associerade IP-adresserna registreras med populära spamfilterlistor, vilket gör dem värdelösa för den nuvarande avsändaren (och problematiska för framtida ägare av IP-adresserna).

Ett smalt fönster av möjlighet: tiden, i timmar, innan en ny spamdomän blir förbjuden och värdelös av SpamHaus och olika andra övervakningstjänster.

Ett smalt fönster av möjlighet: tiden, i timmar, innan en ny spamdomän blir förbjuden och värdelös av SpamHaus och olika andra övervakningstjänster.

När domänplatsen inte längre är praktisk, flyttar spammarna till andra domäner och tjänster vid behov, och upprepar proceduren med nya IP-adresser och konfigurationer.

Data och metoder

De domäner som studerades för forskningen omfattar tiden mellan maj och augusti 2021, som tillhandahålls av Farsight. Endast färskt registrerade domäner beaktades, eftersom detta överensstämmer med modus operandi för den ihållande spammaren.

Domänlistan byggdes över data från ICANN Central Zone Data Service (CZDS). Svartlistningsinformation från SURBL och SpamHaus-projekten användes för att effektivt identifiera potentiellt problematiska nya domänregistreringar i nära realtid – även om författarna medger att den ofullständiga naturen av spamlistor kan leda till att ofarliga domäner av misstag kategoriseras som potentiella källor till massutskick.

Efter att ha fångat DNS-TXT-frågor till de nyligen registrerade domänerna som hittades i den passiva DNS-flödet, behölls endast frågor med giltiga SPF-data, vilket gav underlag för algoritmerna.

SPF har ett antal användbara funktioner; den nya artikeln har funnit att medan ‘ofarliga’ domänägare oftast använder +include-mekanismen, har spammare den högsta användningen av den (nu avskaffade) +ptr-funktionen.

SPF-regel-användning för spammare, jämfört med standardanvändning.

SPF-regel-användning för spammare, jämfört med standardanvändning.

En +ptr-sökning jämför IP-adressen för den avsändande e-posten med de poster som finns för en association mellan den IP-adressen och värdnamnet (t.ex. GoDaddy ). Om värdnamnet upptäcks, jämförs dess domän med den som först användes för att hänvisa till SPF-posten.

Spammare kan utnyttja den uppenbara rigor av +ptr för att presentera sig på ett mer trovärdigt sätt, när de i själva verket inte har de resurser som behövs för att utföra +ptr-sökningar i stor skala, vilket gör att många leverantörer hoppar över kontrollen helt.

I korthet representerar det sätt som spammare använder SPF för att säkra ett fönster av möjlighet innan ‘blast och brännskada’-operationen börjar, en karakteristisk signatur som kan härledas genom maskinanalys.

Karakteristiska SPF-relationer för spamdomäner.

Karakteristiska SPF-relationer för spamdomäner.

Eftersom spammare ofta flyttar till mycket närliggande IP-intervall och resurser, utvecklade forskarna en relationsgraf för att undersöka korrelationen mellan IP-intervall och domäner. Grafen kan uppdateras nästan i realtid som svar på nya data från SpamHaus och andra källor, och blir mer användbar och fullständig över tiden.

Forskarna hävdar:

‘Studiet av dessa strukturer kan belysa potentiella spamdomäner. I vår dataset hittade vi [strukturer] där dussintals domäner använde samma [SPF]-regel och majoriteten av dem hamnade på spam-svartlistor. Det är därför rimligt att anta att de återstående domänerna sannolikt inte har upptäckts eller är inte ännu aktiva spamdomäner.’

Resultat

Forskarna jämförde spamdomänupptäcktsfördröjningen för sitt tillvägagångssätt med SpamHaus och SURBL under en period av 50 timmar. De rapporterar att för 70% av de spamdomäner som identifierades var deras eget system snabbare, även om de medger att 26% av de identifierade spamdomänerna faktiskt hamnade i kommersiella svartlistor inom den följande timmen. 30% av domänerna var redan i en svartlista när de dök upp i den passiva DNS-flödet.

Författarna hävdar en F1-poäng på 79% mot grundtruth baserat på en enda DNS-fråga, medan konkurrerande metoder som Exposure kan kräva en veckas förberedande analys.

De observerar:

‘Vårt schema kan tillämpas i tidiga skeden av en domäns livscykel: med passiv (eller aktiv) DNS kan vi få SPF-regler för nyligen registrerade domäner och klassificera dem omedelbart, eller vänta tills vi upptäcker TXT-frågor till den domänen och förbättra klassificeringen med hjälp av svåra att undvika temporala funktioner.’

Och fortsätter:

‘[Vår] bästa klassificerare upptäcker 85% av spamdomäner medan den håller en falsk positiv frekvens under 1%. Upptäcktsresultaten är anmärkningsvärda med tanke på att klassificeringen endast använder innehållet i domän-SPF-reglerna och deras relationer, och svåra att undvika funktioner baserade på DNS-trafik.

‘Prestandan för klassificerarna förblir hög, även om de endast får de statiska funktionerna som kan samlas in från en enda TXT-fråga (observerad passivt eller aktivt frågad).’

För att se en presentation om den nya metoden, se den inbäddade videon nedan:

 

Publicerad första gången den 5 maj 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai