Andersons vinkel
Forudsigelse af nye spam-domæner gennem maskinlæring

Forskere fra Frankrig har udviklet en metode til at identificere nyligt registrerede domæner, der sandsynligvis vil blive brugt i en ‘hit and run’-fashion af højvolumen e-mail-spammere – nogle gange, endda før spammerne har sendt en enkelt uønsket e-mail.
Metoden er baseret på analyse af, hvordan Sender Policy Framework (SPF), en metode til at verificere e-mail-proveniens, er konfigureret på nyligt registrerede domæner.
Takket være brugen af passive DNS (Domain Name System)-sensorer, kunne forskerne få near real-time DNS-data fra det Seattle-baserede firma Farsight, hvilket gav SPF-aktivitet for TXT-records for en række domæner.
Med brug af en klassenvægtsalgoritme, der oprindeligt var designet til at behandle ubalanceret medicinsk data, og implementeret i scikit-learn maskinlærings-Python-biblioteket, kunne forskerne opdage tre kvarter af de ventende spam-domæner inden for øjeblikke, eller endda før deres operation.
Artiklen siger:
‘Med en enkelt anmodning om TXT-records, kan vi opdage 75% af spam-domænerne, muligvis før starten af spam-kampagnen. Derfor bringer vores skema en vigtig reaktionshastighed: vi kan opdage spammere med god ydelse, selv før nogen mail er sendt og før der er en stigning i DNS-trafikken.’
Forskerne hævder, at de funktioner, der bruges i deres metode, kan tilføjes til eksisterende spam-detections-systemer for at øge ydelsen, og uden at tilføje betydelig beregnings-overhead, da systemet afhænger af SPF-data, der passivt er indført fra near real-time DNS-feeds, der allerede bruges til andre tilgange til problemet.
Den artikel er titlen Early Detection of Spam Domains with Passive DNS and SPF, og kommer fra tre forskere ved Universitetet i Grenoble.
SPF-aktivitet
SPF er designet til at undgå spoofing af e-mail-adresser, ved at verificere, at en registreret og autoriseret IP-adresse er brugt til at sende en e-mail.

I dette eksempel på SPF, sender ‘Alice’ en harmløs e-mail til ‘Bob’, mens angriberen ‘Mallory’ forsøger at efterligne Alice. Begge sender mail fra deres egne domæner, men kun Alices server er registreret til at sende Alices mail, så Mallorys spoof mislykkes, når hans falske mail fejler SPF-verificering. Kilde: https://arxiv.org/pdf/2205.01932.pdf
Andre metoder til e-mail-verificering inkluderer DomainKeys Identified Mail (DKIM) Signatures, og Domain-based Message Authentication, Reporting, and Conformance (DMARC).
Alle tre metoder skal være registreret som TXT-records (konfigurationsindstillinger) hos domæne-registrator for den autentiske afsendende domæne.
Spam og brænd
Spammere udviser ‘signature-adfærd’ på denne måde. Deres intention (eller i hvert fald den samledende effekt af deres aktiviteter) er at ‘brænde’ rygtet for domænet og dets IP-adresser ved at sende ud bulk-mail, indtil enten handling er taget af netværksudbyderne, der sælger disse tjenester; eller de associerede IP-adresser er registreret med populære spam-filterlister, hvilket gør dem ubrugelige for den nuværende afsender (og problematisk for fremtidige ejere af IP-adresserne).

Et smalt vindue af mulighed: tiden, i timer, før et nyt spam-domæne er forbudt og gjort ubrugeligt af SpamHaus og andre overvågnings-tjenester.
Når domænelokationen ikke længere er praktisk, flytter spammere til andre domæner og tjenester efter behov, og gentager proceduren med nye IP-adresser og konfigurationer.
Data og metoder
De domæner, der er studeret i denne forskning, dækker perioden mellem maj og august 2021, som er leveret af Farsight. Kun frisk registrerede domæner blev overvejet, da dette er i overensstemmelse med modus operandi for den vedvarende spammer.
Domænelisten blev bygget over data fra ICANN Central Zone Data Service (CZDS). Blacklist-information fra SURBL og SpamHaus-projekterne blev brugt til at identificere potentielt problematiske nye domæne-registreringer i near real-time – selvom forfatterne indrømmer, at den uperfekte natur af spam-lister kan føre til, at benign domæner utilsigtet bliver kategoriseret som potentielle kilder til bulk-mail.
Efter at have fanget DNS-TXT-anmodninger til de nyligt registrerede domæner, der blev fundet i den passive DNS-feed, blev kun anmodninger med gyldig SPF-data beholdt, hvilket gav grundsandheden for algoritmerne.

SPF har en række brugbare funktioner; den nye artikel har fundet, at mens ‘benign’ domæne-ejere mest almindeligt bruger +include-mekanismen, har spammere den højeste brug af den (nu forældede) +ptr-funktion.

SPF-regel-brug af spammere, sammenlignet med standard-brug.
En +ptr-lookup sammenligner IP-adressen på den sendende mail med de eksisterende poster for en association mellem den IP og hostname (f.eks. GoDaddy ). Hvis hostname er opdaget, sammenlignes dets domæne med det domæne, der først blev brugt til at reference SPF-posten.
Spammere kan udnytte den åbenlyse rigor af +ptr til at præsentere sig selv i et mere troværdigt lys, når de i virkeligheden ikke har de ressourcer, der er nødvendige for at udføre +ptr-lookups i stor målestok.
I kort, repræsenterer måden, spammere bruger SPF for at sikre sig en vindue af mulighed, før ‘blast og brænd’-operationen begynder, en karakteristisk signatur, der kan sluttes af maskin-analyse.

Karakteristiske SPF-forhold for spam-domæner.
Da spammere ofte flytter til meget nærvede IP-områder og ressourcer, udviklede forskerne et relations-diagram for at udforske korrelationen mellem IP-områder og domæner. Diagrammet kan opdateres næsten i realtid som svar på nye data fra SpamHaus og andre kilder, og bliver mere nyttigt og komplet over tid.
Forskerne siger:
‘Studiet af disse strukturer kan højligte potentielle spam-domæner. I vores dataset fandt vi [strukturer], hvor dusinvis af domæner brugte den samme [SPF]-regel, og de fleste af dem dukkede op på spam-blacklister. Derfor er det rimeligt at antage, at de resterende domæner sandsynligvis endnu ikke er blevet opdaget eller er ikke endnu aktive spam-domæner.’
Resultater
Forskerne sammenlignede spam-domæne-detections-forsinkelsen for deres tilgang med SpamHaus og SURBL over en 50-timers periode. De rapporterer, at for 70% af de spam-domæner, der blev identificeret, var deres eget system hurtigere, selvom de indrømmer, at 26% af de identificerede spam-domæner dukkede op i kommercielle blacklister i den følgende time. 30% af domænerne var allerede i en blacklist, da de dukkede op i den passive DNS-feed.
Forfatterne hævder en F1-score på 79% mod grundsandheden baseret på en enkelt DNS-anmodning, mens konkurrerende metoder som Exposure kan kræve en uges forudgående analyse.
De observerer:
‘Vores skema kan anvendes i de tidlige stadier af en domæne-livscyklus: ved at bruge passive (eller aktive) DNS, kan vi få SPF-regler for nyligt registrerede domæner og klassificere dem straks, eller vente, til vi opdager TXT-anmodninger til det domæne og forfine klassificeringen ved hjælp af svær-at-undgå-temporale funktioner.’
Og fortsætter:
‘[Vores] bedste klassifikator opdager 85% af spam-domæner, mens den holder en falsk positiv rate under 1%. Detections-resultaterne er bemærkelsesværdige, givet, at klassificeringen kun bruger indholdet af domæne-SPF-regler og deres forhold, og svær-at-undgå-funktioner baseret på DNS-trafik.
‘Ydelsen af klassifikatorerne forbliver høj, selv hvis de kun får de statiske funktioner, der kan indsamles fra en enkelt TXT-anmodning (observeret passivt eller aktivt anmodet).’
For at se en præsentation af den nye metode, se det indlejrede video nedenfor:
Først udgivet 5. maj 2022.












