Andersons hoek
Voorspellen van nieuwe spamdomeinen met behulp van machine learning

Onderzoekers uit Frankrijk hebben een methode ontwikkeld om nieuw geregistreerde domeinen te identificeren die waarschijnlijk worden gebruikt in een ‘hit and run’-stijl door high-volume e-mailspammers – soms zelfs voordat de spammers één ongewenste e-mail hebben verstuurd.
De techniek is gebaseerd op de analyse van de manier waarop de Sender Policy Framework (SPF), een methode voor het verifiëren van e-mailprovenantie, is ingesteld op nieuw geregistreerde domeinen.
Dankzij het gebruik van passieve DNS (Domain Name System)-sensoren konden de onderzoekers near real-time DNS-gegevens verkrijgen van het in Seattle gevestigde bedrijf Farsight, waardoor SPF-activiteit voor TXT-records voor een reeks domeinen beschikbaar kwam.
Met behulp van een class weight-algoritme dat oorspronkelijk ontworpen was voor het verwerken van onbalansige medische gegevens en geïmplementeerd in de scikit-learn machine learning Python-bibliotheek, konden de onderzoekers drie kwart van de aanstaande spamdomeinen binnen enkele momenten detecteren, of zelfs vóór hun operatie.
Het artikel zegt:
‘Met één verzoek aan de TXT-record detecteren we 75% van de spamdomeinen, mogelijk voordat de start van de spamcampagne. Ons schema brengt dus een belangrijke reactiesnelheid met zich mee: we kunnen spammers met een goede prestatie detecteren, zelfs voordat er één e-mail is verstuurd en voordat er een piek in het DNS-verkeer optreedt.’
De onderzoekers claimen dat de kenmerken die in hun techniek worden gebruikt, kunnen worden toegevoegd aan bestaande spamdetectiesystemen om de prestaties te verbeteren, zonder significante rekenkundige overhead toe te voegen, aangezien het systeem afhankelijk is van SPF-gegevens die passief worden afgeleid uit near real-time DNS-feeds die al in gebruik zijn voor verschillende benaderingen van het probleem.
Het artikel heet Vroegtijdige detectie van spamdomeinen met passieve DNS en SPF en komt van drie onderzoekers aan de Universiteit van Grenoble.
SPF-activiteit
SPF is ontworpen om het vervalsen van e-mailadressen te voorkomen, door te verifiëren dat een geregistreerd en geautoriseerd IP-adres is gebruikt om een e-mail te verzenden.

In dit voorbeeld van SPF stuurt ‘Alice’ een onschadelijke e-mail naar ‘Bob’, terwijl de aanvaller ‘Mallory’ probeert Alice te imiteren. Beiden sturen e-mail vanaf hun eigen domeinen, maar alleen Alice’ server is geregistreerd om Alice’ e-mail te verzenden, dus Mallory’s vervalsing wordt verhinderd wanneer zijn nep-e-mail de SPF-verificatie niet doorstaat. Source: https://arxiv.org/pdf/2205.01932.pdf
Andere methoden voor e-mailverificatie zijn DomainKeys Identified Mail (DKIM)-handtekeningen en Domain-based Message Authentication, Reporting, and Conformance (DMARC).
Alle drie methoden moeten worden geregistreerd als TXT-records (configuratie-instellingen) bij de domeinregistrar voor het authentieke verzenddomein.
Spam en brand
Spammers vertonen ‘handtekeninggedrag’ in dit opzicht. Hun bedoeling (of, in ieder geval, het neveneffect van hun activiteiten) is om de reputatie van het domein en de IP-adressen te ‘verbranden’ door bulk-e-mail te verzenden totdat ofwel actie wordt ondernomen door de netwerkproviders die deze diensten verkopen; of de bijbehorende IP-adressen worden geregistreerd bij populaire spamfilterlijsten, waardoor ze nutteloos worden voor de huidige verzender (en problematisch voor de toekomstige eigenaren van de IP-adressen).

Een smalle tijdvenster van kansen: de tijd, in uren, voordat een nieuw spamdomein wordt geblokkeerd en nutteloos wordt gemaakt door SpamHaus en verschillende andere monitoringdiensten.
Wanneer de domeinlocatie niet langer praktisch is, verhuizen de spammers naar andere domeinen en diensten als nodig, waarbij ze de procedure herhalen met nieuwe IP-adressen en configuraties.
Gegevens en methoden
De domeinen die in het onderzoek zijn bestudeerd, omvatten de periode tussen mei en augustus 2021, zoals verstrekt door Farsight. Alleen vers geregistreerde domeinen werden overwogen, aangezien dit overeenkomt met de modus operandi van de persistente spammer.
De domeinlijst werd opgebouwd uit gegevens van de ICANN Central Zone Data Service (CZDS). Blacklist-informatie van de SURBL en SpamHaus-projecten werd gebruikt om near real-time identificatie van potentieel problematische nieuwe domeinregistraties te bewerkstelligen – hoewel de auteurs toegeven dat de onvolmaakte aard van spamlijsten ertoe kan leiden dat onschuldige domeinen per ongeluk worden gecategoriseerd als potentiële bronnen van bulk-e-mail.
Nadat DNS-TXT-queries naar de nieuw geregistreerde domeinen in de passieve DNS-feed waren vastgelegd, werden alleen queries met geldige SPF-gegevens behouden, waardoor de grondwaarheid voor de algoritmen werd geboden.

SPF heeft een aantal bruikbare kenmerken; het nieuwe artikel heeft ontdekt dat, terwijl ‘onschuldige’ domeineigenaren meestal de +include-mechanisme gebruiken, spammers het hoogste gebruik hebben van de (inmiddels verouderde) +ptr-functie.

SPF-regelgebruik van spammers, in vergelijking met standaardgebruik.
Een +ptr-lookup vergelijkt het IP-adres van de verzendende e-mail met de records die bestaan voor een associatie tussen dat IP-adres en de hostname (d.w.z. GoDaddy ). Als de hostname wordt ontdekt, wordt het domein ervan vergeleken met het domein dat eerst werd gebruikt om naar het SPF-record te verwijzen.
Spammers kunnen de schijnbare strengheid van +ptr uitbuiten om zichzelf in een meer geloofwaardig licht te presenteren, terwijl in feite de middelen die nodig zijn om op grote schaal +ptr-lookups uit te voeren, veel providers ertoe brengen om de controle geheel over te slaan.
Kortom, de manier waarop spammers SPF gebruiken om een venster van kansen te creëren voordat de ‘blast and burn’-operatie begint, vertegenwoordigt een kenmerkende handtekening die kan worden afgeleid door machine-analyse.

Kenmerkende SPF-relaties voor spamdomeinen.
Aangezien spammers vaak naar zeer nabijgelegen IP-bereiken en middelen verhuizen, ontwikkelden de onderzoekers een relatiegrafiek om de correlatie tussen IP-bereiken en domeinen te onderzoeken. De grafiek kan bijna in real-time worden bijgewerkt in reactie op nieuwe gegevens van SpamHaus en andere bronnen, waardoor deze meer bruikbaar en compleet wordt in de loop van de tijd.
De onderzoekers zeggen:
‘De studie van deze structuren kan potentieel spamdomeinen aan het licht brengen. In onze dataset vonden we [structuren] waarin tientallen domeinen dezelfde [SPF]-regel gebruikten en de meerderheid ervan verscheen op spamblacklists. Het is dus redelijk om aan te nemen dat de resterende domeinen waarschijnlijk nog niet zijn gedetecteerd of nog niet actief zijn als spamdomeinen.’
Resultaten
De onderzoekers vergeleken de spamdomein-detectielatentie van hun benadering met die van SpamHaus en SURBL over een periode van 50 uur. Zij melden dat voor 70% van de spamdomeinen die werden geïdentificeerd, hun eigen systeem sneller was, hoewel zij toegeven dat 26% van de geïdentificeerde spamdomeinen in de komende uur in de commerciële blacklists verschenen. 30% van de domeinen stonden al in een blacklist toen ze in de passieve DNS-feed verschenen.
De auteurs claimen een F1-score van 79% tegenover de grondwaarheid op basis van één DNS-query, terwijl concurrerende methoden zoals Exposure een week van voorafgaande analyse kunnen vereisen.
Zij observeren:
‘Ons schema kan worden toegepast in de vroege stadia van de levenscyclus van een domein: met passieve (of actieve) DNS kunnen we SPF-regels voor nieuw geregistreerde domeinen verkrijgen en deze onmiddellijk classificeren, of wachten totdat we TXT-queries naar dat domein detecteren en de classificatie verfijnen met behulp van tijdelijke kenmerken die moeilijk te vermijden zijn.’
En vervolgen:
‘[Ons] beste classificator detecteert 85% van de spamdomeinen, terwijl het een valse positieve rate van minder dan 1% behoudt. De detectieresultaten zijn opmerkelijk, gezien het feit dat de classificatie alleen de inhoud van de domein SPF-regels en hun relaties gebruikt, evenals moeilijk te vermijden kenmerken op basis van DNS-verkeer.
‘De prestaties van de classificators blijven hoog, zelfs als ze alleen de statische kenmerken krijgen die kunnen worden verzameld uit een enkele TXT-query (passief of actief aangevraagd).’
Om een presentatie over de nieuwe methode te zien, kunt u de ingesloten video hieronder bekijken:
Origineel gepubliceerd op 5 mei 2022.












