Andersonův úhel
Předvídání nových spamových domén pomocí strojového učení

Výzkumníci z Francie vyvinuli metodu pro identifikaci nově registrovaných domén, které jsou pravděpodobně použity ve stylu “hit and run” vysokovýkonnými e-mailovými spamery – někdy dokonce předtím, než spammer poslal jeden nežádoucí e-mail.
Technika je založena na analýze způsobu, jakým je nastaven Sender Policy Framework (SPF), metoda ověřování původu e-mailu, na nově registrovaných doménách.
Díky použití pasivních DNS (Domain Name System) senzorů byli výzkumníci schopni získat téměř reálná data DNS z seattleské společnosti Farsight, což poskytlo SPF aktivitu pro TXT záznamy pro řadu domén.
Použitím algoritmu class weight původně navrženého pro zpracování nesouměrných lékařských dat a implementovaného v scikit-learn strojovém učení Python knihovně, byli výzkumníci schopni detekovat tři čtvrtiny čekajících spamových domén během několika okamžiků, nebo dokonce před jejich operací.
Článek uvádí:
‘S jednou žádostí o TXT záznam detekujeme 75% spamových domén, možná dokonce před začátkem spamové kampaně. Naše schéma přináší důležitou rychlost reakce: můžeme detekovat spamery s dobrým výkonem, dokonce předtím, než je odeslán jakýkoli e-mail a předtím, než dojde ke skoku v DNS provozu.’
Výzkumníci tvrdí, že funkce použité v jejich technice by mohly být přidány do stávajících systémů detekce spamu, aby se zvýšila jejich výkonnost, a to bez přidání významného výpočetního zatížení, protože systém se spoléhá na SPF data pasivně odvozená z téměř reálných DNS toků, které jsou již používány pro různé přístupy k problému.
Článek článku je nazvaný Brzká detekce spamových domén s pasivním DNS a SPF a pochází od tří výzkumníků z Univerzity v Grenoblu.
SPF Aktivita
SPF je navržen tak, aby zamezil padělání e-mailových adres, ověřením, zda registrovaná a autorizovaná IP adresa byla použita k odeslání e-mailu.

V tomto příkladu SPF ‘Alice’ pošle neškodný e-mail ‘Bobovi’, zatímco útočník ‘Mallory’ se pokusí napodobit Alici. Oba odesílají poštu ze svých vlastních domén, ale pouze server Aliciny je registrován k odesílání Aliciny pošty, takže Malloryho padělek je zmařen, když jeho falešná pošta selže SPF ověření. Zdroj: https://arxiv.org/pdf/2205.01932.pdf
Další metody ověřování e-mailů zahrnují DomainKeys Identified Mail (DKIM) podpisy a Domain-based Message Authentication, Reporting, and Conformance (DMARC).
Všechny tři metody musí být registrovány jako TXT záznamy (konfigurační nastavení) u registrátora domény pro autentickou odesílací doménu.
Spam a Burn
Spammeři vykazují ‘signaturní chování’ v tomto ohledu. Jejich záměr (nebo alespoň vedlejší efekt jejich aktivit) je ‘spálit’ reputaci domény a jejích IP adres odesíláním hromadné pošty, dokud není přijata opatření poskytovateli sítě, nebo dokud nejsou přidružené IP adresy registrovány u populárních seznamů spamu, což je činí nepoužitelnými pro současného odesílatele (a problematickými pro budoucí majitele IP adres).

Úzké okno příležitosti: čas v hodinách, předtím, než je nová spamová doména zablokována a učiněna nepoužitelnou službami SpamHaus a dalšími monitoringovými službami.
Když je umístění domény již není praktické, spammeři se přesouvají na jiné domény a služby podle potřeby, opakují postup s novými IP adresami a konfiguracemi.
Data a Metody
Pro výzkum byly studovány domény v období mezi květnem a srpnem 2021, poskytnuté Farsightem. Byly zvažovány pouze čerstvě registrované domény, protože to odpovídá modus operandi persistentního spammera.
Seznam domén byl vytvořen na základě dat z ICANN Central Zone Data Service (CZDS). Informace o blacklistech ze SURBL a SpamHaus projektů byly použity k efektivnímu určení potenciálně problematických nových registrací domén – ačkoli autoři připouštějí, že nedokonalá povaha seznamů spamu může vést k tomu, že benigní domény jsou náhodně kategorizovány jako potenciální zdroje hromadné pošty.
Po zachycení DNS TXT dotazů na nově registrované domény nalezené v pasivním DNS toku byly uchovány pouze dotazy s platnými SPF daty, což poskytovalo základ pro algoritmy.

SPF má řadu využitelných funkcí; nový článek zjistil, že zatímco ‘benigní’ vlastníci domén nejčastěji používají +include mechanismus, spammeři mají nejvyšší využití (nyní zastaralé) +ptr funkce.

SPF pravidla využití spammerů ve srovnání se standardním využitím.
+ptr vyhledávání porovnává IP adresu odesílatele s existujícími záznamy pro asociaci mezi touto IP a hostitelem (tj. GoDaddy ). Pokud je hostitel nalezen, jeho doména je porovnávána s tou, která byla použita jako reference pro SPF záznam.
Spammeři mohou využít zdánlivou přísnost +ptr, aby se představili v lebih důvěryhodném světle, zatímco ve skutečnosti prostředky potřebné k provedení rozsáhlých +ptr vyhledávání způsobují, že mnoho poskytovatelů úplně vynechá kontrolu.
Stručně řečeno, způsob, jakým spammeři používají SPF, aby získali okno příležitosti před tím, než ‘blast a burn’ operace začne, představuje charakteristický podpis, který lze odvodit pomocí strojové analýzy.

Charakteristické SPF vztahy pro spamové domény.
Pokud spammeři často přecházejí na blízké IP rozsahy a zdroje, výzkumníci vyvinuli graf vztahů, aby prozkoumali korelaci mezi IP rozsahy a doménami. Graf lze aktualizovat téměř v reálném čase v reakci na nová data ze SpamHaus a dalších zdrojů, čímž se stává užitečnější a kompletnější v průběhu času.
Výzkumníci uvádějí:
‘Studium těchto struktur může poukázat na potenciální spamové domény. V našem datasetu jsme našli [struktury], ve kterých desítky domén používaly stejné [SPF] pravidlo a většina z nich se objevila na seznamech spamu. Je tedy rozumné předpokládat, že zbývající domény jsou pravděpodobně dosud nerozpoznané nebo nejsou dosud aktivní spamové domény.’
Výsledky
Výzkumníci porovnali latenci detekce spamových domén ve svém přístupu se službami SpamHaus a SURBL po dobu 50 hodin. Zjistili, že pro 70% identifikovaných spamových domén byl jejich systém rychlejší, ačkoli uznali, že 26% identifikovaných spamových domén se objevilo v komerčních seznamech během následující hodiny. 30% domén již bylo v blacklistu, když se objevily v pasivním DNS toku.
Autoři prohlašují F1 skóre 79% proti ground truth založenému na jediném DNS dotazu, zatímco konkurenční metody, jako je Exposure, mohou vyžadovat týden předběžné analýzy.
Zaznamenávají:
‘Naše schéma lze aplikovat v raných fázích životního cyklu domény: pomocí pasivního (nebo aktivního) DNS můžeme získat SPF pravidla pro nově registrované domény a klasifikovat je okamžitě, nebo počkat, až detekujeme TXT dotazy na tuto doménu a upřesnit klasifikaci pomocí obtížně uniknutelných temporálních funkcí.’
A pokračují:
‘[Naše] nejlepší klasifikátor detekuje 85% spamových domén, zatímco udržuje falešnou pozitivní míru pod 1%. Výsledky detekce jsou pozoruhodné, pokud vezmeme v úvahu, že klasifikace používá pouze obsah doménových SPF pravidel a jejich vztahů a obtížně uniknutelné funkce založené na DNS provozu.
‘Výkon klasifikátorů zůstává vysoký, i když jsou jim poskytnuty pouze statické funkce, které lze získat z jediného TXT dotazu (pozorovaného pasivně nebo aktivně dotazovaného).’
Abyste si mohli prohlédnout prezentaci o nové metodě, podívejte se na vložené video níže:
Poprvé zveřejněno 5. května 2022.












