Andersonin kulma

Uuden roskapostidomainien ennustaminen koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ranskalaiset tutkijat ovat kehittäneet menetelmän, jolla voidaan tunnistaa vasta rekisteröityjä verkkotunnuksia, joita voidaan käyttää “hit and run” -tyyppisessä roskapostittamisessa – joskus jopa ennen kuin roskapostittaja on lähettänyt yhtään ei-toivottua sähköpostia.

Menetelmä perustuu lähettäjän todennusmenetelmän (Sender Policy Framework, SPF) analyysiin, joka on tapa varmentaa sähköpostin alkuperä.

Kiitos passiivisten DNS-sensoreiden (Domain Name System) avulla, tutkijat pystyivät hankkimaan lähes reaaliaikaisia DNS-tietoja Seattlesta olevasta Farsight-yhtiöstä, mikä antoi heille SPF-aktiivisuuden TXT-tunnuksille laajalle verkkotunnuksille.

Käyttämällä luokan painoalgoritmiä, joka on alun perin suunniteltu epätasapainoisen lääketieteellisen datan käsittelyyn ja toteutettu scikit-learn-koneoppimiskirjastossa, tutkijat pystyivät havaitsemaan kolme neljäsosaa odottavista roskapostitunnuksista hetkessä, tai jopa ennen niiden toimintaa.

Tutkimusraportissa todetaan:

‘Yhdellä TXT-tunnuksen pyynnöllä havaitsemme 75 % roskapostitunnuksista, mahdollisesti ennen roskapostikampanjan alkua. Näin ollen, meidän järjestelmämme tuo tärkeää nopeutta: voimme havaita roskapostittajat hyvällä suorituskyvyllä, ennen kuin mitään sähköpostia on lähetetty ja ennen kuin DNS-liikenne kasvaa.’

Tutkijat väittävät, että heidän menetelmänsä ominaisuudet voidaan lisätä olemassa oleviin roskapostin havaitsemisjärjestelmiin parantamaan suorituskykyä, ilman merkittävää laskentatehon kasvua, koska järjestelmä perustuu passiivisesti johdettuihin SPF-tietoihin, jotka voidaan hankkia lähes reaaliaikaisista DNS-syötteistä, joita käytetään jo muissa lähestymistavoissa.

Tutkimusraportti on nimeltään Roskapostitunnuksien varhainen havaitseminen passiivisen DNS:n ja SPF:n avulla ja se on tehty kolmen Grenoblen yliopiston tutkijan toimesta.

SPF-aktiivisuus

SPF on suunniteltu välttämään sähköpostiosoitteiden väärentämistä, varmentamalla, että rekisteröity ja valtuutettu IP-osoite on käytetty sähköpostin lähettämiseen.

Tässä esimerkissä 'Alice' lähettää sähköpostin 'Bobille', kun taas hyökkääjä 'Mallory' yrittää esiintyä Alicena. Molemmat lähettävät sähköpostia omista verkkotunnuksistaan, mutta ainoastaan Alicen palvelin on rekisteröity lähettämään Alicen sähköpostia, joten Malloryn väärennös estyy, kun hänen väärä sähköpostinsa epäonnistuu SPF-varmentamisessa.

Tässä esimerkissä ‘Alice’ lähettää sähköpostin ‘Bobille’, kun taas hyökkääjä ‘Mallory’ yrittää esiintyä Alicena. Molemmat lähettävät sähköpostia omista verkkotunnuksistaan, mutta ainoastaan Alicen palvelin on rekisteröity lähettämään Alicen sähköpostia, joten Malloryn väärennös estyy, kun hänen väärä sähköpostinsa epäonnistuu SPF-varmentamisessa. Lähde: https://arxiv.org/pdf/2205.01932.pdf

Muita sähköpostin varmentamisen menetelmiä ovat DomainKeys Identified Mail (DKIM) -allekirjoitukset ja Domain-pohjainen viestien todennus, raportointi ja vaatimukset (DMARC).

Kaikki nämä menetelmät on rekisteröitävä TXT-tunnuksina (konfiguraatio-asetukset) verkkotunnuksen rekisteröintipalvelussa.

Roskaposti ja poltto

Roskapostittajat näyttävät “signatuuri-käyttäytymistä” tässä suhteessa. Heidän aikomuksensa (tai ainakin heidän toimintansa seuraus) on “polttaa” verkkotunnuksen ja sen IP-osoitteen maine lähettämällä massapostia, kunnes joko verkko-palveluntarjoajat, jotka myyvät näitä palveluita, ryhtyvät toimiin tai liittyvät IP-osoitteet rekisteröidään suosittuihin roskapostin suodattimien luetteloihin, mikä tekee niistä käyttökelvottomia nykyisille lähettäjille ja ongelmallisia tuleville omistajille.

Kapea aikapara: aika, joka kuluu uuden roskapostitunnuksen kieltoon ja käyttökelvottomaksi tekemiseen SpamHausin ja muiden valvontapalvelujen toimesta.

Kapea aikapara: aika, joka kuluu uuden roskapostitunnuksen kieltoon ja käyttökelvottomaksi tekemiseen SpamHausin ja muiden valvontapalvelujen toimesta.

Kun verkkotunnuksen sijainti ei ole enää käytännöllinen, roskapostittajat siirtyvät toisiin verkkotunnuksiin ja palveluihin tarpeen mukaan, toistamalla menettelyä uusilla IP-osoitteilla ja konfiguraatioilla.

Data ja menetelmät

Tutkimuksessa käytetyt verkkotunnukset kattavat ajanjakson toukokuusta elokuuhun 2021, jonka Farsight tarjosi. Vain vasta rekisteröityjä verkkotunnuksia otettiin huomioon, koska tämä vastaa jatkuvan roskapostittajan toimintatapaa.

Verkkotunnusluettelo rakennettiin ICANN Central Zone Data Servicen (CZDS) datan pohjalta. Musta lista -tietoa SURBL- ja SpamHaus -projekteista käytettiin lähes reaaliaikaisen mahdollisesti ongelmallisten uusien verkkotunnusrekisteröintien tunnistamiseen – vaikka tekijät myöntävät, että epätäydellisten roskapostilistojen luonne voi johtaa siihen, että hyvät verkkotunnukset luokitellaan virheellisesti mahdollisiksi roskapostilähteiksi.

Verkkotunnuksiin kohdistuvien DNS-TXT-kyselyjen tallentamisen jälkeen ainoastaan kyselyt, joissa oli voimassa olevat SPF-tiedot, säilytettiin, mikä antoi pohjan algoritmeille.

SPF:llä on useita käytettävissä olevia ominaisuuksia; uusi tutkimus on osoittanut, että kun “hyvät” verkkotunnuksen omistajat käyttävät yleisimmin +include -mekanismia, roskapostittajat käyttävät eniten (nykyisin vanhentunutta) +ptr-ominaisuutta.

Roskapostittajien SPF-sääntöjen käyttö standardikäyttöön verrattuna.

Roskapostittajien SPF-sääntöjen käyttö standardikäyttöön verrattuna.

+ptr-haku vertaa lähettävän sähköpostin IP-osoitetta mihin tahansa olemassa oleviin tietoihin, jotka liittävät kyseisen IP-osoitteen isäntänimeen (esim. GoDaddy ). Jos isäntänimi löytyy, sen verkkotunnus verrataan siihen, jota käytettiin alun perin SPF-merkin viittaamiseen.

Roskapostittajat voivat hyödyntää +ptr:n näennäistä tiukkuutta esittääkseen itsensä uskottavammin, vaikka kyseessä onkin vain heidän toimintansa sivutuote, kun taas resurssien tarve suorittaa laajamittaiset +ptr-haut tekee monille tarjoajille vaikeaksi suorittaa tarkastus kokonaan.

Lyhykäisyydessään roskapostittajien SPF:n käyttö edustaa ominaismerkkiä, jota voidaan päätellä koneellisella analyysillä.

Roskapostitunnuksille ominaiset SPF-suhteet.

Roskapostitunnuksille ominaiset SPF-suhteet.

Koska roskapostittajat usein siirtyvät hyvin lähelle IP-osoitealueita ja resursseja, tutkijat kehittivät suhdekaavion tutkimaan IP-alueiden ja verkkotunnusten välistä korrelaatiota. Kaavio voidaan päivittää lähes reaaliajassa uusien tietojen perusteella SpamHausista ja muista lähteistä, mikä tekee siitä yhä käyttökelpoisemman ja täydellisemmän ajan kuluessa.

Tutkijat toteavat:

‘Näiden rakenteiden tutkiminen voi korostaa mahdollisia roskapostitunnuksia. Meidän aineistossamme löysimme [rakenteita], joissa kymmenet verkkotunnukset käyttivät samaa [SPF-]sääntöä ja useimmat niistä olivat mustalla listalla. On siis järkevää olettaa, että loput verkkotunnukset ovat todennäköisesti vielä havaitsemattomia tai eivät ole vielä aktiivisia roskapostitunnuksia.’

Tulokset

Tutkijat vertasivat oman lähestymistapansa roskapostitunnuksien havaitsemisviiveä SpamHausiin ja SURBL:ään 50 tunnin ajanjaksolla. He ilmoittavat, että 70 %:ssa roskapostitunnuksista heidän järjestelmänsä oli nopeampi, vaikka myönsivät, että 26 %:ssa tunnetuista roskapostitunnuksista nämä ilmestyivät kaupallisille mustille listoille seuraavan tunnin kuluessa. 30 %:ssa verkkotunnuksista oli jo mustalla listalla, kun ne ilmestyivät passiiviseen DNS-syötteeseen.

Tekijät väittävät F1-pistemääräksi 79 %:n pohjautuen yksittäiseen DNS-kyselyyn, kun taas kilpailevat menetelmät, kuten Exposure, vaativat viikon esitutkimusta.

He huomauttavat:

‘Meidän järjestelmämme voidaan soveltaa verkkotunnuksen elinkaaren varhaisissa vaiheissa: käyttämällä passiivista (tai aktiivista) DNS:ää, voimme hankkia SPF-säännöt uusille verkkotunnuksille ja luokitella ne välittömästi, tai odottaa, kunnes havaitsemme TXT-kyselyjä kyseiseen verkkotunnukseen ja tarkistaa luokittelun käyttämällä vaikeasti vältettävissä olevia aikasarja-ominaisuuksia.’

Ja jatkavat:

‘Paras luokittelijamme havaitsee 85 %:n roskapostitunnuksista, pitäen virheellisen positiivisen osuuden alle 1 %:n. Tulokset ovat merkittäviä, koska luokittelu perustuu ainoastaan verkkotunnuksen SPF-sääntöjen sisältöön ja niiden suhteisiin sekä vaikeasti vältettävissä oleviin DNS-liikenteen ominaisuuksiin.

‘Luokittelijoiden suorituskyky säilyy korkeana, vaikka ne saavat vain statiset ominaisuudet, jotka voidaan kerätä yhdestä TXT-kyselystä (joko passiivisesti tai aktiivisesti kyseltynä).’

Katso uuden menetelmän esittely videolta alla:

Julkaistu ensimmäisen kerran 5. toukokuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai