Η γωνία του Anderson
Προβλέποντας Νέα Σπαμ Domains Μέσω Μηχανικής Μάθησης

Ερευνητές από τη Γαλλία έχουν αναπτύξει μια μέθοδο για την αναγνώριση νεοεγγεγραμμένων domain που είναι πιθανό να χρησιμοποιηθούν σε μια ‘χτύπημα και τρέχω’ μόδα από υψηλής όγκου email spammers – μερικές φορές, ακόμη και πριν οι spammers έχουν στείλει ένα ανεπιθύμητο email.
Η τεχνική βασίζεται στην ανάλυση του τρόπου με τον οποίο το Sender Policy Framework (SPF), μια μέθοδος επαλήθευσης email προελεύσεως, έχει ρυθμιστεί σε νεοεγγεγραμμένα domain.
Χάρη στην χρήση παθητικών DNS (Domain Name System) αισθητήρων, οι ερευνητές ήταν σε θέση να λάβουν σχεδόν σε πραγματικό χρόνο DNS δεδομένα από την εταιρεία Farsight με έδρα το Σιάτλ, παρέχοντας SPF δραστηριότητα για TXT εγγραφές για eine σειρά από domain.
Χρησιμοποιώντας einen αλγόριθμο βαρύτητας κλάσης που αρχικά σχεδιάστηκε για την επεξεργασία ασύμμετρων ιατρικών δεδομένων και εφαρμόστηκε στη βιβλιοθήκη μηχανικής μάθησης Python scikit-learn, οι ερευνητές ήταν σε θέση να ανιχνεύσουν τα τρία τέταρτα των επικείμενων σπαμ domain μέσα σε λίγα λεπτά, ή ακόμη και πριν από την έναρξη της λειτουργίας τους.
Το έγγραφο αναφέρει:
‘Με μια seule αίτηση στην TXT εγγραφή, ανιχνεύουμε το 75% των σπαμ domain, πιθανότατα πριν από την έναρξη της σπαμ εκστρατείας. Έτσι, το σχήμα μας φέρνει σημαντική ταχύτητα αντίδρασης: μπορούμε να ανιχνεύουμε σπαμเมριστές με καλή απόδοση ακόμη και πριν από την αποστολή οποιουδήποτε email και πριν από μια αύξηση στη DNS κυκλοφορία.’
Οι ερευνητές ισχυρίζονται ότι τα χαρακτηριστικά που χρησιμοποιούνται στη τεχνική τους θα μπορούσαν να προστεθούν σε υπάρχουσες συστήματα ανίχνευσης σπαμ για να αυξήσουν την απόδοση, και χωρίς να προστεθεί σημαντική υπολογιστική υπερβολική φόρτωση,既然 το σύστημα βασίζεται σε SPF δεδομένα πουinfer passively από近 real-time DNS feeds που ήδη χρησιμοποιούνται για διαφορετικές προσεγγίσεις στο πρόβλημα.
Το έγγραφο έχει τον τίτλο Πρόωρη Ανίχνευση Σπαμ Domain με Παθητικά DNS και SPF και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο της Γκρενόμπλ.
SPF Δραστηριότητα
Το SPF σχεδιάστηκε για να αποφευχθεί η πλαστογράφηση των email διευθύνσεων, επαληθεύοντας ότι μια εγγεγραμμένη και εξουσιοδοτημένη IP διεύθυνση έχει χρησιμοποιηθεί για την αποστολή ενός email.

Σε αυτό το παράδειγμα του SPF, η ‘Αlice’ στέλνει ένα αθώο email στον ‘Bob’, ενώ ο επιθέτης ‘Mallory’ προσπαθεί να μιμηθεί την Alice. Και οι δύο στέλνουν email από τα δικά τους domain, αλλά μόνο ο διακομιστής της Alice είναι εγγεγραμμένος για να στείλει email της Alice, οπότε η πλαστογράφηση του Mallory αποτυγχάνει όταν το ψευδές email του αποτυγχάνει την επαλήθευση SPF. Πηγή: https://arxiv.org/pdf/2205.01932.pdf
Άλλες μεθόδους επαλήθευσης email περιλαμβάνουν DomainKeys Identified Mail (DKIM) υπογραφές, και Domain-based Message Authentication, Reporting, and Conformance (DMARC).
Όλες οι τρεις μεθόδους πρέπει να καταχωρηθούν ως TXT εγγραφές (ρυθμίσεις) στον καταχωρητή domain για τον αυθεντικό αποστολέα.
Σπαμ και Καύση
Οι σπαμμέριστές εμφανίζουν ‘σημαδιακή συμπεριφορά’ σε αυτό το σημείο. Η πρόθεσή τους (ή, τουλάχιστον, η παρενέργεια των δραστηριοτήτων τους) είναι να ‘καύσουν’ τη φήμη του domain και των IP διευθύνσεων με την αποστολή bulk email μέχρι να ληφθούν μέτρα από τους παρόχους δικτύου που πωλούν αυτές τις υπηρεσίες ή μέχρι οι συσχετιζόμενες IP διευθύνσεις να καταχωρηθούν σε δημοφιλείς λίστες φίλτρων σπαμ, καθιστώντας τις άχρηστες για τον τρέχοντα αποστολέα (και προβληματικές για τους μελλοντικούς ιδιοκτήτες των IP διευθύνσεων).

Ένας στενός χρόνος ευκαιρίας: ο χρόνος, σε ώρες, πριν από einen νέο σπαμ domain να απαγορευτεί και να γίνει άχρηστος από το SpamHaus και άλλες υπηρεσίες παρακολούθησης.
Όταν η τοποθεσία του domain δεν είναι πλέον πρακτική, οι σπαμμέριστές μετακινούνται σε άλλα domain και υπηρεσίες όπως απαιτείται, επαναλαμβάνοντας τη διαδικασία με νέες IP διευθύνσεις και ρυθμίσεις.
Δεδομένα και Μέθοδοι
Τα domain που μελετήθηκαν για την έρευνα καλύπτουν το χρονικό διάστημα μεταξύ Μαΐου και Αυγούστου του 2021, όπως παρέχονται από την Farsight. Μόνο τα νεοεγγεγραμμένα domain θεωρήθηκαν, поскольку αυτό συμφωνεί με το modus operandi του επιμονής σπαμμέριστα.
Η λίστα των domain κατασκευάστηκε με δεδομένα από την ICANN Central Zone Data Service (CZDS). Πληροφορίες από τις μαύρες λίστες του SURBL και SpamHaus χρησιμοποιήθηκαν για να επιτευχθεί gần πραγματικού χρόνου αναγνώριση πιθανών προβληματικών νέων εγγραφών domain – αν και οι συγγραφείς παραδέχονται ότι η ατελής φύση των λιστών σπαμ μπορεί να οδηγήσει σε αθώα domain να κατηγοριοποιηθούν λανθασμένα ως πιθανές πηγές bulk email.
Μετά την कबίωση των DNS TXT ερωτημάτων στα νεοεγγεγραμμένα domain που βρέθηκαν στη παθητική DNS ροή, μόνο ερωτήματα με έγκυρα SPF δεδομένα διατηρήθηκαν, παρέχοντας την αλήθεια για τους αλγορίθμους.

Το SPF έχει eine σειρά από χρησιμοποιήσιμα χαρακτηριστικά. Το νέο έγγραφο έχει βρει ότι ενώ ‘αθώα’ ιδιοκτήτες domain χρησιμοποιούν συνήθως τη μηχανική +include, οι σπαμμέριστές έχουν την υψηλότερη χρήση της (πλέον απαρχαιωμένης) +ptr λειτουργίας.

Χρήση SPF κανόνων από σπαμμέριστές, σε σύγκριση με την τυπική χρήση.
Μια +ptr αναζήτηση συγκρίνει τη διεύθυνση IP του αποστολέα email με ό,τι εγγραφές υπάρχουν για μια σύνδεση μεταξύ αυτής της διεύθυνσης IP και του ονόματος κεντρικού υπολογιστή (π.χ. GoDaddy ). Αν το όνομα κεντρικού υπολογιστή ανακαλυφθεί, η τοποθεσία του domaine συγκρίνεται με αυτή που χρησιμοποιήθηκε αρχικά για να αναφερθεί στην εγγραφή SPF.
Οι σπαμμέριστές μπορούν να εκμεταλλευτούν την εμφανή αυστηρότητα του +ptr για να παρουσιάσουν τον εαυτό τους με πιο πιστωτική εμφάνιση, όταν στην πραγματικότητα οι πόρους που απαιτούνται για την διεξαγωγή σε κλίμακα +ptr αναζητήσεων προκαλούν πολλούς παρόχους να παραλείψουν εντελώς τον έλεγχο.
Συντομότερα, ο τρόπος με τον οποίο οι σπαμμέριστές χρησιμοποιούν το SPF για να εξασφαλίσουν ένα παράθυρο ευκαιρίας πριν από την ‘εκρήξη και καύση’ λειτουργία, αντιπροσωπεύει ένα χαρακτηριστικό σήμα που μπορεί να συναχθεί από την ανάλυση μηχανής.

Χαρακτηριστικές SPF σχέσεις για σπαμ domain.
Καθώς οι σπαμμέριστές συχνά μετακινούνται σε πολύ κοντινές IP περιοχές και πόρους, οι ερευνητές ανέπτυξαν ένα σχέδιο σχέσεων για να εξερευνήσουν τη συσχέτιση μεταξύ IP περιοχών και domain. Το σχέδιο μπορεί να ενημερωθεί σχεδόν σε πραγματικό χρόνο ως απάντηση σε νέα δεδομένα από το SpamHaus και άλλες πηγές, γίνεται πιο χρήσιμο και ολοκληρωμένο με την πάροδο του χρόνου.
Οι ερευνητές αναφέρουν:
‘Η μελέτη αυτών των δομών μπορεί να υπογραμμίσει πιθανά σπαμ domain. Στο dataset μας, βρήκαμε [δομές] στις οποίες δεκάδες domain χρησιμοποιούν τον ίδιο [SPF] κανόνα και η πλειοψηφία τους εμφανίζονται σε μαύρες λίστες σπαμ. Όπως vậy, είναι εύλογο να υποθέσουμε ότι τα υπόλοιπα domain είναι πιθανό να μην έχουν ακόμη ανιχνευθεί ή δεν είναι ακόμη ενεργά σπαμ domain.’
Αποτελέσματα
Οι ερευνητές σύγκριναν την ανίχνευση σπαμ domain της μεθόδου τους με το SpamHaus και το SURBL κατά τη διάρκεια eines 50ωρου περιόδου. Αναφέρουν ότι για το 70% των σπαμ domain που αναγνωρίστηκαν, το δικό τους σύστημα ήταν ταχύτερο, αν και παραδέχονται ότι το 26% των αναγνωρισμένων σπαμ domain εμφανίστηκε στις εμπορικές μαύρες λίστες την επόμενη ώρα. Το 30% των domain ήταν ήδη σε μια μαύρη λίστα όταν εμφανίστηκαν στη παθητική DNS ροή.
Οι συγγραφείς ισχυρίζονται ένα F1 score 79% έναντι της αλήθειας με βάση μια seule DNS ερώτηση, ενώ ανταγωνιστικές μεθόδους όπως η Exposure μπορεί να απαιτούν μια εβδομάδα προκαταρκτικής ανάλυσης.
Παρατηρούν:
‘Το σχήμα μας μπορεί να εφαρμοστεί σε πρώιμα στάδια του κύκλου ζωής eines domain: χρησιμοποιώντας παθητικά (ή ενεργά) DNS, μπορούμε να λάβουμε SPF κανόνες για νεοεγγεγραμμένα domain και να τα ταξινομήσουμε αμέσως, ή να περιμένουμε μέχρι να ανιχνεύσουμε TXT ερωτήματα σε αυτό το domain και να βελτιώσουμε την ταξινόμηση χρησιμοποιώντας δυσκόλως αποφεύγεται χρονολογικές λειτουργίες.’
Και συνεχίζουν:
‘[Το] καλύτερο ταξινομητή μας ανιχνεύει το 85% των σπαμ domain ενώ διατηρεί ένα ποσοστό ψευδώς θετικών κάτω από 1%. Τα αποτελέσματα ανίχνευσης είναι αξιοσημείωτα δεδομένου ότι η ταξινόμηση χρησιμοποιεί μόνο το περιεχόμενο των SPF κανόνων του domain και τις σχέσεις τους, και δυσκόλως αποφεύγεται χαρακτηριστικά με βάση τη DNS κυκλοφορία.
‘Η απόδοση των ταξινομητών παραμένει υψηλή, ακόμη και όταν τους δίνονται μόνο τα στατικά χαρακτηριστικά που μπορούν να συλλεχθούν από μια seule TXT ερώτηση (παρατηρημένη παθητικά ή ενεργά ερωτηθείσα).’
Για να δείτε μια παρουσίαση για τη νέα μέθοδο, δείτε το ενσωματωμένο βίντεο παρακάτω:
Πρώτη δημοσίευση 5ης Μαΐου 2022.












