Η γωνία του Anderson
Μαχόμενοι με το Adblock με τη βοήθεια της Μηχανικής Μάθησης

Μια νέα ερευνητική πρωτοβουλία από τις Ηνωμένες Πολιτείες και το Πακιστάν έχει αναπτύξει μια μεθοδολογία βασισμένη στη μηχανική μάθηση για την αναγνώριση των ιστοσελίδων που είναι ανθεκτικές στα adblocker και άλλες τεχνολογίες που προστατεύουν την ιδιωτικότητα, καθώς και για την ανάλυση των τεχνικών που χρησιμοποιούν αυτές οι ιστοσελίδες για να «μιγνύουν» τις προελεύσεις των διαφημίσεων και του πραγματικού περιεχομένου, έτσι ώστε το περιεχόμενο να μην είναι ορατό αν οι διαφημίσεις μπλοκαριστούν.
Νέα τεχνολογία adblocking που αναπτύχθηκε από τα ευρήματα θα μπορούσε να τερματίσει τα περιστατικά όπου το κεντρικό περιεχόμενο ενός άρθρου δεν είναι ορατό όταν οι διαφημίσεις μπλοκαριστούν, παρέχοντας một αυτοματοποιημένη μέθοδο για τη διάκριση των πόρων διαφημίσεων και script, αντί της χειροκίνητης προσέγγισης που χρησιμοποιείται目前 από τα δημοφιλή adblocking frameworks.
Οι συγγραφείς διεξήγαγαν μια μεγάλη μελέτη των «μιγνυμένων» πόρων σε 100.000 ιστοσελίδες, βρίσκοντας ότι το 17% των domain, το 48% των host-names, το 6% των script και το 9% των μεθόδων παράδοσης περιεχομένου με πρόθεση «μιγνύουν» τη λειτουργικότητα παρακολούθησης (δηλαδή διαφήμιση) με τις διαδικασίες που παραδίδουν πραγματικό περιεχόμενο. Σε τέτοιες περιπτώσεις, το περιεχόμενο του άρθρου θα εξαφανιστεί για τους χρήστες που χρησιμοποιούν adblocking ή anti-tracking λογισμικό,迫使 τους χρήστες να απενεργοποιήσουν αυτά τα μέτρα για να δουν το περιεχόμενο.
Στις περισσότερες περιπτώσεις, αυτό δεν σημαίνει μόνο ότι οι διαφημίσεις θα είναι ορατές ξανά, αλλά και ότι οι χρήστες θα αναγκαστούν να επιστρέψουν στα συστήματα παρακολούθησης διαμέσου domain που έχουν προκαλέσει την οργή των ακτιβιστών της ιδιωτικότητας τα τελευταία χρόνια.
Η νέα έρευνα προσφέρει ένα σύστημα που είναι σε θέση να διακρίνει τους компоненты αυτών των «μιγνυμένων» πόρων ιστού με ακρίβεια 98%, δίνοντας τη δυνατότητα στα adblocking και anti-tracking λύσεις να ξεμπλέξουν τις ροές σε μεταγενέστερες εκδόσεις του λογισμικού τους και να επαναενεργοποιήσουν την πρόσβαση στο περιεχόμενο στις σελίδες που έχουν μπλοκαριστεί.
Το νέο έγγραφο έχει τον τίτλο TrackerSift: Untangling Mixed Tracking and Functional Web Resources, και προέρχεται από ερευνητές στο Virginia Tech και UoC Davis στις Ηνωμένες Πολιτείες, και FAST NUCES και το Lahore University of Management Sciences (LUMS) στο Πακιστάν.
Οι Πόλεμοι του Adblock
Τα συστήματα adblocking βασίζονται γενικά στην ανάγκη για διαφημιστικό περιεχόμενο σε μια σελίδα ιστού να προέρχεται από συγκεκριμένα, αφιερωμένα domain – γενικά adtech πλατφόρμες με ονόματα domain και/ή διευθύνσεις IP που μπορούν να ταξινομηθούν ως «τρίτα μέρη διαφήμισης», επιτρέποντας την ανάπτυξη λιστών μπλοκαρίσματος που δεν θα εμφανίσουν περιεχόμενο από αυτές τις προελεύσεις μέσα σε μια σελίδα ιστού.
Επιπλέον, τα ονόματα των πόρων που σχετίζονται με διαφημίσεις, όπως script, μπορούν να προστεθούν στις λίστες μπλοκαρίσματος, έτσι ώστε αυτά να μην εκτελεστούν ακόμη και σε περιπτώσεις όπου οι προελεύσεις τους έχουν σκοπίμως θολυνθεί. Τα σχήματα ονομάτων των συστηματικά παραγόμενων script είναι συχνά συνεπή, επιτρέποντας την αναγνώριση και το μπλοκάρισμα.
Καθώς μια διαφήμιση σε μια σελίδα ιστού επιλέγεται συχνά στα τελευταία χιλιάδες του δευτερολέπτου πριν από το φόρτωμα της σελίδας μέσω δυναμικών διαδικασιών πλειστηριασμού (βασισμένων σε λέξεις-κλειδιά που βρέθηκαν στη σελίδα, μετρικά στόχων εκστρατείας και πολλά άλλα στοιχεία), δεν είναι πρακτικό να αποθηκεύονται διαφημίσεις στο domain του ιστότοπου, το οποίο θα εμπόδιζε τα adblocker από το να κρύψουν το εμπορικό περιεχόμενο.
Ολοένα και περισσότερες ιστοσελίδες αντιστέκονται στα adblocking μέσω CNAME Cloaking – τη χρήση υποδομών του «αυθεντικού» domain ως μεσάζοντες σε διακομιστές διαφημίσεων (δηλαδή, το content.example.com θα εξυπηρετεί διαφημίσεις στο example.com, ακόμη και αν η υποโดμή δεν έχει κανένα άλλο σκοπό παρά να εξυπηρετεί διαφημίσεις, και δεν διατηρείται από τον ιστότοπο, αλλά από τους διαφημιζόμενους).
Ωστόσο, αυτή η μέθοδος μπορεί να ποσοτικοποιηθεί και να μπλοκαριστεί με τη διάκριση του περιεχομένου της υποδομής ως διαφήμισης, ή με τη χρήση τεχνικών ανάλυσης δικτύου για την αναγνώριση της ανωμαλής και ακανόνιστης σχέσης της υποδομής με το πυρήνα domain.
TrackerSift
Το έγγραφο των συγγραφέων προτείνει το TrackerSift, μια πλατφόρμα για την ανάλυση των πόρων δικτύου που ανακτώνται από ιστοσελίδες, και στη συνέχεια να ανακατηγοριοποιήσει τους μιγνυμένους πόρους σε «περιεχόμενο» και «διαφήμιση». Στο γενικότερο επίπεδο ανάλυσης, το TrackerSift καταγράφει βασικές αιτήσεις δικτύου για πόρους, όπως διαφημιστικό περιεχόμενο που ανακτάται από ένα Δίκτυο Παραδόσης Περιεχομένου (CDN) ή μια πλατφόρμα διαφήμισης, αλλά στη συνέχεια διεισδύει στο περιεχόμενο των ανακτηθέντων πόρων, πραγματοποιώντας ανάλυση σε επίπεδο κώδικα και διακρίνοντας τις λειτουργίες των διαφόρων τύπων κλήσεων και διαδικασιών.

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf
Δεδομένα
Για να ληφθούν τα δεδομένα που τροφοδοτούν το TrackerSift, οι συγγραφείς διέρρευσαν 100.000 τυχαία επιλεγμένες ιστοσελίδες από τη λίστα Tranco top-million του 2018. Selenium αυτοματοποίηση προγράμματος περιήγησης χρησιμοποιήθηκε μαζί με το Google Chrome για την εκτέλεση της εργασίας.
Το δίκτυο web-crawling βασίστηκε σε ιστοσελίδες πανεπιστημίων στη Βόρεια Αμερική, αποτελούμενο από ένα cluster 13 κόμβων με 112 πυρήνες, 52 terabytes αποθήκευσης και 823 gigabytes λειτουργικής μνήμης σε ολόκληρο το σύστημα.
Κάθε κόμβος ήταν βασισμένος σε ένα container Docker και αφιερωμένος στο crawling ενός υποσυνόλου των 100.000 σελίδων ιστού που επιλέχθηκαν, με προγραμματισμένες παύσεις για βιωσιμότητα, και πλήρη διαγραφή όλων των cookies και αναγνωριστικών όταν φορτώνεται μια νέα domaine, για να διασφαλιστεί ότι οι προηγούμενες συνεδρίες και καταστάσεις δεν επηρέαζαν την αναγνωσιμότητα της επόμενης domaine.
Μιγνυμένα Script
Τα αποτελέσματα δείχνουν εκτεταμένη χρήση script bundling, όπου πλατφόρμες διαφημίσεων και οικοδεσπότες περιεχομένου σκοπίμως συνδυάζουν script που βασίζονται σε περιεχόμενο και script που βασίζονται σε διαφήμιση σε «uberscript» που θα εμποδίσουν την εμφάνιση του περιεχομένου αν μπλοκαριστούν. Για παράδειγμα, οι συγγραφείς σημειώνουν ότι το pressl.co εξυπηρετεί ένα web script που συνδυάζεται μέσω της WebPack πλατφόρμας συνδυασμού JavaScript, το οποίο περιέχει ένα pixel παρακολούθησης του Facebook, και επίσης κώδικα που επιτρέπει την εμφάνιση πραγματικού περιεχομένου.
Επιπλέον, το έγγραφο σημειώνει ότι ένας αριθμός domain είναι πρόθυμος να ενσωματώσει script απευθείας στον κώδικα των σελίδων ιστού, καθιστώντας αναγκαίο για τα adblocking frameworks να αντιμετωπίσουν τη λειτουργικότητα μέσα στα script, αντί να αποτρέψουν απλώς το script από το να φορτωθεί με βάση την τρίτη πηγή URL.
Με τη τοπικοποίηση αυτών των μεθόδων, ο δρόμος είναι σαφής για τη συστηματική διάσπαση του κώδικα σε κατηγορίες περιεχομένου και διαφήμισης, και τη potεντική επαναφορά της εμφάνισης του περιεχομένου σε περιβάλλοντα που έχουν μπλοκαριστεί.
Αν και τα υπάρχοντα adblocking λύσεις, όπως το NoScript, AdGuard, uBlock Origin και Firefox Smartblock, χρησιμοποιούν surrogate script που αποσυναρμολογούν τέτοιους συνδυασμούς script σε μπλοκαριστά component script, αυτά εξαρτώνται από χειροκίνητη αναγραφή script, οδηγώντας σε einen συνεχιζόμενο ψυχρό πόλεμο μεταξύ των μπλοκαρίσματος και των συνεχώς μεταβαλλόμενων τεχνικών που τα σπάει. Αντίθετα, το TrackerSift προσφέρει μια potεντική προγραμματική μέθοδο για την αποσύνθεση μιγνυμένου περιεχομένου.












