Η γωνία του Anderson

Μια Μέθοδος Μηχανικής Μάθησης για το Μπλοκάρισμα Διαφημίσεων Βασισμένη στη Τοπική Συμπεριφορά του Προγράμματος Περιήγησης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στην Ελβετία και τις Ηνωμένες Πολιτείες έχουν αναπτύξει μια νέα προσέγγιση μηχανικής μάθησης για την ανίχνευση υλικού διαφήμισης σε ιστοσελίδες, βασισμένη στον τρόπο με τον οποίο αυτό το υλικό αλληλεπιδρά με το πρόγραμμα περιήγησης, αντί να αναλύουν το περιεχόμενό του ή τη συμπεριφορά του δικτύου – δύο προσεγγίσεις που έχουν αποδειχθεί αναποτελεσματικές μακροπρόθεσμα αντιμετωπίζοντας την CNAME cloaking (βλέπε παρακάτω).

Η ονομαζόμενη WebGraph πλατφόρμα χρησιμοποιεί μια γραφική-βασισμένη προσέγγιση AI για το μπλοκάρισμα διαφημίσεων για την ανίχνευση προωθητικού περιεχομένου, εστιάζοντας σε δραστηριότητες δικτύου διαφήμισης – συμπεριλαμβανομένων των προσπαθειών τηλεμετρίας και της τοπικής αποθήκευσης του προγράμματος περιήγησης – που η seule αποτελεσματική τεχνική αποφυγής θα ήταν να μην διεξάγονται αυτές οι δραστηριότητες.

Αν και προηγούμενες προσεγγίσεις έχουν επιτύχει ελαφρώς υψηλότερους ρυθμούς ανίχνευσης από τη WebGraph, όλες είναι ευάλωτες σε τεχνικές αποφυγής, ενώ η WebGraph μπορεί να φτάσει στο 100% ακεραιότητα αντιμετωπίζοντας ανταγωνιστικές απαντήσεις, συμπεριλαμβανομένων και πιο σύνθετων υποθετικών απαντήσεων που μπορεί να εμφανιστούν αντιμετωπίζοντας αυτή τη νέα μέθοδο μπλοκάρισμα διαφημίσεων.

Η εργασία αυτή είναι μια εξέλιξη μιας έρευνας του 2020 με το πρόγραμμα περιήγησης Brave που ονομάζεται AdGraph, η οποία είχε δύο από τους ερευνητές της νέας εργασίας.

Σύγκριση AdGraph vs. WebGraph, με στιγμιότυπα που αντιπροσωπεύουν αρχιτεκτονικές καινοτομίες στην προηγούμενη προσέγγιση. Πηγή: https://arxiv.org/pdf/2107.11309.pdf

Σύγκριση AdGraph vs. WebGraph, με στιγμιότυπα που αντιπροσωπεύουν αρχιτεκτονικές καινοτομίες στην προηγούμενη προσέγγιση. Πηγή: https://arxiv.org/pdf/2107.11309.pdf

Πέρα από το AdGraph

Η AdGraph βασίζεται σε χαρακτηριστικά (περιεχομένου), που προέρχονται από την ανάλυση των URL, ως κλειδί για την ανίχνευση εμπορικού υλικού. Ωστόσο, αυτά τα χαρακτηριστικά αντιπροσωπεύουν ένα seul πιθανό σημείο αποτυχίας για τους ανταγωνιστές που επιδιώκουν να ανιχνεύσουν την παρουσία συστημάτων ανίχνευσης διαφημίσεων και να διαμορφώσουν μεθόδους για να τις αποφύγουν. Αυτή η εξάρτηση από ιδιότητες περιεχομένου καθιστά την AdGraph ουσιαστικά μια μηχανοποιημένη εκδοχή των προσεγγίσεων που βασίζονται σε χειροκίνητα επιμελημένες λίστες φίλτρου, μοιράζοντας τις αδυναμίες τους.

CNAME Cloaking

Το υλικό που προέρχεται από το δικό του домένιο μιας ιστοσελίδας εμπίπτει σε μια ‘αξιόπιστη’ κατηγορία, σε όσο το δικό του домένιο είναι αξιόπιστο. Για μια ιστοσελίδα υψηλής εξουσίας, υπάρχει một πολύτιμο premium στο να διεξάγονται διαφημιστικές καμπάνιες που εμφανίζουν υλικό που φαίνεται να φιλοξενείται από την ίδια την ιστοσελίδα,既然 αυτή η διαφήμιση είναι ασφαλής από τις λίστες φίλτρου και ακόμη και από την προσέγγιση AdGraph του 2020.

Ωστόσο, οι προσαρμοσμένες καμπάνιες είναι δύσκολο να διαπραγματευτούν, ακριβές να εφαρμοστούν και αντίθετες με τις βασικές αρχές του μοντέλου διαφήμισης δικτύου που έχει αναπτυχθεί τα τελευταία 25 χρόνια, όπου ένα τρίτο μέρος εισάγει κώδικα απευθείας στην ιστοσελίδα, συνήθως ‘διαγωνίζοντας’ το διαφημιστικό σлот σε εκατοστά του δευτερολέπτου με βάση την επιθυμητότητα των λέξεων-κλειδιών και άλλους παράγοντες.

Από τότε που σχεδόν όλα τα συστήματα μπλοκάρισμα διαφημίσεων βασίζονται σε υλικό τρίτων μερών σε ιστοσελίδες (δηλαδή στοιχεία που φιλοξενούνται σε ‘ξένα’ домένια), οι διαφημιζόμενοι έχουν αντιδράσει με τεχνικές CNAME cloaking τα τελευταία πέντε χρόνια. Η CNAME cloaking εξαπατά τους παρακολούθους να πιστεύουν ότι ένα υποдомένιο της ιστοσελίδας (π.χ. πληροφορίες.example.com αντί για example.com) είναι một γνήσιο προσάρτημα στην ιστοσελίδα, ενώ στην πραγματικότητα είναι ένα μεσολαβικό μηχανισμό διαφήμισης που έχει συμφωνηθεί με τρίτους παρόχους διαφήμισης.

Τον Μάρτιο του 2021, μια μελέτη αποκάλυψε ότι τα περιστατικά CNAME cloaking αυξήθηκαν κατά 22% μεταξύ 2018 και 2020, με σχεδόν το 10% των κορυφαίων 10.000 ιστοσελίδων του Tranco να χρησιμοποιούν τουλάχιστον einen CNAME-βασισμένο παρακολούθηση μέχρι τον Οκτώβριο του 2020.

Αποποίηση εμπιστοσύνης στα URL

Οι τεχνικές CNAME cloaking εμπλέκουν την εξαπάτηση των URL που συμμετέχουν στη διαδικασία διαφήμισης. Κάποιο σύστημα μπλοκάρισμα διαφημίσεων που εμπιστεύεται την αλυσίδα URL θα είναι υπόκειται σε εξαπάτηση και αποφυγή. Για αυτό, η WebGraph αλλάζει τυχαία τα παρεχόμενα URL σε μια διαδικασία (συμπεριλαμβανομένων των query strings, του αριθμού των παραμέτρων και των ονομάτων παραμέτρων), αναζητώντας μοτίβα χρήσης αντί για συγκεκριμένα απαγορευμένα ή αποδεκτά URL.

Το σύστημα πρέπει να λάβει υπόψη δύο συνήθεις ρυθμίσεις σε μια αρχιτεκτονική διαφήμισης: μια, όπου ο ξενιστής συνεργάζεται απευθείας με τον διαφημιζόμενο; και μια δεύτερη (περισσότερο συνηθισμένη) περίπτωση όπου ο διαφημιζόμενος παρέχει περιορισμένη συνεργασία λόγω της ανάγκης να προστατεύσει τον εαυτό του από την εξαπάτηση από τους πελάτες του.

Στις προσεγγίσεις που βασίζονται σε λίστες, συμπεριλαμβανομένης της AdGraph, η επιτυχημένη εξαπάτηση των URL από το σύστημα διαφήμισης είναι σχεδόν μια πλήρης νίκη, αποδίδοντας ‘τοπική’ προέλευση στη διαφήμιση και αποφεύγοντας σχεδόν όλες τις προσπάθειες να μπλοκάρουν συστηματικά το περιεχόμενο διαφήμισης.

Τι μένει, ως υπογραφή; Η WebGraph εστιάζει αντίθετα στις ανάγκες των συστημάτων διαφήμισης να μοιράζονται πληροφορίες με διάφορους ημι-αποκρυπτογραφημένους τρόπους, όπως web trackers, επικοινωνίες μεταξύ iframes και web ‘listeners’, που ρωτούν συνεχώς την ζωντανή κατάσταση της ιστοσελίδας για δραστηριότητα που είναι σημαντική σε όρους web-μετρήσεων για τη διαφήμιση. Τέτοιες δραστηριότητες περιλαμβάνουν την αποθήκευση μεταβλητών σε cookies ή HTML5-βασισμένη τοπική αποθήκευση.

Η WebGraph χρησιμοποιεί το Mozilla’s Web Privacy Measurement (OpenWPM framework) για να παρακολουθήσει τέτοιου είδους δραστηριότητες στο Firefox. Καταγράφει όλες τις δραστηριότητες στο επίπεδο JavaScript και όλες τις εξερχόμενες αιτήσεις δικτύου, καθώς και τις απαντήσεις τους, στο επίπεδο δικτύου.

Αυτή η πρόσθετη επιτήρηση εισάγει νέες ‘παρουσίες ροής πληροφοριών’ στο γραφικό δίκτυο που προτάθηκε προηγουμένως από την AdGraph, επιτρέποντας στην WebGraph να καταγράψει και να ποσοτικοποιήσει μοτίβα μοιράσματος πληροφοριών με βάση την τοπική δραστηριότητα, ανεξάρτητα από την προέλευση και τον προορισμό των URL για τηλεμετρία ή άλλους τύπους επικοινωνιών σε συστήματα διαφήμισης.

Αποτελέσματα

Οι ερευνητές χρησιμοποίησαν μια επεκταμένη έκδοση του OpenWPM για να κάνουν συστηματική αναζήτηση 10.000 ιστοσελίδων από τις 100.000 κορυφαίες ιστοσελίδες του Alexa και ένα τυχαίο δείγμα 9.000 ιστοσελίδων που κατατάσσονται μεταξύ 1k-100k, αποθηκεύοντας τις γραφικές αναπαραστάσεις τους πριν τις περάσουν σε einen κλασificador δέντρου που μοντελοποιήθηκε με βάση την αρχική σχεδίαση της AdGraph, χρησιμοποιώντας δημοφιλείς λίστες φίλτρου διαφημίσεων ως αλήθεια. Με αυτόν τον τρόπο, κατασκευάστηκε ένα σύνολο δεδομένων για την εκπαίδευση του βασικού μοντέλου.

Το σύστημα πέτυχε αποτελέσματα συγκρίσιμα με αυτά της AdGraph, με ακρίβεια 92,33%. Ωστόσο, η ανθεκτικότητα του νέου συστήματος στην ανταγωνιστική αντίσταση αυξήθηκε από έναν σχεδόν πλήρη ρυθμό αποτυχίας για την AdGraph σε μόλις 8% ευαλωτότητα υπό τη WebGraph.

Μελλοντικές Κατευθύνσεις

Η εργασία υποστηρίζει ότι τα δίκτυα διαφήμισης θα πρέπει να αναδιαμορφώσουν σημαντικά τα συστήματά τους για να αποφύγουν την ανίχνευση αντιμετωπίζοντας την προσέγγιση WebGraph, και προτείνει ότι τέτοιες αλλαγές θα απαιτούσαν μια αναθεώρηση της τρέχουσας περιφρόνησης της σχέσης εμπιστοσύνης μεταξύ τρίτων διαφημιζομένων και των ιστοσελίδων που φιλοξενούν τις διαφημίσεις τους.

Η εργασία σημειώνει επίσης ότι η WebGraph δεν λαμβάνει υπόψη τεχνικές παρακολούθησης χωρίς κατάσταση, όπως η αποτύπωση του προγράμματος περιήγησης (μέσω του στοιχείου Canvas), οι οποίες χρησιμοποιούν APIs που το σύστημα δεν παρακολουθεί目前. Οι ερευνητές προτείνουν ότι η WebGraph μπορεί να επεκταθεί στο μέλλον για να λάβει υπόψη και αυτούς τους τύπους αλληλεπιδράσεων και τοπικών σηματοδοτών αποθήκευσης.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai