Η γωνία του Anderson
Οι ερευνητές του AI εκτιμούν ότι το 97% των ιστότοπων της ΕΕ δεν συμμορφώνονται με τις απαιτήσεις GDPR για την προστασία της ιδιωτικής ζωής – Ιδιαίτερα η προφίλωση χρηστών

Ερευνητές στις Ηνωμένες Πολιτείες έχουν χρησιμοποιήσει τεχνικές μηχανικής μάθησης για να μελετήσουν τις πολιτικές προστασίας της ιδιωτικής ζωής του GDPR για πάνω από χίλιους αντιπροσωπευτικούς ιστότοπους που базίζονται στην ΕΕ. Βρήκαν ότι το 97% των ιστότοπων που μελετήθηκαν δεν συμμορφώθηκαν με τουλάχιστον μία απαιτηση του κανονιστικού πλαισίου της Ευρωπαϊκής Ένωσης του 2018 και ότι συμμορφώθηκαν λιγότερο από όλα με τις κανονιστικές απαιτήσεις γύρω από την πρακτική της “προφίλωσης χρηστών”.
Το έγγραφο αναφέρει:
‘[Εφόσον] η πολιτική προστασίας της ιδιωτικής ζωής είναι το βασικό κανάλι επικοινωνίας για τους χρήστες για να κατανοήσουν και να ελέγξουν την ιδιωτική ζωή τους, πολλές εταιρείες ενημέρωσαν τις πολιτικές προστασίας της ιδιωτικής ζωής τους μετά τη θέσπιση του GDPR. Ωστόσο, οι περισσότερες πολιτικές προστασίας της ιδιωτικής ζωής είναι περιπλεχτικές, γεμάτες με τεχνικούς όρους και περιγράφουν αμυδρά τις πρακτικές δεδομένων των εταιρειών και τα δικαιώματα των χρηστών. Έτσι, δεν είναι σαφές αν συμμορφώνονται με το GDPR.’
Συνεχίζει:
‘Τα αποτελέσματά μας δείχνουν ότι ακόμη και μετά τη θέσπιση του GDPR, το 97% των ιστότοπων δεν συμμορφώνονται με τουλάχιστον μία απαιτηση του GDPR.’
Η μελέτη έχει τον τίτλο Αυτόματη ανίχνευση απαιτήσεων GDPR στις πολιτικές προστασίας της ιδιωτικής ζωής με τη χρήση Deep Active Learning και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο της Βιρτζίνια στο Σαρλόττεσβιλ.
Η Προστασία της Ιδιωτικής Ζωής Είναι Τελευταία
Η περιοχή της ελάχιστης συμμόρφωσης, σύμφωνα με τη μελέτη, αφορά τις διατάξεις του GDPR σχετικά με την προφίλωση χρηστών, με τους συγγραφείς να αναφέρουν ότι μόνο το 15,3% των ιστότοπων που μελετήθηκαν ήταν πλήρως συμμορφωμένο με αυτήν την cụ thể διατάξη.

Ένα γράφημα συμμόρφωσης μεταξύ των πολιτικών GDPR που μελετήθηκαν για την έρευνα. Πηγή: https://arxiv.org/pdf/2111.04224.pdf
Η προφίλωση χρηστών (όπου η αλληλεπίδραση ενός ατόμου με τους ιστότοπους καταγράφεται και συχνά χρησιμοποιείται για να “στόχευση” σε άλλους διαδικτυακούς контекστούς, όπως διαφήμιση) έχει γίνει ένας από τους πιο καυτούς διαμάχους στην τεχνολογία από το σκάνδαλο της Cambridge Analytica.
Την Τρίτη, μια κρίσιμη επιτροπή του Ευρωπαϊκού Κοινοβουλίου έπασχε το πρώτο στάδιο του νέου Νόμου για τις Ψηφιακές Αγορές (DMA) νομοθεσίας, η οποία θα απαγορεύσει την συμπεριφορική στοχεύθυνση ανήλικων, επιβάλλοντας πρόστιμα μέχρι 20% των παγκόσμιων ετήσιων πωλήσεων για τις εταιρείες που παραβιάζουν.
Αν και ο Νόμος έχει ληφθεί από τα μέσα ενημέρωσης ως μια άμεση απάντηση στην αυξανόμενη επιρροή των τεχνολογικών γιγάντων όπως η Facebook και η Google, η τεράστια κλίμακα της μη συμμόρφωσης που αντιπροσωπεύεται από την καινούρια έρευνα υποδηλώνει ότι η μεγάλη πλειοψηφία των εταιρειών της ΕΕ (συμπεριλαμβανομένων των γραφείων της ΕΕ για τις αμερικανικές εταιρείες που εμπορεύονται στην Ευρώπη) είναι νομικά εκτεθειμένες σε πρόστιμα GDPR.
Επιπλέον, η Ιταλία έχει επιβάλει φέτος το μέγιστο επιτρεπόμενο πρόστιμο των 10 εκατομμυρίων ευρώ ($11,2 εκατομμύρια USD) κατά της Apple και της Google για την εκμετάλλευση της προφίλωσης χρηστών, μεταξύ άλλων παραβάσεων.
Δεδομένα
Οι ιστότοποι που εξετάστηκαν στην καινούρια έρευνα δείχθηκαν από τους top 10.000 ιστότοπους που αναφέρονται στο Quantcast, τις αγγλικές πολιτικές προστασίας της ιδιωτικής ζωής των οποίων εξαγόταν μέσω αναζητήσεων Yandex σε UK-βασισμένα VPN (για να διασφαλιστεί ότι οι πολιτικές δεν ήταν geo-μπλοκ).
Οι ιστότοποι της ΕΕ έχουν υποχρεωθεί να παρέχουν προκαθορισμένες πολιτικές προστασίας της ιδιωτικής ζωής, που καλύπτουν 18 κεντρικές απαιτήσεις (βλέπε γράφημα παραπάνω) από τότε που ο Γενικός Κανονισμός Προστασίας Δεδομένων (GDPR) τέθηκε πλήρως σε ισχύ τον Μάιο του 2018.
Οι ερευνητές περιόρισαν την εξαγωγή των πολιτικών προστασίας της ιδιωτικής ζωής σε μια περίοδο από τον Αύγουστο του 2018 και μετά, για να επιτρέψουν εύλογο χρόνο για τους τομείς να έχουν δημοσιεύσει τις απαιτούμενες πολιτικές (μια απαιτούμενη που είχαν προηγουμένως γνώση για τουλάχιστον ένα χρόνο της δύο ετών ανάπτυξης του GDPR από το 2016).
Η διαδικασία φιλτράρισμα παρήγαγε ένα σώμα πολιτικών προστασίας της ιδιωτικής ζωής των 9.761 πολιτικών, από τις οποίες 1.080 πολιτικές επιλέχθηκαν τυχαία από τους ερευνητές.
Προεπεξεργασία
Η ομάδα χρησιμοποίησε δύο νομικούς εμπειρογνώμονες για να εκπαιδεύσουν τέσσερις ανθρώπινους ανανεωτές για να etiquetάρουν κάθε μία από τις 18 πιθανές πολιτικές προστασίας της ιδιωτικής ζωής που απαιτούνται από το GDPR.
Μερικά από τα νομικά κείμενα στις πολιτικές κάλυπταν περισσότερες από μία από τις 18 απαιτήσεις, καθιστώντας αναγκαία τη χρήση ενός Συνελικτικού Νευρωνικού Ιδρύματος (CNN) για να ανιχνεύσει γλωσσικές λειτουργίες που σχετίζονται με κάθε πολιτική.
Μια αρχική προσπάθεια να εκπαιδεύσει ένα μοντέλο για να αναγνωρίσει τη συμμόρφωση με βάση τη γλώσσα έφτασε στο 80,5% της επιτυχίας. Για να βελτιώσουν αυτά τα αποτελέσματα, οι ερευνητές εφαρμόσαν Ενεργό Μάθηση για να ενισχύσουν την απόδοση του μοντέλου χρησιμοποιώντας λιγότερα etiquetάρια δεδομένα. Με αυτά τα μέσα ήταν δυνατό να εκπαιδευτεί ο ταξινομητής CNN μέχρι μια ακρίβεια του 89,2%, με ένα F1 score του 0,88 (όπου ‘1’ είναι πλήρης επιτυχία).
Για να διασφαλιστεί ότι οι ενσωματώσεις λέξεων ήταν συγκεκριμένες για την πολιτική προστασίας της ιδιωτικής ζωής, οι ερευνητές εκπαίδευσαν ένα μη επιτηρούμενο μοντέλο ενσωματώσεων λέξεων χρησιμοποιώντας τη βιβλιοθήκη FastText της Facebook.
Κατά τη τυπική πρακτική, τα τελικά δεδομένα χωρίστηκαν 80/20 μεταξύ εκπαιδευμένων δεδομένων και δεδομένων ελέγχου (δηλαδή τυχαία επιλεγμένα δεδομένα κατά τα οποία θα αξιολογηθεί η ακρίβεια του αλγορίθμου). Μια μελέτη ανθρώπινου-στο-βρόχο προστέθηκε στην αρχιτεκτονική για να αξιολογήσει την ποιότητα των αποτελεσμάτων.

Η αρχιτεκτονική για το σύστημα ταξινομητή.
Κατά τη διάρκεια της ροής εργασίας, 11.271 ανθρώπινα-ετικεταρισμένα τμήματα πολιτικών προστασίας της ιδιωτικής ζωής παράχθηκαν, από τα οποία το καθένα αναθεωρήθηκε από τέσσερις ανθρώπινους ανανεωτές που είχαν εκπαιδευτεί από τους δύο νομικούς εμπειρογνώμονες που συμμετείχαν στη μελέτη. Όπου συνέβη διαφωνία, χρειαζόταν ένα ποσοστό συμφωνίας 75% για να μην απορριφθεί η δεδομένα από την ένταξη.

Άνθρωποι-στο-βρόχο – δεν ήταν δυνατό να αυτοματοποιηθεί πλήρως η ετικέτα των δεδομένων πολιτικών, αν και η Ενεργός Μάθηση επέτρεψε μια ροή εργασίας που βασίζεται σε πισίνα που έκανε το έργο εφικτό.
Εκτός από τα αποτελέσματα που αναφέρθηκαν ήδη, οι χρήστες βρήκαν ότι μεταφερσιμότητα – το δικαίωμα σύμφωνα με το GDPR να μεταφέρουν ή να εξαγάγουν δεδομένα που κατέχονται από μια εταιρεία – ήταν σχεδόν τόσο κακώς εξυπηρετημένο όσο και η προφίλωση.
Οι ερευνητές συμπεραίνουν:
‘[Απαιτήσεις] όπως το δικαίωμα των χρηστών στη Μεταφερσιμότητα και την παροχή των στοιχείων επικοινωνίας του Αξιωματούχου Προστασίας Δεδομένων (DPO contact) καλύπτονται από 15,5% και 16,4% των ιστότοπων, αντίστοιχα. Άλλες κύριες απαιτήσεις, όπως το δικαίωμα των χρηστών να καταθέσουν καταγγελία, να αποσύρουν τη συγκατάθεση, το δικαίωμα να αντιταχθούν και η Απόφαση Αξιολόγησης, καλύπτονται από 17-20% των ιστότοπων.’
…και συνεχίζει:
‘Φαίνεται ότι μόνο το 3% των ιστότοπων συμμορφώνονται πλήρως με τις 18 απαιτήσεις. Αυτά τα ευρήματα δείχνουν ότι πολλές ιστοσελίδες δεν ακολουθούν ακόμη τις απαιτήσεις του GDPR.’
7pm 26/11/2021 – Διευκρίνισε το πρώτο γράφημα. – MA












