Η γωνία του Anderson

Επίλυση CAPTCHAs με Μηχανική Μάθηση για Ενεργό Έρευνα στο Δαρκό Ιστό

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ένα συνδυασμένο ακαδημαϊκό ερευνητικό πρόγραμμα στις Ηνωμένες Πολιτείες έχει αναπτύξει μια μέθοδο για να αποτρέψει τους ελέγχους CAPTCHA*, αναφέροντας ότι υπερβαίνει τις παρόμοιες λύσεις μηχανικής μάθησης με τη χρήση Αντισταθμιστικών Ανταγωνιστικών Νευρωνικών Δικτύων (GANs) για να αποκωδικοποιήσει τις οπτικά σύνθετες προκλήσεις.

Δοκιμάζοντας το νέο σύστημα ενάντια στα καλύτερα τρέχοντα πλαίσια, οι ερευνητές βρήκαν ότι η μέθοδός τους επιτυγχάνει περισσότερο από 94,4% επιτυχία σε một προσεκτικά επιλεγμένο σύνολο δεδομένων του πραγματικού κόσμου και έχει αποδείξει ότι είναι ικανό να ‘εξαφανίσει την ανθρώπινη εμπλοκή’ όταν πλοηγείται σε ένα εξελισσόμενο Marketplace του Δαρκού Ιστού, που αυτόματα επιλύει τις προκλήσεις CAPTCHA σε μέγιστο τρεις προσπάθειες.

Αρχιτεκτονική για DW-GAN. Πηγή: https://arxiv.org/pdf/2201.02799.pdf

Ροή εργασίας για DW-GAN. Πηγή: https://arxiv.org/pdf/2201.02799.pdf

Οι συγγραφείς υποστηρίζουν ότι η προσέγγισή τους αντιπροσωπεύει μια突破 για τους ερευνητές της κυβερνοασφάλειας, οι οποίοι παραδοσιακά είχαν να φέρουν το κόστος της παροχής ανθρώπων στο βρόχο για να λύσουν τις CAPTCHAs, συνήθως μέσω πλατφορμών crowdsourcing όπως το Amazon Mechanical Turk (AMT).

Εάν το σύστημα μπορεί να αποδείξει ότι είναι προσαρμόσιμο και ανθεκτικό, μπορεί να ανοίξει τον δρόμο για περισσότερα αυτόματα συστήματα εποπτείας και για τον δείκτη και το web-scraping των δικτύων TOR. Αυτό θα μπορούσε να επιτρέψει αναλύσεις μεγάλης κλίμακας και υψηλής απόδοσης, καθώς και την ανάπτυξη νέων προσεγγίσεων και τεχνικών κυβερνοασφάλειας, οι οποίες έχουν εμποδιστεί μέχρι τώρα από τις πυραυλίδες CAPTCHA.

Το έγγραφο έχει τον τίτλο Αντιμετώπιση του κειμένου CAPTCHA του Δαρκού Ιστού με Αντισταθμιστική Ανταγωνιστική Μάθηση για Προηγμένη Κυβερνοασφάλεια και προέρχεται από ερευνητές στο Πανεπιστήμιο της Αριζόνας, το Πανεπιστήμιο της Νότιας Φλόριντα και το Πανεπιστήμιο της Τζόρτζια.

Επιπτώσεις

Από τη στιγμή που το σύστημα – που ονομάζεται Dark Web-GAN (DW-GAN, διαθέσιμο στο GitHub) – φαίνεται να είναι τόσο πιο επιτελές από τους προκατόχους του, υπάρχει η πιθανότητα ότι θα χρησιμοποιηθεί ως μια γενική μέθοδος για να υπερβεί το (συνήθως λιγότερο δυσκόλο) υλικό CAPTCHA στο τυπικό ιστό, είτε σε αυτήν την ειδική εφαρμογή, είτε με βάση τις γενικές αρχές που περιγράφονται στην καινούργια εργασία. Λόγω του περιορισμένου χώρου αποθήκευσης στο GitHub, ωστόσο, είναι目前 αναγκαίο να επικοινωνήσετε με τον κύριο συγγραφέα Ning Zhang για να λάβετε τα δεδομένα που σχετίζονται με το πλαίσιο.

Επειδή το DW-GAN έχει ένα ‘θετικό’ αποστολή για την υπέρβαση των CAPTCHAs (όπως και το TOR είχε αρχικά μια θετική αποστολή για την προστασία των στρατιωτικών επικοινωνιών και, αργότερα, των δημοσιογράφων), και επειδή οι CAPTCHAs είναι και μια νόμιμη άμυνα (συχνά και αμφιλεγόμενα χρησιμοποιούνται από τον πανταχού παρόντα γίγαντα CDN CloudFlare) και ένα αγαπημένο εργαλείο των αθέμιτων αγορών του δαρκού ιστού, η προσέγγιση είναι ουσιαστικά μια ‘ισοπέδωση’ τεχνολογία.

Οι συγγραφείς ομολογούν ότι το DW-GAN έχει ευρύτερη χρήση:

‘[Ενώ] αυτή η μελέτη είναι κυρίως επικεντρωμένη στο CAPTCHA του δαρκού ιστού ως ένα πιο δύσκολο πρόβλημα, η προτεινόμενη μέθοδος σε αυτή τη μελέτη αναμένεται να είναι εφαρμόσιμη σε άλλους τύπους CAPTCHA χωρίς απώλεια γενικότητας.’

Πιθανότατα το DW-GAN, ή ένα παρόμοιο σύστημα, θα χρειαζόταν να γίνει ευρέως και εμφανώς διαδεδομένο για να προκαλέσει τις αγορές του δαρκού ιστού να αναζητήσουν λιγότερο μηχανικά λύσιμα, ή τουλάχιστον να εξελίξουν τις ρυθμίσεις CAPTCHA περιοδικά, ένα σενάριο ‘ψυχρού πολέμου’.

Κινητροί

Όπως παρατηρεί το έγγραφο, ο δαρκός ιστός είναι η основная πηγή πληροφοριών για τις κυβερνοεπιθέσεις, οι οποίες εκτιμάται ότι θα κοστίσουν στην παγκόσμια οικονομία 10 τρισεκατομμύρια δολάρια μέχρι το 2025. Έτσι, τα δίκτυα onion παραμένουν ένα σχετικά ασφαλές περιβάλλον για τις αθέμιτες αγορές του δαρκού ιστού, οι οποίες μπορούν να απομακρύνουν τους εισβολείς με διάφορους τρόπους, συμπεριλαμβανομένων των λήξεων συνόδου, των cookies και της αυθεντικοποίησης του χρήστη.

Δύο τύποι CAPTCHA, και οι δύο χρησιμοποιούν backgrounds που μπερδεύουν και γράμματα με κλίση για να τα κάνουν λιγότερο αναγνώσιμα από τις μηχανές.

Δύο τύποι CAPTCHA, και οι δύο χρησιμοποιούν backgrounds που μπερδεύουν και γράμματα με κλίση για να τα κάνουν λιγότερο αναγνώσιμα από τις μηχανές.

Ωστόσο, οι συγγραφείς παρατηρούν ότι κανένας από τους εμποδισμούς δεν είναι τόσο μεγάλος όσο η σειρά των CAPTCHAs που διακόπτουν την εμπειρία πλοήγησης σε μια ‘ευαίσθητη’ κοινότητα:

‘Ενώ hầu hết από αυτά τα μέτρα μπορούν να παρακαμφθούν αποτελεσματικά με την εφαρμογή αυτοματοποιημένων αντεπιθέσεων σε ένα πρόγραμμα πλοήγησης, το CAPTCHA είναι το πιο εμποδιστικό μέτρο κατά της πλοήγησης στο δαρκό ιστό που δεν μπορεί να παρακαμφθεί εύκολα λόγω των υψηλών γνωστικών ικανοτήτων που συχνά δεν κατέχονται από τα εργαλεία αυτοματοποίησης’

Οι κειμενικοί CAPTCHAs δεν είναι η μόνη διαθέσιμη επιλογή. Υπάρχουν παραλλαγές, οικείες σε πολλούς από εμάς, που ζητούν από τον χρήστη να ερμηνεύσει βίντεο, ήχο και ιδιαίτερα εικόνες. Παρόλα αυτά, όπως παρατηρούν οι συγγραφείς, οι κειμενικοί CAPTCHAs είναι τώρα η πρόκληση της επιλογής για τις αγορές του δαρκού ιστού, και ένα φυσικό σημείο εκκίνησης για να κάνουν τα δίκτυα TOR πιο ευάλωτα στην ανάλυση από τις μηχανές.

Αρχιτεκτονική

Αν και μια προηγούμενη προσέγγιση από το Πανεπιστήμιο Northwest στην Κίνα χρησιμοποίησε Αντισταθμιστικά Ανταγωνιστικά Νευρωνικά Δίκτυα για να εξαγάγει μοτίβα από πλατφόρμες CAPTCHA, οι συγγραφείς της νέας εργασίας σημειώνουν ότι αυτή η μέθοδος βασίζεται στην ερμηνεία μιας εικόνας raster, αντί για μια πιο sâuτική εξέταση των γραμμάτων που αναγνωρίζονται στην πρόκληση. και ότι η αποτελεσματικότητα του DW-GAN δεν επηρεάζεται από το μεταβλητό μήκος των ανοηθών λέξεων (και των αριθμών) που συνήθως βρίσκονται στις CAPTCHAs του δαρκού ιστού.

Το DW-GAN χρησιμοποιεί μια διαδικασία τεσσάρων σταδίων: πρώτα η εικόνα συλλαμβάνεται και στη συνέχεια τροφοδοτείται σε ένα模块 απομακρύνσεως φόντου που χρησιμοποιεί ένα GAN που έχει εκπαιδευτεί σε αναγνωρισμένα δείγματα CAPTCHA, και είναι因此能够 να διακρίνει τα γράμματα από το perturbed φόντο που βρίσκονται. Τα εξαγόμενα γράμματα στη συνέχεια φιλτράρονται περαιτέρω από οποιοδήποτε υπόλοιπο θόρυβο μετά την εξαγωγή GAN-βασισμένης.

Στη συνέχεια, η τομή thực hiệnται στο εξαγόμενο κείμενο, το οποίο στη συνέχεια διασπάται σε ό,τι φαίνεται να είναι συνθετικά γράμματα, χρησιμοποιώντας αλγόριθμους ανίχνευσης περιγράμματος.

Τομείς χαρακτήρων απομονώνουν την ομάδα pixel και προσπαθούν να αναγνωρίσουν με ανίχνευση περιγράμματος.

Τομείς χαρακτήρων απομονώνουν την ομάδα pixel και προσπαθούν να αναγνωρίσουν με ανίχνευση περιγράμματος.

Τέλος, οι ‘υποψήφιοι’ τομείς χαρακτήρων υπόκεινται σε αναγνώριση χαρακτήρων μέσω ενός Νευρωνικού Δικτύου Συμβολισμού (CNN).

Μερικές φορές τα γράμματα μπορούν να перекrýονται, μια υπέρ-κέρνινγκ που σχεδιάζεται ειδικά για να εξαπατήσει τα συστήματα μηχανών. Το DW-GAN χρησιμοποιεί因此 διαστήματα-βασισμένη τομή για να ενισχύσει και να απομονώσει τα σύνορα, αποτελεσματικά分离 τα γράμματα.既然 οι λέξεις είναι συνήθως ανοησίες, δεν υπάρχει κανένας σεμαντικός контекστ για να βοηθήσει σε αυτή τη διαδικασία.

Αποτελέσματα

Το DW-GAN δοκιμάστηκε ενάντια σε εικόνες CAPTCHA από τρία διαφορετικά σύνολα δεδομένων του δαρκού ιστού, καθώς και σε einen δημοφιλή συνθετητή CAPTCHA. Οι μαύρες αγορές από τις οποίες προέρχονταν οι εικόνες αποτελούσαν δύο καταστήματα καρτών, Rescator-1 και Rescator-2, και ένα νέο σύνολο από μια τότε εξελισσόμενη αγορά που ονομάζεται Yellow Brick (η οποία αναφέρθηκε να έχει αργότερα εξαφανιστεί μετά την κατάσχεση της DarkMarket).

Δείγματα CAPTCHAs από τα τρία σύνολα δεδομένων, καθώς και ο ανοιχτός συνθετητής CAPTCHA.

Δείγματα CAPTCHAs από τα τρία σύνολα δεδομένων, καθώς και ο ανοιχτός συνθετητής CAPTCHA.

Σύμφωνα με τους συγγραφείς, τα δεδομένα που χρησιμοποιήθηκαν στη δοκιμή συνιστώνταν από εμπειρογνώμονες Κυβερνοασφάλειας (CTI) με βάση την ευρεία διάδοσή τους σε μαύρες αγορές.

Η δοκιμή κάθε συνόλου δεδομένων περιελάμβανε την ανάπτυξη ενός TOR-πρόσβλεψης αραχνού που συλλέγει 500 εικόνες CAPTCHA, οι οποίες στη συνέχεια επισημάνθηκαν και επιμεληθηκαν από συμβούλους CTI.

Τρεις πειραματικές δοκιμές σχεδιάστηκαν. Η πρώτη αξιολόγησε την γενική απόδοση του DW-GAN ενάντια στα τυπικά SOTA μέθοδους. Οι αντίπαλοι μέθοδοι ήταν εικόνα-επίπεδο CNN με προεπεξεργασία, που περιελάμβανε μετατροπή σε ασπρόμαυρο, κανονικοποίηση και λείανση Gaussian, μια κοινή ακαδημαϊκή προσπάθεια από το Ιράν και το Ηνωμένο Βασίλειο. Χαρακτήρας-επίπεδο CNN με διαστήματα-βασισμένη τομή. και εικόνα-επίπεδο CNN, από το Πανεπιστήμιο του Οξφόρδη στο Ηνωμένο Βασίλειο.

Αποτελέσματα από το DW-GAN για την πρώτη πειραματική δοκιμή, συγκριμένα με προηγούμενες μεθόδους SOTA.

Αποτελέσματα από το DW-GAN για την πρώτη πειραματική δοκιμή, συγκριμένα με προηγούμενες μεθόδους SOTA.

Οι ερευνητές βρήκαν ότι το DW-GAN μπόρεσε να βελτιώσει τα προηγούμενα αποτελέσματα σε όλους τους τομείς (βλέπε πίνακα παραπάνω).

Η δεύτερη πειραματική δοκιμή ήταν μια μελέτη αφαίρεσης, όπου διάφορα μέρη του ενεργού πλαισίου αφαιρούνται ή απενεργοποιούνται για να αποκλείσουν την πιθανότητα ότι εξωτερικοί ή δευτερεύοντες παράγοντες επηρεάζουν τα αποτελέσματα.

Αποτελέσματα της μελέτης αφαίρεσης.

Αποτελέσματα της μελέτης αφαίρεσης.

Εδώ, οι συγγραφείς βρήκαν ότι η απενεργοποίηση κλειδιών τμημάτων της αρχιτεκτονικής μειώνει την απόδοση του DW-GAN σε σχεδόν όλες τις περιπτώσεις (βλέπε πίνακα παραπάνω).

Η τρίτη πειραματική δοκιμή συγκρίνει την αποτελεσματικότητα του DW-GAN ενάντια σε μια μεθοδολογία εικόνας-βασισμένης και δύο μεθόδων χαρακτήρα-επίπεδου, για να καθορίσει το βαθμό στον οποίο η αξιολόγηση χαρακτήρων του DW-GAN επηρεάζει την उपयσιμότητά του σε περιπτώσεις όπου μια ανοησία λέξη CAPTCHA είναι μια τυχαία (παρά μια προκαθορισμένη) μήκος. Σε αυτές τις περιπτώσεις, το μήκος CAPTCHA ποικίλλει μεταξύ 4 και 7 χαρακτήρων.

Για αυτή τη δοκιμή, οι συγγραφείς χρησιμοποίησαν ένα σύνολο εκπαίδευσης 50.000 εικόνων CAPTCHA, με 5.000 που διατηρούνται για δοκιμή σε một τυπική 90/10 διαίρεση.

Εδώ, το DW-GAN υπερέβη τις προηγούμενες προσεγγίσεις:

Ζωντανή Δοκιμή σε μια Αγορά του Δαρκού Ιστού

Τέλος, το DW-GAN αναπτύχθηκε ενάντια στην (τότε ζωντανή) αγορά Yellow Brick του δαρκού ιστού. Για αυτή τη δοκιμή, ένας TOR-πρόσβλεψης αραχνούς αναπτύχθηκε που ενσωματώνει το DW-GAN στις ικανότητες πλοήγησής του, αυτόματα αναλύοντας τις προκλήσεις CAPTCHA.

Σε αυτή τη περίπτωση, μια πρόκληση CAPTCHA παρουσιάστηκε στον αυτοματοποιημένο αραχνού για κάθε 15 αιτήματα HTTP, κατά μέσο όρο. Ο αραχνούς μπόρεσε να δείξει 1.831 παράνομες položkeiten προς πώληση στο Yellow Brick, συμπεριλαμβανομένων 1.223 προϊόντων που σχετίζονται με ναρκωτικά (συμπεριλαμβανομένων οπιοειδών και κοκαΐνης), 44 πακέτων hacking, και εννέα ψευδείς εγγραφές εγγράφων. Συνολικά, το σύστημα μπόρεσε να αναγνωρίσει 286 položky που σχετίζονται με την κυβερνοασφάλεια, συμπεριλαμβανομένων 102 κλεμμένων καρτών πιστωτικής και 131 κλεμμένων λογαριασμών.

Οι συγγραφείς αναφέρουν ότι το DW-GAN ήταν σε όλες τις περιπτώσεις能够 να σπάσει μια πρόκληση CAPTCHA σε τρεις ή λιγότερες προσπάθειες, και ότι 76 λεπτά χρόνου επεξεργασίας ήταν αναγκαία για να λογαριαστούν για τις προκλήσεις CAPTCHA που φυλούσαν όλα τα 1.831 προϊόντα. Δεν χρειάστηκαν άνθρωποι για να παρέμβουν, και δεν υπήρξαν περιπτώσεις αποτυχίας τερματικού.

Οι συγγραφείς σημειώνουν την εμφάνιση προκλήσεων που προσφέρουν ένα υψηλότερο επίπεδο σοφιστικέ than κειμενικοί CAPTCHAs, συμπεριλαμβανομένων κάποιων που φαίνεται να είναι μοντελοποιημένα σε τεστ Turing, και παρατηρούν ότι το DW-GAN θα μπορούσε να ενισχυθεί για να προσαρμοστεί σε αυτές τις νέες τάσεις καθώς γίνονται δημοφιλείς.

 

*Αυτόματα Δημόσιο Τεστ Turing για να Ξεχωρίσει τους Υπολογιστές από τους Ανθρώπους

Πρώτη δημοσίευση 11ης Ιανουαρίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]