Angle d’Anderson

RÃĐsoudre les CAPTCHAs avec l’apprentissage automatique pour permettre la recherche sur le dark web

mm
Ajouter Unite.AI à vos sources prÃĐfÃĐrÃĐes sur Google

Un projet de recherche universitaire conjoint aux États-Unis a dÃĐveloppÃĐ une mÃĐthode pour contourner les tests CAPTCHA*, rapportant qu’il surpasse les solutions d’apprentissage automatique similaires actuelles en utilisant des rÃĐseaux antagonistes gÃĐnÃĐratifs (GAN) pour dÃĐcoder les dÃĐfis visuellement complexes.

Lorsque le nouveau systÃĻme a ÃĐtÃĐ testÃĐ contre les meilleurs cadres actuels, les chercheurs ont constatÃĐ que leur mÃĐthode atteint plus de 94,4 % de rÃĐussite sur un ensemble de donnÃĐes du monde rÃĐel soigneusement sÃĐlectionnÃĐ, et s’est avÃĐrÃĐe capable d’ÃĐliminer l’intervention humaine lors de la navigation sur un marchÃĐ ÃĐmergent du dark net fortement protÃĐgÃĐ par CAPTCHA, en rÃĐsolvant automatiquement les dÃĐfis CAPTCHA en un maximum de trois tentatives.

Architecture pour DW-GAN. Source: https://arxiv.org/pdf/2201.02799.pdf

Flux de travail pour DW-GAN. Source: https://arxiv.org/pdf/2201.02799.pdf

Les auteurs affirment que leur approche reprÃĐsente une avancÃĐe pour les chercheurs en cybersÃĐcuritÃĐ, qui traditionnellement ont dÃŧ supporter les coÃŧts de la fourniture de personnes dans la boucle pour rÃĐsoudre manuellement les CAPTCHAs, gÃĐnÃĐralement via des plateformes de crowdsourcing telles que Amazon Mechanical Turk (AMT).

Si le systÃĻme peut se rÃĐvÃĐler adaptable et rÃĐsilient, il peut ouvrir la voie à des systÃĻmes de surveillance plus automatisÃĐs, et à l’indexation et au scraping de rÃĐseaux TOR. Cela pourrait permettre des analyses à grande ÃĐchelle et à haut volume, ainsi que le dÃĐveloppement de nouvelles approches et techniques de cybersÃĐcuritÃĐ, qui ont ÃĐtÃĐ entravÃĐes jusqu’à prÃĐsent par les pare-feu CAPTCHA.

Le document s’intitule Contre les CAPTCHAs de texte du dark web avec un apprentissage gÃĐnÃĐratif antagoniste pour une intelligence de menace proactive, et provient de chercheurs de l’UniversitÃĐ de l’Arizona, de l’UniversitÃĐ de Floride du Sud et de l’UniversitÃĐ de GÃĐorgie.

Implications

Puisque le systÃĻme – appelÃĐ Dark Web-GAN (DW-GAN, disponible sur GitHub) – est apparemment beaucoup plus performant que ses prÃĐdÃĐcesseurs, il y a la possibilitÃĐ qu’il sera utilisÃĐ comme mÃĐthode gÃĐnÃĐrale pour surmonter le matÃĐriel CAPTCHA (gÃĐnÃĐralement moins difficile) sur le web standard, soit dans cette mise en œuvre spÃĐcifique, soit sur la base des principes gÃĐnÃĐraux que la nouvelle ÃĐtude dÃĐcrit. En raison de la limitation de stockage sur GitHub, cependant, il est actuellement nÃĐcessaire de contacter l’auteur principal Ning Zhang pour obtenir les donnÃĐes associÃĐes au cadre.

Parce que DW-GAN a une mission ÂŦ positive Âŧ pour briser les CAPTCHAs (tout comme TOR lui-mÊme avait à l’origine une mission positive pour protÃĐger les communications militaires et, plus tard, les journalistes), et parce que les CAPTCHAs sont à la fois une dÃĐfense lÃĐgitime (frÃĐquemment et controversÃĐe utilisÃĐe par le gÃĐant du CDN CloudFlare) et un outil prÃĐfÃĐrÃĐ des marchÃĐs illicites du dark web, l’approche est en fait une ÂŦ technologie de nivellement Âŧ.

Les auteurs eux-mÊmes concÃĻdent que DW-GAN a des utilisations plus larges:

‘[Bien que] cette ÃĐtude se concentre principalement sur les CAPTCHAs du dark web comme problÃĻme plus difficile, la mÃĐthode proposÃĐe dans cette ÃĐtude est susceptible d’Être applicable à d’autres types de CAPTCHAs sans perte de gÃĐnÃĐralitÃĐ.’

PrÃĐsumablement, DW-GAN, ou un systÃĻme similaire, devrait devenir largement et ÃĐvidemment diffusÃĐ pour inciter les marchÃĐs du dark web à rechercher des solutions moins rÃĐsolubles par machine, ou au moins à faire ÃĐvoluer leurs configurations CAPTCHA pÃĐriodiquement, un scÃĐnario de ÂŦ guerre froide Âŧ.

Motivations

Comme le constate le document, le dark web est la principale source d’intelligence de hacker liÃĐe aux attaques de cybersÃĐcuritÃĐ, qui sont estimÃĐes à coÃŧter 10 billions de dollars USD à l’ÃĐconomie mondiale d’ici 2025. Par consÃĐquent, les rÃĐseaux onion restent un environnement relativement sÃŧr pour les communautÃĐs illicites du dark net, qui peuvent repousser les intrus par divers moyens, notamment des timeouts de session, des cookies et une authentification utilisateur.

Deux types de CAPTCHA, tous deux utilisant des arriÃĻre-plans obscurcis et des lettres inclinÃĐes pour les rendre moins lisibles par machine.

Deux types de CAPTCHA, tous deux utilisant des arriÃĻre-plans obscurcis et des lettres inclinÃĐes pour les rendre moins lisibles par machine.

Cependant, les auteurs observent que none de ces obstacles n’est aussi grand que le groupe de CAPTCHAs qui ponctuent l’expÃĐrience de navigation dans une ÂŦ communautÃĐ sensible Âŧ:

‘Alors que la plupart de ces mesures peuvent Être efficacement contournÃĐes en mettant en œuvre des contre-mesures automatisÃĐes dans un programme de crawl, le CAPTCHA est la mesure anti-crawl la plus gÊnante du dark web qui ne peut pas Être facilement contournÃĐe en raison des capacitÃĐs cognitives ÃĐlevÃĐes qui sont souvent dÃĐtenues par les outils d’automatisation.’

Les CAPTCHAs basÃĐs sur le texte ne sont pas la seule option disponible; il existe des variantes, familiÃĻres à beaucoup d’entre nous, qui obligent l’utilisateur à interprÃĐter des vidÃĐos, des audio et surtout des images. NÃĐanmoins, comme le constatent les auteurs, les CAPTCHAs basÃĐs sur le texte sont actuellement le dÃĐfi de choix pour les marchÃĐs du dark web, et un point de dÃĐpart naturel pour rendre les rÃĐseaux TOR plus sensibles à l’analyse par machine.

Architecture

Bien qu’une approche antÃĐrieure de l’UniversitÃĐ du Nord-Ouest en Chine ait utilisÃĐ des rÃĐseaux antagonistes gÃĐnÃĐratifs pour dÃĐriver des modÃĻles de fonctionnalitÃĐs à partir de plateformes CAPTCHA, les auteurs de la nouvelle ÃĐtude notent que cette mÃĐthode repose sur l’interprÃĐtation d’une image rasterisÃĐe, plutÃīt que sur un examen plus approfondi des lettres reconnues dans le dÃĐfi; et que l’efficacitÃĐ de DW-GAN n’est pas affectÃĐe par la longueur variable des mots sans sens (et des nombres) qui sont gÃĐnÃĐralement trouvÃĐs dans les CAPTCHAs du dark web.

DW-GAN utilise un pipeline à quatre ÃĐtapes: tout d’abord, l’image est capturÃĐe, puis alimentÃĐe dans un module de dÃĐbruitage de l’arriÃĻre-plan qui utilise un GAN qui a ÃĐtÃĐ formÃĐ sur des ÃĐchantillons CAPTCHA annotÃĐs, et est donc capable de distinguer les lettres du fond perturbÃĐ sur lequel elles reposent. Les lettres extraites sont ensuite filtrÃĐes pour ÃĐliminer tout bruit rÃĐsiduel aprÃĻs l’extraction basÃĐe sur le GAN.

Ensuite, une segmentation est effectuÃĐe sur le texte extrait, qui est ensuite divisÃĐ en ce qui semble Être des caractÃĻres constitutifs, à l’aide d’algorithmes de dÃĐtection de contours.

La segmentation de caractÃĻres isole le groupe de pixels et tente de reconnaissance avec un traçage de bordure.

La segmentation de caractÃĻres isole le groupe de pixels et tente de reconnaissance avec un traçage de bordure.

Enfin, les segments de caractÃĻres ÂŦ devinÃĐs Âŧ sont soumis à une reconnaissance de caractÃĻres via un rÃĐseau de neurones convolutionnel (CNN).

Parfois, les caractÃĻres peuvent se chevaucher, un hyper-espacement conçu spÃĐcifiquement pour tromper les systÃĻmes de machine. DW-GAN utilise donc une segmentation basÃĐe sur les intervalles pour amÃĐliorer et isoler les bordures, sÃĐparant efficacement les caractÃĻres. Puisque les mots sont gÃĐnÃĐralement sans sens, il n’y a pas de contexte sÃĐmantique pour aider dans ce processus.

RÃĐsultats

DW-GAN a ÃĐtÃĐ testÃĐ contre des images CAPTCHA de trois ensembles de donnÃĐes diversifiÃĐs du dark web, ainsi que contre un synthÃĐtiseur CAPTCHA populaire. Les marchÃĐs du dark web à partir desquels les images provenaient comprenaient deux magasins de cartes, Rescator-1 et Rescator-2, et un nouvel ensemble à partir d’un marchÃĐ ÃĐmergent appelÃĐ Yellow Brick (qui a ÃĐtÃĐ signalÃĐ avoir plus tard disparu à la suite de la fermeture de DarkMarket).

Exemples de CAPTCHAs des trois ensembles de donnÃĐes, ainsi que du synthÃĐtiseur CAPTCHA open source.

Exemples de CAPTCHAs des trois ensembles de donnÃĐes, ainsi que du synthÃĐtiseur CAPTCHA open source.

Selon les auteurs, les donnÃĐes utilisÃĐes pour les tests ont ÃĐtÃĐ recommandÃĐes par des experts en intelligence de menace (CTI) en fonction de leur large diffusion sur les marchÃĐs du dark net.

Les tests de chaque ensemble de donnÃĐes ont impliquÃĐ le dÃĐveloppement d’un spider TOR qui collectait 500 images CAPTCHA, qui ont ÃĐtÃĐ ensuite ÃĐtiquetÃĐes et curÃĐes par des conseillers CTI.

Trois expÃĐriences ont ÃĐtÃĐ conçues. La premiÃĻre a ÃĐvaluÃĐ les performances gÃĐnÃĐrales de DW-GAN pour vaincre les CAPTCHAs par rapport aux mÃĐthodes SOTA standard. Les mÃĐthodes rivales ÃĐtaient un CNN de niveau d’image avec prÃĐtraitement, impliquant une conversion en nuances de gris, une normalisation et un lissage gaussien, un effort acadÃĐmique conjoint de l’Iran et du Royaume-Uni; un CNN de niveau de caractÃĻre avec segmentation basÃĐe sur les intervalles; et un CNN de niveau d’image, de l’UniversitÃĐ d’Oxford au Royaume-Uni.

RÃĐsultats de DW-GAN pour la premiÃĻre expÃĐrience, comparÃĐs aux approches SOTA antÃĐrieures.

RÃĐsultats de DW-GAN pour la premiÃĻre expÃĐrience, comparÃĐs aux approches SOTA antÃĐrieures.

Les chercheurs ont constatÃĐ que DW-GAN a amÃĐliorÃĐ les rÃĐsultats antÃĐrieurs dans l’ensemble (voir tableau ci-dessus).

La deuxiÃĻme expÃĐrience ÃĐtait une ÃĐtude d’ablation, oÃđ divers composants du cadre actif sont supprimÃĐs ou dÃĐsactivÃĐs afin de dÃĐterminer si des facteurs externes ou secondaires influencent les rÃĐsultats.

RÃĐsultats de l'ÃĐtude d'ablation.

RÃĐsultats de l’ÃĐtude d’ablation.

Ici aussi, les auteurs ont constatÃĐ que la dÃĐsactivation de sections clÃĐs de l’architecture rÃĐduisait les performances de DW-GAN dans presque tous les cas (voir tableau ci-dessus).

La troisiÃĻme expÃĐrience hors ligne a comparÃĐ l’efficacitÃĐ de DW-GAN contre une mÃĐthode d’image de rÃĐfÃĐrence et deux mÃĐthodes de niveau de caractÃĻre, afin de dÃĐterminer dans quelle mesure l’ÃĐvaluation des caractÃĻres de DW-GAN influençait son utilitÃĐ dans les cas oÃđ un mot CAPTCHA sans sens ÃĐtait d’une longueur arbitraire (plutÃīt que prÃĐdÃĐfinie). Dans ces cas, la longueur du CAPTCHA variait entre 4 et 7 caractÃĻres.

Pour cette expÃĐrience, les auteurs ont utilisÃĐ un ensemble d’entraÃŪnement de 50 000 images CAPTCHA, avec 5 000 rÃĐservÃĐs pour les tests dans un split typique de 90/10.

Ici aussi, DW-GAN a surpassÃĐ les approches antÃĐrieures:

Test en direct sur un marchÃĐ du dark net

Enfin, DW-GAN a ÃĐtÃĐ dÃĐployÃĐ contre le marchÃĐ du dark net Yellow Brick (alors en ligne). Pour ce test, un navigateur web TOR a ÃĐtÃĐ dÃĐveloppÃĐ qui intÃĐgrait DW-GAN dans ses capacitÃĐs de navigation, analysant automatiquement les dÃĐfis CAPTCHA.

Dans ce scÃĐnario, un CAPTCHA ÃĐtait prÃĐsentÃĐ au crawl automatique pour chaque 15 requÊtes HTTP, en moyenne. Le crawl a pu indexer 1 831 articles illÃĐgaux à vendre sur Yellow Brick, dont 1 223 produits liÃĐs à la drogue (y compris des opioÃŊdes et de la cocaÃŊne), 44 packages de piratage et neuf scans de documents falsifiÃĐs. Au total, le systÃĻme a pu identifier 286 articles liÃĐs à la cybersÃĐcuritÃĐ, dont 102 cartes de crÃĐdit volÃĐes et 131 connexions de comptes volÃĐs. En moyenne, 76 minutes de temps de traitement ont ÃĐtÃĐ nÃĐcessaires pour tenir compte des CAPTCHAs qui protÃĐgeaient tous les 1 831 produits. Aucun humain n’a eu besoin d’intervenir, et aucun cas de dÃĐfaillance de point de terminaison n’est survenu.

Les auteurs notent l’ÃĐmergence de dÃĐfis qui offrent un niveau de sophistication supÃĐrieur aux CAPTCHAs de texte, y compris certains qui semblent modÃĐlisÃĐs sur les tests de Turing, et observent que DW-GAN pourrait Être amÃĐliorÃĐ pour rÃĐpondre à ces nouvelles tendances à mesure qu’elles deviennent populaires.

 

*Test de Turing public entiÃĻrement automatisÃĐ pour faire la distinction entre les ordinateurs et les humains

PubliÃĐ pour la premiÃĻre fois le 11 janvier 2022.

Écrivain sur l'apprentissage automatique, spÃĐcialiste du domaine de la synthÃĻse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]