Ángulo de Anderson
Resolviendo CAPTCHAs con Aprendizaje Automático para Habilitar la Investigación de la Red Oscura

Un proyecto de investigación académico conjunto de los Estados Unidos ha desarrollado un método para frustrar las pruebas CAPTCHA*, informando que supera a soluciones de aprendizaje automático similares y de vanguardia al utilizar Redes Adversarias Generativas (GAN) para decodificar los desafíos visualmente complejos.
Al probar el nuevo sistema contra los mejores marcos actuales, los investigadores encontraron que su método logra más del 94,4% de éxito en un conjunto de datos de benchmark del mundo real cuidadosamente curado, y ha demostrado ser capaz de ‘eliminar la participación humana’ al navegar por un mercado emergente de Red Oscura altamente protegido por CAPTCHA, resolviendo automáticamente los desafíos de CAPTCHA en un máximo de tres intentos.
Los autores sostienen que su enfoque representa un avance para los investigadores de ciberseguridad, que tradicionalmente han tenido que soportar los costos de suministrar humanos en el bucle para resolver manualmente las CAPTCHAs, generalmente a través de plataformas de crowdsourcing como Amazon Mechanical Turk (AMT).
Si el sistema puede demostrar ser adaptable y resistente, puede abrir el camino para sistemas de supervisión más automatizados, y para el índice y la extracción de datos de las redes TOR. Esto podría permitir análisis escalables y de alto volumen, así como el desarrollo de nuevos enfoques y técnicas de ciberseguridad, que hasta la fecha han sido obstaculizados por los cortafuegos de CAPTCHA.
El documento se titula Contrarrestar CAPTCHAs de texto de la Red Oscura con Aprendizaje Adversario Generativo para Inteligencia de Amenazas Cibernéticas Proactiva, y proviene de investigadores de la Universidad de Arizona, la Universidad del Sur de la Florida y la Universidad de Georgia.
Implicaciones
Dado que el sistema – llamado Dark Web-GAN (DW-GAN, disponible en GitHub) – es aparentemente mucho más performante que sus predecesores, existe la posibilidad de que se utilice como un método general para superar el material de CAPTCHA (generalmente menos difícil) en la web estándar, ya sea en esta implementación específica o basada en los principios generales que el nuevo documento describe. Debido a la limitada capacidad de almacenamiento en GitHub, sin embargo, actualmente es necesario contactar al autor principal Ning Zhang para obtener los datos asociados con el marco.
Debido a que DW-GAN tiene una ‘misión positiva’ para romper CAPTCHAs (al igual que TOR originalmente tenía una misión positiva para proteger las comunicaciones militares y, más tarde, a los periodistas), y debido a que las CAPTCHAs son tanto una defensa legítima (frecuentemente y controvertidamente utilizada por el gigante de CDN CloudFlare) como una herramienta favorita de los mercados ilegales de la red oscura, el enfoque es arguablemente una ‘tecnología de nivelación’.
Los autores mismos conceden que DW-GAN tiene usos más amplios:
‘[Mientras] este estudio se centra principalmente en CAPTCHAs de la red oscura como un problema más desafiante, el método propuesto en este estudio se espera que sea aplicable a otros tipos de CAPTCHAs sin pérdida de generalidad.’
Presumiblemente, DW-GAN, o un sistema similar, necesitaría volverse amplia y evidentemente difundido para provocar que los mercados de la red oscura busquen soluciones menos resolubles por máquina, o al menos para evolucionar sus configuraciones de CAPTCHA periódicamente, un escenario de ‘guerra fría’.
Motivaciones
Como observa el documento, la red oscura es la principal fuente de inteligencia de hackers relacionada con ataques cibernéticos, que se estiman que costarán a la economía global 10 billones de dólares estadounidenses para 2025. Por lo tanto, las redes de cebolla siguen siendo un entorno relativamente seguro para las comunidades ilegales de la red oscura, que pueden repeler a los intrusos mediante diversos métodos, incluyendo tiempos de espera de sesión, cookies y autenticación de usuario.

Dos tipos de CAPTCHA, ambos utilizando fondos ofuscados y letra inclinada para hacerlos menos legibles por máquina.
Sin embargo, los autores observan que ninguno de estos obstáculos es tan grande como el conjunto de CAPTCHAs que puntuán la experiencia de navegación en una ‘comunidad sensible’:
‘Mientras que la mayoría de estas medidas pueden ser efectivamente sorteadas mediante la implementación de contramedidas automatizadas en un programa de rastreo, CAPTCHA es la medida anti-rastreo más obstaculizadora en la red oscura que no puede ser fácilmente sorteada debido a las altas capacidades cognitivas que a menudo no poseen las herramientas de automatización’
Las CAPTCHAs basadas en texto no son la única opción disponible; existen variantes, familiares para muchos de nosotros, que desafían al usuario a interpretar video, audio y especialmente imágenes. Sin embargo, como observan los autores, las CAPTCHAs basadas en texto son actualmente el desafío de elección para los mercados de la red oscura, y un punto de partida natural para hacer que las redes TOR sean más susceptibles al análisis de máquina.
Arquitectura
Aunque un enfoque anterior de la Universidad del Noroeste en China utilizó Redes Adversarias Generativas para derivar patrones de características de plataformas de CAPTCHA, los autores del nuevo documento observan que este método se basa en la interpretación de una imagen rasterizada, en lugar de un examen más profundo de las letras reconocidas en el desafío; y que la efectividad de DW-GAN no se ve afectada por la longitud variable de palabras sin sentido (y de números) que se encuentran típicamente en las CAPTCHAs de la red oscura.
DW-GAN utiliza una tubería de cuatro etapas: primero, la imagen se captura y se alimenta a un módulo de desenoise de fondo que utiliza un GAN que se ha entrenado en muestras de CAPTCHA anotadas, y que por lo tanto puede distinguir letras del fondo perturbado en el que descansan. Las letras extraídas se filtran aún más para eliminar cualquier ruido después de la extracción basada en GAN.
A continuación, se realiza una segmentación en el texto extraído, que se divide en lo que parecen ser caracteres constituyentes, utilizando algoritmos de detección de contornos.

Segmentación de caracteres aísla el grupo de píxeles y intenta el reconocimiento con trazado de bordes.
Finalmente, los segmentos de caracteres ‘adivinados’ se someten a reconocimiento de caracteres a través de una Red Neuronal Convolucional (CNN).

A veces, los caracteres pueden superponerse, un hipercernido diseñado específicamente para engañar a los sistemas de máquina. DW-GAN utiliza, por lo tanto, una segmentación basada en intervalos para mejorar y aislar los bordes, separando efectivamente los caracteres. Dado que las palabras suelen ser sin sentido, no hay contexto semántico que ayude en este proceso.

Resultados
DW-GAN se probó contra imágenes de CAPTCHA de tres conjuntos de datos de la red oscura diversificados, así como un popular sintetizador de CAPTCHA. Los mercados oscuros de los que se originaron las imágenes comprendían dos tiendas de tarjetas, Rescator-1 y Rescator-2, y un conjunto nuevo de un mercado emergente llamado Yellow Brick (que se informó que más tarde desapareció en el seguimiento del desmantelamiento de DarkMarket).

Ejemplos de CAPTCHAs de los tres conjuntos de datos, así como el sintetizador de CAPTCHA de código abierto.
Según los autores, los datos utilizados en la prueba se recomendaron por expertos en Inteligencia de Amenazas Cibernéticas (CTI) basados en su amplia difusión en los mercados de la red oscura.
La prueba de cada conjunto de datos involucró el desarrollo de una araña que enfrenta TOR para recopilar 500 imágenes de CAPTCHA, que posteriormente se etiquetaron y curaron con asesores de CTI.
Se diseñaron tres experimentos. El primero evaluó el rendimiento general de DW-GAN para derrotar CAPTCHAs en comparación con métodos estándar de vanguardia. Los métodos rivales fueron CNN de nivel de imagen con preprocesamiento, que involucra la conversión a escala de grises, normalización y suavizado gaussiano, un esfuerzo académico conjunto de Irán y el Reino Unido; CNN de nivel de caracter con segmentación basada en intervalos; y CNN de nivel de imagen, de la Universidad de Oxford en el Reino Unido.

Resultados de DW-GAN para el primer experimento, en comparación con enfoques de vanguardia anteriores.
Los investigadores encontraron que DW-GAN fue capaz de mejorar los resultados anteriores en todos los sentidos (ver tabla arriba).
El segundo experimento fue un estudio de ablación, donde se eliminan o deshabilitan varios componentes del marco activo para descartar la posibilidad de que factores externos o secundarios estén influyendo en los resultados.

Resultados del estudio de ablación.
Aquí también, los autores encontraron que deshabilitar secciones clave de la arquitectura redujo el rendimiento de DW-GAN en casi todos los casos (ver tabla arriba).
El tercer experimento fuera de línea comparó la eficacia de DW-GAN contra un método basado en imagen y dos métodos de nivel de caracter, para determinar la medida en que la evaluación de caracteres de DW-GAN influyó en su utilidad en casos en los que una palabra de CAPTCHA sin sentido era de longitud arbitraria (en lugar de predefinida). En estos casos, la longitud de la CAPTCHA variaba entre 4 y 7 caracteres.
Para este experimento, los autores utilizaron un conjunto de entrenamiento de 50,000 imágenes de CAPTCHA, con 5,000 reservados para pruebas en una división típica de 90/10.
Aquí también, DW-GAN superó a los enfoques anteriores:

Prueba en vivo en un mercado de la Red Oscura
Finalmente, DW-GAN se desplegó contra el (entonces activo) mercado de la red oscura Yellow Brick. Para esta prueba, se desarrolló un navegador web que enfrenta TOR que integró DW-GAN en sus capacidades de navegación, analizando automáticamente los desafíos de CAPTCHA.
En este escenario, se presentó una CAPTCHA al rastreador automatizado para cada 15 solicitudes HTTP, en promedio. El rastreador pudo indexar 1,831 artículos ilegales para la venta en Yellow Brick, incluyendo 1,223 productos relacionados con drogas (incluyendo opioides y cocaína), 44 paquetes de piratería, y nueve escaneos de documentos falsificados. En total, el sistema pudo identificar 286 artículos relacionados con la ciberseguridad, incluyendo 102 tarjetas de crédito robadas y 131 inicios de sesión de cuentas robadas. En todos los casos, DW-GAN pudo crackear una CAPTCHA en tres o menos intentos, y se necesitaron 76 minutos de tiempo de procesamiento para dar cuenta de las CAPTCHAs que custodiaban todos los 1,831 productos. No se necesitó la intervención de humanos, y no se produjeron casos de fallo de punto final.
Los autores observan la aparición de desafíos que ofrecen un mayor nivel de sofisticación que las CAPTCHAs de texto, incluyendo algunos que parecen modelados en pruebas de Turing, y observan que DW-GAN podría mejorarse para acomodar estas nuevas tendencias a medida que se vuelvan populares.
*Prueba Pública Completamente Automatizada de Turing para Distinguir entre Computadoras y Humanos
Publicado por primera vez el 11 de enero de 2022.













