Взгляд Anderson
Решение CAPTCH с помощью машинного обучения для обеспечения исследований на темную сеть

Совместный академический исследовательский проект из США разработал метод, чтобы обмануть тесты CAPTCHA*, якобы превосходя подобные решения на основе машинного обучения, используя генеративные состязательные сети (GAN) для декодирования визуально сложных задач.
Тестирование новой системы против лучших текущих решений показало, что метод достигает более 94,4% успеха на тщательно отобранном реальном наборе данных, и оказался способным «ликвидировать человеческое участие» при навигации по высоко защищенному рынку Dark Net, автоматически решая задачи CAPTCHA за не более трех попыток.
Авторы утверждают, что их подход представляет собой прорыв для исследователей кибербезопасности, которые традиционно должны были нести затраты на обеспечение участия людей в решении CAPTCH, обычно через платформы краудсорсинга, такие как Amazon Mechanical Turk (AMT).
Если система окажется адаптивной и устойчивой, она может еще больше проложить путь для более автоматизированных систем надзора, а также для индексирования и веб-скрейпинга сетей TOR. Это может позволить проводить масштабные и высокообъемные анализы, а также разработку новых подходов и методов кибербезопасности, которые до сих пор были ограничены CAPTCHA-ограждениями.
Статья названа Противодействие текстовым CAPTCHA в темной сети с помощью генеративного состязательного обучения для активной киберугрозы, и исходит от исследователей Университета Аризоны, Университета Южной Флориды и Университета Джорджии.
Последствия
Поскольку система – называемая Dark Web-GAN (DW-GAN, доступна на GitHub) – кажется намного более производительной, чем ее предшественники, существует возможность, что она будет использоваться как общий метод для преодоления (обычно менее сложных) CAPTCHA-материалов на стандартной сети, либо в этом конкретном воплощении, либо на основе общих принципов, изложенных в новой статье. Однако из-за ограниченного хранилища на GitHub в настоящее время необходимо связаться с ведущим автором Нином Чжаном, чтобы получить данные, связанные с этой основой.
Поскольку DW-GAN имеет «положительную» миссию по взлому CAPTCHA (так же, как и сам TOR изначально имел положительную миссию по защите военных коммуникаций и, позже, журналистов), и поскольку CAPTCHA являются как законной защитой (часто и спорно используемой повсеместной CDN-гигантом CloudFlare), и любимым инструментом нелегальных темных рынков, подход можно рассматривать как «уравновешивающую» технологию.
Авторы сами признают, что DW-GAN имеет более широкие применения:
«[Хотя] это исследование в основном посвящено CAPTCHA темной сети как более сложной проблеме, предложенный метод в этом исследовании, как ожидается, будет применим к другим типам CAPTCHA без потери общности».
Предположительно DW-GAN или подобная система должны стать широко распространенными и очевидными, чтобы темные рынки начали искать менее решаемые машины или, по крайней мере, чтобы развивать свои конфигурации CAPTCHA периодически, «холодная война»-сценарий.
Мотивация
Как отмечает статья, темная сеть является основным источником хакерской разведки, связанной с кибератаками, которые, оцениваются в 10 триллионов долларов США к 2025 году. Следовательно, сети лука остаются относительно безопасной средой для нелегальных темных сообществ, которые могут отталкивать посетителей различными методами, включая сессионные тайм-ауты, куки и аутентификацию пользователей.

Два типа CAPTCHA, оба использующие затеняющие фоны и наклонное письмо, чтобы сделать их менее читаемыми для машин.
Однако авторы отмечают, что ни одна из этих препятствий не так велика, как набор CAPTCH, который пунктирует опыт просмотра в «чувствительном» сообществе:
«Хотя большинство этих мер можно эффективно обойти, реализовав автоматические контрмеры в программе-пауке, CAPTCHA является наиболее препятствующей анти-кравлинг мерой в темной сети, которую нельзя легко обойти из-за высоких когнитивных возможностей, которыми часто не обладают инструменты автоматизации».
Текстовые CAPTCHA не являются единственным доступным вариантом; существуют варианты, знакомые многим из нас, которые бросают вызов пользователю интерпретировать видео, аудио и, особенно, изображения. Тем не менее, как отмечают авторы, текстовые CAPTCHA в настоящее время являются вызовом по выбору для темных рынков, и естественным местом для начала, чтобы сделать сети TOR более восприимчивыми к машинному анализу.
Архитектура
Хотя предыдущий подход из Северо-Западного университета в Китае использовал генеративные состязательные сети для получения моделей функций из платформ CAPTCHA, авторы новой статьи отмечают, что этот метод полагается на интерпретацию растеризованного изображения, а не на более глубокий анализ распознаваемых букв в задаче; и что эффективность DW-GAN не зависит от переменной длины бессмысленных слов (и чисел), обычно встречающихся в темных веб-CAPTCHA.
DW-GAN использует четырехэтапный конвейер: сначала изображение захватывается, а затем подается в модуль очистки фона, который использует GAN, обученный на аннотированных образцах CAPTCHA, и, следовательно, способный различать буквы и затененный фон, на котором они находятся. Извлеченные буквы затем дополнительно фильтруются из любого оставшегося шума после извлечения на основе GAN.
Далее выполняется сегментация извлеченного текста, который затем разбивается на то, что кажется составными символами, с помощью алгоритмов обнаружения контуров.

Сегментация символов изолирует группу пикселей и пытается распознать с помощью трассировки границ.
Наконец, «угаданные» сегменты символов подвергаются распознаванию символов с помощью свёрточной нейронной сети (CNN).

Иногда символы могут перекрываться, гипер-кернинг, специально разработанный для обмана машинных систем. DW-GAN поэтому использует интервальную сегментацию для улучшения и изоляции границ, эффективно разделяя символы. Поскольку слова обычно бессмысленны, нет семантического контекста, который мог бы помочь в этом процессе.

Результаты
DW-GAN был протестирован на изображениях CAPTCHA из трех различных наборов темной сети, а также на популярном синтезаторе CAPTCHA. Темные рынки, откуда произошли изображения, состояли из двух магазинов карт, Rescator-1 и Rescator-2, и нового набора из появившегося рынка под названием Yellow Brick (который, сообщалось, позже исчез в связи с ликвидацией DarkMarket).

Примеры CAPTCHA из трех наборов, а также открытого синтезатора CAPTCHA.
Согласно авторам, данные, использованные при тестировании, были рекомендованы экспертами по киберугрозам (CTI) на основе их широкого распространения по темным сетям.
Тестирование каждого набора данных включало разработку паука, ориентированного на TOR, задачей которого было сбор 500 изображений CAPTCHA, которые затем были помечены и отобраны советниками CTI.
Были разработаны три эксперимента. Первый оценивал общую производительность DW-GAN по преодолению CAPTCHA по сравнению со стандартными методами SOTA. Соперничающие методы были CNN на уровне изображения с предварительной обработкой, включающей преобразование в оттенки серого, нормализацию и гауссовское сглаживание, совместная академическая работа из Ирана и Великобритании; CNN на уровне символа с интервальной сегментацией; и CNN на уровне изображения, из Университета Оксфорда в Великобритании.

Результаты DW-GAN для первого эксперимента, сравненные с предыдущими подходами SOTA.
Исследователи обнаружили, что DW-GAN смог улучшить предыдущие результаты во всех отношениях (см. таблицу выше).
Второй эксперимент был исследованием абляции, где различные компоненты активной основы удаляются или отключаются, чтобы исключить возможность того, что внешние или вторичные факторы влияют на результаты.

Результаты исследования абляции.
И здесь авторы обнаружили, что отключение ключевых разделов архитектуры снижает производительность DW-GAN почти во всех случаях (см. таблицу выше).
Третий офлайн-эксперимент сравнил эффективность DW-GAN с базовым методом на основе изображения и двумя методами на уровне символов, чтобы определить, в какой степени оценка символов DW-GAN влияет на его полезность в случаях, когда бессмысленное слово CAPTCHA является произвольной (а не предопределенной) длины. В этих случаях длина CAPTCHA варьировалась от 4 до 7 символов.
Для этого эксперимента авторы использовали обучающий набор из 50 000 изображений CAPTCHA, с 5 000 зарезервированных для тестирования в типичном разделе 90/10.
И здесь DW-GAN превосходит предыдущие подходы:

Живой тест на темном рынке
Наконец, DW-GAN был развернут против (тогда живого) темного рынка Yellow Brick. Для этого теста был разработан браузер TOR, который интегрировал DW-GAN в свои возможности просмотра, автоматически парсируя задачи CAPTCHA.
В этом сценарии CAPTCHA представлялся автоматизированному пауку для каждых 15 HTTP-запросов в среднем. Паук смог проиндексировать 1 831 незаконный товар, включая 1 223 товара, связанных с наркотиками (включая опиоиды и кокаин), 44 пакета взлома и 9 сканов поддельных документов. Всего система смогла выявить 286 товаров, связанных с кибербезопасностью, включая 102 украденные кредитные карты и 131 украденную учетную запись.
Авторы заявляют, что DW-GAN смог взломать CAPTCHA за три или менее попыток, и что 76 минут обработки были необходимы для учета CAPTCHA, охраняющих все 1 831 продукта. Не потребовалось никакого вмешательства человека, и не произошло ни одного случая сбоя конечной точки.
Авторы отмечают появление задач, которые предлагают более высокий уровень сложности, чем текстовые CAPTCHA, включая некоторые, которые, кажется, моделируются на основе тестов Тьюринга, и отмечают, что DW-GAN может быть улучшен, чтобы приспособиться к этим новым тенденциям, когда они станут популярными.
*Полностью автоматизированный публичный тест Тьюринга, чтобы различать компьютеры и людей
Опубликовано впервые 11 января 2022 года.













