Погляд Anderson
Розробка CAPTCHAS з використанням машинного навчання для забезпечення дослідження темної мережі

Спільний академічний дослідницький проєкт зі Сполучених Штатів розробив метод обману тестів CAPTCHA*, який, як повідомляється, перевершує подібні рішення на основі машинного навчання, що використовують генеративні суперницькі мережі (GAN), для декодування візуально складних завдань.
Під час тестування нової системи проти найкращих поточних каркасів дослідники виявили, що їхній метод досягає успіху понад 94,4% на ретельно відібраному реальному наборі даних, і довів здатність «виключити участь людини» при навігації по високозахищеному новому ринку Dark Net, автоматично вирішуючи завдання CAPTCHA за три спроби.
Автори стверджують, що їхній підхід представляє прорив для дослідників кібербезпеки, які традиційно мали витрати на забезпечення участі людини в ручному вирішенні CAPTCHA, зазвичай через платформи краудсорсингу, такі як Amazon Mechanical Turk (AMT).
Якщо система зможе довести свою адаптивність і стійкість, вона може далі відкрити шлях для більш автоматизованих систем нагляду, а також для індексування і веб-скрейпінгу мереж TOR. Це може дозволити масштабовані та високотемпові аналізи, а також розвиток нових підходів і технік кібербезпеки, які до цього дня були обмежені CAPTCHA-брандмауерами.
Документ документ називається Протидія текстовим CAPTCHA темної мережі з генеративним суперницьким навчанням для проактивного кібер-розвідки, і походить від дослідників Університету Аризони, Університету Південної Флориди та Університету Джорджії.
Наслідки
Відтак система – звана Dark Web-GAN (DW-GAN, доступна на GitHub) – явно більш продуктивна, ніж її попередники, існує можливість, що вона буде використовуватися як загальний метод для подолання (зазвичай менш складних) CAPTCHA-матеріалів на стандартному вебі, або в цій конкретній реалізації, або на основі загальних принципів, які викладені в новій статті. Через обмежені можливості зберігання на GitHub, однак, зараз необхідно зв’язатися з головним автором Нінгом Чжаном, щоб отримати дані, пов’язані з каркасом.
Оскільки DW-GAN має «позитивну» місію для обману CAPTCHA (подібно до того, як сам TOR спочатку мав позитивну місію для захисту військової зв’язку та пізніше журналістів), і оскільки CAPTCHA є і легітимною обороною (часто і суперечливо використовуваною всепроникним гігантом CDN CloudFlare) і улюбленим інструментом нелегітимних темних веб-рінків, підхід є доволі «рівняючим» технологіям.
Автори самі визнають, що DW-GAN має ширше застосування:
‘[Хоча] це дослідження в основному зосереджене на CAPTCHA темної мережі як більш складній проблемі, запропонований метод у цьому дослідженні очікується бути застосовним до інших типів CAPTCHA без втрати загальності.’
Ймовірно, DW-GAN або подібна система повинна стати широко поширеною і очевидною, щоб спонукати темні веб-рінки шукати менш машинно-розв’язувані рішення, або принаймні періодично змінювати свої конфігурації CAPTCHA, «холодна війна»-сценарій.
Мотивація
Як зазначається в статті, темна мережа є основним джерелом розвідки хакерів щодо кібератак, які, як оцінюються, коштують глобальній економіці 10 трильйонів доларів США до 2025 року. Тому мережі-луковиці залишаються відносно безпечним середовищем для нелегітимних темних веб-спільнот, які можуть відштовхнути нападників різними методами, включаючи часові інтервали сеансу, файли cookie та автентифікацію користувача.

Два типи CAPTCHA, обидва використовують розмиті фони та нахилений шрифт, щоб зробити їх менш машинозчитуваними.
Однак автори зазначають, що жодна з цих перешкод не така велика, як маса CAPTCHA, які пунктуують досвід перегляду в «чутливому» співтоваристві:
‘Хоча більшість цих заходів можна ефективно обійти шляхом реалізації автоматизованих контрзаходів у програмі-кравлері, CAPTCHA є найбільш перешкоджаючим анти-кравлерським заходом у темній мережі, який не можна легко обійти через високі когнітивні можливості, яких часто не володіють інструментами автоматизації’
Текстові CAPTCHA не єдиний варіант; існують варіанти, знайомі багатьом з нас, які викликають у користувача інтерпретацію відео, аудіо та особливо зображень. Тим не менш, як зазначають автори, текстові CAPTCHA є поточним викликом для темних веб-рінків, і природним місцем для початку того, щоб зробити мережі TOR більш сприйнятливими до машинного аналізу.
Архітектура
Хоча попередній підхід від Північно-Західного університету в Китаї використовував генеративні суперницькі мережі для виведення моделей особливостей з платформ CAPTCHA, автори нової статті зазначають, що цей метод залежить від інтерпретації растеризованого зображення, а не глибшого дослідження літер, визнаних у виклику; і що ефективність DW-GAN не залежить від змінної довжини безглуздих слів (і чисел), які зазвичай зустрічаються в темній мережі CAPTCHA.
DW-GAN використовує чотириетапний потік: спочатку зображення захоплюється, а потім подається в модуль очищення фону, який використовує GAN, навчений на анотованих зразках CAPTCHA, і тому能够 розрізнити літери від розмитого фону, на якому вони розташовані. Вилучені літери потім додатково фільтруються від шуму після витягування на основі GAN.
Далі проводиться сегментація витягнутого тексту, який потім розбивається на те, що здається складовими символами, за допомогою алгоритмів виявлення контурів.

Сегментація символів ізолює групу пікселів і намагається розпізнати з контурною трасуванням.
Нарешті, «вгадані» сегменти символів піддаються розпізнаванню символів через звивисту нейронну мережу (CNN).

Іноді символи можуть перекриватися, гіпер-кернінг, спеціально розроблений для обману машинних систем. DW-GAN тому використовує інтервал-основану сегментацію для покращення та ізоляції кордонів, ефективно розділяючи символи. Оскільки слова зазвичай безглузді, немає семантичного контексту для допомоги в цьому процесі.

Результати
DW-GAN був протестований проти зображень CAPTCHA з трьох різноманітних наборів даних темної мережі, а також популярного синтезатора CAPTCHA. Темні ринки, з яких походили зображення, складалися з двох карткових магазинів, Rescator-1 і Rescator-2, і нового набору з нового ринку під назвою Yellow Brick (який був повідомлено, що пізніше зник після ліквідації DarkMarket).

Зразки CAPTCHA з трьох наборів даних, а також відкритого синтезатора CAPTCHA.
За словами авторів, дані, використані для тестування, були рекомендовані експертами з кібер-розвідки (CTI) на основі їх широкого поширення по темній мережі.
Тестування кожного набору даних включало розробку павука, орієнтованого на TOR, який збирав 500 зображень CAPTCHA, які потім маркувалися та курирувалися консультантами CTI.
Було розроблено три експерименти. Перший оцінював загальну продуктивність DW-GAN щодо стандартних методів SOTA. Рівні методи були рівень зображення CNN з попередньою обробкою, що включало перетворення у відтінки сірого, нормалізацію та гауссове згладжування, спільна академічна робота з Ірану та Великої Британії; рівень символу CNN з інтервал-основаною сегментацією; і рівень зображення CNN, з Університету Оксфорда у Великій Британії.

Результати з DW-GAN для першого експерименту, порівняно з попередніми підходами рівня стану мистецтва.
Дослідники виявили, що DW-GAN能够 покращити попередні результати по всьому фронту (див. таблицю вище).
Другий експеримент був абляційним дослідженням, де різні компоненти активної структури видаляються або відключаються, щоб виключити можливість того, що зовнішні або вторинні чинники впливають на результати.

Результати абляційного дослідження.
І тут автори виявили, що відключення ключових секцій архітектури знижує продуктивність DW-GAN майже у всіх випадках (див. таблицю вище).
Третій офлайн-експеримент порівнював ефективність DW-GAN проти базового зображення-методу та двох символ-рівневих методів, щоб визначити, якою мірою оцінка символів DW-GAN впливає на його корисність у випадках, коли безглузде слово CAPTCHA довільної (а не попередньо визначеної) довжини. У цих випадках довжина CAPTCHA варіювалася від 4 до 7 символів.
Для цього експерименту автори використали навчальний набір із 50 000 зображень CAPTCHA, з 5 000, що залишилися для тестування у типовому розрізі 90/10.
І тут DW-GAN перевершив попередні підходи:

Живий тест на ринку темної мережі
Нарешті, DW-GAN був розгорнутий проти (тоді активного) ринку Yellow Brick темної мережі. Для цього тесту був розроблений браузер, орієнтований на TOR, який інтегрував DW-GAN у свої можливості перегляду, автоматично розбираючи завдання CAPTCHA.
У цьому сценарії CAPTCHA представлявся автоматизованому кравлеру для кожних 15 HTTP-запитів у середньому. Кравлер能够 індексувати 1 831 незаконний товар, який продавався на Yellow Brick, включаючи 1 223 продукти, пов’язані з наркотиками (включаючи опіоїди та кокаїн), 44 пакети хакінгу та дев’ять сканів підроблених документів. Загалом система能够 ідентифікувати 286 товарів, пов’язаних з кібербезпекою, включаючи 102 вкрадені кредитні карти та 131 вкрадену облікову інформацію. Автори заявляють, що DW-GAN能够 вирішити CAPTCHA за три спроби, і що 76 хвилин часу обробки були необхідні для обліку CAPTCHA, які охороняли всі 1 831 продукти. Люди не були потрібні для втручання, і не відбулося жодного випадку відмови кінцевої точки.
Автори відзначають появу завдань, які пропонують більший рівень складності, ніж текстові CAPTCHA, включаючи деякі, які схоже змодельовані на турингові тести, і спостерігають, що DW-GAN能够 бути покращений для задоволення цих нових тенденцій, коли вони стають популярними.
*Комплексно автоматизований публічний тест Тьюринга для визначення комп’ютерів і людей
Перше видання 11 січня 2022 року.













