Погляд Anderson

Передбачення нових спам-доменів за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Франції розробили метод ідентифікації нових зареєстрованих доменів, які, ймовірно, будуть використані в режимі “hit and run” високовolume електронними спамерами – іноді навіть до того, як спамери відправили хочабодь одну нежадану електронну пошту.

Цей метод заснований на аналізі того, як Sender Policy Framework (SPF), метод перевірки походження електронної пошти, встановлений на нових зареєстрованих доменах.

За допомогою пасивних (пасивних) DNS-сенсорів (системи доменних імен) дослідники змогли отримати майже в режимі реального часу DNS-дані від компанії Farsight, що базується в Сіетлі, і отримати інформацію про SPF-діяльність для TXT-записів для ряду доменів.

За допомогою алгоритму вагових класів, спочатку розробленого для обробки несбалансованих медичних даних, і реалізованого в бібліотеці машинного навчання Python scikit-learn, дослідники змогли виявити три чверті майбутніх спам-доменів уже через кілька моментів, або навіть до початку їхньої діяльності.

У статті зазначено:

‘За допомогою одного запиту до TXT-запису ми виявляємо 75% спам-доменів, можливо, навіть до початку спам-кампанії. Таким чином, наша схема забезпечує важливу швидкість реакції: ми можемо виявляти спамерів з хорошою продуктивністю, навіть до того, як буде відправлено будь-яка пошта, і до того, як буде спостережуватися пік в DNS-трафіку.’

Дослідники стверджують, що характеристики, використані в їхньому методі, можуть бути додані до існуючих систем виявлення спаму для підвищення продуктивності, і це не додасть суттєвого обчислювального навантаження, оскільки система використовує пасивно витягнуті SPF-дані з майже в режимі реального часу DNS-потоків, які вже використовуються для різних підходів до проблеми.

Стаття опублікована під назвою Раннє виявлення спам-доменів з пасивним DNS і SPF і походить від трьох дослідників Університету Гренобля.

Діяльність SPF

SPF розроблений для запобігання підробці електронних адрес, шляхом перевірки того, що зареєстрований і авторизований IP-адрес використовувався для відправки електронної пошти.

У цьому прикладі SPF, 'Аліса' відправляє доброзичливу електронну пошту 'Бобу', тоді як атакувальник 'Маллорі' намагається видати себе за Алісу. Обидва відправляють пошту з власних доменів, але тільки сервер Аліси зареєстрований для відправки пошти Аліси, тому підробка Маллорі зазнає поразки, коли його фальшиву пошту не проходить перевірку SPF.

У цьому прикладі SPF, ‘Аліса’ відправляє доброзичливу електронну пошту ‘Бобу’, тоді як атакувальник ‘Маллорі’ намагається видати себе за Алісу. Обидва відправляють пошту з власних доменів, але тільки сервер Аліси зареєстрований для відправки пошти Аліси, тому підробка Маллорі зазнає поразки, коли його фальшиву пошту не проходить перевірку SPF. Джерело: https://arxiv.org/pdf/2205.01932.pdf

Інші методи перевірки електронної пошти включають DomainKeys Identified Mail (DKIM) Підписи, і Domain-based Message Authentication, Reporting, and Conformance (DMARC).

Всі три методи повинні бути зареєстровані як TXT-записи (конфігураційні налаштування) у реєстратора домену для автентичного домену відправника.

Спам і підпал

Спамери демонструють “сигнатурну поведінку” в цьому відношенні. Їхня мета (або, принаймні, побічна дія їхньої діяльності) полягає в тому, щоб “підпалити” репутацію домену та його IP-адрес, розсилаючи масову пошту, поки не буде прийнято заходів з боку постачальників мережевих послуг, які продають ці послуги; або поки пов’язані з ними IP-адреси не будуть зареєстровані в популярних списках фільтрації спаму, що робить їх непридатними для поточного відправника (і проблематичними для майбутніх власників цих IP-адрес).

Вузьке вікно можливостей: час, протягом якого новий спам-домен забороняється і ставає непридатним для служби моніторингу SpamHaus та інших служб.

Вузьке вікно можливостей: час, протягом якого новий спам-домен забороняється і ставає непридатним для служби моніторингу SpamHaus та інших служб.

Коли місце розташування домену більше не є придатним, спамери переходять до інших доменів і послуг, повторюючи процедуру з новими IP-адресами і конфігураціями.

Дані і методи

Досліджувані домени охоплюють період з травня по серпень 2021 року, як це надавалося компанією Farsight. Були розглянуті тільки свіжо зареєстровані домени, оскільки це відповідає модусу operandi постійного спамера.

Список доменів був побудований на основі даних служби CZDS (Central Zone Data Service) організації ICANN. Інформація про чорні списки з проектів SURBL і SpamHaus була використана для майже в режимі реального часу ідентифікації потенційно проблемних нових реєстрацій доменів – хоча автори визнають, що неідеальна природа списків спаму може привести до того, що безвінні домени будуть випадково категоризовані як потенційні джерела масової пошти.

Після захоплення DNS-запитів до нових зареєстрованих доменів, знайдених у пасивному DNS-потоці, були збережені тільки запити з дійсними SPF-даними, що забезпечило основу для алгоритмів.

SPF має ряд корисних функцій; нова стаття виявила, що, хоча “безвінні” власники доменів найчастіше використовують механізм +include, спамери мають найбільше використання (зараз застарілої) функції +ptr.

Використання правил SPF спамерами порівняно зі стандартним використанням.

Використання правил SPF спамерами порівняно зі стандартним використанням.

Функція +ptr порівнює IP-адресу відправника пошти з існуючими записами для асоціації між цією IP-адресою та хостом (тобто GoDaddy ). Якщо хост виявлений, його домен порівнюється з доменом, який спочатку використовувався для посилання на SPF-запис.

Спамери можуть використати видимість +ptr, щоб представити себе в більш правдоподібному світлі, хоча насправді ресурси, необхідні для проведення масштабних перевірок +ptr, змушують багатьох постачальників пропускати цю перевірку зовсім.

У короткому, спосіб, яким спамери використовують SPF, щоб забезпечити вікно можливостей перед початком операції “бласт і підпал”, являє собою характерну сигнатуру, яку можна вивести за допомогою машинного аналізу.

Характерні SPF-відносини для спам-доменів.

Характерні SPF-відносини для спам-доменів.

Оскільки спамери часто переходять до дуже близьких діапазонів IP-адрес і ресурсів, дослідники розробили граф关系, щоб дослідити кореляцію між діапазонами IP-адрес і доменами. Граф можна оновлювати майже в режимі реального часу у відповідь на нові дані з SpamHaus і інших джерел, стаючи більш корисним і повним протягом часу.

Дослідники зазначають:

‘Дослідження цих структур може виділити потенційні спам-домени. У нашому наборі даних ми знайшли [структури], в яких десятки доменів використовували одну й ту ж SPF-правило, і більшість з них з’являлися в списках спаму. Тому можна вважати, що інші домени, ймовірно, ще не були виявлені або не є активними спам-доменами.’

Результати

Дослідники порівняли затримку виявлення спам-доменів свого підходу з SpamHaus і SURBL протягом 50-годинного періоду. Вони повідомляють, що для 70% спам-доменів, виявлених їхнім підходом, їхня система була швидшою, хоча вони визнають, що 26% виявлених спам-доменів з’явилися в комерційних чорних списках протягом наступної години. 30% доменів вже були в чорному списку, коли вони з’явилися в пасивному DNS-потоці.

Автори заявляють про F1-оцінку 79% проти істинної підстави на основі одного DNS-запиту, тоді як інші методи, такі як Exposure, можуть вимагати тижня попереднього аналізу.

Вони спостерігають:

‘Наша схема може бути застосована на ранніх стадіях життєвого циклу домену: за допомогою пасивного (або активного) DNS ми можемо отримати SPF-правила для нових зареєстрованих доменів і класифікувати їх негайно, або чекати, поки не виявимо TXT-запити до цього домену і уточнимо класифікацію, використовуючи важкообхідні тимчасові особливості.’

І продовжують:

‘Наш найкращий класифікатор виявляє 85% спам-доменів, зберігаючи рівень хибних позитивних результатів нижче 1%. Результати виявлення є видатними, враховуючи, що класифікація використовує тільки вміст SPF-правил доменів і їхніх відносин, а також важкообхідні особливості, засновані на DNS-трафіку.

‘Продуктивність класифікаторів залишається високою, навіть якщо їм надаються тільки статичні особливості, які можна зібрати з одного TXT-запиту (спостережуваного пасивно або активного запиту).’

Для перегляду презентації про новий метод дивіться вкладений відеоролик нижче:

 

Опубліковано вперше 5 травня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai