Взгляд Anderson

Предвидение новых спам-доменов с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Франции разработали метод выявления недавно зарегистрированных доменов, которые, скорее всего, будут использоваться в режиме “удар и бег” высокообъемными спамерами – иногда даже до того, как спамеры отправили хотя бы одно нежелательное письмо.

Метод основан на анализе того, как настроен Sender Policy Framework (SPF), метод проверки происхождения электронной почты, на недавно зарегистрированных доменах.

Благодаря использованию пассивных DNS-сенсоров (системы доменных имен), исследователи смогли получить gần реальное время DNS-данных от компании Farsight, что дало SPF-активность для TXT-записей для ряда доменов.

Используя алгоритм классов весов, первоначально разработанный для обработки несбалансированных медицинских данных и реализованный в библиотеке машинного обучения scikit-learn на языке Python, исследователи смогли обнаружить три четверти ожидаемых спам-доменов в течение нескольких моментов или даже до начала их работы.

В статье говорится:

‘С помощью одного запроса к TXT-записи мы обнаруживаем 75% спам-доменов, возможно, до начала спам-кампании. Таким образом, наша схема обеспечивает важную скорость реакции: мы можем обнаруживать спамеров с хорошей производительностью даже до того, как будет отправлено какое-либо письмо, и до того, как произойдет всплеск DNS-трафика.’

Исследователи утверждают, что функции, используемые в их методе, могут быть добавлены к существующим системам обнаружения спама, чтобы повысить производительность, и без добавления значительного вычислительного overhead, поскольку система полагается на SPF-данные, пассивно полученные из gần реального времени DNS-потоков, которые уже используются для различных подходов к этой проблеме.

Статья называется Раннее обнаружение спам-доменов с помощью пассивного DNS и SPF и исходит от трех исследователей из Университета Гренобля.

Активность SPF

SPF предназначен для предотвращения подделки электронных адресов, проверяя, что зарегистрированный и авторизованный IP-адрес был использован для отправки электронного письма.

В этом примере SPF 'Алиса' отправляет доброе письмо 'Бобу', в то время как атакующий 'Маллори' пытается выдать себя за Алису. Оба отправляют письма со своих собственных доменов, но только сервер Алисы зарегистрирован для отправки писем Алисы, поэтому подделка Маллори сорвана, когда его фальшивое письмо не проходит проверку SPF.

В этом примере SPF ‘Алиса’ отправляет доброе письмо ‘Бобу’, в то время как атакующий ‘Маллори’ пытается выдать себя за Алису. Оба отправляют письма со своих собственных доменов, но только сервер Алисы зарегистрирован для отправки писем Алисы, поэтому подделка Маллори сорвана, когда его фальшивое письмо не проходит проверку SPF. Источник: https://arxiv.org/pdf/2205.01932.pdf

Другие методы проверки электронной почты включают DomainKeys Identified Mail (DKIM) подписи и Domain-based Message Authentication, Reporting, and Conformance (DMARC).

Все три метода должны быть зарегистрированы в качестве TXT-записей (конфигурационных настроек) в регистраторе домена для аутентичного отправляющего домена.

Спам и сжигание

Спамеры демонстрируют ‘сигнатурное поведение’ в этом отношении. Их цель (или, по крайней мере, побочный эффект их действий) – ‘сжечь’ репутацию домена и его IP-адресов, рассылая массовую почту до тех пор, пока не будет принято действие со стороны поставщиков сетевых услуг; или связанные с ними IP-адреса не будут зарегистрированы в популярных списках фильтров спама, что делает их бесполезными для текущего отправителя (и проблематичными для будущих владельцев IP-адресов).

Узкое окно возможностей: время, в часах, до того, как новый спам-домен будет заблокирован и станет бесполезным для сервисов мониторинга, таких как SpamHaus.

Узкое окно возможностей: время, в часах, до того, как новый спам-домен будет заблокирован и станет бесполезным для сервисов мониторинга, таких как SpamHaus.

Когда местоположение домена больше не является действительным, спамеры переходят к другим доменам и услугам по мере необходимости, повторяя процедуру с новыми IP-адресами и конфигурациями.

Данные и методы

Изученные домены охватывают период с мая по август 2021 года, предоставленный Farsight. Были рассмотрены только свежие зарегистрированные домены, поскольку это соответствует модусу operandi настойчивого спамера.

Список доменов был построен на основе данных из ICANN Central Zone Data Service (CZDS). Информация из черных списков проектов SURBL и SpamHaus использовалась для gần реального времени выявления потенциально проблемных новых регистраций доменов – хотя авторы признают, что несовершенный характер списков спама может привести к тому, что добросовестные домены будут случайно классифицированы как потенциальные источники массовой почты.

После захвата DNS-запросов TXT к зарегистрированным доменам, найденным в пассивном DNS-потоке, были сохранены только запросы с действительными SPF-данными, что дало основу для алгоритмов.

SPF имеет ряд полезных функций; новая статья обнаружила, что, хотя ‘добросовестные’ владельцы доменов чаще всего используют механизм +include, спамеры имеют наибольшее использование (ныне устаревшей) функции +ptr.

Использование SPF-правил спамерами по сравнению с стандартным использованием.

Использование SPF-правил спамерами по сравнению с стандартным использованием.

Проверка +ptr сравнивает IP-адрес отправляющего почты с тем, что существует в записях для ассоциации между этим IP и именем хоста (т.е. GoDaddy ). Если имя хоста обнаружено, его домен сравнивается с тем, который был первоначально использован для ссылки на SPF-запись.

Спамеры могут использовать видимую строгость +ptr, чтобы представить себя в более достоверном свете, когда на самом деле ресурсы, необходимые для проведения масштабных проверок +ptr, заставляют многих провайдеров пропустить проверку совсем.

Вкратце, способ, которым спамеры используют SPF, чтобы обеспечить окно возможностей перед началом операции ‘удар и бег’, представляет собой характерную сигнатуру, которую можно вывести с помощью машинного анализа.

Характерные SPF-отношения для спам-доменов.

Характерные SPF-отношения для спам-доменов.

Поскольку спамеры часто переходят к ближайшим диапазонам IP-адресов и ресурсам, исследователи разработали граф отношений, чтобы изучить корреляцию между диапазонами IP и доменами. Граф может быть обновлен почти в реальном времени в ответ на новые данные из SpamHaus и других источников, становясь более полезным и полным со временем.

Исследователи заявляют:

‘Изучение этих структур может выявить потенциальные спам-доменов. В нашем наборе данных мы обнаружили [структуры], в которых десятки доменов использовали одно и то же [SPF] правило, и большинство из них появилось в списках спама. Таким образом, можно предположить, что оставшиеся домены, скорее всего, еще не были обнаружены или не являются активными спам-доменами.’

Результаты

Исследователи сравнили задержку обнаружения спам-доменов своего подхода с SpamHaus и SURBL за 50-часовой период. Они сообщают, что для 70% спам-доменов, выявленных их системой, она была быстрее, хотя и признают, что 26% выявленных спам-доменов появились в коммерческих черных списках в течение следующего часа. 30% доменов уже были в черном списке, когда они появились в пассивном DNS-потоке.

Авторы заявляют об показателе F1 в 79% против основы истинности на основе одного DNS-запроса, в то время как конкурирующие методы, такие как Exposure, могут требовать недели предварительного анализа.

Они отмечают:

‘Наша схема может быть применена на ранних стадиях жизненного цикла домена: используя пассивный (или активный) DNS, мы можем получить SPF-правила для недавно зарегистрированных доменов и классифицировать их сразу, или подождать, пока мы обнаружим TXT-запросы к этому домену и уточнить классификацию, используя труднообходные временные функции.’

И продолжают:

‘[Наш] лучший классификатор обнаруживает 85% спам-доменов, сохраняя уровень ложных положительных результатов ниже 1%. Результаты обнаружения замечательны, учитывая, что классификация использует только содержание SPF-правил доменов и их отношения, а также труднообходные функции, основанные на DNS-трафике.

‘Производительность классификаторов остается высокой, даже если им предоставляются только статические функции, которые можно собрать из одного TXT-запроса (наблюдаемого пассивно или активно запрошенного).’

Чтобы увидеть презентацию о новом методе, посмотрите встроенное видео ниже:

 

Опубликовано впервые 5 мая 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai