Ângulo de Anderson
Prever Domínios de Spam Novos por Aprendizado de Máquina

Pesquisadores da França desenvolveram um método para identificar domínios recém-registrados que provavelmente serão usados de forma “ataque e fuga” por spammers de alto volume – às vezes, mesmo antes de enviarem um único e-mail indesejado.
A técnica é baseada na análise de como o Sender Policy Framework (SPF), um método de verificação de proveniência de e-mail, foi configurado em domínios recém-registrados.
Graças ao uso de sensores DNS passivos, os pesquisadores conseguiram obter dados DNS em tempo real da empresa Farsight, sediada em Seattle, fornecendo atividade SPF para registros TXT para uma variedade de domínios.
Usando um algoritmo de peso de classe originalmente projetado para processar dados médicos desequilibrados e implementado na biblioteca de aprendizado de máquina Python scikit-learn, os pesquisadores conseguiram detectar três quartos dos domínios de spam pendentes em questão de momentos, ou mesmo antes de sua operação.
O artigo afirma:
‘Com uma única solicitação ao registro TXT, detectamos 75% dos domínios de spam, possivelmente antes do início da campanha de spam. Assim, nosso esquema traz uma importante velocidade de reação: podemos detectar spammers com bom desempenho, mesmo antes de qualquer e-mail ser enviado e antes de um pico no tráfego DNS.’
Os pesquisadores alegam que as características usadas em sua técnica podem ser adicionadas a sistemas de detecção de spam existentes para aumentar o desempenho, sem adicionar sobrecarga computacional significativa, pois o sistema depende de dados SPF inferidos passivamente de feeds DNS em tempo real que já estão em uso para abordagens diferentes para o problema.
O artigo é intitulado Deteção Precoce de Domínios de Spam com DNS Passivo e SPF e vem de três pesquisadores da Universidade de Grenoble.
Atividade SPF
O SPF é projetado para evitar a falsificação de endereços de e-mail, verificando se um endereço IP registrado e autorizado foi usado para enviar um e-mail.

Neste exemplo de SPF, ‘Alice’ envia um e-mail benigno para ‘Bob’, enquanto o atacante ‘Mallory’ tenta se passar por Alice. Ambos estão enviando e-mails de seus próprios domínios, mas apenas o servidor de Alice está registrado para enviar e-mails de Alice, então a falsificação de Mallory é frustrada quando seu e-mail falso falha na verificação SPF. Fonte: https://arxiv.org/pdf/2205.01932.pdf
Outros métodos de verificação de e-mail incluem Assinaturas DomainKeys Identified Mail (DKIM) e Autenticação, Relatório e Conformidade baseada em Domínio (DMARC).
Todos os três métodos devem ser registrados como registros TXT (configurações) no registrador de domínio para o domínio de envio autêntico.
Spam e Queima
Os spammers exibem ‘comportamento de assinatura’ neste aspecto. Sua intenção (ou, pelo menos, o efeito colateral de suas atividades) é ‘queimar’ a reputação do domínio e seus endereços IP, enviando e-mails em massa até que ação seja tomada pelos provedores de serviços de rede que vendem esses serviços; ou os endereços IP associados sejam registrados em listas de spam populares, tornando-os inúteis para o remetente atual (e problemáticos para os futuros proprietários dos endereços IP).

Uma janela estreita de oportunidade: o tempo, em horas, antes de um novo domínio de spam ser banido e tornado inútil por SpamHaus e outros serviços de monitoramento.
Quando a localização do domínio não é mais viável, os spammers se mudam para outros domínios e serviços, conforme necessário, repetindo o procedimento com novos endereços IP e configurações.
Dados e Métodos
Os domínios estudados para a pesquisa abrangem o período entre maio e agosto de 2021, fornecido pela Farsight. Apenas domínios recém-registrados foram considerados, pois isso está de acordo com o modus operandi do spammer persistente.
A lista de domínios foi construída a partir de dados do Serviço de Dados da Zona Central da ICANN (CZDS). Informações de lista negra do SURBL e SpamHaus foram usadas para identificar potencialmente problemáticos novos registros de domínio em tempo real – embora os autores admitam que a natureza imperfeita das listas de spam possa levar a domínios benignos sendo categorizados por engano como fontes potenciais de e-mails em massa.
Depois de capturar consultas DNS TXT para os domínios recém-registrados encontrados no feed DNS passivo, apenas consultas com dados SPF válidos foram retidas, fornecendo a verdade para os algoritmos.

O SPF tem uma série de recursos utilizáveis; o novo artigo descobriu que, enquanto os proprietários de domínios ‘benignos’ mais comumente usam o mecanismo +include, os spammers têm o uso mais alto do recurso (agora depreciado) +ptr.

Uso de regras SPF de spammers, em comparação com o uso padrão.
Uma busca +ptr compara o endereço IP do remetente de e-mail com os registros existentes para uma associação entre esse IP e o hostname (por exemplo, GoDaddy ). Se o hostname for descoberto, seu domínio é comparado com o que foi usado para referenciar o registro SPF.
Os spammers podem explorar a aparente rigidez do +ptr para se apresentarem de forma mais credível, quando na verdade os recursos necessários para realizar buscas +ptr em larga escala causam muitos provedores a pular a verificação por completo.
Em resumo, a forma como os spammers usam o SPF para garantir uma janela de oportunidade antes de a operação ‘blast e burn’ começar representa uma assinatura característica que pode ser inferida por análise de máquina.

Relacionamentos SPF característicos para domínios de spam.
Como os spammers frequentemente se mudam para faixas de IP e recursos próximos, os pesquisadores desenvolveram um gráfico de relacionamento para explorar a correlação entre faixas de IP e domínios. O gráfico pode ser atualizado quase em tempo real em resposta a novos dados do SpamHaus e outras fontes, tornando-se mais útil e completo com o passar do tempo.
Os pesquisadores afirmam:
‘O estudo dessas estruturas pode destacar potenciais domínios de spam. Em nosso conjunto de dados, encontramos [estruturas] em que dezenas de domínios usaram a mesma regra SPF e a maioria deles apareceu em listas negras de spam. Portanto, é razoável supor que os domínios restantes provavelmente ainda não foram detectados ou não estão ativos como domínios de spam.’
Resultados
Os pesquisadores compararam a latência de detecção de domínios de spam de sua abordagem com a do SpamHaus e SURBL durante um período de 50 horas. Eles relatam que, para 70% dos domínios de spam identificados, seu próprio sistema foi mais rápido, embora admitam que 26% dos domínios de spam identificados apareceram nas listas negras comerciais na hora seguinte. 30% dos domínios já estavam em uma lista negra quando apareceram no feed DNS passivo.
Os autores reivindicam uma pontuação F1 de 79% contra a verdade baseada em uma única consulta DNS, enquanto métodos concorrentes, como Exposure, podem exigir uma semana de análise preliminar.
Eles observam:
‘Nosso esquema pode ser aplicado em estágios iniciais do ciclo de vida de um domínio: usando DNS passivo (ou ativo), podemos obter regras SPF para domínios recém-registrados e classificá-los imediatamente, ou esperar até detectarmos consultas TXT para esse domínio e refinar a classificação usando recursos temporais difíceis de evitar.’
E continuam:
‘[Nosso] melhor classificador detecta 85% dos domínios de spam, mantendo uma taxa de falsos positivos abaixo de 1%. Os resultados de detecção são notáveis, considerando que a classificação usa apenas o conteúdo das regras SPF do domínio e suas relações, e recursos baseados em tráfego DNS difíceis de evitar.
‘O desempenho dos classificadores permanece alto, mesmo quando são dados apenas os recursos estáticos que podem ser coletados de uma única consulta TXT (observada passivamente ou consultada ativamente).’
Para ver uma apresentação sobre o novo método, confira o vídeo incorporado abaixo:
Publicado pela primeira vez em 5 de maio de 2022.












