Anderson의 관점
새로운 스팸 도메인 예측을 위한 기계 학습

프랑스의 연구자들은 대량 이메일 스팸을 보내는 스팸머들이 사용할 가능성이 있는 새로 등록된 도메인을 식별하는 방법을 개발했습니다. 때때로 스팸머들이 원치 않는 이메일을 하나도 보내지 않은 경우에도 말입니다.
이 기술은 이메일 출처를 확인하는 방법인 Sender Policy Framework(SPF)가 새로 등록된 도메인에 설정된 방식을 분석하는 데 기반합니다.
シアトル에 본사를 둔 FarSight 社의 수동 DNS(도메인 이름 시스템) 센서를 사용하여 연구자들은 다양한 도메인의 SPF 활동에 대한 거의 실시간 DNS 데이터를 얻을 수 있었습니다.
원래 의료 데이터 처리를 위해 설계되었으며 scikit-learn 머신 러닝 Python 라이브러리에서 구현된 클래스 가중 알고리즘을 사용하여 연구자들은 운영 시작 전에 또는 운영 시작 직후에_pending 스팸 도메인의 3/4를检测할 수 있었습니다.
연구 논문은 다음과 같이 말합니다.
‘단일 TXT 레코드 요청으로 우리는 스팸 도메인의 75%를检测할 수 있으며, 이는 스팸 캠페인의 시작 전에 발생할 수 있습니다. 따라서 우리의 체계는 중요한 반응 속도를 제공합니다. 우리는 메일이 보내지기 전에 스팸 필터 목록에 등록되기 전에 좋은 성능으로 스팸머를检测할 수 있습니다.’
연구자들은 자신의 기술에서 사용된 기능을 기존의 스팸 검출 시스템에 추가하여 성능을 향상시킬 수 있으며, 이는 이미 사용 중인 수동 DNS 피드에서 유추된 SPF 데이터에 의존하기 때문에 계산 오버헤드가 크지 않기 때문입니다.
연구 논문은 Early Detection of Spam Domains with Passive DNS and SPF이며, 그레노블 대학교의 3명의 연구자에 의해 작성되었습니다.
SPF 활동
SPF는 이메일 주소를 스푸핑하는 것을 방지하기 위해 등록된 IP 주소가 이메일을 보내기 위해 사용되었는지 확인하는 데 설계되었습니다.
다음은 SPF의 예입니다.

이 예에서는 ‘Alice’가 ‘Bob’에게 이메일을 보낸다. 공격자는 ‘Mallory’가 ‘Alice’를 가장하려고 하지만, ‘Alice’의 서버만 ‘Alice’의 메일을 보내기 위해 등록되어 있으므로 ‘Mallory’의 가짜 메일은 SPF 검증에 실패합니다. 출처: https://arxiv.org/pdf/2205.01932.pdf
이메일 검증의 다른 방법에는 DomainKeys Identified Mail(DKIM) 서명과 Domain-based Message Authentication, Reporting, and Conformance(DMARC)가 있습니다.
이 세 가지 방법은 모두 도메인 등록업체에서 TXT 레코드(구성 설정)로 등록되어야 합니다.
스팸과 번
스팸머들은 이 점에서 ‘서명 행동’을 보입니다. 그들의 의도(또는 적어도 그들의 활동의 부수적인 효과)는 도메인과 그 IP 주소의 평판을 손상시키기 위해 대량 이메일을 보내는 것입니다. 이는 네트워크 제공업체가 이러한 서비스를 판매하거나 관련 IP 주소가 인기 있는 스팸 필터 목록에 등록되어 향후의 소유자에게 문제가 되기 전까지 계속됩니다.
스팸머들은 도메인과 서비스를 변경하여 이 과정을 반복합니다.
데이터 및 방법
연구에 사용된 도메인은 2021년 5월에서 8월 사이의 기간을 다룹니다. 도메인 목록은 ICANN Central Zone Data Service(CZDS)에서 구축되었습니다.
SURBL 및 SpamHaus 프로젝트의 블랙리스트 정보를 사용하여 연구자들은 새로 등록된 도메인에 대한 잠재적으로 문제가 있는 도메인 등록을 거의 실시간으로 식별할 수 있었습니다.
새로 등록된 도메인에 대한 DNS TXT 쿼리를 캡처한 후, 연구자들은 유효한 SPF 데이터가 있는 쿼리만 유지했습니다.
SPF에는 사용할 수 있는 기능이 몇 가지 있습니다. 새로운 논문에서는 ‘benign’ 도메인 소유자가 주로 +include 메커니즘을 사용하는 반면, 스팸머들은(now deprecated) +ptr 기능을 가장 많이 사용한다는 것을 발견했습니다.
+ptr 조회는 전송 메일의 IP 주소를 호스트 이름(예: GoDaddy )과 관련된 레코드와 비교합니다.
스팸머들은 +ptr의 명백한 엄격성을 이용하여 더 신뢰할 수 있는 모습을 보이려고 하지만, +ptr 조회를 수행하는 데 필요한 리소스는 많은 제공업체가 이 검사를 완전히 건너뛰게 만듭니다.
스팸머들이 SPF를 사용하여 ‘블래스트 앤 번’ 운영을 시작하기 전에 창口을 확보하는 방식은 기계 분석에 의해 추론될 수 있는 특징적인 서명입니다.
결과
연구자들은 50시간 동안 자신의 접근 방식의 스팸 도메인 검출 지연 시간을 SpamHaus 및 SURBL과 비교했습니다.
그들은 자신의 시스템이 70%의 스팸 도메인에서 더 빠르다고 보고하지만, 26%의 검출된 스팸 도메인이 1시간 이내에 상업적 블랙리스트에 나타났음을 인정합니다.
도메인이 Passive DNS 피드에 나타날 때 이미 30%의 도메인이 블랙리스트에 있었습니다.
저자들은 단일 DNS 쿼리에서 79%의 F1 점수를 주장합니다.
그들은 다음과 같이 말합니다.
‘우리의 체계는 도메인 수명 주기의 초기 단계에서 적용할 수 있습니다. 수동 또는 활성 DNS를 사용하여 새로 등록된 도메인에 대한 SPF 규칙을 얻을 수 있으며, 즉시 분류하거나 TXT 쿼리가 도메인에 대한 검출을 기다릴 수 있습니다. ‘
그리고 계속합니다.
‘우리의 최상의 분류기는 85%의 스팸 도메인을檢出하면서 거짓 양성률을 1% 미만으로 유지합니다. 분류 결과는 도메인 SPF 규칙의 내용과 관계, 그리고 DNS 트래픽 기반의 어려운 특징을 사용하여 분류되므로 놀라울 정도입니다.’
‘분류기의 성능은 정적 특징만 사용하더라도 높은 수준에 유지됩니다. 이는 단일 TXT 쿼리(수동 또는 활성 쿼리)에서 수집할 수 있는 특징입니다.’
새로운 방법에 대한 프레젠테이션을 보려면 아래에 포함된 비디오를 확인하십시오.
最初에 게시됨 2022년 5월 5일.












