Góc nhìn Anderson
Dự đoán các miền spam mới thông qua học máy

Những nhà nghiên cứu từ Pháp đã tạo ra một phương pháp để xác định các miền mới được đăng ký có khả năng bị sử dụng bởi những kẻ gửi thư rác với số lượng lớn – đôi khi, ngay cả trước khi những kẻ gửi thư rác này đã gửi một email không mong muốn.
Phương pháp này dựa trên phân tích cách thức mà Sender Policy Framework (SPF), một phương pháp xác minh nguồn gốc email, đã được thiết lập trên các miền mới được đăng ký.
Cảm ơn việc sử dụng passive DNS (Hệ thống tên miền), các nhà nghiên cứu đã có thể thu được dữ liệu DNS gần như thời gian thực từ công ty Farsight có trụ sở tại Seattle, cho thấy hoạt động SPF cho TXT records cho một loạt các miền.
Sử dụng một thuật toán trọng số lớp ban đầu được thiết kế để xử lý dữ liệu y tế không cân bằng, và được thực hiện trong thư viện học máy Python scikit-learn, các nhà nghiên cứu đã có thể phát hiện ba phần tư số miền spam đang chờ xử lý trong vài giây, hoặc thậm chí trước khi chúng hoạt động.
Bài báo cho biết:
‘Với một yêu cầu duy nhất đến TXT record, chúng tôi phát hiện 75% số miền spam, có thể trước khi bắt đầu chiến dịch spam. Do đó, sơ đồ của chúng tôi mang lại tốc độ phản ứng quan trọng: chúng tôi có thể phát hiện những kẻ gửi thư rác với hiệu suất tốt ngay cả trước khi bất kỳ email nào được gửi và trước khi có sự tăng đột ngột trong lưu lượng DNS.’
Các nhà nghiên cứu cho rằng các tính năng được sử dụng trong kỹ thuật của họ có thể được thêm vào các hệ thống phát hiện spam hiện có để tăng hiệu suất, và không cần thêm tải tính toán đáng kể, vì hệ thống dựa trên dữ liệu SPF được suy luận một cách thụ động từ các nguồn cấp dữ liệu DNS gần như thời gian thực đã được sử dụng cho các phương pháp khác để giải quyết vấn đề.
Bài báo này có tiêu đề Phát hiện sớm miền spam với DNS thụ động và SPF, và đến từ ba nhà nghiên cứu tại Đại học Grenoble.
Hoạt động SPF
SPF được thiết kế để tránh việc giả mạo địa chỉ email, bằng cách xác minh rằng một địa chỉ IP đã đăng ký và được ủy quyền đã được sử dụng để gửi email.
Các phương pháp khác để xác minh email bao gồm DomainKeys Identified Mail (DKIM) Signatures, và Domain-based Message Authentication, Reporting, và Conformance (DMARC).
Tất cả các phương pháp này phải được đăng ký dưới dạng TXT records (cài đặt cấu hình) tại nhà đăng ký miền cho miền gửi email chính thức.
Spam và Burn
Những kẻ gửi thư rác thường thể hiện ‘hành vi đặc trưng’ trong trường hợp này. Mục đích của họ (hoặc ít nhất, hiệu ứng phụ của hoạt động của họ) là ‘đốt cháy’ danh tiếng của miền và địa chỉ IP bằng cách gửi thư rác số lượng lớn cho đến khi nhà cung cấp dịch vụ mạng thực hiện hành động hoặc địa chỉ IP được đăng ký với các danh sách lọc thư rác phổ biến, khiến chúng trở nên vô dụng cho người gửi hiện tại (và gây vấn đề cho chủ sở hữu tương lai của địa chỉ IP).
Khi vị trí miền không còn khả thi, những kẻ gửi thư rác sẽ chuyển sang các miền và dịch vụ khác khi cần, lặp lại thủ tục với các địa chỉ IP và cấu hình mới.
Dữ liệu và Phương pháp
Các miền được nghiên cứu cho nghiên cứu này bao gồm khoảng thời gian từ tháng 5 đến tháng 8 năm 2021, như được cung cấp bởi Farsight. Chỉ các miền mới được đăng ký mới được xem xét, vì điều này phù hợp với modus operandi của những kẻ gửi thư rác dai dẳng.
Danh sách miền được xây dựng từ dữ liệu của Dịch vụ Dữ liệu Trung tâm ICANN (CZDS). Thông tin danh sách đen từ SURBL và SpamHaus được sử dụng để xác định gần như thời gian thực các đăng ký miền mới có khả năng gây vấn đề – mặc dù các tác giả thừa nhận rằng bản chất không hoàn hảo của danh sách spam có thể dẫn đến việc các miền vô hại bị phân loại nhầm thành nguồn thư rác tiềm năng.
Sau khi thu thập các truy vấn DNS TXT đến các miền mới được đăng ký tìm thấy trong nguồn cấp dữ liệu DNS thụ động, chỉ các truy vấn có dữ liệu SPF hợp lệ mới được giữ lại, cung cấp sự thật cho các thuật toán.
SPF có một số tính năng có thể sử dụng; bài báo mới này đã tìm thấy rằng trong khi ‘các miền vô hại’ thường sử dụng cơ chế +include, những kẻ gửi thư rác có tỷ lệ sử dụng cao nhất của tính năng +ptr (đã bị lỗi thời).
Một +ptr lookup so sánh địa chỉ IP của máy gửi thư với bất kỳ bản ghi nào tồn tại cho sự liên kết giữa địa chỉ IP đó và tên miền (tức là GoDaddy ). Nếu tên miền được phát hiện, miền của nó sẽ được so sánh với miền được sử dụng đầu tiên để tham chiếu đến bản ghi SPF.
Những kẻ gửi thư rác có thể khai thác sự nghiêm ngặt rõ ràng của +ptr để trình bày mình một cách đáng tin cậy hơn, khi thực tế, các nguồn lực cần thiết để thực hiện các tìm kiếm +ptr với quy mô lớn khiến nhiều nhà cung cấp bỏ qua kiểm tra hoàn toàn.
Tóm lại, cách những kẻ gửi thư rác sử dụng SPF để đảm bảo một cửa sổ cơ hội trước khi bắt đầu hoạt động ‘bắn và đốt cháy’ đại diện cho một chữ ký đặc trưng có thể được suy luận bằng phân tích máy.
Vì những kẻ gửi thư rác thường di chuyển đến các dải IP và tài nguyên gần đó, các nhà nghiên cứu đã phát triển một đồ thị mối quan hệ để khám phá sự tương quan giữa các dải IP và miền. Đồ thị này có thể được cập nhật gần như thời gian thực để đáp ứng với dữ liệu mới từ SpamHaus và các nguồn khác, trở nên hữu ích và hoàn chỉnh hơn theo thời gian.
Các nhà nghiên cứu cho biết:
‘Việc nghiên cứu các cấu trúc này có thể làm nổi bật các miền spam tiềm năng. Trong tập dữ liệu của chúng tôi, chúng tôi đã tìm thấy [cấu trúc] trong đó hàng chục miền sử dụng cùng một [quy tắc SPF] và đa số trong số chúng xuất hiện trong danh sách đen thư rác. Do đó, có thể giả định rằng các miền còn lại có khả năng chưa được phát hiện hoặc chưa hoạt động như miền spam.’
Kết quả
Các nhà nghiên cứu đã so sánh độ trễ phát hiện miền spam của phương pháp của họ với SpamHaus và SURBL trong một khoảng thời gian 50 giờ. Họ báo cáo rằng đối với 70% số miền spam được xác định, hệ thống của họ nhanh hơn, mặc dù thừa nhận rằng 26% số miền spam được xác định đã xuất hiện trong danh sách đen thương mại trong giờ tiếp theo. 30% số miền đã nằm trong danh sách đen khi chúng xuất hiện trong nguồn cấp dữ liệu DNS thụ động.
Các tác giả tuyên bố đạt được điểm F1 là 79% so với sự thật dựa trên một truy vấn DNS duy nhất, trong khi các phương pháp cạnh tranh như Exposure có thể yêu cầu một tuần phân tích sơ bộ.
Họ quan sát:
‘Sơ đồ của chúng tôi có thể được áp dụng tại các giai đoạn đầu của chu kỳ sống của miền: sử dụng DNS thụ động (hoặc chủ động), chúng tôi có thể thu được quy tắc SPF cho các miền mới được đăng ký và phân loại chúng ngay lập tức, hoặc chờ cho đến khi chúng tôi phát hiện các truy vấn TXT đến miền đó và tinh chỉnh phân loại bằng cách sử dụng các tính năng thời gian khó tránh.’
Và tiếp tục:
‘Phân loại器 tốt nhất của chúng tôi phát hiện 85% số miền spam trong khi giữ tốc độ dương giả dưới 1%. Kết quả phát hiện đáng chú ý given rằng việc phân loại chỉ sử dụng nội dung của các quy tắc SPF và mối quan hệ của chúng, và các tính năng khó tránh dựa trên lưu lượng DNS.
‘Hiệu suất của các phân loại器 vẫn cao, ngay cả khi chúng chỉ được cung cấp các tính năng tĩnh có thể thu được từ một truy vấn TXT duy nhất (quan sát thụ động hoặc được hỏi chủ động).’
Để xem một bài trình bày về phương pháp mới, hãy xem video nhúng dưới đây:
Được xuất bản lần đầu vào ngày 5 tháng 5 năm 2022.












