มุมมองของ Anderson
การคาดการณ์โดเมน 垃圾จดหมายใหม่ผ่าน Machine Learning

นักวิจัยจากฝรั่งเศสได้พัฒนาวิธีการระบุโดเมนที่จดทะเบียนใหม่ซึ่งมีแนวโน้มที่จะถูกใช้ในลักษณะ ‘ฮิตและวิ่ง’ โดยผู้ส่ง 垃圾จดหมายจำนวนมาก – บางครั้งแม้กระทั่งก่อนที่ผู้ส่งจะส่งอีเมลที่ไม่พึงประสงค์ออกไป
เทคนิคนี้เป็นไปตามการวิเคราะห์วิธีการตั้งค่า Sender Policy Framework (SPF) ซึ่งเป็นวิธีการยืนยันจุดกำเนิดของอีเมลบนโดเมนที่จดทะเบียนใหม่
ด้วยการใช้ passive DNS (Domain Name System) sensors นักวิจัยสามารถรับข้อมูล DNS ในเวลาจริงจากบริษัท Farsight ในซีแอตเทิล ซึ่งให้ข้อมูล SPF สำหรับ TXT records สำหรับโดเมนต่างๆ
โดยใช้อัลกอริทึม class weight ที่ออกแบบมาเพื่อประมวลผลข้อมูลทางการแพทย์ที่ไม่สมดุล และใช้ไลบรารี machine learning ของ Python ชื่อ scikit-learn นักวิจัยสามารถตรวจจับโดเมน 垃圾จดหมายที่กำลังจะเกิดขึ้นได้ภายในไม่กี่วินาที หรือแม้กระทั่งก่อนที่จะเริ่มการดำเนินการ
ในบทความวิจัยระบุว่า:
‘ด้วยการร้องขอเพียงครั้งเดียวไปยัง TXT record เราสามารถตรวจจับโดเมน 垃圾จดหมายได้ 75% ซึ่งอาจจะเกิดขึ้นก่อนที่การรณรงค์ 垃圾จดหมายจะเริ่มต้นขึ้น ดังนั้น วิธีการของเราจึงมีความเร็วในการตอบสนอง: เราสามารถตรวจจับ 垃圾จดหมายได้ด้วยประสิทธิภาพที่ดีแม้กระทั่งก่อนที่จะส่งอีเมลและก่อนที่จะมีการเพิ่มขึ้นของการร้องขอ DNS’
นักวิจัยอ้างว่าลักษณะที่ใช้ในเทคนิคนี้สามารถเพิ่มประสิทธิภาพของระบบตรวจจับ 垃圾จดหมายที่มีอยู่แล้วโดยไม่ต้องเพิ่มการประมวลผลที่สำคัญ เนื่องจากระบบนี้พึ่งพาข้อมูล SPF ที่ได้รับมาจากข้อมูล DNS ในเวลาจริงที่มีอยู่แล้ว
บทความวิจัยชื่อ Early Detection of Spam Domains with Passive DNS and SPF มาจากนักวิจัยสามคนจากมหาวิทยาลัย Grenoble
SPF Activity
SPF ได้รับการออกแบบมาเพื่อป้องกันการปลอมแปลงที่อยู่อีเมลโดยการตรวจสอบว่าที่อยู่ IP ที่ได้รับการลงทะเบียนและได้รับอนุญาตได้ถูกใช้ในการส่งอีเมลหรือไม่

ในตัวอย่างนี้ของ SPF ‘Alice’ ส่งอีเมลที่ไม่มี 垃圾จดหมายไปยัง ‘Bob’ ในขณะที่ผู้โจมตี ‘Mallory’ พยายามปลอมแปลง ‘Alice’ ทั้งสองคนกำลังส่งอีเมลจากโดเมนของตนเอง แต่เพียง ‘Alice’ เท่านั้นที่ได้รับการลงทะเบียนเพื่อส่งอีเมลของ ‘Alice’ ดังนั้นการปลอมแปลงของ ‘Mallory’ จึงถูกขัดขวางเมื่ออีเมลปลอมของเขาไม่ผ่านการตรวจสอบ SPF แหล่งที่มา: https://arxiv.org/pdf/2205.01932.pdf
วิธีการยืนยันอีเมลอื่นๆ ได้แก่ DomainKeys Identified Mail (DKIM) Signatures และ Domain-based Message Authentication, Reporting, and Conformance (DMARC)
ทั้งสามวิธีการต้องได้รับการลงทะเบียนเป็น TXT records (ค่ากำหนด) ที่ผู้จดทะเบียนโดเมนสำหรับโดเมนที่ส่งอีเมลอย่างถูกต้อง
Spam and Burn
ผู้ส่ง 垃圾จดหมายมีพฤติกรรมที่เป็น ‘ลักษณะเฉพาะ’ ในด้านนี้ ความตั้งใจของพวกเขา (หรือผลกระทบที่ไม่ได้ตั้งใจของกิจกรรมของพวกเขา) คือการ ‘เผา’ ชื่อเสียงของโดเมนและที่อยู่ IP โดยการส่งอีเมลจำนวนมากจนกว่าการดำเนินการจะถูกดำเนินการโดยผู้ให้บริการเครือข่ายที่ขายบริการเหล่านี้ หรือที่อยู่ IP ที่เกี่ยวข้องจะถูกลงทะเบียนในรายการฟิลเตอร์ 垃圾จดหมายที่ได้รับความนิยม ซึ่งทำให้พวกเขาไม่มีประโยชน์สำหรับผู้ส่งในปัจจุบัน (และเป็นปัญหาสำหรับผู้จัดหาที่อยู่ IP ในอนาคต)

ช่วงเวลาที่จำกัด: เวลาที่ใช้ในการห้ามโดเมน 垃圾จดหมายใหม่และทำให้ไม่มีประโยชน์โดย SpamHaus และบริการติดตามอื่นๆ
เมื่อโดเมนไม่สามารถใช้งานได้อีกต่อไป ผู้ส่ง 垃圾จดหมายจะย้ายไปยังโดเมนและบริการอื่นๆ ตามความจำเป็น โดยทำซ้ำขั้นตอนนี้ด้วยที่อยู่ IP และการกำหนดค่าใหม่
Data and Methods
โดเมนที่ศึกษาในงานวิจัยครอบคลุมช่วงเวลาระหว่างเดือนพฤษภาคมถึงสิงหาคม พ.ศ. 2564 ตามที่ Farsight 提供มา โดเมนที่จดทะเบียนใหม่เท่านั้นที่ถูกพิจารณา เนื่องจากสิ่งนี้สอดคล้องกับวิธีการดำเนินงานของผู้ส่ง 垃圾จดหมายที่มีความสม่ำเสมอ
รายการโดเมนถูกสร้างขึ้นจากข้อมูลของ ICANN Central Zone Data Service (CZDS) ข้อมูลจาก SURBL และ SpamHaus ถูกใช้เพื่อระบุโดเมนที่อาจเป็นปัญหาในเวลาจริง – แม้ว่าผู้เขียนจะยอมรับว่าลักษณะที่ไม่สมบูรณ์ของรายการ 垃圾จดหมายอาจทำให้โดเมนที่ไม่ใช่ 垃圾จดหมายถูกจัดประเภทผิด
หลังจากจับ DNS TXT queries ไปยังโดเมนที่จดทะเบียนใหม่ในฟีด DNS ที่ไม่เคลื่อนไหวแล้ว ผู้วิจัยก็เก็บเฉพาะค่าที่มีข้อมูล SPF ที่ถูกต้องเพื่อใช้เป็นข้อมูลพื้นฐานสำหรับอัลกอริทึม

SPF มีลักษณะที่สามารถใช้ได้หลายอย่าง บทความวิจัยใหม่นี้พบว่าในขณะที่เจ้าของโดเมนที่ไม่ใช่ 垃圾จดหมายมักใช้กลไก +include มากที่สุด ผู้ส่ง 垃圾จดหมายมีการใช้ฟังก์ชัน +ptr (ที่เลิกใช้แล้ว) มากที่สุด

การใช้กฎ SPF ของผู้ส่ง 垃圾จดหมายเมื่อเทียบกับการใช้งานมาตรฐาน
การค้นหา +ptr จะเปรียบเทียบที่อยู่ IP ของผู้ส่งอีเมลกับบันทึกที่มีอยู่สำหรับการเชื่อมโยงระหว่างที่อยู่ IP และชื่อโฮสต์ (เช่น GoDaddy ) หากชื่อโฮสต์ถูกพบ โดเมนของชื่อโฮสต์จะถูกเปรียบเทียบกับโดเมนที่ใช้ในการอ้างอิง SPF record แรก
ผู้ส่ง 垃圾จดหมายสามารถใช้การค้นหา +ptr เพื่อทำให้ตัวเองดูเหมือนมีความน่าเชื่อถือมากขึ้น เมื่อในความเป็นจริงแล้วทรัพยากรที่จำเป็นในการดำเนินการค้นหา +ptr ในระดับใหญ่นั้นเป็นสิ่งที่ผู้ให้บริการหลายรายไม่สามารถทำได้
โดยสรุป การใช้ SPF ของผู้ส่ง 垃圾จดหมายเพื่อความปลอดภัยในช่วงเวลาก่อนที่การดำเนินการ ‘ระเบิดและเผา’ จะเริ่มต้นขึ้น เป็นตัวบ่งชี้ที่สามารถอนุมานได้จากการวิเคราะห์เครื่องจักร

ความสัมพันธ์ SPF ที่มีลักษณะเฉพาะสำหรับโดเมน 垃圾จดหมาย
เนื่องจากผู้ส่ง 垃圾จดหมายมักจะย้ายไปยังพื้นที่ IP ใกล้เคียงและทรัพยากรอื่นๆ นักวิจัยจึงพัฒนากราฟความสัมพันธ์เพื่อสำรวจความสัมพันธ์ระหว่างพื้นที่ IP และโดเมน กราฟนี้สามารถอัปเดตได้ใกล้เคียงกับเวลาจริงตามข้อมูลใหม่จาก SpamHaus และแหล่งอื่นๆ ทำให้กราฟมีประโยชน์และสมบูรณ์มากขึ้นเมื่อเวลาผ่านไป
นักวิจัยระบุว่า:
‘การ研究โครงสร้างเหล่านี้สามารถเน้นโดเมน 垃圾จดหมายที่อาจเกิดขึ้น ในชุดข้อมูลของเรา เราพบโครงสร้างที่โดเมนหลายสิบโดเมนใช้กฎ SPF เดียวกัน และส่วนใหญ่ปรากฏในรายการ 垃圾จดหมาย ดังนั้นจึงสมเหตุสมผลที่จะถือว่าโดเมนที่เหลือยังไม่ได้รับการตรวจจับหรือยังไม่ได้ดำเนินการเป็นโดเมน 垃圾จดหมาย’
Results
นักวิจัยเปรียบเทียบความล่าช้าของการตรวจจับโดเมน 垃圾จดหมายของวิธีการของตนเองกับ SpamHaus และ SURBL ในช่วงเวลา 50 ชั่วโมง พวกเขารายงานว่าสำหรับ 70% ของโดเมน 垃圾จดหมายที่ถูกตรวจจับ ระบบของตนเองเร็วกว่า แม้ว่าจะยอมรับว่า 26% ของโดเมน 垃圾จดหมายที่ถูกตรวจจับจะปรากฏในรายการ 垃圾จดหมายเชิงพาณิชย์ภายในหนึ่งชั่วโมงถัดไป 30% ของโดเมน 垃圾จดหมายอยู่ในรายการ 垃圾จดหมายแล้วเมื่อปรากฏในฟีด DNS ที่ไม่เคลื่อนไหว
ผู้เขียนอ้างว่ามีคะแนน F1 ที่ 79% เมื่อเทียบกับข้อมูลพื้นฐานโดยใช้การร้องขอ DNS เพียงครั้งเดียว ในขณะที่วิธีการอื่นๆ เช่น Exposure อาจต้องใช้การวิเคราะห์เบื้องต้นเป็นเวลาหนึ่งสัปดาห์
พวกเขาเปิดเผย:
‘วิธีการของเราสามารถนำไปใช้ในช่วงแรกของวงจรชีวิตของโดเมน: โดยใช้ DNS ที่ไม่เคลื่อนไหว (หรือที่เคลื่อนไหว) เราสามารถรับกฎ SPF สำหรับโดเมนที่จดทะเบียนใหม่และจัดประเภทได้ทันที หรือรอจนกว่าเราจะตรวจจับ TXT queries ไปยังโดเมนนั้นและปรับปรุงการจำแนกประเภทโดยใช้คุณลักษณะที่ยากจะหลบเลี่ยงตามเวลา’
และต่อด้วย:
‘ตัวจำแนกที่ดีที่สุดของเราตรวจจับโดเมน 垃圾จดหมายได้ 85% ในขณะที่รักษาอัตราผลบวกลวงต่ำกว่า 1% ผลการตรวจจับนั้นยอดเยี่ยมเมื่อพิจารณาว่าการจำแนกประเภทนี้ใช้เฉพาะเนื้อหาของกฎ SPF และความสัมพันธ์ของมัน และคุณลักษณะที่ยากจะหลบเลี่ยงตามการร้องขอ DNS’
‘ประสิทธิภาพของตัวจำแนกยังคงสูง แม้ว่าพวกมันจะได้รับเฉพาะคุณลักษณะที่คงที่ที่สามารถรวบรวมได้จาก TXT query เดียว (ที่สังเกตการณ์แบบไม่เคลื่อนไหวหรือแบบเคลื่อนไหว)’
เพื่อดูการนำเสนอเกี่ยวกับวิธีการใหม่นี้ โปรดดูวิดีโอที่ฝังตัวอยู่ด้านล่าง:
เผยแพร่ครั้งแรกเมื่อวันที่ 5 พฤษภาคม 2022












