มุมมองของ Anderson

การคาดการณ์โดเมน 垃圾จดหมายใหม่ผ่าน Machine Learning

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากฝรั่งเศสได้พัฒนาวิธีการระบุโดเมนที่จดทะเบียนใหม่ซึ่งมีแนวโน้มที่จะถูกใช้ในลักษณะ ‘ฮิตและวิ่ง’ โดยผู้ส่ง 垃圾จดหมายจำนวนมาก – บางครั้งแม้กระทั่งก่อนที่ผู้ส่งจะส่งอีเมลที่ไม่พึงประสงค์ออกไป

เทคนิคนี้เป็นไปตามการวิเคราะห์วิธีการตั้งค่า Sender Policy Framework (SPF) ซึ่งเป็นวิธีการยืนยันจุดกำเนิดของอีเมลบนโดเมนที่จดทะเบียนใหม่

ด้วยการใช้ passive DNS (Domain Name System) sensors นักวิจัยสามารถรับข้อมูล DNS ในเวลาจริงจากบริษัท Farsight ในซีแอตเทิล ซึ่งให้ข้อมูล SPF สำหรับ TXT records สำหรับโดเมนต่างๆ

โดยใช้อัลกอริทึม class weight ที่ออกแบบมาเพื่อประมวลผลข้อมูลทางการแพทย์ที่ไม่สมดุล และใช้ไลบรารี machine learning ของ Python ชื่อ scikit-learn นักวิจัยสามารถตรวจจับโดเมน 垃圾จดหมายที่กำลังจะเกิดขึ้นได้ภายในไม่กี่วินาที หรือแม้กระทั่งก่อนที่จะเริ่มการดำเนินการ

ในบทความวิจัยระบุว่า:

‘ด้วยการร้องขอเพียงครั้งเดียวไปยัง TXT record เราสามารถตรวจจับโดเมน 垃圾จดหมายได้ 75% ซึ่งอาจจะเกิดขึ้นก่อนที่การรณรงค์ 垃圾จดหมายจะเริ่มต้นขึ้น ดังนั้น วิธีการของเราจึงมีความเร็วในการตอบสนอง: เราสามารถตรวจจับ 垃圾จดหมายได้ด้วยประสิทธิภาพที่ดีแม้กระทั่งก่อนที่จะส่งอีเมลและก่อนที่จะมีการเพิ่มขึ้นของการร้องขอ DNS’

นักวิจัยอ้างว่าลักษณะที่ใช้ในเทคนิคนี้สามารถเพิ่มประสิทธิภาพของระบบตรวจจับ 垃圾จดหมายที่มีอยู่แล้วโดยไม่ต้องเพิ่มการประมวลผลที่สำคัญ เนื่องจากระบบนี้พึ่งพาข้อมูล SPF ที่ได้รับมาจากข้อมูล DNS ในเวลาจริงที่มีอยู่แล้ว

บทความวิจัยชื่อ Early Detection of Spam Domains with Passive DNS and SPF มาจากนักวิจัยสามคนจากมหาวิทยาลัย Grenoble

SPF Activity

SPF ได้รับการออกแบบมาเพื่อป้องกันการปลอมแปลงที่อยู่อีเมลโดยการตรวจสอบว่าที่อยู่ IP ที่ได้รับการลงทะเบียนและได้รับอนุญาตได้ถูกใช้ในการส่งอีเมลหรือไม่

ในตัวอย่างนี้ของ SPF 'Alice' ส่งอีเมลที่ไม่มี 垃圾จดหมายไปยัง 'Bob' ในขณะที่ผู้โจมตี 'Mallory' พยายามปลอมแปลง 'Alice' ทั้งสองคนกำลังส่งอีเมลจากโดเมนของตนเอง แต่เพียง 'Alice' เท่านั้นที่ได้รับการลงทะเบียนเพื่อส่งอีเมลของ 'Alice' ดังนั้นการปลอมแปลงของ 'Mallory' จึงถูกขัดขวางเมื่ออีเมลปลอมของเขาไม่ผ่านการตรวจสอบ SPF

ในตัวอย่างนี้ของ SPF ‘Alice’ ส่งอีเมลที่ไม่มี 垃圾จดหมายไปยัง ‘Bob’ ในขณะที่ผู้โจมตี ‘Mallory’ พยายามปลอมแปลง ‘Alice’ ทั้งสองคนกำลังส่งอีเมลจากโดเมนของตนเอง แต่เพียง ‘Alice’ เท่านั้นที่ได้รับการลงทะเบียนเพื่อส่งอีเมลของ ‘Alice’ ดังนั้นการปลอมแปลงของ ‘Mallory’ จึงถูกขัดขวางเมื่ออีเมลปลอมของเขาไม่ผ่านการตรวจสอบ SPF แหล่งที่มา: https://arxiv.org/pdf/2205.01932.pdf

วิธีการยืนยันอีเมลอื่นๆ ได้แก่ DomainKeys Identified Mail (DKIM) Signatures และ Domain-based Message Authentication, Reporting, and Conformance (DMARC)

ทั้งสามวิธีการต้องได้รับการลงทะเบียนเป็น TXT records (ค่ากำหนด) ที่ผู้จดทะเบียนโดเมนสำหรับโดเมนที่ส่งอีเมลอย่างถูกต้อง

Spam and Burn

ผู้ส่ง 垃圾จดหมายมีพฤติกรรมที่เป็น ‘ลักษณะเฉพาะ’ ในด้านนี้ ความตั้งใจของพวกเขา (หรือผลกระทบที่ไม่ได้ตั้งใจของกิจกรรมของพวกเขา) คือการ ‘เผา’ ชื่อเสียงของโดเมนและที่อยู่ IP โดยการส่งอีเมลจำนวนมากจนกว่าการดำเนินการจะถูกดำเนินการโดยผู้ให้บริการเครือข่ายที่ขายบริการเหล่านี้ หรือที่อยู่ IP ที่เกี่ยวข้องจะถูกลงทะเบียนในรายการฟิลเตอร์ 垃圾จดหมายที่ได้รับความนิยม ซึ่งทำให้พวกเขาไม่มีประโยชน์สำหรับผู้ส่งในปัจจุบัน (และเป็นปัญหาสำหรับผู้จัดหาที่อยู่ IP ในอนาคต)

ช่วงเวลาที่จำกัด: เวลาที่ใช้ในการห้ามโดเมน 垃圾จดหมายใหม่และทำให้ไม่มีประโยชน์โดย SpamHaus และบริการติดตามอื่นๆ

ช่วงเวลาที่จำกัด: เวลาที่ใช้ในการห้ามโดเมน 垃圾จดหมายใหม่และทำให้ไม่มีประโยชน์โดย SpamHaus และบริการติดตามอื่นๆ

เมื่อโดเมนไม่สามารถใช้งานได้อีกต่อไป ผู้ส่ง 垃圾จดหมายจะย้ายไปยังโดเมนและบริการอื่นๆ ตามความจำเป็น โดยทำซ้ำขั้นตอนนี้ด้วยที่อยู่ IP และการกำหนดค่าใหม่

Data and Methods

โดเมนที่ศึกษาในงานวิจัยครอบคลุมช่วงเวลาระหว่างเดือนพฤษภาคมถึงสิงหาคม พ.ศ. 2564 ตามที่ Farsight 提供มา โดเมนที่จดทะเบียนใหม่เท่านั้นที่ถูกพิจารณา เนื่องจากสิ่งนี้สอดคล้องกับวิธีการดำเนินงานของผู้ส่ง 垃圾จดหมายที่มีความสม่ำเสมอ

รายการโดเมนถูกสร้างขึ้นจากข้อมูลของ ICANN Central Zone Data Service (CZDS) ข้อมูลจาก SURBL และ SpamHaus ถูกใช้เพื่อระบุโดเมนที่อาจเป็นปัญหาในเวลาจริง – แม้ว่าผู้เขียนจะยอมรับว่าลักษณะที่ไม่สมบูรณ์ของรายการ 垃圾จดหมายอาจทำให้โดเมนที่ไม่ใช่ 垃圾จดหมายถูกจัดประเภทผิด

หลังจากจับ DNS TXT queries ไปยังโดเมนที่จดทะเบียนใหม่ในฟีด DNS ที่ไม่เคลื่อนไหวแล้ว ผู้วิจัยก็เก็บเฉพาะค่าที่มีข้อมูล SPF ที่ถูกต้องเพื่อใช้เป็นข้อมูลพื้นฐานสำหรับอัลกอริทึม

SPF มีลักษณะที่สามารถใช้ได้หลายอย่าง บทความวิจัยใหม่นี้พบว่าในขณะที่เจ้าของโดเมนที่ไม่ใช่ 垃圾จดหมายมักใช้กลไก +include มากที่สุด ผู้ส่ง 垃圾จดหมายมีการใช้ฟังก์ชัน +ptr (ที่เลิกใช้แล้ว) มากที่สุด

การใช้กฎ SPF ของผู้ส่ง 垃圾จดหมายเมื่อเทียบกับการใช้งานมาตรฐาน

การใช้กฎ SPF ของผู้ส่ง 垃圾จดหมายเมื่อเทียบกับการใช้งานมาตรฐาน

การค้นหา +ptr จะเปรียบเทียบที่อยู่ IP ของผู้ส่งอีเมลกับบันทึกที่มีอยู่สำหรับการเชื่อมโยงระหว่างที่อยู่ IP และชื่อโฮสต์ (เช่น GoDaddy ) หากชื่อโฮสต์ถูกพบ โดเมนของชื่อโฮสต์จะถูกเปรียบเทียบกับโดเมนที่ใช้ในการอ้างอิง SPF record แรก

ผู้ส่ง 垃圾จดหมายสามารถใช้การค้นหา +ptr เพื่อทำให้ตัวเองดูเหมือนมีความน่าเชื่อถือมากขึ้น เมื่อในความเป็นจริงแล้วทรัพยากรที่จำเป็นในการดำเนินการค้นหา +ptr ในระดับใหญ่นั้นเป็นสิ่งที่ผู้ให้บริการหลายรายไม่สามารถทำได้

โดยสรุป การใช้ SPF ของผู้ส่ง 垃圾จดหมายเพื่อความปลอดภัยในช่วงเวลาก่อนที่การดำเนินการ ‘ระเบิดและเผา’ จะเริ่มต้นขึ้น เป็นตัวบ่งชี้ที่สามารถอนุมานได้จากการวิเคราะห์เครื่องจักร

ความสัมพันธ์ SPF ที่มีลักษณะเฉพาะสำหรับโดเมน 垃圾จดหมาย

ความสัมพันธ์ SPF ที่มีลักษณะเฉพาะสำหรับโดเมน 垃圾จดหมาย

เนื่องจากผู้ส่ง 垃圾จดหมายมักจะย้ายไปยังพื้นที่ IP ใกล้เคียงและทรัพยากรอื่นๆ นักวิจัยจึงพัฒนากราฟความสัมพันธ์เพื่อสำรวจความสัมพันธ์ระหว่างพื้นที่ IP และโดเมน กราฟนี้สามารถอัปเดตได้ใกล้เคียงกับเวลาจริงตามข้อมูลใหม่จาก SpamHaus และแหล่งอื่นๆ ทำให้กราฟมีประโยชน์และสมบูรณ์มากขึ้นเมื่อเวลาผ่านไป

นักวิจัยระบุว่า:

‘การ研究โครงสร้างเหล่านี้สามารถเน้นโดเมน 垃圾จดหมายที่อาจเกิดขึ้น ในชุดข้อมูลของเรา เราพบโครงสร้างที่โดเมนหลายสิบโดเมนใช้กฎ SPF เดียวกัน และส่วนใหญ่ปรากฏในรายการ 垃圾จดหมาย ดังนั้นจึงสมเหตุสมผลที่จะถือว่าโดเมนที่เหลือยังไม่ได้รับการตรวจจับหรือยังไม่ได้ดำเนินการเป็นโดเมน 垃圾จดหมาย’

Results

นักวิจัยเปรียบเทียบความล่าช้าของการตรวจจับโดเมน 垃圾จดหมายของวิธีการของตนเองกับ SpamHaus และ SURBL ในช่วงเวลา 50 ชั่วโมง พวกเขารายงานว่าสำหรับ 70% ของโดเมน 垃圾จดหมายที่ถูกตรวจจับ ระบบของตนเองเร็วกว่า แม้ว่าจะยอมรับว่า 26% ของโดเมน 垃圾จดหมายที่ถูกตรวจจับจะปรากฏในรายการ 垃圾จดหมายเชิงพาณิชย์ภายในหนึ่งชั่วโมงถัดไป 30% ของโดเมน 垃圾จดหมายอยู่ในรายการ 垃圾จดหมายแล้วเมื่อปรากฏในฟีด DNS ที่ไม่เคลื่อนไหว

ผู้เขียนอ้างว่ามีคะแนน F1 ที่ 79% เมื่อเทียบกับข้อมูลพื้นฐานโดยใช้การร้องขอ DNS เพียงครั้งเดียว ในขณะที่วิธีการอื่นๆ เช่น Exposure อาจต้องใช้การวิเคราะห์เบื้องต้นเป็นเวลาหนึ่งสัปดาห์

พวกเขาเปิดเผย:

‘วิธีการของเราสามารถนำไปใช้ในช่วงแรกของวงจรชีวิตของโดเมน: โดยใช้ DNS ที่ไม่เคลื่อนไหว (หรือที่เคลื่อนไหว) เราสามารถรับกฎ SPF สำหรับโดเมนที่จดทะเบียนใหม่และจัดประเภทได้ทันที หรือรอจนกว่าเราจะตรวจจับ TXT queries ไปยังโดเมนนั้นและปรับปรุงการจำแนกประเภทโดยใช้คุณลักษณะที่ยากจะหลบเลี่ยงตามเวลา’

และต่อด้วย:

‘ตัวจำแนกที่ดีที่สุดของเราตรวจจับโดเมน 垃圾จดหมายได้ 85% ในขณะที่รักษาอัตราผลบวกลวงต่ำกว่า 1% ผลการตรวจจับนั้นยอดเยี่ยมเมื่อพิจารณาว่าการจำแนกประเภทนี้ใช้เฉพาะเนื้อหาของกฎ SPF และความสัมพันธ์ของมัน และคุณลักษณะที่ยากจะหลบเลี่ยงตามการร้องขอ DNS’

‘ประสิทธิภาพของตัวจำแนกยังคงสูง แม้ว่าพวกมันจะได้รับเฉพาะคุณลักษณะที่คงที่ที่สามารถรวบรวมได้จาก TXT query เดียว (ที่สังเกตการณ์แบบไม่เคลื่อนไหวหรือแบบเคลื่อนไหว)’

เพื่อดูการนำเสนอเกี่ยวกับวิธีการใหม่นี้ โปรดดูวิดีโอที่ฝังตัวอยู่ด้านล่าง:

 

เผยแพร่ครั้งแรกเมื่อวันที่ 5 พฤษภาคม 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai