Anderson का एंगल

नए स्पैम डोमेन की पहचान मशीन लर्निंग के माध्यम से

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

फ्रांस के शोधकर्ताओं ने एक ऐसी विधि विकसित की है जो नए पंजीकृत डोमेन की पहचान करने में मदद करती है जो संभवतः ‘हिट और रन’ तरीके से उच्च-वॉल्यूम ईमेल स्पैमर्स द्वारा उपयोग किए जा सकते हैं – कभी-कभी, यहां तक कि स्पैमर्स ने एक अनचाहे ईमेल भेजने से पहले भी।

यह तकनीक सेंडर पॉलिसी फ्रेमवर्क (एसपीएफ) के माध्यम से नए पंजीकृत डोमेन पर स्थापित किए गए तरीके के विश्लेषण पर आधारित है, जो एक ईमेल के प्रावधिक स्रोत की पुष्टि करने का एक तरीका है।

पассив डीएनएस (डोमेन नेम सिस्टम) सेंसर के उपयोग के माध्यम से, शोधकर्ता सिएटल स्थित कंपनी फारसाइट से लगभग वास्तविक समय डीएनएस डेटा प्राप्त करने में सक्षम थे, जो विभिन्न डोमेन के लिए एसपीएफ गतिविधि के लिए टीएक्सटी रिकॉर्ड प्रदान करता था।

एक क्लास वेट अल्गोरिदम का उपयोग किया गया था, जो मूल रूप से असंतुलित चिकित्सा डेटा के प्रसंस्करण के लिए डिज़ाइन किया गया था, और स्किट-लर्न मशीन लर्निंग पायथन लाइब्रेरी में लागू किया गया था, जिससे शोधकर्ता कुछ ही क्षणों में या यहां तक कि उनके संचालन से पहले तीन चौथाई प्रतीक्षित स्पैम डोमेन का पता लगाने में सक्षम थे।

लेख में कहा गया है:

‘एक ही टीएक्सटी रिकॉर्ड के अनुरोध के साथ, हम 75% स्पैम डोमेन का पता लगाते हैं, संभवतः स्पैम अभियान की शुरुआत से पहले। इसलिए, हमारी योजना महत्वपूर्ण प्रतिक्रिया की गति लाती है: हम स्पैमर्स का पता लगा सकते हैं अच्छे प्रदर्शन के साथ, यहां तक कि एक मेल भेजने से पहले और डीएनएस ट्रैफिक में वृद्धि से पहले।’

शोधकर्ता दावा करते हैं कि उनकी तकनीक में उपयोग किए गए विशेषताएं मौजूदा स्पैम पता लगाने वाली प्रणालियों में जोड़ी जा सकती हैं ताकि प्रदर्शन में सुधार किया जा सके, और महत्वपूर्ण गणना ओवरहेड जोड़े बिना, क्योंकि प्रणाली एसपीएफ डेटा पर निर्भर करती है जो निकट वास्तविक समय डीएनएस फीड से पासिव रूप से अनुमानित होती है जो पहले से ही समस्या के विभिन्न दृष्टिकोणों के लिए उपयोग की जा रही है।

लेख का शीर्षक पассив डीएनएस और एसपीएफ के साथ स्पैम डोमेन का प्रारंभिक पता लगाना है, और यह ग्रेनोबल विश्वविद्यालय के तीन शोधकर्ताओं से आया है।

एसपीएफ गतिविधि

एसपीएफ ईमेल पते की नकल करने से बचने के लिए डिज़ाइन किया गया है, जो यह पुष्टि करने के लिए कि एक पंजीकृत और अधिकृत आईपी पता ईमेल भेजने के लिए उपयोग किया गया है।

इस एसपीएफ के उदाहरण में, 'एलिस' 'बॉब' को एक सौम्य ईमेल भेजती है, जबकि हमलावर 'मैलोरी' एलिस की नकल करने की कोशिश करता है। दोनों अपने स्वयं के डोमेन से मेल भेज रहे हैं, लेकिन केवल एलिस का सर्वर एलिस के मेल भेजने के लिए पंजीकृत है, इसलिए मैलोरी का नकली मेल एसपीएफ सत्यापन में विफल हो जाता है।

इस एसपीएफ के उदाहरण में, ‘एलिस’ ‘बॉब’ को एक सौम्य ईमेल भेजती है, जबकि हमलावर ‘मैलोरी’ एलिस की नकल करने की कोशिश करता है। दोनों अपने स्वयं के डोमेन से मेल भेज रहे हैं, लेकिन केवल एलिस का सर्वर एलिस के मेल भेजने के लिए पंजीकृत है, इसलिए मैलोरी का नकली मेल एसपीएफ सत्यापन में विफल हो जाता है। स्रोत: https://arxiv.org/pdf/2205.01932.pdf

ईमेल सत्यापन के अन्य तरीकों में डोमेनकीस आइडेंटिफाइड मेल (डीकेआईएम) हस्ताक्षर और डोमेन-आधारित संदेश प्रमाणीकरण, रिपोर्टिंग और अनुपालन (डीएमएआरसी) शामिल हैं।

इन तीनों तरीकों को प्रामाणिक भेजने वाले डोमेन के डोमेन रजिस्ट्रार में टीएक्सटी रिकॉर्ड (कॉन्फ़िगरेशन सेटिंग्स) के रूप में पंजीकृत किया जाना चाहिए।

स्पैम और जलना

स्पैमर इस मामले में ‘हस्ताक्षर व्यवहार’ प्रदर्शित करते हैं। उनका उद्देश्य (या कम से कम, उनकी गतिविधियों का परिणाम) डोमेन और इसके आईपी पते की प्रतिष्ठा को ‘जलाने’ के लिए है जो बड़े पैमाने पर मेल भेजने तक जारी रहता है; या तो नेटवर्क प्रदाताओं द्वारा कार्रवाई की जाती है जो इन सेवाओं को बेचते हैं; या संबंधित आईपी पते लोकप्रिय स्पैम-फिल्टर सूचियों में पंजीकृत हो जाते हैं, जिससे वे वर्तमान भेजने वाले (और भविष्य के मालिकों के लिए समस्याग्रस्त) के लिए उपयोगी हो जाते हैं।

एक संकीर्ण अवसर की खिड़की: घंटों में समय, एक नए स्पैम डोमेन को प्रतिबंधित और स्पैमहाउस और विभिन्न अन्य निगरानी सेवाओं द्वारा उपयोगहीन बनाने से पहले।

एक संकीर्ण अवसर की खिड़की: घंटों में समय, एक नए स्पैम डोमेन को प्रतिबंधित और स्पैमहाउस और विभिन्न अन्य निगरानी सेवाओं द्वारा उपयोगहीन बनाने से पहले।

जब डोमेन स्थान अधिक उपयोगी नहीं होता है, तो स्पैमर अन्य डोमेन और सेवाओं पर चलते हैं, जैसा आवश्यक हो, प्रक्रिया को नए आईपी पते और कॉन्फ़िगरेशन के साथ दोहराते हैं।

डेटा और विधियाँ

अध्ययन किए गए डोमेन मई और अगस्त 2021 के बीच की अवधि को कवर करते हैं, जैसा कि फारसाइट द्वारा प्रदान किया गया है। केवल ताज़ा पंजीकृत डोमेन पर विचार किया गया था, क्योंकि यह लगातार स्पैमर के मोडस ऑपरेंडी के अनुरूप है।

डोमेन सूची आईसीएएनएन सेंट्रल ज़ोन डेटा सर्विस (सीजेडडीएस) से डेटा पर बनाई गई थी। सुरब्ल और स्पैमहाउस परियोजनाओं से ब्लैकलिस्ट जानकारी का उपयोग संभावित रूप से समस्याग्रस्त नए डोमेन पंजीकरण की लगभग वास्तविक समय पहचान के लिए किया गया था – हालांकि लेखक स्वीकार करते हैं कि स्पैम सूचियों की अपूर्ण प्रकृति के कारण बेनignum डोमेन को गलत तरीके से संभावित बल्क मेल के स्रोत के रूप में वर्गीकृत किया जा सकता है।

नए पंजीकृत डोमेन के लिए पассив डीएनएस फीड में डीएनएस टीएक्सटी क्वेरी को पकड़ने के बाद, केवल वैध एसपीएफ डेटा वाले क्वेरी बरकरार रखे गए, जो अल्गोरिदम के लिए आधारभूत सच्चाई प्रदान करते हैं।

एसपीएफ की कई उपयोगी विशेषताएं हैं; नए लेख में पाया गया है कि जबकि ‘सौम्य’ डोमेन मालिक आमतौर पर +include तंत्र का उपयोग करते हैं, स्पैमर +ptr सुविधा का उपयोग करने वालों की संख्या में सबसे अधिक है, जो अब पुरानी हो चुकी है।

स्पैमर्स के एसपीएफ नियम उपयोग, मानक उपयोग की तुलना में।

स्पैमर्स के एसपीएफ नियम उपयोग, मानक उपयोग की तुलना में।

एक +ptr लुकअप भेजने वाले मेल के आईपी पते की तुलना होस्टनाम (यानी, गोडैडी) के साथ करता है। यदि होस्टनाम का पता लगाया जाता है, तो इसके डोमेन की तुलना पहले एसपीएफ रिकॉर्ड का संदर्भ देने वाले डोमेन से की जाती है।

स्पैमर +ptr की apparent सख्ती का फायदा उठा सकते हैं ताकि वे अधिक विश्वसनीय दिखाई दें, जबकि वास्तव में उन्हें बड़े पैमाने पर +ptr लुकअप करने के लिए आवश्यक संसाधनों की आवश्यकता होती है, जो कई प्रदाताओं को पूरी तरह से जांच छोड़ने का कारण बनता है।

संक्षेप में, एसपीएफ का उपयोग स्पैमर द्वारा ‘ब्लास्ट और बर्न’ ऑपरेशन शुरू होने से पहले एक खिड़की का अवसर प्राप्त करने के लिए किया जाता है, जो एक विशिष्ट हस्ताक्षर है जिसे मशीन विश्लेषण द्वारा अनुमानित किया जा सकता है।

स्पैम डोमेन के लिए विशिष्ट एसपीएफ संबंध।

स्पैम डोमेन के लिए विशिष्ट एसपीएफ संबंध।

चूंकि स्पैमर अक्सर बहुत करीबी आईपी रेंज और संसाधनों पर चलते हैं, शोधकर्ताओं ने आईपी रेंज और डोमेन के बीच संबंध का अन्वेषण करने के लिए एक संबंध ग्राफ विकसित किया। ग्राफ स्पैमहाउस और अन्य स्रोतों से नए डेटा के प्रतिक्रिया में लगभग वास्तविक समय में अपडेट किया जा सकता है, जो समय के साथ अधिक उपयोगी और पूर्ण हो जाता है।

शोधकर्ता कहते हैं:

‘इन संरचनाओं का अध्ययन संभावित स्पैम डोमेन को उजागर कर सकता है। हमारे डेटासेट में, हमने [संरचनाएं] पाईं जिनमें दर्जनों डोमेन ने एक ही [एसपीएफ] नियम का उपयोग किया और अधिकांश उनमें से स्पैम ब्लैकलिस्ट में दिखाई दिए। ऐसे में यह मानना उचित है कि शेष डोमेन अभी तक पता नहीं चले हैं या अभी तक सक्रिय स्पैम डोमेन नहीं हैं।’

परिणाम

शोधकर्ताओं ने 50 घंटे की अवधि में स्पैमहाउस और सुरब्ल के साथ अपने दृष्टिकोण की स्पैम डोमेन पता लगाने की देरी की तुलना की। वे बताते हैं कि अपनी प्रणाली 70% स्पैम डोमेन के लिए तेज थी, हालांकि उन्होंने स्वीकार किया कि 26% पहचाने गए स्पैम डोमेन अगले घंटे में व्यावसायिक ब्लैकलिस्ट में दिखाई दिए। 30% डोमेन पहले से ही प्रतिबंधित थे जब वे पассив डीएनएस फीड में दिखाई दिए।

लेखक एकल डीएनएस क्वेरी पर आधारित जमीनी सच्चाई के खिलाफ 79% का एफ1 स्कोर दावा करते हैं, जबकि प्रतिस्पर्धी विधियां जैसे एक्सपोजर एक सप्ताह के प्रारंभिक विश्लेषण की आवश्यकता हो सकती है।

वे देखते हैं:

‘हमारी योजना डोमेन जीवन चक्र के शुरुआती चरणों में लागू की जा सकती है: पассив (या सक्रिय) डीएनएस का उपयोग करके, हम नए पंजीकृत डोमेन के लिए एसपीएफ नियम प्राप्त कर सकते हैं और उन्हें तुरंत वर्गीकृत कर सकते हैं, या जब तक हम उस डोमेन के लिए टीएक्सटी क्वेरी का पता लगाते हैं और कठिन से बचने वाली अस्थायी विशेषताओं का उपयोग करके वर्गीकरण को परिष्कृत करते हैं। ‘

और जारी रखते हैं:

‘[हमारे] सर्वश्रेष्ठ वर्गीकारक 85% स्पैम डोमेन का पता लगाता है, जबकि 1% से कम झूठी सकारात्मक दर बनाए रखता है। पता लगाने के परिणाम उल्लेखनीय हैं क्योंकि वर्गीकरण केवल डोमेन एसपीएफ नियमों और उनके संबंधों की सामग्री का उपयोग करता है, और डीएनएस ट्रैफिक पर आधारित कठिन से बचने वाली विशेषताएं। ‘

‘वर्गीकारकों का प्रदर्शन तब भी उच्च रहता है, जब उन्हें केवल एक ही टीएक्सटी क्वेरी (पासिव रूप से या सक्रिय रूप से पूछताछ की गई) से एकत्र की जा सकने वाली स्थिर विशेषताएं दी जाती हैं। ‘

नई विधि पर एक प्रस्तुति देखने के लिए नीचे दिए गए एम्बेडेड वीडियो को देखें:

 

पहली बार 5 मई 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai