Anderson का एंगल

कैप्चा को मशीन लर्निंग के साथ हल करना डार्क वेब रिसर्च को सक्षम करने के लिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

संयुक्त राज्य अमेरिका से एक संयुक्त अकादमिक अनुसंधान परियोजना ने कैप्चा परीक्षणों को विफल करने के लिए एक विधि विकसित की है, जो कथित तौर पर जेनरेटिव एडवर्सेरियल नेटवर्क (GANs) का उपयोग करके दृश्य जटिल चुनौतियों को डिकोड करने के लिए राज्य-कला मशीन लर्निंग समाधानों को पार करती है।

नई प्रणाली का परीक्षण सर्वोत्तम वर्तमान फ्रेमवर्क के खिलाफ किया गया, शोधकर्ताओं ने पाया कि उनकी विधि 94.4% से अधिक सफलता प्राप्त करती है एक सावधानी से क्यूरेटेड वास्तविक दुनिया के बेंचमार्क डेटासेट पर, और साबित हुआ है कि यह एक उच्च कैप्चा-संरक्षित उभरते डार्क नेट मार्केटप्लेस में मानव सहभागिता को समाप्त करने में सक्षम है, स्वचालित रूप से कैप्चा चुनौतियों को तीन प्रयासों में हल करता है।

DW-GAN के लिए आर्किटेक्चर। स्रोत: https://arxiv.org/pdf/2201.02799.pdf

DW-GAN के लिए कार्यप्रवाह। स्रोत: https://arxiv.org/pdf/2201.02799.pdf

लेखकों का दावा है कि उनका दृष्टिकोण साइबर सुरक्षा शोधकर्ताओं के लिए एक सफलता का प्रतिनिधित्व करता है, जिन्हें पारंपरिक रूप से कैप्चा को मैन्युअल रूप से हल करने के लिए मानवों की आपूर्ति की लागत को सहन करना पड़ता है, आमतौर पर अमेज़न मैकेनिकल टर्क (एएमटी) जैसे भीड़भाड़ वाले प्लेटफार्मों के माध्यम से।

यदि प्रणाली अनुकूलनीय और लचीली साबित होती है, तो यह अधिक स्वचालित निगरानी प्रणालियों के लिए मार्ग प्रशस्त कर सकती है, और टीओआर नेटवर्क के अनुक्रमण और वेब स्क्रैपिंग के लिए। इससे बड़े पैमाने पर विश्लेषण और नए साइबर सुरक्षा दृष्टिकोण और तकनीकों का विकास संभव हो सकता है, जो अब तक कैप्चा फायरवॉल द्वारा बाधित किया गया है।

दस्तावेज़ कागज़ शीर्षक जेनरेटिव एडवर्सेरियल लर्निंग के साथ डार्क वेब टेक्स्ट-आधारित कैप्चा का मुकाबला करना प्रोक्टिव साइबर खतरा खुफिया के लिए, और शोधकर्ताओं से आता है अरिज़ोना विश्वविद्यालय, दक्षिण फ्लोरिडा विश्वविद्यालय, और जॉर्जिया विश्वविद्यालय।

निहितार्थ

चूंकि प्रणाली – जिसे डार्क वेब-जीएन (DW-GAN, गिटहब पर उपलब्ध) कहा जाता है – अपने पूर्ववर्तियों की तुलना में इतनी अधिक प्रदर्शनकारी है, इसलिए इसके उपयोग की संभावना है एक सामान्य विधि के रूप में कैप्चा सामग्री को पार करने के लिए मानक वेब पर, या तो इस विशिष्ट कार्यान्वयन में, या नए पत्र में रेखांकित सामान्य सिद्धांतों के आधार पर। हालांकि, गिटहब पर सीमित संग्रहण के कारण, वर्तमान में फ्रेमवर्क से जुड़े डेटा प्राप्त करने के लिए लीड लेखक निंग झांग से संपर्क करना आवश्यक है।

चूंकि DW-GAN का कैप्चा को तोड़ने के लिए एक ‘सकारात्मक’ मिशन है (जैसे कि टीओआर खुद को मूल रूप से सैन्य संचार और बाद में पत्रकारों की रक्षा के लिए एक सकारात्मक मिशन के साथ बनाया गया था), और चूंकि कैप्चा एक वैध रक्षा है (जो अक्सर और विवादास्पद रूप से उबिक्यूटस सीडीएन दिग्गज क्लाउडफ्लेयर द्वारा उपयोग किया जाता है) और एक अवैध डार्क वेब बाजारों का पसंदीदा उपकरण है, इसलिए दृष्टिकोण एक ‘स्तर’ प्रौद्योगिकी के रूप में तर्कसंगत है।

लेखक स्वयं स्वीकार करते हैं कि DW-GAN का व्यापक उपयोग है:

‘[जबकि] यह अध्ययन मुख्य रूप से डार्क-वेब कैप्चा के रूप में एक अधिक चुनौतीपूर्ण समस्या पर केंद्रित है, इस अध्ययन में प्रस्तावित विधि को सामान्य रूप से अन्य प्रकार के कैप्चा पर लागू किया जा सकता है।’

संभवतः DW-GAN, या एक समान प्रणाली, को व्यापक रूप से और स्पष्ट रूप से प्रसारित होने की आवश्यकता होगी ताकि डार्क वेब बाजारों को कम मशीन-रिजोल्वेबल समाधानों की तलाश करने के लिए प्रेरित किया जा सके, या कम से कम उनके कैप्चा कॉन्फ़िगरेशन को आवधिक रूप से विकसित किया जा सके, एक ‘ठंडा युद्ध’ परिदृश्य।

प्रेरणा

जैसा कि पत्र में观察 किया गया है, डार्क वेब साइबर हमलों से संबंधित हैकर खुफिया का प्राथमिक स्रोत है, जो अनुमान है कि 2025 तक वैश्विक अर्थव्यवस्था को 10 ट्रिलियन अमेरिकी डॉलर की लागत से पहुंचाएगा। इसलिए, प्याज नेटवर्क अवैध डार्क नेट समुदायों के लिए एक अपेक्षाकृत सुरक्षित वातावरण बने हुए हैं, जो सत्र समय समाप्ति, कुकीज़ और उपयोगकर्ता प्रमाणीकरण जैसे विभिन्न तरीकों से बोर्डर्स को प्रतिबंधित कर सकते हैं।

दो प्रकार के कैप्चा, दोनों में धुंधले पृष्ठभूमि और झुकी हुई अक्षरों का उपयोग किया जाता है जो मशीन द्वारा पढ़ने में मुश्किल होते हैं।

दो प्रकार के कैप्चा, दोनों में धुंधले पृष्ठभूमि और झुकी हुई अक्षरों का उपयोग किया जाता है जो मशीन द्वारा पढ़ने में मुश्किल होते हैं।

हालांकि, लेखकों का निरीक्षण है कि इनमें से कोई भी बाधा उतनी बड़ी नहीं है जितनी कि एक ‘संवेदनशील’ समुदाय में ब्राउज़िंग अनुभव में कैप्चा की खेप है:

‘जबकि अधिकांश उपायों को एक क्रॉलर प्रोग्राम में स्वचालित प्रति-उपायों को लागू करके प्रभावी ढंग से परिहार किया जा सकता है, कैप्चा डार्क वेब में सबसे अधिक बाधा पैदा करने वाला एंटी-क्रॉलिंग उपाय है जो उच्च संज्ञानात्मक क्षमताओं के कारण आसानी से परिहार नहीं किया जा सकता है जो अक्सर स्वचालन उपकरणों द्वारा नहीं रखी जाती है।’

पाठ-आधारित कैप्चा के अलावा वीडियो, ऑडियो और विशेष रूप से छवियों की व्याख्या करने के लिए उपयोगकर्ता को चुनौती देने वाले विविधताएं हैं; हालांकि, जैसा कि लेखकों का निरीक्षण है, पाठ-आधारित कैप्चा वर्तमान में डार्क वेब बाजारों के लिए चुनौती का चयन है, और टीओआर नेटवर्क को मशीन विश्लेषण के लिए अधिक प्रवण बनाने के लिए एक प्राकृतिक प्रारंभ बिंदु है।

आर्किटेक्चर

हालांकि चीन के नॉर्थवेस्ट विश्वविद्यालय से एक पूर्व दृष्टिकोण ने कैप्चा प्लेटफार्मों से सुविधा पैटर्न को व्युत्पन्न करने के लिए जेनरेटिव एडवर्सेरियल नेटवर्क का उपयोग किया, नए पत्र के लेखकों का निरीक्षण है कि यह विधि एक रास्टरीकृत छवि की व्याख्या पर निर्भर करती है, बल्कि चुनौती में मान्यता प्राप्त अक्षरों की एक गहरी जांच पर; और यह कि DW-GAN की प्रभावशीलता डार्क वेब कैप्चा में आमतौर पर पाए जाने वाले अर्थहीन शब्दों (और संख्याओं) की परिवर्तनशील लंबाई से प्रभावित नहीं होती है।

DW-GAN एक चार-चरण पाइपलाइन का उपयोग करता है: पहले छवि को कब्जा कर लिया जाता है, और फिर एक पृष्ठभूमि शोर-मुक्ति मॉड्यूल में खिलाया जाता है जो एक जीएनए का उपयोग करता है जिसे एनोटेटेड कैप्चा नमूनों पर प्रशिक्षित किया गया है, और इसलिए अक्षरों को परेशान पृष्ठभूमि से अलग करने में सक्षम है जिस पर वे आराम कर रहे हैं। निकाले गए अक्षरों को फिर जीएन-आधारित निष्कर्षण के बाद किसी भी शोर से और फिल्टर किया जाता है।

इसके बाद, निकाले गए पाठ पर सेगमेंटेशन किया जाता है, जिसे फिर संवेग प्रत्यय का पता लगाने वाले एल्गोरिदम का उपयोग करके संवेग अक्षरों में तोड़ा जाता है।

अक्षर सेगमेंटेशन पिक्सेल समूह को अलग करता है और सीमा ट्रेसिंग के साथ मान्यता का प्रयास करता है।

अक्षर सेगमेंटेशन पिक्सेल समूह को अलग करता है और सीमा ट्रेसिंग के साथ मान्यता का प्रयास करता है।

अंत में, ‘अनुमानित’ अक्षर खंडों को एक कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) के माध्यम से अक्षर मान्यता के लिए विषय हैं।

कभी-कभी अक्षर ओवरलैप हो सकते हैं, एक हाइपर-केर्निंग जो विशेष रूप से मशीन प्रणालियों को धोखा देने के लिए डिज़ाइन की गई है। DW-GAN इसलिए सीमा को बढ़ाने और अक्षरों को प्रभावी ढंग से अलग करने के लिए अंतराल-आधारित सेगमेंटेशन का उपयोग करता है। चूंकि शब्द आमतौर पर अर्थहीन होते हैं, इसलिए इस प्रक्रिया में सहायता के लिए कोई सेमेंटिक संदर्भ नहीं है।

परिणाम

DW-GAN का परीक्षण तीन विविध डार्क वेब डेटासेट से कैप्चा छवियों के साथ-साथ एक लोकप्रिय कैप्चा सिंथेसाइज़र के खिलाफ किया गया था। डेटा जिसने छवियों को उत्पन्न किया था वह दो कार्डिंग दुकानों, रेस्केटर-1 और रेस्केटर-2, और एक नए बाजार से आया था जिसे येलो ब्रिक कहा जाता था (जो रिपोर्ट के अनुसार बाद में डार्कमार्केट के तakedown के बाद गायब हो गया था)।

तीन डेटासेट और ओपन सोर्स कैप्चा सिंथेसाइज़र से कैप्चा के नमूने।

तीन डेटासेट और ओपन सोर्स कैप्चा सिंथेसाइज़र से कैप्चा के नमूने।

लेखकों के अनुसार, परीक्षण में उपयोग किए जाने वाले डेटा को साइबर खतरा खुफिया (सीटीआई) विशेषज्ञों द्वारा डार्क नेट बाजारों में उनके व्यापक प्रसार के आधार पर अनुशंसित किया गया था।

प्रत्येक डेटासेट का परीक्षण एक टीओआर-फेसिंग स्पाइडर के विकास के साथ शामिल था जो 500 कैप्चा छवियों को इकट्ठा करने के लिए कार्य किया था, जिन्हें बाद में सीटीआई सलाहकारों द्वारा लेबल और क्यूरेट किया गया था।

तीन प्रयोग तैयार किए गए थे। पहला डब्ल्यू-जीएन के सामान्य कैप्चा-विफल करने वाले प्रदर्शन का मूल्यांकन करता है मानक एसओटीए विधियों के खिलाफ। प्रतिद्वंद्वी विधियों में प्रीप्रोसेसिंग के साथ इमेज-लेवल सीएनएन शामिल थे, जिसमें ग्रेस्केल रूपांतरण, सामान्यीकरण और गॉसियन स्मूथिंग शामिल थे, ईरान और यूके से एक संयुक्त अकादमिक प्रयास; अक्षर-स्तर सीएनएन अंतराल-आधारित सेगमेंटेशन के साथ; और इमेज-लेवल सीएनएन, यूके के ऑक्सफोर्ड विश्वविद्यालय से।

पहले प्रयोग के लिए डब्ल्यू-जीएन के परिणाम, पूर्व राज्य-कला दृष्टिकोणों के साथ तुलना में।

पहले प्रयोग के लिए डब्ल्यू-जीएन के परिणाम, पूर्व राज्य-कला दृष्टिकोणों के साथ तुलना में।

शोधकर्ताओं ने पाया कि DW-GAN पूरे बोर्ड में पिछले परिणामों में सुधार कर रहा था (ऊपर तालिका देखें)।

दूसरा प्रयोग एक ablation अध्ययन था, जहां सक्रिय फ्रेमवर्क के विभिन्न घटकों को हटा दिया गया था या अक्षम कर दिया गया था ताकि यह छोड़ दिया जा सके कि बाहरी या माध्यमिक कारक परिणामों को प्रभावित कर रहे हैं।

ablation अध्ययन के परिणाम।

ablation अध्ययन के परिणाम।

यहां भी, लेखकों ने पाया कि आर्किटेक्चर के मुख्य खंडों को अक्षम करने से DW-GAN के प्रदर्शन में लगभग सभी मामलों में कमी आई (ऊपर तालिका देखें)।

तीसरा ऑफलाइन प्रयोग DW-GAN की प्रभावशीलता की तुलना एक बेंचमार्क इमेज-आधारित विधि और दो अक्षर-स्तर की विधियों के साथ की गई, ताकि यह निर्धारित किया जा सके कि DW-GAN का अक्षर मूल्यांकन कितना उपयोगी है जब एक अर्थहीन कैप्चा शब्द एक निर्धारित (रATHER एक पूर्वनिर्धारित) लंबाई का था। इन मामलों में, कैप्चा लंबाई 4 से 7 अक्षरों के बीच भिन्न होती है।

इस प्रयोग के लिए, लेखकों ने 50,000 कैप्चा छवियों का एक प्रशिक्षण सेट का उपयोग किया, जिसमें 5,000 को परीक्षण के लिए आरक्षित किया गया था एक मानक 90/10 विभाजन में।

यहां भी, DW-GAN ने पिछले दृष्टिकोणों को पार किया:

एक डार्क नेट मार्केट पर लाइव परीक्षण

अंत में, DW-GAN को (तब लाइव) पीले ईंट डार्क नेट बाजार के खिलाफ तैनात किया गया था। इस परीक्षण के लिए, एक टीओआर-फेसिंग वेब ब्राउज़र विकसित किया गया था जिसने DW-GAN को अपनी ब्राउज़िंग क्षमताओं में एकीकृत किया था, स्वचालित रूप से कैप्चा चुनौतियों को पार्स किया था।

इस परिदृश्य में, एक कैप्चा को स्वचालित क्रॉलर को प्रत्येक 15 एचटीटीपी अनुरोधों के लिए प्रस्तुत किया गया था, औसतन। क्रॉलर 1,831 अवैध वस्तुओं को बेचने में सक्षम था, जिसमें 1,223 दवा-संबंधित उत्पाद (ओपियोड और कोकीन सहित), 44 हैकिंग पैकेज, और नौ जाली दस्तावेज़ स्कैन शामिल थे। कुल मिलाकर, प्रणाली 286 साइबर सुरक्षा-संबंधित वस्तुओं की पहचान करने में सक्षम थी, जिसमें 102 चोरी किए गए क्रेडिट कार्ड और 131 चोरी किए गए खाता लॉगिन शामिल थे।

लेखकों का दावा है कि DW-GAN सभी मामलों में तीन या कम प्रयासों में एक कैप्चा को तोड़ने में सक्षम था, और 76 मिनट का प्रसंस्करण समय सभी 1,831 उत्पादों को सुरक्षित करने वाले कैप्चा के लिए आवश्यक था। मानव हस्तक्षेप की आवश्यकता नहीं थी, और कोई एंडपॉइंट विफलता मामले नहीं हुए।

लेखकों का निरीक्षण है कि जटिलता के उच्च स्तर की पेशकश करने वाली चुनौतियों का उदय हो रहा है, जिसमें ट्यूरिंग परीक्षणों के आधार पर कुछ शामिल हैं, और यह देखते हैं कि DW-GAN को इन नए रुझानों को समायोजित करने के लिए बढ़ाया जा सकता है क्योंकि वे लोकप्रिय हो जाते हैं।

 

*कंप्यूटर और मानवों के बीच सार्वजनिक ट्यूरिंग परीक्षण को बताने के लिए पूरी तरह से स्वचालित सार्वजनिक

11 जनवरी 2022 को पहली बार प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]