Anderson का एंगल
मशीन लर्निंग वेर्बोस थ्रेट रिपोर्ट्स से अटैक डेटा निकालता है

शिकागो विश्वविद्यालय से नए शोध में पिछले दस वर्षों में लंबे-चौड़े सामग्री के एसईओ लाभों और मशीन लर्निंग सिस्टम के बीच उत्पन्न हुए संघर्ष को दर्शाया गया है, जो इससे आवश्यक डेटा प्राप्त करने में कठिनाई होती है।
साइबर थ्रेट इंटेलिजेंस (सीटीआई) रिपोर्ट्स से आवश्यक खतरा जानकारी निकालने के लिए एक एनएलपी विश्लेषण प्रणाली विकसित करते हुए, शिकागो शोधकर्ताओं ने तीन समस्याओं का सामना किया: रिपोर्ट्स आमतौर पर बहुत लंबी होती हैं, जिसमें केवल एक छोटा सा खंड वास्तविक हमला व्यवहार के लिए समर्पित होता है; शैली घनी और व्याकरणिक रूप से जटिल है, जिसमें व्यापक डोमेन-विशिष्ट जानकारी होती है जो पाठक की ओर से पूर्व ज्ञान की मांग करती है; और सामग्री को क्रॉस-डोमेन संबंध ज्ञान की आवश्यकता होती है, जिसे संदर्भ में समझने के लिए ‘स्मृति’ में रखना होता है (एक स्थायी समस्या, शोधकर्ता ध्यान देते हैं)।
लंबी-चौड़ी खतरा रिपोर्ट्स
प्राथमिक समस्या वाक्पटुता है। उदाहरण के लिए, शिकागो के पेपर में उल्लेख किया गया है कि क्लियरस्काई की 42-पृष्ठ 2019 खतरा रिपोर्ट में डस्टीस्काई (अका नेड वर्म) मैलवेयर के लिए, केवल 11 वाक्य वास्तव में हमला व्यवहार से संबंधित हैं और इसका वर्णन करते हैं।
दूसरी बाधा पाठ जटिलता है, और प्रभावी रूप से, वाक्य लंबाई: शोधकर्ता यह देखते हैं कि माइक्रोसॉफ्ट के खतरा रिपोर्ट केंद्र से 4020 खतरा रिपोर्ट्स में, औसत वाक्य में 52 शब्द होते हैं – केवल नौ कम 500 साल पहले (इस तथ्य के संदर्भ में कि वाक्य लंबाई 75% घट गई है)।
हालांकि, पेपर यह तर्क देता है कि ये लंबे वाक्य मूल रूप से ‘संपीड़ित अनुच्छेद’ हैं जिनमें खंड, क्रियाविशेषण और विशेषण होते हैं जो जानकारी के मूल अर्थ को ढक देते हैं; और वाक्यों में अक्सर मूल रूप से पारंपरिक विराम चिह्न की कमी होती है जिस पर एनएलपी प्रणाली जैसे स्पेसी, स्टैनफोर्ड और एनएलटीके निर्भर करती हैं ताकि इरादा या कठिन डेटा निकाला जा सके।
एनएलपी से सार्थक खतरा जानकारी निकालना
इस समस्या को हल करने के लिए शिकागो शोधकर्ताओं द्वारा विकसित मशीन लर्निंग पाइपलाइन को एक्सट्रैक्टर कहा जाता है, और यह एनएलपी तकनीकों का उपयोग करके ग्राफ़ बनाता है जो लंबे-चौड़े रिपोर्ट्स से हमला व्यवहार को सारांशित और संक्षेप में प्रस्तुत करता है। प्रक्रिया ऐतिहासिक, कथात्मक और भौगोलिक सजावट को त्याग देती है जो एक आकर्षक और विस्तृत ‘कहानी’ बनाती है जो सूचना पेलोड को स्पष्ट रूप से प्राथमिकता देने की कीमत पर होती है।
(MSFT )चूंकि संदर्भ वेर्बोस और प्रोलिक्स सीटीआई रिपोर्ट्स में एक चुनौती है, शोधकर्ताओं ने बीईआरटी (बिडायरेक्शनल एनकोडर रिप्रेजेंटेशन्स फ्रॉम ट्रांसफॉर्मर) भाषा प्रतिनिधित्व मॉडल को गूगल के वर्ड2वेक या स्टैनफोर्ड के ग्लोव (ग्लोबल वेक्टर्स फॉर वर्ड रिप्रेजेंटेशन) के ऊपर चुना।
बीईआरटी शब्दों का मूल्यांकन उनके आसपास के संदर्भ से करता है, और साथ ही उप-शब्दों (अर्थात लॉन्च, लॉन्चिंग और लॉन्चेस सभी लॉन्च में नीचे उतरते हैं) के लिए एम्बेडिंग विकसित करता है। यह एक्सट्रैक्टर को बीईआरटी के प्रशिक्षण मॉडल में मौजूद नहीं होने वाली तकनीकी शब्दावली से निपटने में मदद करता है, और वाक्यों को ‘उत्पादक’ (प्रासंगिक जानकारी वाले) या ‘गैर-उत्पादक’ के रूप में वर्गीकृत करने में मदद करता है।
स्थानीय शब्दावली बढ़ाना
अनिवार्य रूप से, कुछ विशिष्ट डोमेन अंतर्दृष्टि को इस प्रकार की एनएलपी पाइपलाइन में एकीकृत किया जाना चाहिए, क्योंकि आईपी पते और तकनीकी प्रक्रिया नाम जैसे उच्च प्रासंगिक शब्द रूपों को त्यागना नहीं चाहिए।
प्रक्रिया के बाद के भाग बीआईएलएसटीएम (बिडायरेक्शनल एलएसटीएम) नेटवर्क का उपयोग करके शब्द वाक्पटुता से निपटते हैं, वाक्य के हिस्सों के लिए सेमेंटिक भूमिकाएं व्युत्पन्न करते हैं, इससे पहले कि गैर-उत्पादक शब्दों को हटा दिया जाए। बीआईएलएसटीएम इसके लिए अच्छी तरह से अनुकूल है, क्योंकि यह वेर्बोस दस्तावेजों में दिखाई देने वाली लंबी दूरी की निर्भरताओं को संबंधित कर सकता है, जहां अधिक ध्यान और प्रतिधारण की आवश्यकता होती है ताकि संदर्भ का अनुमान लगाया जा सके।
<img class="wp-image-175281" src="https://www.unite.ai/wp-content/uploads/2021/04/semantic_roles_propbank.png" alt="एक्सट्रैक्टर शब्दों के बीच सेमेंटिक भूमिकाएं और संबंध परिभाषित करता है, जिसमें प्रोपबैंक (प्रोपबैंक) एनोटेशन द्वारा उत्पन्न भूमिकाएं हैं।” width=”899″ height=”403″ /> एक्सट्रैक्टर शब्दों के बीच सेमेंटिक भूमिकाएं और संबंध परिभाषित करता है, जिसमें प्रोपबैंक (प्रोपबैंक) एनोटेशन द्वारा उत्पन्न भूमिकाएं हैं।
परीक्षणों में, एक्सट्रैक्टर (आंशिक रूप से डार्पा द्वारा वित्तपोषित) डार्पा रिपोर्ट्स से मानव डेटा निष्कर्षण से मेल खाने में सक्षम पाया गया। प्रणाली को माइक्रोसॉफ्ट सिक्योरिटी इंटेलिजेंस और ट्रेंडमाइक्रो थ्रेट एनसाइक्लोपीडिया से एक उच्च मात्रा में असंरचित रिपोर्ट्स के खिलाफ भी चलाया गया, जिसमें अधिकांश मामलों में सार्थक जानकारी को सफलतापूर्वक निकाला गया।
शोधकर्ता स्वीकार करते हैं कि एक्सट्रैक्टर का प्रदर्शन उन कार्यों को संक्षेपित करने की कोशिश करते समय जो कई वाक्यों या अनुच्छेदों में होते हैं, कम होने की संभावना है, हालांकि अन्य रिपोर्ट्स के लिए प्रणाली को फिर से उपकरण करना यहां एक तरीका है।
लंबाई == प्राधिकरण?
यह देखना दिलचस्प है कि गूगल के जटिल एसईओ एल्गोरिदम के बीच चल रहा तनाव कैसे हाल के वर्षों में लंबे-चौड़े सामग्री को पुरस्कृत करता है (हालांकि इस स्कोर पर आधिकारिक सलाह विरोधाभासी है), और एआई शोधकर्ताओं (जिनमें कई प्रमुख गूगल शोध पहल शामिल हैं) को इन बढ़ती जटिल और लंबी लेखों से इरादा और वास्तविक डेटा डिकोड करने में जो चुनौतियों का सामना करना पड़ता है।
यह तर्क दिया जा सकता है कि लंबे समय तक सामग्री को पुरस्कृत करके, गूगल एक निरंतर गुणवत्ता की मान्यता प्राप्त करता है जिसे यह अभी तक एनएलपी प्रक्रियाओं के माध्यम से पहचानने या मात्रा निर्धारित नहीं कर सकता है, सिवाय इसके कि यह लिंक करने वाली प्राधिकरण साइटों की संख्या की गणना करता है (एक ‘मांसवेयर’ मेट्रिक, अधिकांश मामलों में); और यह कि यह असामान्य नहीं है कि 2,500 शब्दों या अधिक के पोस्ट को एसईआरपीएस प्रमुखता प्राप्त करते हुए देखना, भले ही अतिरिक्त सामग्री ब्रॉडली बुद्धिमान है और अन्य दिशानिर्देशों का उल्लंघन नहीं करती है।
रेसिपी कहां है?
तदनुसार, शब्द गणना बढ़ रही है, जो कि लंबे-चौड़े सामग्री की वास्तविक इच्छा के कारण है, लेकिन यह भी क्योंकि ‘स्टोरीफाइंग’ कुछ मुट्ठी भर तथ्यों को लंबे समय तक एसईओ मानकों तक बढ़ा सकता है, और कम प्रयास के साथ सामग्री को उच्च प्रयास के साथ प्रतिस्पर्धा करने की अनुमति देता है।
एक उदाहरण रेसिपी साइटें हैं, जो बार-बार शिकायत की हैं हैकर न्यूज समुदाय में मूल जानकारी (रेसिपी) के साथ-साथ आत्मवृत्तात्मक या व्हिम्सिकल सामग्री के साथ प्रस्तुत करने के लिए, और एसईओ-अनुकूल 2,500+ शब्द क्षेत्र में शब्द गणना बढ़ाने के लिए।
रेसिपी साइटों से वास्तविक रेसिपी निकालने के लिए कई प्रक्रियात्मक समाधान सामने आए हैं, जिनमें ओपन सोर्स रेसिपी स्क्रैपर और फायरफॉक्स और क्रोम के लिए रेसिपी एक्सट्रैक्टर शामिल हैं। मशीन लर्निंग भी इस मुद्दे से जुड़ी हुई है, जिसमें जापान, अमेरिका और पुर्तगाल से विभिन्न दृष्टिकोण हैं, साथ ही स्टैनफोर्ड से शोध भी है।
शिकागो शोधकर्ताओं द्वारा संबोधित खतरा खुफिया रिपोर्टों के संदर्भ में, वेर्बोस खतरा रिपोर्टिंग की सामान्य प्रथा आंशिक रूप से इस तथ्य के कारण हो सकती है कि एक उपलब्धि के पैमाने को प्रतिबिंबित करने के लिए (जिसे अक्सर एक अनुच्छेद में संक्षेप में किया जा सकता है) एक बहुत लंबी कथा बनाने की आवश्यकता होती है, और शब्द लंबाई का उपयोग प्रयास की मात्रा के प्रॉक्सी के रूप में किया जाता है, जो कि लागू होने की परवाह किए बिना।
दूसरी, एक जलवायु में जहां एक कहानी का मूल स्रोत अक्सर लोकप्रिय समाचार आउटलेट द्वारा खराब उद्धरण अभ्यास के कारण खो जाता है, किसी भी पुनः रिपोर्टिंग पत्रकार द्वारा प्रतिलिपि बनाने की तुलना में अधिक शब्दों की मात्रा उत्पन्न करना एसईआरपीएस जीतने की गारंटी देता है, यह मानकर कि वाक्पटुता – अब एनएलपी के लिए एक बढ़ती चुनौती – वास्तव में इस तरह से पुरस्कृत की जाती है।













