Anderson का एंगल

स्वचालित विज्ञान लेखन की ओर

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

सुबह के समय, अराइव में कंप्यूटर साइंस के खंडों को खंगालना, जैसा कि मैं अधिकांश सुबह करता हूं, मैं ब्राजील के फेडरल यूनिवर्सिटी से एक हालिया पेपर पर आया, जो वैज्ञानिक पत्रों से मुख्य डेटा के सारांश और निष्कर्षण को स्वचालित करने के लिए एक नया प्राकृतिक भाषा प्रसंस्करण फ्रेमवर्क प्रदान करता है।

चूंकि यह मूल रूप से वही है जो मैं प्रतिदिन करता हूं, इसलिए पेपर ने मुझे इस साल की शुरुआत में एक रेडिट लेखकों के थ्रेड पर एक टिप्पणी की याद दिलाई – एक पूर्वानुमान जिसका अर्थ था कि विज्ञान लेखन उन पहले पत्रकारिता नौकरियों में से एक होगा जो मशीन लर्निंग द्वारा अधिग्रहित की जाएगी।

मुझे स्पष्ट रूप से कहना है – मैं पूरी तरह से विश्वास करता हूं कि स्वचालित विज्ञान लेखक आ रहा है, और यह कि इस लेख में मैं जो चुनौतियां उठाता हूं वे या तो अब हल की जा सकती हैं, या अंततः हल की जाएंगी। जहां संभव हो, मैं इसके उदाहरण देता हूं। इसके अलावा, मैं यह नहीं कह रहा हूं कि वर्तमान या निकट भविष्य के विज्ञान-लेखन एआई स्पष्ट रूप से लिखने में सक्षम होंगे; इस क्षेत्र में वर्तमान स्तर के हित के आधार पर, मैं मानता हूं कि यह चुनौती अंततः हल हो जाएगी।

इसके बजाय, मैं यह पूछ रहा हूं कि क्या एक विज्ञान-लेखक एआई विज्ञान कहानियों की पहचान करने में सक्षम होगा जो प्रकाशकों की (बहुत भिन्न) वांछित परिणामों के अनुरूप हों।

मैं नहीं सोचता कि यह आसन्न है; अराइव डोमेन पर लगभग 2000 नए वैज्ञानिक पत्रों की सुर्खियों और/या प्रतिलिपि के माध्यम से खंगालने के आधार पर, मैं मशीन लर्निंग पर अकादमिक जमा को एल्गोरिदमिक रूप से तोड़ने की सीमा के बारे में एक अधिक निराशावादी दृष्टिकोण रखता हूं, चाहे वह अकादमिक सूचीकरण के उद्देश्यों के लिए हो या वैज्ञानिक पत्रकारिता के लिए। जैसा कि यह आमतौर पर होता है, यह उन शापित लोग हैं जो रास्ते में आ रहे हैं।

स्वचालित विज्ञान लेखक के लिए आवश्यकताएं

आइए नवीनतम अकादमिक अनुसंधान पर विज्ञान रिपोर्टिंग को स्वचालित करने की चुनौती पर विचार करें। इसे न्यायसंगत रखने के लिए, हम मुख्य रूप से कॉर्नेल यूनिवर्सिटी के बहुत लोकप्रिय गैर-भुगतान वाले अराइव डोमेन के सीएस श्रेणियों तक सीमित रहेंगे, जिसमें कम से कम कुछ व्यवस्थित, टेम्पलेटेड सुविधाएं हैं जिन्हें एक डेटा निष्कर्षण पाइपलाइन में प्लग किया जा सकता है।

आइए यह भी मान लें कि कार्य, ब्राजील से नए पेपर के साथ, नए वैज्ञानिक पत्रों की शीर्षकों, सारांशों, मेटाडेटा और (यदि उचित हो) शरीर सामग्री के माध्यम से पुनरावृत्ति करना है, स्थिरांक, विश्वसनीय पैरामीटर, टोकन और क्रियाशील, कम करने योग्य डोमेन जानकारी की तलाश में है।

यह,毕竟, उस सिद्धांत पर है जिस पर उच्चतम सफल नए फ्रेमवर्क पृथ्वी भूकंप रिपोर्टिंग, खेल लेखन, वित्तीय पत्रकारिता और स्वास्थ्य कवरेज के क्षेत्रों में जमीन हासिल कर रहे हैं, और एक तर्कसंगत प्रस्थान बिंदु है एक एआई-संचालित विज्ञान पत्रकार के लिए।

<img class="wp-image-178114 size-full" src="https://www.unite.ai/wp-content/uploads/2021/10/brazil-data-extraction.jpg" alt="ब्राजील की नई पेशकश का कार्यप्रवाह। पीडीएफ विज्ञान पत्र को यूटीएफ -8 सादा पाठ में परिवर्तित किया जाता है (हालांकि यह सेमेंटिक अर्थ होने वाले इटैलिक जोर को हटा देगा), और लेख के खंडों को लेबल और निकाले जाने से पहले पाठ फ़िल्टरिंग के लिए पारित किया जाता है। डीकंस्ट्रक्टेड पाठ को वाक्यों के रूप में डेटा-फ्रेम में तोड़ा जाता है, और डेटा-फ्रेम को मerged किया जाता है इससे पहले कि टोकन पहचान और दो डॉक-टोकन मैट्रिक्स के निर्माण के लिए। स्रोत: https://arxiv.org/ftp/arxiv/papers/2107/2107.14638.pdf ब्राजील की नई पेशकश का कार्यप्रवाह। पीडीएफ विज्ञान पत्र को यूटीएफ -8 सादा पाठ में परिवर्तित किया जाता है (हालांकि यह सेमेंटिक अर्थ होने वाले इटैलिक जोर को हटा देगा), और लेख के खंडों को लेबल और निकाले जाने से पहले पाठ फ़िल्टरिंग के लिए पारित किया जाता है। डीकंस्ट्रक्टेड पाठ को वाक्यों के रूप में डेटा-फ्रेम में तोड़ा जाता है, और डेटा-फ्रेम को मerged किया जाता है इससे पहले कि टोकन पहचान और दो डॉक-टोकन मैट्रिक्स के निर्माण के लिए। स्रोत: https://arxiv.org/ftp/arxiv/papers/2107/2107.14638.pdf

टेम्पलेट को जटिल बनाना

एक प्रोत्साहित करने वाली परत है एकरूपता और नियमितता की है, अराइव एक बहुत ही अच्छी तरह से लागू किया गया टेम्पलेट जमा करने के लिए, और विस्तृत दिशानिर्देश प्रदान करता है जमा करने वाले लेखकों के लिए। इसलिए, पत्र आमतौर पर जिस काम का वर्णन किया जा रहा है उसके लिए प्रोटोकॉल के जिन भागों पर लागू होते हैं उन्हें मानते हैं।

इस प्रकार, एआई प्री-प्रोसेसिंग सिस्टम के लिए संभावित स्वचालित विज्ञान लेखक आमतौर पर ऐसे खंडों का इलाज कर सकता है: सारांश, परिचय, संबंधित/पिछला काम, विधि/डेटा, परिणाम/निष्कर्ष, अभिलेखन अध्ययन, चर्चा, निष्कर्ष के रूप में उप-डोमेन।

हालांकि, व्यवहार में, इनमें से कुछ खंड गायब हो सकते हैं, पुनर्नामित किए जा सकते हैं, या ऐसी सामग्री हो सकती है जो सख्ती से बोलते समय किसी अन्य खंड में शामिल की जा सकती है। इसके अलावा, लेखक स्वाभाविक रूप से टेम्पलेट के अनुरूप नहीं होने वाले शीर्षक और उपशीर्षक शामिल करेंगे। इसलिए, यह एनएलपी/एनएलयू के लिए खंड-संबंधित प्रासंगिक सामग्री को संदर्भ से पहचानने के लिए होगा।

मुश्किल में पड़ना

एक हेडर पदानुक्रम एनएलपी सिस्टम के लिए सामग्री के ब्लॉक को शुरू में वर्गीकृत करने का एक आसान तरीका है। अराइव जमा करने वाले कई माइक्रोसॉफ्ट वर्ड (जैसा कि अराइव पीडीएफ में ‘माइक्रोसॉफ्ट वर्ड’ शीर्षक हेडर में छोड़े जाने के साक्ष्य के रूप में देखा जाता है – नीचे दी गई छवि देखें) से निर्यात किए जाते हैं। यदि आप वर्ड में खंड शीर्षक का उपयोग करते हैं, तो एक पीडीएफ के लिए निर्यात एक ही पदानुक्रम के रूप में पुनर्निर्मित होगा जो एक मशीन रिपोर्टर के डेटा निष्कर्षण प्रक्रियाओं के लिए उपयोगी है।

हालांकि, यह मानता है कि लेखक वास्तव में वर्ड या अन्य दस्तावेज़ निर्माण फ्रेमवर्क (जैसे टेक्स और डेरिवेटिव, जो अराइव जमा में दुर्लभ रूप से मूल विकल्प के रूप में प्रदान किए जाते हैं, अधिकांश प्रस्ताव पीडीएफ और कभी-कभी पोस्टस्क्रिप्ट तक सीमित हैं) में ऐसी सुविधाओं का उपयोग कर रहे हैं।

अराइव पत्रों को पढ़ने के वर्षों के आधार पर, मैंने देखा है कि उनके अधिकांश में कोई व्याख्यात्मक संरचनात्मक मेटाडेटा नहीं है, पाठक (अर्थात एक वेब ब्राउज़र या पीडीएफ रीडर) में शीर्षक को पूर्ण शीर्षक (विस्तार सहित) के रूप में रिपोर्ट किया जाता है। डॉक्यूमेंट खुद।

इस मामले में, पत्र की सेमेंटिक व्याख्यात्मकता सीमित है, और एक एआई-आधारित विज्ञान लेखक प्रणाली को अराइव डोमेन में इसके संबंधित मेटाडेटा से जुड़ने के लिए कार्यक्रमवार रूप से जोड़ना होगा। अराइव का सम्मेलन यह निर्देश देता है कि बुनियादी मेटाडेटा भी पेज 1 पर बड़े ग्रे प्रकार में बाद में डाला जाता है (नीचे दी गई छवि देखें)। दुर्भाग्य से, – कम से कम इसलिए नहीं कि यह प्रकाशन तिथि या संस्करण संख्या प्राप्त करने के लिए एकमात्र विश्वसनीय स्थान है – यह अक्सर बाहर रखा जाता है।

कई लेखक या तो कोई शैली का उपयोग नहीं करते हैं, या केवल एच 1 (सबसे उच्च शीर्षक/शीर्षक) शैली का उपयोग करते हैं, एनएलयू को फिर से संदर्भ से (संभवतः इतनी मुश्किल नहीं) या दस्तावेज़ मार्ग में शामिल रेफरेंस नंबर (अर्थात https://arxiv.org/pdf/2110.00168 से शीर्षक को निकालने के लिए मजबूर किया जाता है। pdf) और नेट-आधारित (स्थानीय के बजाय) मेटाडेटा का लाभ उठाने के लिए जमा के लिए।

हालांकि, बाद वाला कम से कम शीर्षक को हटा देगा, यह सुनिश्चित करने के लिए कि जमा किस खंड के लिए लागू होता है, और तारीख और संस्करण जानकारी प्रदान करेगा।

पैराग्राफ रिटर्न पर ग्लूडटेक्स्ट

पीडीएफ और पोस्टस्क्रिप्ट अराइव द्वारा लेखकों द्वारा जमा की जाने वाली सबसे आम प्रारूप होने के साथ, एनएलपी सिस्टम को एक दिनचर्या की आवश्यकता होगी जो अंत-ऑफ-लाइन शब्दों को अगले-लाइन शब्दों से विभाजित करे जो पीडीएफ प्रारूप के दुर्भाग्यपूर्ण डिफ़ॉल्ट अनुकूलन विधियों के तहत उनसे जुड़े हुए हैं।

शब्दों को डी-कॉनकेटेनेटिंग (और डी-हाइफ़नाइज़िंग) पेरल में और कई अन्य सरल पुनरावृत्ति दिनचर्या में किया जा सकता है, हालांकि एक पायथन-आधारित दृष्टिकोण कम समय लेने वाला हो सकता है और एक एमएल फ्रेमवर्क के लिए अधिक अनुकूल हो सकता है। पीडीएफ प्रारूप के मूल, एडोब ने एक एआई-सक्षम रूपांतरण प्रणाली विकसित की है जिसे लिक्विड मोड कहा जाता है, जो पीडीएफ में बेक्ड टेक्स्ट को ‘रीफ्लो’ करने में सक्षम है, हालांकि इसका मोबाइल स्थान से परे रोलआउट साबित हुआ है धीमा।

खराब अंग्रेजी

अंग्रेजी वैज्ञानिक पत्रों को जमा करने के लिए वैश्विक मानक बनी हुई है, भले ही यह विवादास्पद हो। इसलिए, कभी-कभी रोचक और समाचार योग्य पत्रों में गैर-अंग्रेजी शोधकर्ताओं से अपमानजनक मानकों की अंग्रेजी होती है। यदि अंग्रेजी का कुशल उपयोग एक मूल्य के रूप में शामिल किया जाता है जब एक मशीन प्रणाली काम का मूल्यांकन करती है, तो न केवल अच्छी कहानियां अक्सर खो जाएंगी, बल्कि पेडांटिक निम्न-मूल्य आउटपुट को उच्च दर्जा दिया जाएगा क्योंकि यह बहुत कम कहता है बहुत अच्छी तरह से।

एनएलपी सिस्टम जो इस संबंध में लचीले नहीं हैं उन्हें डेटा निष्कर्षण में एक अतिरिक्त परत के रूप में अनुभव होने की संभावना है, जब तक कि सबसे कठोर और पैरामीटरीकृत विज्ञान, जैसे कि रसायन विज्ञान और सैद्धांतिक भौतिकी में, जहां ग्राफ और चार्ट अधिक समान रूप से वैश्विक विज्ञान समुदायों में अनुरूप होते हैं, जब तक कि पूरी तरह से स्थापित वैज्ञानिक सर्वसम्मति के बारे में विधि के बारे में पुराने विज्ञान का आनंद नहीं मिलता है। हालांकि मशीन लर्निंग पत्र अक्सर सूत्रों की सुविधा देते हैं, वे प्रस्तुति के अभाव में पूरी तरह से स्थापित वैज्ञानिक सर्वसम्मति के बारे में विधि के बारे में पुराने विज्ञान का आनंद लेने में विफल हो सकते हैं।

चयन: दर्शकों की आवश्यकताओं का निर्धारण

हम जल्द ही विज्ञान पत्रों को डिकंपोज़ करने की कई समस्याओं पर वापस आएंगे। अब, आइए अपने दर्शकों और उद्देश्यों पर विचार करें, क्योंकि वे विज्ञान लेखक एआई को हजारों पत्रों के माध्यम से छानने में मदद करने के लिए आवश्यक होंगे। संभावित समाचार कहानियों की सफलता की भविष्यवाणी करना पहले से ही एक सक्रिय क्षेत्र है मशीन लर्निंग में।

उदाहरण के लिए, यदि उच्च-वॉल्यूम ‘विज्ञान यातायात’ एक वेबसाइट पर एकमात्र उद्देश्य है जहां विज्ञान लेखन केवल एक व्यापक पत्रकारिता पेशकश का एक हिस्सा है (जैसा कि यूके के डेली मेल विज्ञान अनुभाग के मामले में है), तो एक एआई को उच्चतम-गrossing विषयों का निर्धारण करने की आवश्यकता हो सकती है यातायात के संदर्भ में, और अपनी चयन को उसकी ओर अनुकूलित करें। यह प्रक्रिया संभवतः (सापेक्षिक रूप से) कम लटके हुए फल जैसे रोबोट, ड्रोन, गहरे नकली, गोपनीयता और सुरक्षा कमजोरियों को प्राथमिकता देगी।

इस प्रकार के उच्च-स्तरीय हार्वेस्टिंग से संभवतः हमारे विज्ञान लेखक एआई के लिए ‘फिल्टर बबल’ मुद्दे उत्पन्न होंगे, क्योंकि एल्गोरिदम इन विषयों पर ‘वांछनीय’ उच्च-आवृत्ति कीवर्ड और वाक्यांशों वाले कई अधिक संदेहास्पद विज्ञान पत्रों पर बढ़ी हुई ध्यान देता है (फिर से, क्योंकि उनमें यातायात और समाचार आउटलेट के लिए धन है, और अकादमिक विभागों के लिए धन), जबकि अराइव के कम देखे जाने वाले कोनों में पाए जाने वाले कई कम लिखने योग्य ‘ईस्टर एग’ की उपेक्षा करता है।

एक और किया!

अच्छा विज्ञान समाचार सामग्री अजीब और अप्रत्याशित स्थानों से आ सकती है, और पहले से अनुपयोगी क्षेत्रों और विषयों से। हमारे एआई विज्ञान लेखक को और अधिक भ्रमित करने के लिए, एक ऑफ-बीट ‘हिट’ (जैसे कि एक डिस्कॉर्ड सर्वर, एक अकादमिक अनुसंधान विभाग या एक प्रौद्योगिकी स्टार्टअप) का स्रोत अक्सर कभी भी कार्रवाई योग्य सामग्री का उत्पादन नहीं करेगा, जबकि एक बड़े पैमाने पर और शोर वाले जानकारी प्रवाह का उत्पादन जारी रखेगा जो मूल्य का है।

एक पुनरावृत्ति मशीन लर्निंग आर्किटेक्चर से क्या निष्कर्ष निकाला जा सकता है? कि कई हजारों पिछले ‘आउटलियर’ समाचार स्रोत जिन्हें यह एक बार पहचाना और बाहर कर दिया गया था, अब प्राथमिकता दी जानी चाहिए (हालांकि ऐसा करने से एक अव्यवस्थित संकेत-से-शोर अनुपात बन जाएगा, वर्ष में जारी किए गए पत्रों की उच्च मात्रा को देखते हुए)? कि विषय स्वयं एक कार्यकर्ता परत की तुलना में अधिक योग्य है जिसने इसे उत्पन्न किया (जो एक लोकप्रिय विषय के मामले में, एक अतिरिक्त कार्रवाई है)..?

अधिक उपयोगी ढंग से, प्रणाली सीख सकती है कि उसे पैटर्न की तलाश में डेटा-माप के पदानुक्रम में ऊपर या नीचे जाने की आवश्यकता है – यदि वास्तव में कोई हैं – जो मेरे दिवंगत पत्रकार दादा द्वारा ‘समाचार की नाक’ को परिभाषित करते हैं, और ‘समाचार योग्य’ सुविधा को एक यात्री और अमूर्त गुण के रूप में परिभाषित करते हैं जो स्रोत के आधार पर सटीक रूप से भविष्यवाणी नहीं की जा सकती है, और जो दैनिक आधार पर परिवर्तित होने की उम्मीद की जाती है।

परिकल्पना विफलता की पहचान करना

कोटा दबाव के कारण, अकादमिक विभाग कभी-कभी ऐसे कार्य प्रकाशित करते हैं जहां केंद्रीय परिकल्पना पूरी तरह से (या लगभग पूरी तरह से) परीक्षण में विफल हो जाती है, भले ही परियोजना के तरीके और निष्कर्ष अपने आप में थोड़ा रुचिकर हों।

ऐसे निराशाओं को अक्सर सारांश में संकेत नहीं दिया जाता है; सबसे खराब मामलों में, खंडित परिकल्पनाएं केवल परिणाम ग्राफ़ पढ़कर ही पहचानी जा सकती हैं। यह न केवल विधि की विस्तृत समझ का अंतर्ग्रहण करने की आवश्यकता को शामिल करता है जो पत्र प्रदान कर सकता है, बल्कि संदर्भ में एक पाई चार्ट से लेकर एक स्कैटर प्लॉट तक सब कुछ की व्याख्या करने में सक्षम ग्राफ़ व्याख्या एल्गोरिदम भी शामिल हैं।

एक एनएलपी-आधारित प्रणाली जो सारांश पर विश्वास करती है लेकिन ग्राफ़ और तालिकाओं की व्याख्या नहीं कर सकती है, एक नए पत्र पर पहली बार पढ़ने पर बहुत उत्साहित हो सकती है। दुर्भाग्य से, पूर्व उदाहरणों को सामान्य पैटर्न में ‘छिपी हुई विफलता’ के लिए प्रशिक्षण के लिए सामान्य बनाना मुश्किल है, क्योंकि यह मुख्य रूप से एक लोप या कमजोरी का अपराध है, और इसलिए कठिन है।

एक चरम मामले में, हमारा एआई लेखक संभवतः संदेहास्पद परिणामों के प्रति अपनी समझ को सत्यापित करने के लिए भंडार डेटा (अर्थात गिटहब से) का पता लगाने और परीक्षण करने की आवश्यकता हो सकती है, या उपलब्ध पूरक सामग्री को पार्स करने की आवश्यकता हो सकती है। इसलिए, एक मशीन लर्निंग प्रणाली को इनमें शामिल कई अनमैप्ड स्रोतों और प्रारूपों को नेविगेट करने की आवश्यकता होगी, स्वचालित सत्यापन प्रक्रियाओं को एक प्रकार की वास्तुकला चुनौती बना देगी।

‘सफेद बॉक्स’ परिदृश्य

कुछ एआई-केंद्रित सुरक्षा पत्रों में Attackers को असाधारण और बहुत ही अनोखे स्तर की पहुंच की आवश्यकता होती है – ‘सफेद बॉक्स’ हमले। जबकि यह एआई प्रणालियों की वास्तुकला में पहले से अज्ञात कrinkles को उजागर करने के लिए उपयोगी है, यह लगभग कभी भी वास्तविक रूप से शोषण योग्य हमला सतह का प्रतिनिधित्व नहीं करता है। इसलिए, विज्ञान लेखक एआई को सुरक्षा के दावों को प्रभावी तैनाती की संभावनाओं में विभाजित करने के लिए एक काफी अच्छा बुलशिट डिटेक्टर की आवश्यकता होगी।

स्वचालित विज्ञान लेखक को ‘सफेद बॉक्स’ के उल्लेख को अर्थपूर्ण संदर्भ में एक अर्थपूर्ण संदर्भ में अलग करने के लिए एक कुशल एनएलयू दिनचर्या की आवश्यकता होगी (अर्थात पत्र के मुख्य निहितार्थ से उन्हें अलग करने के लिए), और ‘सफेद बॉक्स’ पद्धति के मामलों में जहां वाक्यांश कभी पत्र में दिखाई नहीं देता है।

अन्य ‘गोटचास’

अन्य स्थान जहां अवास्तविकता और परिकल्पना विफलता बहुत दफन हो सकती है अभिलेशन अध्ययन में, जो नए सूत्र या विधि के मुख्य तत्वों को व्यवस्थित रूप से दूर करने के लिए है, यह देखने के लिए कि क्या परिणाम नकारात्मक रूप से प्रभावित होते हैं या यदि एक ‘मूल’ खोज लचीली है। अभ्यास में, ऐसे पत्र जिनमें अभिलेशन अध्ययन शामिल हैं, आमतौर पर अपने निष्कर्षों के बारे में आश्वस्त होते हैं, हालांकि एक सावधानीपूर्वक पढ़ाई अक्सर एक ‘ब्लफ’ को उजागर कर सकती है। एआई अनुसंधान में, यह अक्सर ओवरफिटिंग के बराबर होता है, जहां एक मशीन लर्निंग सिस्टम मूल अनुसंधान डेटा पर अच्छा प्रदर्शन करता है, लेकिन नए डेटा पर सामान्य नहीं करता है, या अन्य गैर-पुनरुत्पादक प्रतिबंधों के तहत संचालित होता है।

एक और उपयोगी अनुभाग शीर्षलेख सीमाएं है। यह वह पहला अनुभाग है जिसे किसी भी विज्ञान लेखक (एआई या मानव) को छोड़ना चाहिए, क्योंकि यह जानकारी शामिल कर सकता है जो पत्र की整个 परिकल्पना को अमान्य कर देती है, और उसे आगे बढ़ाने से (कम से कम मानव के लिए) घंटों का काम बचा सकता है। एक और भी बुरा परिदृश्य यह है कि एक पत्र में वास्तव में सीमाएं अनुभाग है, लेकिन ‘समझौता’ तथ्य अन्य地方 में काम में शामिल हैं और यहां नहीं हैं, या यहां कमजोर हैं।

इसके बाद पिछला काम है। यह अराइव टेम्पलेट में शुरू में होता है, और अक्सर खुलासा करता है कि वर्तमान पत्र केवल 12-18 महीने पहले की एक बहुत ही अभिनव परियोजना पर एक छोटी सी प्रगति का प्रतिनिधित्व करता है। इस चरण में, एआई लेखक को यह स्थापित करने की क्षमता होनी चाहिए कि क्या पिछला काम गति प्राप्त किया; क्या यहां अभी भी एक कहानी है? क्या पहले का काम उस समय प्रकाशन के समय से असेवित रूप से चूक गया था? या क्या नया पत्र केवल एक पूर्व परियोजना के लिए एक निरर्थक पोस्टस्क्रिप्ट है?

पुनरावृत्ति और ‘ताजगी’ का मूल्यांकन

इसके अलावा, वी.2 का एक पत्र अक्सर V.1 के प्रकाशन के बाद से ध्यान नहीं मिलने के बाद ध्यान आकर्षित करने के लिए लेखकों द्वारा केवल एक प्रयास होता है। अक्सर, हालांकि, एक पत्र वास्तव में दूसरे मौके का हकदार है, क्योंकि मीडिया का ध्यान मूल प्रकाशन के समय कहीं और मोड़ दिया जा सकता है, या काम बहुत भीड़भाड़ वाले ‘सिम्पोजियम’ और सम्मेलन अवधियों (जैसे शरद ऋतु और देर से सर्दियों) में जमा की भीड़ से छिपा हो सकता है।

एक उपयोगी विशेषता अराइव पर एक पुनरावृत्ति को अलग करने के लिए [अद्यतन] टैग है जो जमा शीर्षकों में जोड़ा जाता है। हमारे एआई लेखक के आंतरिक ‘रिकमेंडर सिस्टम’ को सावधानी से विचार करने की आवश्यकता होगी कि क्या [अद्यतन] == ‘खेला गया’ है, खासकर जब यह (संभवतः) एक दबाव वाले विज्ञान हैक की तुलना में बहुत तेजी से पुनर्जीवित पत्र का मूल्यांकन कर सकता है। इस संबंध में, यह मानवों के लिए एक उल्लेखनीय लाभ है, अराइव के एक नामकरण सम्मेलन के कारण जो शायद ही कभी बने रहेंगे।

अराइव यह जानकारी भी प्रदान करता है कि क्या पत्र को किसी अन्य पत्र (अक्सर एक ही लेखकों द्वारा) के साथ महत्वपूर्ण पाठ ओवरलैप के रूप में पहचाना गया है, और यह जानकारी एक एआई लेखक प्रणाली द्वारा [अद्यतन] टैग के अभाव में ‘डुप्लिकेट/पुनरावृत्ति’ स्थिति में व्याख्या की जा सकती है।

विस्तार का निर्धारण

जैसा कि अधिकांश पत्रकारों के साथ होता है, हमारा परियोजना विज्ञान लेखक अंडररिपोर्टेड या अनरिपोर्टेड समाचार की तलाश में है, ताकि वह समर्थन करने वाली सामग्री धारा में मूल्य जोड़ सके। अधिकांश मामलों में, टेकक्रंच, द वर्ज और यूरेकालर्ट जैसे प्रमुख आउटलेट्स में पहले से ही विज्ञान ब्रेकथ्रू की रिपोर्टिंग करना बेकार है एट अल, क्योंकि ऐसे बड़े प्लेटफार्मों में अपनी सामग्री के साथ व्यापक प्रचार मशीनों का समर्थन होता है, जो पत्र के लिए मीडिया संतृप्ति की लगभग गारंटी देता है।

इसलिए, हमारा एआई लेखक यह निर्धारित करना होगा कि कहानी पर्याप्त ताज़ा है या नहीं यह आगे बढ़ने लायक है।

सिद्धांत रूप में, सबसे आसान तरीका होगा हाल के इनबाउंड लिंक की पहचान करना मुख्य अनुसंधान पृष्ठों (सारांश, पीडीएफ, अकादमिक विभाग वेबसाइट समाचार अनुभाग, आदि) में। सामान्य तौर पर, फ्रेमवर्क जो अप-टू-डेट इनबाउंड लिंक जानकारी प्रदान कर सकते हैं वे ओपन सोर्स या कम लागत वाले नहीं हैं, लेकिन प्रमुख प्रकाशक संभवतः एक नईसवर्थ-मूल्यांकन फ्रेमवर्क के हिस्से के रूप में एसएएएस लागत को सहन कर सकते हैं।

ऐसी पहुंच के धारण करने पर, हमारे विज्ञान लेखक एआई को यह समस्या का सामना करना पड़ता है कि कई विज्ञान रिपोर्टिंग आउटलेट पत्रों का हवाला नहीं देते हैं जिन पर वे लिख रहे हैं, यहां तक कि तब भी जब यह जानकारी स्वतंत्र रूप से उपलब्ध होती है। इसके बाद, वे एक दूसरे के लिए माध्यमिक रिपोर्टिंग के लिंक चाहते हैं, न कि स्रोत के लिए। चूंकि उन्होंने वास्तव में एक शोध पत्र (देखें सामाजिक विज्ञान लेखक नीचे) तक पहुंच प्राप्त की है, इसलिए उनके पास इसके लिए एक कपटपूर्ण उपसर्ग है।

इसलिए, हमारे एआई लेखक को पत्र से क्रियाशील कीवर्ड निकालने और यह निर्धारित करने के लिए समय-निर्धारित खोज करनी होगी कि कहानी पहले से ही कहां टूट गई है – और फिर मूल्यांकन करें कि क्या कोई पूर्व विस्तार को छूट दिया जा सकता है, या यदि कहानी खेली जा चुकी है।

कभी-कभी, पत्र पेपर में पूरक वीडियो सामग्री प्रदान करते हैं यूट्यूब पर, जहां ‘दृश्य गणना’ का उपयोग विस्तार के सूचक के रूप में किया जा सकता है। इसके अलावा, हमारा एआई पत्र से छवियों को निकाल सकता है और विस्तार को निर्धारित करने के लिए एक प्रणालीगत छवि-आधारित खोज कर सकता है कि क्या कहीं भी और कब छवियों को पुनः प्रकाशित किया गया है।

ईस्टर एग

कभी-कभी एक ‘सूखा’ पत्र ऐसे निष्कर्षों का खुलासा करता है जो गहन और समाचार योग्य प्रभाव हैं, लेकिन जो लेखकों द्वारा कम करके आंका जाता है (या यहां तक कि देखा या स्वीकार किया जाता है), और केवल पूरे पत्र को पढ़कर और गणित करके ही प्रकट हो सकता है।

मुझे लगता है कि दुर्लभ मामलों में, यह इसलिए है क्योंकि लेखक अकादमिक प्राप्ति की तुलना में सार्वजनिक की तुलना में अधिक चिंतित हैं, शायद इसलिए कि वे महसूस करते हैं (न कि हमेशा गलत तरीके से) कि शामिल मूल अवधारणाएं सामान्य उपभोग के लिए पर्याप्त रूप से सरल नहीं की जा सकती हैं, उनके संस्थानों के पीआर विभागों के हाइपरबोलिक प्रयासों के बावजूद।

लेकिन लगभग उतनी ही बार, लेखक अपने काम के प्रभाव को देख या स्वीकार नहीं कर सकते हैं, ‘वैज्ञानिक निकासी’ के तहत काम कर रहे हैं। कभी-कभी ये ‘ईस्टर एग’ सकारात्मक संकेतक नहीं होते हैं, और जटिल तालिकाओं में छिपे होते हैं।

अराइव से परे

यह विचार किया जाना चाहिए कि कंप्यूटर विज्ञान के बारे में पत्रों को विच्छिन्न टोकन और संस्थाओं में पारित करना अराइव जैसे डोमेन में बहुत आसान होगा, जो विश्लेषण के लिए एक संख्या और टेम्पलेटेड ‘हुक’ प्रदान करता है, और जिसके लिए अधिकांश कार्यक्षमता के लिए लॉगिन की आवश्यकता नहीं होती है।

न केवल विज्ञान प्रकाशन की सभी पहुंच खुली नहीं है। यह देखा जाना बाकी है कि क्या हमारा एआई विज्ञान लेखक व्यावहारिक या कानूनी दृष्टिकोण से साइ-हब के माध्यम से पेड़वाल को बायपास करने का सहारा लेगा; पेड़वाल को रोकने के लिए अभिलेखागार साइटों का उपयोग करेगा; और क्या यह विभिन्न अन्य विज्ञान प्रकाशन मंचों के लिए समान डोमेन-खनन वास्तुकला का निर्माण करना व्यावहारिक होगा, जिनमें से कई प्रणालीगत जांच के लिए प्रतिरोधी हैं।

यह विचार किया जाना चाहिए कि अराइव दर सीमाएं हैं जो एक एआई लेखक की समाचार मूल्यांकन दिनचर्या को एक अधिक ‘मानव’ गति में धीमा कर देंगी।

सामाजिक एआई विज्ञान लेखक

अराइव और अन्य ‘खुले’ विज्ञान प्रकाशन मंचों के खुले और सुलभ क्षेत्र से परे, यहां तक कि एक नए और दिलचस्प पत्र तक पहुंच प्राप्त करना एक चुनौती हो सकती है, जिसमें एक लेखक के लिए संपर्क चैनल का पता लगाना और उनसे संपर्क करना शामिल है अनुरोध करने के लिए पढ़ने और यहां तक कि उद्धरण प्राप्त करने के लिए (जब समय का दबाव एक प्रमुख कारक नहीं है – एक दुर्लभ मामला है मानव विज्ञान रिपोर्टरों के लिए इन दिनों)।

यह संभवतः विज्ञान डोमेन और लेखक के ईमेल पते (यहां तक कि अराइव पर भी) को प्रकट करने के लिए खाते बनाने और लिंक्डइन में शामिल होने के लिए स्वचालित रूप से नेविगेट करने की आवश्यकता होगी। अधिकांश समय, लिंक्डइन तेजी से प्रतिक्रिया प्राप्त करने का सबसे तेज़ तरीका है, लेकिन एआई सिस्टम वर्तमान में लिंक्डइन सदस्यों से संपर्क करने से प्रतिबंधित हैं।

एक प्रतिष्ठित आउटलेट जैसे वायर्ड से एक संभावित एआई-आधारित लेखक के साथ शोधकर्ता कैसे प्रतिक्रिया देंगे – खासकर यदि वे अपने काम को प्रसारित करने की उम्मीद कर रहे हैं – यह संभवतः आउटलेट के प्रभाव पर निर्भर करेगा।

अधिकांश मामलों में, आप कल्पना कर सकते हैं कि लेखक आशा करेंगे कि ये अर्ध-स्वचालित आदान-प्रदान अंततः लेख में मानव को लाएंगे, लेकिन यह संभव नहीं है कि अनुवर्ती वीओआईपी साक्षात्कार एक एआई द्वारा सुविधाजनक हो सकते हैं, कम से कम जहां लेख की व्यवहार्यता का पूर्वानुमान एक निश्चित सीमा से नीचे है, और जहां प्रकाशन मानव भागीदारी को आकर्षित करने के लिए पर्याप्त धक्का है।

एआई के साथ समाचार की पहचान करना

यहां वर्णित कई सिद्धांत और चुनौतियां अन्य पत्रकारिता के क्षेत्रों में स्वचालन की संभावना पर भी लागू होते हैं, और जैसा कि यह हमेशा से रहा है, एक संभावित कहानी की पहचान करना मुख्य चुनौती है। अधिकांश मानव पत्रकारों को यह स्वीकार करना होगा कि वास्तव में कहानी लिखना प्रयास का केवल अंतिम 10% है, और एक बार कीबोर्ड क्लटरिंग हो जाने के बाद, काम मुख्य रूप से समाप्त हो जाता है।

तब मुख्य चुनौती एआई सिस्टम विकसित करना है जो एक कहानी को स्पॉट, जांच और प्रमाणित कर सकते हैं, समाचार खेल के कई जटिल विचारों के आधार पर, और जो पहले से ही मानव या अन्य के लिए प्रतिरोधी हैं, जो मंचों की एक विस्तृत श्रृंखला को नेविगेट करते हैं।

विज्ञान रिपोर्टिंग के मामले में, नए पत्रों के लेखकों के पास एक ही स्व-सेवा एजेंडा है जो किसी भी अन्य संभावित समाचार कहानी के प्राथमिक स्रोत के रूप में है। इसलिए, एक संभावित स्वचालित विज्ञान लेखक को समाजशास्त्र, मनोविज्ञान और आर्थिक प्रेरणा के बारे में पूर्व ज्ञान को एम्बेड करने की आवश्यकता होगी ताकि यह आज कहां है यह निर्धारित किया जा सके, जब तक कि समाचार डोमेन विशेष रूप से स्तरित न हो, जैसा कि स्टॉक, महामारी आंकड़े, खेल परिणाम, भूकंपीय गतिविधि और अन्य शुद्ध सांख्यिकीय समाचार स्रोतों के मामले में होता है।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai