Anderson का एंगल
एआई को छवियों को समझने और संवाद में उनका उपयोग करने के लिए सिखाना

दक्षिण कोरिया के शोधकर्ताओं ने एक डेटासेट विकसित किया है जो एआई को यह समझने में मदद करेगा कि लोग संवाद में छवियों का उपयोग कैसे करते हैं, और प्राकृतिक भाषा मॉडल को इस बहुत ही हालिया मानव संचार में विकास में भाग लेने में मदद करेगा।
केएआईएसटी tại डेडॉक इन्नोपोलिस से पेपर में उल्लेख किया गया है कि पिछले दस वर्षों में ऐसे बहु-मोडल संवाद प्रणालियों के शोध में डेटासेट और विधियों की कमी के कारण बाधा उत्पन्न हुई है, जो विषय से संबंधित अनुशासनों पर केंद्रित हैं, जैसे कि दृश्य प्रश्न उत्तर और छवि शीर्षक।
इन पुराने दृष्टिकोणों में, छवियों का मूल्यांकन संवाद के लेक्सिकल संदर्भ से बाहर किया जाता है, छवि प्रतिक्रियाओं द्वारा संवाद के विकास और सुधार के तरीके को समझे बिना, और छवियों के योगदान को डिकोड करने के लिए कोई क्रॉस-डोमेन स्कीमा नहीं होती है।
संवाद में छवियों को पहली श्रेणी के पहलू के रूप में
अब तक के कई दृष्टिकोण माइक्रोसॉफ्ट के एआई अनुसंधान विभाग से शुरू किए गए हैं, जिन्होंने 2017 में अध्ययन किया था जो छवि द्वारा शुरू की गई बहु-मोडल बातचीत के विषय पर केंद्रित था, न कि छवियों को संवाद के घटकों के रूप में स्वतंत्र रूप से उपयोग करने पर।
शोध डेटा में कमी को दूर करने के लिए, दक्षिण कोरियाई शोधकर्ताओं ने 45,000 संवाद उदाहरणों का एक डेटासेट विकसित किया है जिसमें छवियों का अर्ध-संरचित उपयोग शामिल है, जो वायरल ‘मीम’ छवियों पर केंद्रित नहीं है; बाद वाला, भाषा शोध में रुचि का एक क्षेत्र है, लेकिन यह कम चुनौतीपूर्ण हो सकता है, क्योंकि सोशल मीडिया प्लेटफार्मों पर संदर्भ में उपयोग के माध्यम से वायरल मीम का अर्थ अधिक आसानी से अनुमानित किया जा सकता है।
पाठ के स्थान पर चित्रण विकसित करना
शब्द/वाक्य>छवि द्विदिश प्रतिलेखन के लिए एक विधि विकसित करने के लिए, दक्षिण कोरियाई शोधकर्ताओं ने एक मशीन लर्निंग सिस्टम को प्रशिक्षित किया है जो एक पाठ-आधारित संवाद के हिस्सों को अर्थपूर्ण छवि सामग्री में बदल देता है।

कोरियाई बहु-मोडल संवाद अनुसंधान के लिए डेटासेट जनरेशन प्रणाली का आर्किटेक्चर। स्रोत: https://arxiv.org/pdf/2107.08685.pdf
लक्ष्य वाक्यों को पूर्व-प्रसंस्करण में शामिल किया गया था जिसमें रोक शब्दों को हटाना शामिल था जो संवाद में अगले सैली की भविष्यवाणी को बाधित कर सकते थे, और संदर्भ समानता फिल्टर के माध्यम से कम गुणवत्ता वाले आदान-प्रदान को काटना।
डेटासेट की उपयोगिता का परीक्षण करने के लिए, शोधकर्ताओं ने एक मॉड्यूल सेट किया जो संवाद और शामिल छवियों के संदर्भ में अगले ‘मोड़’ की भविष्यवाणी करता था।

शोध में उपयोग किया गया मानव मूल्यांकन जीयूआई।
45k डेटासेट (जो गिटहब पर उपलब्ध है) के लिए पांच बाहरी डेटासेट का उपयोग आधार सामग्री के रूप में किया गया था। तीन पाठ-आधारित तत्व हैं: डेलीडायलॉग, 2017 से एक मैन्युअल रूप से अन्नोटेटेड मल्टी-टर्न पाठ-आधारित सेट; और फेसबुक के सहानुभूतिपूर्ण संवाद और पर्सनाचैट, दोनों 2018 से। दो छवि-आधारित डेटासेट उपयोग किए गए थे एमएस-सीओसीओ और फ्लिकर30के।

छवि/पाठ जोड़े – डेटासेट में वाक्यों का जेएसओएन स्कीमा, जो (इस उदाहरण में) माइक्रोसॉफ्ट के सीओसीओ छवि डेटाबेस से छवियों के साथ जुड़े हुए हैं।
सिस्टम के लिए पाठ से छवि प्रतिस्थापन 2019 में नॉर्थईस्टर्न यूनिवर्सिटी में विकसित पूर्व-प्रशिक्षित विज़ुअल सेमेंटिक रीज़निंग नेटवर्क (वीएसआरएन) द्वारा संचालित किया गया था। वीएसआरएन को मैन्युअल रूप से पूर्व-चयनित वाक्यों पर काम करने के लिए सेट किया गया था योगदान करने वाले पाठ डेटासेट से।
सुसंगतता स्थापित करना
स्रोत डेटासेट की सुसंगतता छह संयोजनों को विकसित करके स्थापित की गई थी, जो प्रत्येक छवि डेटासेट में उदाहरणों से संबंधित थी, और कई दौरों में मानव द्वारा मूल्यांकित की गई थी।
मानव स्कोरिंग तीन मानदंडों पर आधारित थी: संवाद के संदर्भ के लिए सुसंगतता; छवि की प्रासंगिकता जो छवि द्वारा व्यक्त करने का प्रयास किया जा रहा था; और छवि में मुख्य वस्तुओं की सीमा जितनी दूर तक शामिल थी।
बाद के मानदंड को ध्यान में रखते हुए, यह तर्क दिया जा सकता है कि शोधकर्ताओं द्वारा तय की गई योजना ने मुख्य रूप से छवि के अर्थ की हास्यास्पद, व्यंग्यात्मक, अमूर्त या दार्शनिक संभावनाओं की संभावना को कम कर दिया है जो पाठ संवाद में इंजेक्ट की जा सकती है।
हालांकि, यह एक महत्वपूर्ण काम है, और इसकी शुरुआत कहीं से करनी होगी, जबकि प्राकृतिक भाषा प्रसंस्करण (एनएलपी) क्षेत्र में अन्य जगहों पर व्यंग्य के उदाहरणों को मैप करने के लिए महत्वपूर्ण प्रयास किए जा रहे हैं।
परीक्षण
डेटा जनरेशन फ्रेमवर्क का परीक्षण करने के लिए, शोधकर्ताओं ने फेसबुक के 2020 के इमेज-चैट शोध पर आधारित तीन-भाग रिट्रीवल मॉडल का उपयोग किया। मॉड्यूल में रेसनेक्स-101 छवि एनकोडर के रूप में शामिल है; गूगल के बीईआरटी पाठ एनकोडर के लिए; और एक कस्टम फ्यूजन मॉड्यूल इन दोनों के लिए।
सिस्टम ने वर्तमान और अगले वाक्य भविष्यवाणी कार्य में क्रमशः 50.35 और 14.38 हासिल किया, जो प्रत्येक कार्य के लिए बेसलाइन में सुधार करता है।
बाद में, दो शोधकर्ताओं को 100 बहु-मोडल संवाद बनाने का काम सौंपा गया था जिसमें मानव द्वारा संवाद में छवियों को डाला जाता था, और सिस्टम को इन ‘जैविक’ बहु-मोडल संवाद के खिलाफ चलाया जाता था। सिस्टम इन अर्ध-संरचित उदाहरणों के लिए भी उच्च संदर्भ जागरूकता के साथ वर्तमान और अगले मोड़ की भविष्यवाणी करने में सक्षम था।













