विचार नेता

जेनरेटिव-ऑगमेंटेड रिट्रीवल डेटा एनालिटिक्स का अगला फ्रंटियर क्यों है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

चार में से तीन लोग कहते हैं कि उनके संगठन एआई का उपयोग करते हैं। फिर भी, अधिकांश गतिविधि अभी भी अनस्ट्रक्चर्ड सामग्री पर केंद्रित है: बैठकों का सारांश, ईमेल की रचना, या ग्राहक सहायता का स्वचालन।

लेकिन विडंबना यह है कि वास्तव में व्यावसायिक निर्णय लेने वाले अधिकांश डेटा – वित्तीय रिपोर्ट, वेयरहाउस टेबल, और केपीआई – अभी भी एआई द्वारा लगभग अछूते हैं।

कारण महत्वाकांक्षा की कमी नहीं है, बल्कि विश्वास की कमी है। जब एक मॉडल एक वाक्य को हॉलुसिनेट करता है, तो अक्सर इसे ठीक किया जा सकता है; जब यह एक संख्या को हॉलुसिनेट करता है, तो यह विनाशकारी है। एक सीएफओ किसी ऐसे उत्तर पर हस्ताक्षर नहीं कर सकता जिसकी पुष्टि नहीं की जा सकती।

आज, स्ट्रक्चर्ड डेटा दर्जनों प्रणालियों में रहता है, प्रत्येक के अपने नियमों और संबंधों के साथ। एआई को इस जटिलता के पार सही तरीके से तर्क करने की चुनौती किसी भी चैटबॉट से अधिक कठिन है।

व्यवसायों और उनकी टीमों – गैर-तकनीकी उपयोगकर्ताओं सहित – को अपने डेटा के साथ एक सरल तरीके से बातचीत करने में सक्षम होने की आवश्यकता है ताकि बोतलनेक को कम किया जा सके और तेज़, सटीक अंतर्दृष्टि प्राप्त की जा सके। एसक्यूएल सीखने के बिना।

कुछ समाधान उभर रहे हैं – आइए कुछ प्रमुख उदाहरणों पर एक नज़र डालें, उनके लाभों और उनके सेटबैक के साथ।

एआई और स्ट्रक्चर्ड डेटा – एक पुल बहुत दूर

पिछले दो वर्षों में, एआई अंतर्दृष्टि और स्ट्रक्चर्ड डेटा को पुल करने के लिए कई प्रयास सामने आए हैं।

इनमें से कई प्रयास तकनीकी दिग्गजों से आते हैं जिनके पास महत्वपूर्ण संसाधन और डेटा हैं। स्नोफ्लेक, उदाहरण के लिए, कॉर्टेक्स विश्लेषक के साथ एक पेश किया, जो उपयोगकर्ताओं को स्नोफ्लेक डेटा वेयरहाउस के खिलाफ प्राकृतिक भाषा प्रश्न पूछने की अनुमति देता है।

सटीकता में सुधार करने के लिए, कॉर्टेक्स में सेमांटिक मेटाडेटा प्रदान करने का एक तरीका है – लेकिन मॉडल भारी रूप से सीमित है। एक के लिए, इसे मैन्युअल रूप से बनाया जाना है, और यहां तक कि ऐसा करने पर भी, यह केवल 10 टेबल पर काम कर सकता है, जो मध्यम आकार की कंपनी के लिए भी पर्याप्त नहीं है। इससे अधिक, और विश्वास टूट जाता है, क्योंकि सटीकता कम हो जाती है।

यह कहानी डाटाब्रिक्स के प्रयासों के साथ दोहराई जाती है, जिसने एआई/बीआई जीनी के साथ एक पाठ-से-एसक्यूएल दृष्टिकोण लिया। यह समाधान केवल छोटे डोमेन पर प्रभावी ढंग से तैनात किया जा सकता है, बड़े डेटासेट के साथ सटीकता खो देता है।

माइक्रोसॉफ्ट पावर बीआई कोपायलट एक सतह-स्तर के जेनरेटिव दृष्टिकोण लेता है, डैशबोर्ड के भीतर एआई को एम्बेड करता है ताकि दृश्यों का वर्णन किया जा सके, उपायों का सुझाव दिया जा सके, और रिपोर्ट तैयार की जा सके। यह अन्वेषण को बढ़ाता है लेकिन तर्क या सत्यापन के तरीके को नहीं बदलता। प्रत्येक प्रतिक्रिया अभी भी मॉडल के निर्णय पर निर्भर करती है, और जब यह निर्णय विफल होता है, तो कोई ऑडिट ट्रेल या निर्धारित तर्क नहीं होता है जिस पर वापस जाया जा सके।

सामूहिक रूप से, ये प्रणाली सही दिशा में इशारा करती हैं: स्ट्रक्चर्ड एंटरप्राइज डेटा पर एआई को तैनात करना। लेकिन वे एक महत्वपूर्ण दोष साझा करते हैं। वे प्राकृतिक भाषा से एसक्यूएल में एआई मॉडल पर निर्भर करते हैं, और जब एसक्यूएल गलत होता है, जो अक्सर होता है, तो व्यवसाय उपयोगकर्ता फंस जाता है। जो कार्यकारी एसक्यूएल नहीं पढ़ सकता, उसके पास परिणाम का निदान या सुधार करने का कोई तरीका नहीं है। बातचीत ठप हो जाती है।

एक और तरीका इस समस्या को हल करने का है पूर्व-निर्धारित प्रश्न-उत्तर जोड़े को पूर्व-इंडेक्स करना। एडा का जीएआरएजी, अन्य लोगों के बीच, इस पद्धति का पालन करता है। यह संकीर्ण डोमेन में काम करता है जहां प्रश्न अनुमानित होते हैं, लेकिन जैसे ही डेटा जटिलता बढ़ती है, प्रदर्शन गिर जाता है। एक बार जब टेबल और स्कीमा गुणा हो जाते हैं, तो पूर्व-इंडेक्सिंग जल्दी ही अप्रबंधनीय हो जाती है।

एक अलग मार्ग: जेनरेटिव-ऑगमेंटेड रिट्रीवल

जेनरेटिव-ऑगमेंटेड रिट्रीवल (जीएआर) वर्तमान आरएजी दृष्टिकोण को अपने सिर पर रखता है (रिट्रीवल-ऑगमेंटेड जेनरेशन संबंधित जानकारी को स्रोत करता है और इसे एक एलएलएम में शामिल करता है ताकि सटीकता बढ़ सके)।

इसके बजाय एक एलएलएम को एसक्यूएल लिखने के लिए कहने के, जीएआर उपयोगकर्ता के प्रश्न के इरादे को समझने के लिए जेनरेटिव एआई का उपयोग करता है, और फिर उत्तर पैदा करने के लिए तर्क चरण बनाता है।

जीएआर में, प्रश्न ज्ञान आधार के साथ सीधे बातचीत करते हैं। वे संकलित किए जाते हैं, न कि उत्पन्न किए जाते हैं, एक ही प्रश्न हमेशा एक ही उत्तर देता है। जीएआर में एक तर्क श्रृंखला एक स्थायी، समीक्षा योग्य कलाकृति है, एक अस्थायी बातचीत नहीं, इसलिए पूरी तर्क श्रृंखला को पुन: उत्पन्न किया जा सकता है।

इसका मतलब है कि परिणाम सामान्यीकृत जेनएआई इंजनों की तुलना में असीमित रूप से अधिक सटीक हैं।

इसके मूल में, जीएआर तीन चीजें करता है:

  1. स्वचालित रूप से एक सेमांटिक परत बनाता है। जीएआर एआई का उपयोग सिस्टम भर में संबंधों और व्यावसायिक परिभाषाओं को उजागर करने के लिए करता है, डेटा को एक एकल मॉडल में एकीकृत करता है
  2. व्यावसायिक इरादे को उच्च-स्तरीय विश्लेषणात्मक भाषा में अनुवादित करता है। यह भाषा व्यावसायिक अवधारणा स्तर (“प्रदाता के लिए Q2 के लिए प्रति दौरे राजस्व”) पर प्रश्न को पकड़ती है और सीधे एसक्यूएल में संकलित होती है।
  3. प्रत्येक तर्क चरण को ऑडिट करने योग्य बनाता है। प्रत्येक प्रतिक्रिया का मूल स्पष्ट है।

यह क्यों मायने रखता है

व्यवसाय के अपने आंतरिक ज्ञान मॉडल तक तर्क को प्रतिबंधित करके, जीएआर हॉलुसिनेशन को समाप्त कर सकता है और साबित रूप से सही उत्तर प्रदान कर सकता है।

परिभाषाएं, मेट्रिक्स और प्रश्न पैटर्न समय के साथ जुड़ते हैं, जिससे भविष्य के उत्तर अपने विशिष्ट उपयोगकर्ता के लिए और अधिक अनुकूलित हो जाते हैं।

व्यवसायिक उपयोगकर्ताओं के लिए जो अपने संरचित डेटा पर सूचित व्यवसायिक निर्णय लेने के लिए निर्भर करते हैं, विश्वास का तत्व महत्वपूर्ण है। जैसे ही अधिक से अधिक संगठन उन्नत एआई समाधान लागू करते हैं, वे ऐसे फ्रेमवर्क की मांग करेंगे जो हॉलुसिनेशन और त्रुटि के जोखिम को लगभग शून्य तक ले जाए।

यह तब होता है जब प्रश्न सीधे आपके डेटा से जुड़ते हैं, जब एआई बड़े डेटासेट पर काम कर सकता है बिना टूटे, और जब उत्तर सुसंगतता और प्रोवेबिलिटी के साथ प्रदान किए जाते हैं।

रॉब जियार्डिना क्लैरिटीपे के सह-संस्थापक और सीईओ हैं, जो एक कंपनी है जो एआई सिस्टम विकसित करती है जो उद्यम डेटा विश्लेषण में व्याख्यात्मकता और लेखा परीक्षा लाती है। उन्होंने पहले पैलेंटिर टेक्नोलॉजीज में एक फॉरवर्ड डिप्लॉयड इंजीनियर के रूप में काम किया था।