विचार नेता

एंटिटी रिज़ॉल्यूशन एआई इंफ्रास्ट्रक्चर बन रहा है, न कि डेटा क्लीनअप

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कुछ समय पहले मैंने एक एआई एजेंट को एक आत्मविश्वास से भरे हुए गलत उत्तर देते हुए देखा, जो एक पूरी तरह से साधारण कारण से था। एक व्यवसाय के पास दो रिकॉर्ड थे जो एक ही कॉर्पोरेट ग्राहक के लिए थे। एक रिकॉर्ड में पुराना व्यापारिक नाम और वित्त संपर्क था, जबकि दूसरे रिकॉर्ड में नई कानूनी नाम और एक अलग बिलिंग पता था जो कंपनी ने अधिग्रहण के बाद अपनाया था। एजेंट से एक सरल प्रश्न पूछा गया था: क्या यह खाता अच्छी स्थिति में है? यह एक रिकॉर्ड खोजा, कोई बकाया चालान नहीं देखा, और हाँ कहा। बकाया चालान दूसरे नाम के तहत दायर किए गए थे।

कुछ भी नहीं हुआ था। मॉडल ने साफ़ तरीके से दिए गए डेटा पर तर्क किया। डेटा बस इतना हुआ कि दो ग्राहकों का वर्णन करता था जहाँ वास्तविक दुनिया में एक था। गलती मॉडल में नहीं थी। यह जोड़ में थी।

मैं इसे उद्यम एआई में सबसे कम चर्चा किए जाने वाले जोखिमों में से एक मानता हूँ। हम मॉडल की सटीकता, प्रॉम्प्ट डिज़ाइन और शासन के बारे में बात करते हैं। हम कम बात करते हैं कि क्या प्रणाली वास्तव में जानती है कि यह किस वास्तविक दुनिया के ग्राहक, आपूर्तिकर्ता या खाते पर कार्य कर रही है। उस प्रश्न का एक नाम है। यह एंटिटी रिज़ॉल्यूशन कहलाता है, और साठ वर्षों के बाद यह शांति से लाइव इंफ्रास्ट्रक्चर में बदल रहा है।

समस्या का काल बदल गया

इसके काम के जीवन के अधिकांश हिस्से के लिए, “क्या ये दो रिकॉर्ड एक ही इकाई हैं?” एक क्लीनअप प्रश्न था। आप इसे एक बैच में चलाते थे, एक अनुसूची पर, एक मास्टर डेटा प्रबंधन कार्यक्रम, एक वेयरहाउस, या एक विश्लेषण पाइपलाइन के भीतर। यह कभी भी सही नहीं था, लेकिन यह जीवित था, क्योंकि आउटपुट एक रिपोर्ट थी जिसे कोई अगले हफ्ते पढ़ता था। यदि एक ही आपूर्तिकर्ता के लिए दो रिकॉर्ड विलय नहीं किए गए थे, तो एक खर्च आंकड़ा थोड़ा गलत निकला, एक विश्लेषक ने इसे देखा, और इसे अगले रन में ठीक कर दिया गया। प्रणाली में ढीलापन था। समय ने त्रुटियों को अवशोषित किया।

एक एआई एजेंट उस ढीलापन को हटा देता है। यह प्रश्न के काल को “आखिरकार” से “अब” में बदलता है। जब एक एजेंट एक रिफंड को मंजूरी देने वाला होता है, एक मामले को रूट करने वाला होता है, एक प्रोफाइल को अपडेट करने वाला होता है, या एक अनुपालन प्रश्न का उत्तर देने वाला होता है, तो हल की गई इकाई अब एक डैशबोर्ड को खिलाती नहीं है। यह एक कार्रवाई को खिलाती है। एक गलत जोड़ की लागत एक संख्या से बदलती है जो थोड़ी गलत है कुछ ऐसा जो दुनिया में तुरंत होता है, अक्सर मानव हस्तक्षेप के बिना।

यह वह परिवर्तन है जिसे बैठने के लिए खड़ा करना है। अंतर्निहित समस्या पुरानी और अच्छी तरह से समझी जाती है। नया यह है कि हमने इसे सीधे उन प्रणालियों में जोड़ दिया है जो अपने आप कार्य करती हैं।

1960 के दशक की एक आँकड़ों की समस्या

एंटिटी रिज़ॉल्यूशन बड़े भाषा मॉडल के साथ नहीं आया। यह पंच कार्ड के साथ आया। 1959 में, एच.बी. न्यूकोम्बे और उनके सहयोगियों ने विज्ञान में एक लघु पत्र प्रकाशित किया वital रिकॉर्ड के स्वचालित लिंकेज पर, जिसमें वर्णित किया गया था कि एक कंप्यूटर कैसे तय कर सकता है कि एक जन्म रिकॉर्ड और एक विवाह रिकॉर्ड एक ही व्यक्ति के लिए हैं या नहीं। एक दशक बाद, इवान फेलेगी और एलन सुन्टर ने इस विचार को एक आधिकारिक गणितीय सिद्धांत दिया, जिसमें तीन परिणामों को परिभाषित किया गया था जो आज भी किसी भी मिलान प्रणाली द्वारा उत्पादित किए जाते हैं: एक लिंक, एक गैर-लिंक, और एक संभावित लिंक जिसे एक व्यक्ति को समीक्षा करने की आवश्यकता होती है।

इस वंशावली में एक विवरण है जिस पर ध्यान देने योग्य है, क्योंकि यह वह हिस्सा है जो लोग अक्सर गलत समझते हैं। रिकॉर्ड लिंकेज कभी भी केवल एक ईमेल पते या एक साझा आईडी पर सटीक मिलान नहीं था। शुरू से ही यह संभाव्य था। यह एक सूर्यनाम, एक तारीख, एक स्थान पर सहमति के साक्ष्य को तौला, और एक स्कोर उत्पादित किया, क्योंकि मानव-दर्ज डेटा गंदा है और सटीक कुंजी लगातार विफल होती है। आधुनिक एंटिटी रिज़ॉल्यूशन अभी भी इसी तरह काम करता है। यह निर्धारित नियमों को जोड़ती है, जहां एक साझा स्थिर पहचानकर्ता निर्णायक है, संभाव्य और फजी मशीन-लर्निंग मिलान के साथ जो टाइपो, उपनाम, फ़ील्ड को पारित करने, संक्षिप्त रूप, और उसी व्यक्ति या कंपनी के लिए दिखने के एक दर्जन छोटे तरीकों को संभालता है। क्षेत्र का एक अच्छा सर्वेक्षण 1950 के दशक के विटल रिकॉर्ड से लेकर अब तक के क्लस्टरिंग और मशीन-लर्निंग विधियों की एक अविच्छिन्न रेखा का पता लगाता है।

जो वास्तव में बदला है वह यह है कि हमें उत्तर कब चाहिए। शोधकर्ता प्रश्न समय पर इकाइयों को हल करने के बारे में लिख रहे थे, न कि केवल अग्रिम में, वर्तमान एआई लहर से पहले। तब यह एक दिलचस्प अनुकूलन था। अब यह एक आवश्यकता के करीब है।

एजेंट इसे इंफ्रास्ट्रक्चर में क्यों बदलते हैं

अधिकांश उद्यम एआई प्रणालियाँ मॉडल की स्मृति से उत्तर नहीं देती हैं। वे पुनर्प्राप्ति करते हैं। रिट्रीवल-ऑगमेंटेड जेनरेशन के रूप में लोकप्रिय पैटर्न में एक एजेंट प्रश्न के क्षण में प्रासंगिक संदर्भ खींचता है और इसके ऊपर तर्क करता है। यह संतुलन में, एक अच्छी बात है। यह उत्तरों को आपके डेटा में आधारित बनाता है, न कि मॉडल के प्रशिक्षण में।

लेकिन इसका एक परिणाम है जिसे मिस करना आसान है। एजेंट पुनर्प्राप्ति चरण से जो कुछ भी मिलता है उसे विरासत में मिलता है। यदि पुनर्प्राप्ति एक खंडित ग्राहक को वापस करती है, तीन आंशिक रिकॉर्ड जो कभी जुड़े नहीं थे, तो एजेंट तीन ग्राहकों के बारे में तर्क करेगा। यदि पुनर्प्राप्ति एक गलत विलय वापस करती है, तो दो अलग-अलग कंपनियों को एक ही प्रोफ़ाइल में मिला दिया जाता है, एजेंट एक के बारे में तर्क करेगा। स्रोत प्रणालियों में पहले से मौजूद अस्पष्टता सीधे मॉडल को एक निपटा हुआ तथ्य के रूप में प्रस्तुत की जाती है। मॉडल को यह पता नहीं है कि जोड़ गलत था, जैसे कि आप कभी भी देखे गए रिकॉर्ड का एक साफ़ सारांश पढ़ रहे हों।

इसलिए हल नहीं हो सकता है एक बाद के विचार के रूप में जो एक तिमाही में चलता है और एक अलग तालिका में जमा होता है। इकाई को डेटा को निगलने के समय इकट्ठा किया जाना चाहिए, और हल किए गए दृष्टिकोण को एजेंट पूछने के क्षण में पुनर्प्राप्त किया जाना चाहिए। यह एक रनटाइम निर्भरता है। यह एक डेटाबेस या प्रमाणीकरण सेवा की तरह व्यवहार करता है, न कि एक आवर्ती डेटा-साफ़ करने की परियोजना की तरह, और इसका डिज़ाइन, निगरानी, ​​और विश्वास उसी तरह किया जाना चाहिए जैसे आप किसी अन्य प्रणाली का इलाज करेंगे जिसे आपका अनुप्रयोग वास्तविक समय में कहता है।

किसी के द्वारा सटीक रूप से नामित नहीं की गई तैयारी का अंतर

उद्योग पहले से ही महसूस करता है कि यहाँ कुछ कमी है। सिस्को के एआई रेडीनेस इंडेक्स 2025 में पाया गया कि 83 प्रतिशत संगठन स्वायत्त एजेंटों को तैनात करने की योजना बना रहे हैं, जबकि केवल लगभग एक तिहाई महसूस करते हैं कि उनकी बुनियादी ढांचा वास्तव में उनके लिए तैयार है, और केवल लगभग एक चौथाई महसूस करते हैं कि उन्हें नियंत्रित और शासित करने के लिए सुसज्जित किया गया है कि वास्तव में एजेंट क्या करते हैं। मैककिंसे के सबसे हाल के एआई की स्थिति सर्वेक्षण एक समान अंतर का वर्णन करता है: लगभग 88 प्रतिशत संगठन अब कम से कम एक कार्य में एआई का उपयोग करते हैं, फिर भी अधिकांश ने इसे पूरे उद्यम में स्केल नहीं किया है।

जब लोग इस अंतर को समझाते हैं, तो वे आमतौर पर दो शब्दों का उपयोग करते हैं: डेटा गुणवत्ता और शासन। दोनों महत्वपूर्ण हैं, और न तो वैकल्पिक है। लेकिन एक संकीर्ण प्रश्न है जो उनके नीचे बैठा है जो स्वच्छ, अच्छी तरह से शासित डेटा से खुद नहीं उत्तर देता है। क्या प्रणाली बता सकती है कि एक दिए गए रिकॉर्ड किस वास्तविक दुनिया की इकाई से संबंधित है, सभी स्थानों पर जहां वह रिकॉर्ड रहता है, अभी? आपके पास प्रत्येक व्यक्तिगत प्रणाली में उच्च गुणवत्ता वाला डेटा हो सकता है और फिर भी उस परीक्षण में विफल हो सकता है, क्योंकि विफलता किसी एक प्रणाली के भीतर नहीं रहती है। यह उनके बीच के स्थान में रहता है, जहां एक ही ग्राहक तीन थोड़े अलग चेहरे पहनता है।

एक एजेंट को कार्य करने देने से पहले जाँचें

यदि आप एंटिटी रिज़ॉल्यूशन को लाइव इंफ्रास्ट्रक्चर के रूप में मानते हैं, तो आप इसे इंफ्रास्ट्रक्चर की तरह जांच सकते हैं। संचालन विफलता मोड विशिष्ट और परीक्षण योग्य हैं: जो एक होना चाहिए उन्हें विभाजित करना, जो अलग रहना चाहिए उनके रिकॉर्ड को गलत विलय करना, जो एक पुराने पते को बढ़ावा देने के लिए जीवित रहने वाले नियम, गायब स्थायी पहचानकर्ता, और एजेंट जो स्रोत-प्रणाली की अस्पष्टता को विरासत में मिली है जैसे कि यह एक निपटा हुआ तथ्य है।

एक व्यावहारिक तैयारी परीक्षण के लिए एक नए मॉडल या एक नए विक्रेता श्रेणी की आवश्यकता नहीं है। एक मैदान-सत्य सेट इकट्ठा करें जो आप वास्तव में समझते हैं। इसे उसी पुनर्प्राप्ति पथ से चलाएं जो आपका एजेंट उपयोग करता है, न कि एक अलग साफ़ कॉपी जो डेमो के लिए बनाई गई है। फिर उन चीजों को मापें जो वास्तव में परिणामों का फैसला करती हैं: गलत विलय और गलत विभाजन की संख्या, प्रणाली वास्तविक अस्पष्टता को कैसे संभालती है, जहां इसके विश्वास सीमा बैठते हैं, जब यह एक मानव को बढ़ाता है बजाय इसके अनुमान लगाने के, और यह आपके मौजूदा मास्टर डेटा और शासन नियंत्रणों को कैसे साफ़ सौंपता है। यदि एक टीम इन प्रश्नों का उत्तर नहीं दे सकती है, तो एजेंट एक पहचान पर कार्य कर रहा है जिसे यह सत्यापित नहीं कर सकता है, और इसके आउटपुट में विश्वास गलत है।

कोई भी मास्टर डेटा प्रबंधन, शासन, ग्राहक डेटा प्लेटफ़ॉर्म, या वेयरहाउस को प्रतिस्थापित नहीं करता है। वे अलग-अलग प्रश्नों का उत्तर देते हैं, और वे अभी भी आवश्यक हैं। शासन तय करता है कि एक एजेंट क्या करने की अनुमति है। एंटिटी रिज़ॉल्यूशन तय करता है कि यह किसे या किस चीज़ पर कार्य कर रहा है। पहला अधिकांश बड़े संगठनों में परिपक्व है। दूसरा वह परत है जिसे कई जल्द ही खोजेंगे कि उन्हें इसकी आवश्यकता है बESIDE यह, वास्तविक समय में, जब वे एक एजेंट को कार्य करने देते हैं बजाय इसके परामर्श देने के।

मैंने जिस एजेंट को देखा था उसे एक चतुर मॉडल की आवश्यकता नहीं थी। उसे यह जानने की आवश्यकता थी कि दो नाम एक ग्राहक थे इससे पहले कि उसे निश्चित ध्वनि करने की अनुमति दी जाए। जैसे ही हम इन प्रणालियों को वास्तविक प्राधिकरण देते हैं कि वे कार्य करें, वह शांत, साठ वर्ष पुराना अनुशासन साफ़-सफ़ाई के बजाय भार-वहन करना शुरू कर देता है।

स्टीवन रेनविक टिलोरेस (tilores.io) के सह-संस्थापक और सीईओ हैं, जो एआई और डेटा टीमों के लिए एपीआई के माध्यम से वास्तविक समय में इकाई समाधान प्रदान करते हैं। वह इंजीनियरिंग और डेटा नेताओं के साथ ग्राहक, आपूर्तिकर्ता और खाता पहचान को खंडित प्रणालियों में हल करने पर काम करते हैं।