एआई की मूल बातें

वेक्टर समानता खोज क्या है और यह कैसे काम करती है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

वेक्टर समानता खोज ऐसे आइटम खोजती है जिनके संख्यात्मक प्रतिनिधित्व चुनी गई दूरी या समानता फ़ंक्शन के तहत क्वेरी वेक्टर के निकट होते हैं। एक एम्बेडिंग मॉडल टेक्स्ट, इमेज, ऑडियो, प्रोडक्ट या उपयोगकर्ताओं को वेक्टर में मैप करता है ताकि संबंधित आइटम प्रतिनिधित्व स्थान के निकट क्षेत्रों में स्थित हो सकें।

सर्च इंडेक्स एम्बेडिंग और मीट्रिक से स्वतंत्र रूप से समानता को नहीं समझता। यदि प्रतिनिधित्व गलत प्रासंगिकता की अवधारणा एन्कोड करता है, तो तेज़ निकटतम पड़ोसी एल्गोरिद्म गलत पड़ोसियों को प्रभावी रूप से लौटाएगा।

मुख्य बिंदु

  • एम्बेडिंग मॉडल, प्रीप्रोसेसिंग और दूरी मीट्रिक यह निर्धारित करते हैं कि निकटता क्या अर्थ रखती है।
  • सटीक k-निकटतम पड़ोसी खोज सभी उम्मीदवारों को स्कैन करती है; अनुमानित इंडेक्स गति और मेमोरी के लिए कुछ रिकॉल का त्याग करते हैं।
  • HNSW, इनवर्टेड-फ़ाइल इंडेक्स और प्रोडक्ट क्वांटाइज़ेशन विभिन्न निर्माण, क्वेरी और अपडेट ट्रेड‑ऑफ़ प्रदान करते हैं।
  • मेटाडाटा फ़िल्टरिंग, हाइब्रिड रिट्रीवल और री‑रैंकिंग सिस्टम का हिस्सा हैं, न कि बाद में जोड़े गए विचार।
What is Vector Similarity Search and How Does It Work? diagram showing content, embed, index, search, filter + rerank, results
रिट्रीवल गुणवत्ता एम्बेडिंग, मीट्रिक, इंडेक्स, फ़िल्टर और मूल्यांकन के एकीकृत कार्य से आती है।

एम्बेडिंग और समानता मीट्रिक

एक ट्रांसफ़ॉर्मर या अन्य एन्कोडर आइटम को निश्चित लंबाई वाले वेक्टर में परिवर्तित करता है। कोसाइन समानता कोण की तुलना करती है, डॉट प्रोडक्ट दिशा और परिमाण को मिलाता है, और यूक्लिडियन दूरी सीधी रेखा के विभाजन को मापती है।

नॉर्मलाइज़ेशन कोसाइन समानता और डॉट प्रोडक्ट रैंकिंग को समान बना सकता है। एम्बेडिंग को प्रशिक्षित करने के लिए उपयोग किया गया मीट्रिक रिट्रीवल से मेल खाना चाहिए। डोमेन‑विशिष्ट प्रासंगिकता का मूल्यांकन करें क्योंकि सैमान्टिक समानता, प्रतिस्थापन क्षमता और उपयोगकर्ता प्राथमिकताएँ अलग-अलग लक्ष्य हैं।

सटीक बनाम अनुमानित खोज

सटीक खोज प्रत्येक योग्य वेक्टर के साथ समानता की गणना करती है और वास्तविक निकटतम उम्मीदवार लौटाती है। यह सरल और सटीक है लेकिन संग्रह, आयाम या क्वेरी दर बढ़ने पर महंगी हो जाती है।

अनुमानित निकटतम‑पड़ोसी (ANN) इंडेक्स छोटे उम्मीदवार सेट की जांच करते हैं। रिकॉल@k को सटीक ग्राउंड ट्रुथ के साथ-साथ लेटेंसी, थ्रूपुट और मेमोरी के साथ मापें। अनुमानित शब्द खोज एल्गोरिद्म को दर्शाता है, न कि एम्बेडिंग स्वयं सही है या नहीं।

HNSW, इनवर्टेड फ़ाइलें और संपीड़न

हायरार्किकल नेविगेबल स्मॉल वर्ल्ड ग्राफ़ वेक्टर को परतों में जोड़ते हैं। एक क्वेरी विरल दीर्घ‑रेंज लिंक से घनी स्थानीय लिंक तक नीचे उतरती है। खोज की चौड़ाई रिकॉल‑लेटेंसी ट्रेड‑ऑफ़ को नियंत्रित करती है, जबकि ग्राफ निर्माण और अपडेट मेमोरी का उपभोग करते हैं।

इनवर्टेड‑फ़ाइल इंडेक्स मोटी क्लस्टरिंग—अक्सर K-means से संबंधित—का उपयोग करके चयनित क्षेत्रों की खोज करते हैं। प्रोडक्ट क्वांटाइज़ेशन वेक्टर सबस्पेस को संपीड़ित करता है, जिससे मेमोरी घटती है लेकिन दूरी त्रुटि बढ़ती है। Faiss कई ऐसी तकनीकों को मिलाता है।

फ़िल्टरिंग, हाइब्रिड रिट्रीवल और री‑रैंकिंग

वास्तविक क्वेरी अक्सर टेनेंट, भाषा, तिथि, अनुमति या प्रोडक्ट फ़िल्टर की आवश्यकता रखती हैं। प्री‑फ़िल्टरिंग से ग्राफ़ उम्मीदवार बहुत कम रह सकते हैं; पोस्ट‑फ़िल्टरिंग से रिट्रीवल कार्य बर्बाद हो सकता है। इंडेक्स और क्वेरी प्लान को वास्तविक फ़िल्टर चयनशीलता पर परीक्षण किया जाना चाहिए।

हाइब्रिड खोज लेक्सिकल मिलान को वेक्टर समानता के साथ जोड़ती है ताकि सटीक नाम और सैमान्टिक अर्थ दोनों योगदान दें। री‑रैंकर शीर्ष उम्मीदवारों पर अधिक महंगा क्रॉस‑एन्कोडर या व्यावसायिक नियम लागू कर सकता है। प्रत्येक चरण में प्राधिकरण जांच को बनाए रखें।

मूल्यांकन, अपडेट और ड्रिफ्ट

केवल दृश्य क्लस्टर नहीं, बल्कि लेबल्ड प्रासंगिकता निर्णय या डाउनस्ट्रीम टास्क सफलता का उपयोग करें। रिकॉल, प्रिसीजन, नॉर्मलाइज़्ड डिस्काउंटेड क्यूम्यूलेटिव गेन, लेटेंसी पर्सेंटाइल, मेमोरी, इंडेक्स निर्माण समय और ताज़गी को ट्रैक करें।

एम्बेडिंग‑मॉडल अपग्रेड के लिए री‑एम्बेडिंग आवश्यक है और यह प्रत्येक बिंदु को स्थानांतरित कर सकता है। संस्करण वेक्टर और इंडेक्स, द्वि‑रन माइग्रेशन का समर्थन करते हैं और क्वेरी/जनसंख्या ड्रिफ्ट की निगरानी करते हैं। डायमेंशनलिटी रिडक्शन विज़ुअलाइज़ेशन में मदद कर सकता है लेकिन पड़ोस को विकृत कर सकता है और इसे रिट्रीवल मूल्यांकन के रूप में नहीं लेना चाहिए।

एम्बेडिंग, मीट्रिक, और इंडेक्स संरचनाएँ

वेक्टर समानता खोज आइटम को संख्यात्मक एम्बेडिंग के रूप में प्रस्तुत करती है और क्वेरी के निकट वेक्टर को कोसाइन समानता, डॉट प्रोडक्ट या यूक्लिडियन दूरी जैसे मीट्रिक के तहत पुनः प्राप्त करती है। एम्बेडिंग मॉडल यह निर्धारित करता है कि निकटता क्या अर्थ रखती है; इंडेक्स केवल उस ज्यामिति को तेज़ करता है। आवश्यक होने पर वेक्टर को नॉर्मलाइज़ करें, मॉडल और प्री‑प्रोसेसिंग संस्करण को संरक्षित रखें, और असंगत एम्बेडिंग स्पेस से दूरी की तुलना न करें। सामान्य सैमान्टिक के लिए एक मजबूत मॉडल उत्पाद संगतता, कानूनी उद्धरण, इमेज, कोड, या बहुभाषी शब्दावली पर डोमेन मूल्यांकन के बिना विफल हो सकता है।

सटीक खोज प्रत्येक वेक्टर की तुलना करती है और सरल है लेकिन स्केल पर महंगी होती है। अनुमानित निकटतम‑पड़ोसी विधियाँ गति और मेमोरी के लिए रिकॉल का त्याग करती हैं। HNSW जैसे ग्राफ़ इंडेक्स लिंक्ड पड़ोसियों को नेविगेट करते हैं; इनवर्टेड‑फ़ाइल विधियाँ वेक्टर को मोटे सेल में विभाजित करती हैं; प्रोडक्ट क्वांटाइज़ेशन वेक्टर को संपीड़ित करता है; डिस्क‑आधारित विधियाँ स्टोरेज और लेटेंसी का ट्रेड‑ऑफ़ करती हैं। निर्माण‑समय, क्वेरी‑समय, और मेमोरी पैरामीटर परस्पर क्रिया करते हैं। प्रोडक्शन‑जैसे वेक्टर संख्या, आयाम, अपडेट, फ़िल्टर, समवर्तीता और हार्डवेयर पर बेंचमार्क करें।

रिट्रीवल गुणवत्ता और हाइब्रिड खोज

संबंधित और अप्रासंगिक आइटमों के साथ जज्ड क्वेरी बनाएं, जिसमें दुर्लभ शब्द, अस्पष्टता, लंबा टेक्स्ट, भाषाएँ और ताज़गी शामिल हों। रिकॉल@k, प्रिसीजन@k, मीन रेसिप्रोकल रैंक, नॉर्मलाइज़्ड डिस्काउंटेड गेन, लेटेंसी और लागत को मापें। ANN रिकॉल को सटीक पड़ोसियों के विरुद्ध और सैमान्टिक प्रासंगिकता को मानव निर्णयों के विरुद्ध अलग‑अलग मापें। यदि एम्बेडिंग खराब है तो तेज़ इंडेक्स गणितीय रूप से निकटतम गलत आइटम भी पुनः प्राप्त कर सकता है।

कीवर्ड खोज सटीक नाम, पहचानकर्ता, तिथियों और दुर्लभ टोकन के लिए मजबूत बनी रहती है। हाइब्रिड रिट्रीवल लेक्सिकल और वेक्टर रैंकिंग को जोड़ता है, जबकि मेटाडाटा फ़िल्टर टेनेंट, अनुमति, भाषा, तिथि और प्रकार को लागू करते हैं। परिणाम लौटाने या उत्पन्न करने से पहले प्राधिकरण लागू करें; रिट्रीवल के बाद फ़िल्टरिंग से अस्तित्व या सामग्री लीक हो सकती है। री‑रैंकर अतिरिक्त लेटेंसी पर प्रिसीजन बढ़ाते हैं। चंकिंग को दस्तावेज़ संरचना का पालन करना चाहिए और स्रोत, संस्करण और ऑफ़सेट को उद्धरण के लिए संरक्षित रखना चाहिए।

प्रोडक्शन लाइफ़साइकल

अपडेट के लिए निर्धारक आईडी, डिलीट प्रोपेगेशन, टॉम्बस्टोन या कम्पैक्शन, और मॉडल परिवर्तन के बाद री‑एम्बेडिंग की रणनीति आवश्यक है। पुराने और नए एम्बेडिंग को चुपचाप मिश्रित न करें; कटओवर से पहले इंडेक्स को पुनः बनाएं या संस्करणित करें और ऑफ़लाइन तुलना करें। क्वेरी और परिणाम वितरण, खाली और कम‑स्कोर खोज, लेटेंसी, इंडेकस स्वास्थ्य, और जज्ड फीडबैक की निगरानी करें। एम्बेडिंग को सुरक्षित रखें क्योंकि वे संवेदनशील जानकारी एन्कोड कर सकते हैं और इनफ़रेंस को सक्षम बनाते हैं। वेक्टर खोज रिट्रीवल इन्फ्रास्ट्रक्चर है, तथ्यात्मकता की गारंटी नहीं; डाउनस्ट्रीम सिस्टम को साक्ष्य संरक्षित करना चाहिए और जब समर्थन अपर्याप्त हो तो परहेज़ करना चाहिए।

व्यावहारिक उदाहरण: अनुमति‑सजग वेक्टर रिट्रीवल

एक एंटरप्राइज़ मैनुअल को सेक्शन के अनुसार चंक करता है, उन्हें संस्करणित मॉडल से एम्बेड करता है, और दस्तावेज़ आईडी, अनुमतियाँ, भाषा, संस्करण और ऑफ़सेट संग्रहीत करता है। एक जज्ड क्वेरी सेट लेक्सिकल, वेक्टर, हाइब्रिड और री‑रैंकेड रिट्रीवल की तुलना करता है। मूल्यांकन रिकॉल और प्रिसीजन @k, सिटेशन कवरेज, लेटेंसी, लागत, और सटीक पार्ट नंबर तथा बहुभाषी शब्दावली के परिणामों को मापता है। ANN रिकॉल को सटीक वेक्टर पड़ोसियों के विरुद्ध अलग‑अलग जाँचा जाता है।

क्वेरी समय पर, प्राधिकरण फ़िल्टर उम्मीदवारों को सामग्री लौटने से पहले फ़िल्टर करता है। कम‑स्कोर खोजें परहेज़ करती हैं, और उत्तर लेयर स्रोत सेक्शन का उल्लेख करती है तथा संघर्षों को दर्शाती है। री‑एम्बेडिंग नया इंडेक्स बनाता है बजाय वेक्टर संस्करणों को मिश्रित करने के, और डिलीट इवेंट स्रोत, चंक्स और कैश को हटाते हैं। मॉनिटरिंग खाली क्वेरी, स्कोर और लेटेंसी वितरण, अनुमति अस्वीकरण, और समीक्षित प्रासंगिकता को ट्रैक करती है। एम्बेडिंग को संवेदनशील व्युत्पन्न डेटा के रूप में संरक्षित किया जाता है। समानता साक्ष्य पुनः प्राप्त करती है; यह यह स्थापित नहीं करती कि साक्ष्य सत्य या लागू है।

कार्यान्वयन साक्ष्य और परिचालन तत्परता

एक प्रोडक्शन निर्णय सफल डेमो से अधिक की आवश्यकता रखता है। इच्छित उपयोगकर्ताओं, संचालन वातावरण, इनपुट, आउटपुट, निर्भरताएँ, मालिक, और प्रत्येक महत्वपूर्ण विफलता के परिणाम को परिभाषित करें। ट्यूनिंग से पहले पुनरुत्पादक बेसलाइन और संस्करणित मूल्यांकन सेट स्थापित करें। सामान्य मामलों, सीमा स्थितियों, विकृत या गायब इनपुट, वितरण परिवर्तन, निर्भरता आउटेज, दुरुपयोग, और सबसे अधिक उपेक्षित समूहों या वातावरणों का परीक्षण करें। कार्य गुणवत्ता को कैलिब्रेशन या अनिश्चितता, लेटेंसी, थ्रूपुट, संसाधन लागत, पहुँच, गोपनीयता और सुरक्षा के साथ मापें। प्रत्येक परिवर्तन और थ्रेशोल्ड को रिकॉर्ड करें ताकि स्वतंत्र समीक्षक परिणाम को पुनरुत्पादित कर सके और साक्ष्य को आकर्षक प्रोटोटाइप से अलग कर सके।

लॉन्च से पहले, रिलीज़, अपवाद, परिवर्तन, रोलबैक और रिटायरमेंट के लिए अधिकार निर्धारित करें। चरणबद्ध रोलआउट का उपयोग करें, एक सुरक्षित फॉलबैक को संरक्षित रखें, और जानबूझकर इंजेक्टेड विफलताओं के साथ मॉनिटरिंग की पुष्टि करें। ऑपरेशनल टेलीमेट्री को इनपुट गुणवत्ता, आउटपुट व्यवहार, मॉडल या नियम संस्करण, निर्भरता स्वास्थ्य, मानव ओवरराइड और पुष्टि किए गए परिणाम दिखाने चाहिए, बिना अनावश्यक संवेदनशील डेटा एकत्र किए। अलर्ट थ्रेशोल्ड और प्रतिक्रिया मालिक को परिभाषित करें, फिर डिप्लॉयमेंट के बाद वास्तविक‑विश्व साक्ष्य की समीक्षा करें, न कि यह मानते हुए कि ऑफ़लाइन प्रदर्शन बना रहेगा। जब भी डेटा स्रोत, उपयोगकर्ता, मॉडल, विक्रेता, नीतियां, हार्डवेयर या लक्ष्य बदलें, पुनः‑मूल्यांकन करें। एक रखरखाव वाला सिस्टम दस्तावेज़ीकृत रिकवरी, घटना सीखना, डिलीशन और रिटेंशन प्रक्रियाओं, तथा स्पष्ट बिंदु की भी आवश्यकता रखता है जहाँ इसे निष्क्रिय या बदलना चाहिए।

अक्सर पूछे जाने वाले प्रश्न

क्या समानता खोज के लिए वेक्टर डेटाबेस आवश्यक है?

नहीं। लाइब्रेरी और रिलेशनल डेटाबेस वेक्टर इंडेक्स को समर्थन दे सकते हैं। जब स्केल, फ़िल्टरिंग, स्थायित्व और ऑपरेशनल फीचर वर्कलोड के अनुरूप हों तो एक विशेषीकृत डेटाबेस उपयोगी होता है।

क्या उच्च‑आयामी एम्बेडिंग हमेशा बेहतर प्रदर्शन करती है?

नहीं। अधिक आयाम लागत बढ़ाते हैं और शोर को एन्कोड कर सकते हैं। मॉडल को प्रतिनिधिक रिट्रीवल गुणवत्ता, लेटेंसी और स्टोरेज पर तुलना करें।

प्राथमिक संदर्भ

हाज़िका एक डेटा साइंटिस्ट हैं जिनके पास एआई और सास कंपनियों के लिए तकनीकी सामग्री लिखने का व्यापक अनुभव है।