विचार नेता
फजी मैचिंग – परिभाषा, प्रक्रिया और तकनीक

एक एक्सेंचर सर्वेक्षण में दिखाया गया कि 75% उपभोक्ता उन खुदरा विक्रेताओं से खरीदना पसंद करते हैं जो उनका नाम और खरीदारी व्यवहार जानते हैं, और 52% उन्हें व्यक्तिगत अनुभव प्रदान नहीं करने पर ब्रांड बदलने की अधिक संभावना है। लाखों डेटा बिंदुओं को ब्रांडों द्वारा लगभग हर दिन कब्जा किया जा रहा है, विशिष्ट ग्राहकों की पहचान करना और उनके प्रोफाइल बनाना सबसे बड़ी चुनौतियों में से एक है जिसका सामना अधिकांश कंपनियों को करना पड़ता है।
जब एक उद्यम कई उपकरणों का उपयोग डेटा को कब्जा करने के लिए करता है, तो यह बहुत आम है कि एक ग्राहक का नाम गलत लिखा जाए या एक ईमेल पते को गलत पैटर्न के साथ स्वीकार किया जाए। इसके अलावा, जब विभिन्न डेटा अनुप्रयोगों में एक ही ग्राहक के बारे में विभिन्न जानकारी होती है, तो अपने ग्राहक के व्यवहार और प्राथमिकताओं के बारे में जानकारी प्राप्त करना असंभव हो जाता है।
अब, हम जानेंगे कि फजी मैचिंग क्या है, यह कैसे लागू किया जाता है, सामान्य तकनीकें जो उपयोग की जाती हैं, और चुनौतियों का सामना किया जाता है। आइए शुरू करें।
फजी मैचिंग क्या है?
फजी मैचिंग एक डेटा मैचिंग तकनीक है जो दो या अधिक रिकॉर्ड की तुलना करती है और उनके एक ही इकाई से संबंधित होने की संभावना की गणना करती है। रिकॉर्ड को व्यापक रूप से मैच और नॉन-मैच के रूप में वर्गीकृत करने के बजाय, फजी मैचिंग एक संख्या (आमतौर पर 0-100% के बीच) का उत्पादन करती है जो यह पहचानती है कि ये रिकॉर्ड एक ही ग्राहक, उत्पाद, कर्मचारी, आदि से संबंधित होने की कितनी संभावना है।
एक कुशल फजी मैचिंग एल्गोरिदम डेटा की विभिन्न अस्पष्टताओं का ध्यान रखता है, जैसे कि पहले/अंतिम नाम के उलट, संक्षिप्त नाम, फोनेटिक और जानबूझकर गलत वर्तनी, संक्षिप्त नाम, जोड़े/हटाए गए विराम चिह्न, आदि।
फजी मैचिंग प्रक्रिया
फजी मैचिंग प्रक्रिया निम्नलिखित के रूप में की जाती है:
- प्रोफाइल रिकॉर्ड मूलभूत मानकीकरण त्रुटियों के लिए। ये त्रुटियां ठीक की जाती हैं ताकि रिकॉर्ड के माध्यम से एक समान और मानकीकृत दृश्य प्राप्त किया जा सके।
- विशेषताओं का चयन और मैपिंग जिसके आधार पर फजी मैचिंग होगी। चूंकि ये विशेषताएं अलग-अलग स्रोतों में अलग-अलग शीर्षकों से जानी जा सकती हैं, उन्हें स्रोतों के माध्यम से मैप किया जाना चाहिए।
- प्रत्येक विशेषता के लिए एक फजी मैचिंग तकनीक का चयन करें। उदाहरण के लिए, नाम कीबोर्ड दूरी या नाम विविधताओं के आधार पर मेल खा सकते हैं, जबकि फोन नंबर संख्यात्मक समानता मीट्रिक के आधार पर मेल खा सकते हैं।
- प्रत्येक विशेषता के लिए एक वजन चुनें, ताकि उच्चतर वजन (या उच्च प्राथमिकता) वाली विशेषताएं समग्र मैच विश्वास स्तर पर अधिक प्रभाव डालेंगी, जो कम वजन वाले क्षेत्रों की तुलना में अधिक होंगे।
- सीमा स्तर को परिभाषित करें – रिकॉर्ड जिनका फजी मैचिंग स्कोर स्तर से अधिक है, उन्हें मैच माना जाता है और जो कम हैं उन्हें नॉन-मैच माना जाता है।
- फजी मैचिंग एल्गोरिदम चलाएं और मैच परिणामों का विश्लेषण करें।
- किसी भी गलत सकारात्मक और नकारात्मक को ओवरराइड करें जो आ सकते हैं।
- मिलाएं, डुप्लिकेट करें, या बस डुप्लिकेट रिकॉर्ड को समाप्त करें।
फजी मैचिंग पैरामीटर
उपरोक्त प्रक्रिया से, आप देख सकते हैं कि एक फजी मैचिंग एल्गोरिदम में कई पैरामीटर होते हैं जो इस तकनीक का आधार बनते हैं। इनमें विशेषता वजन, फजी मैचिंग तकनीक, और स्कोर सीमा स्तर शामिल हैं।
अधिमानतः परिणाम प्राप्त करने के लिए, आपको विभिन्न पैरामीटर के साथ फजी मैचिंग तकनीकों को निष्पादित करना चाहिए और उन मूल्यों को खोजना चाहिए जो आपके डेटा के लिए सबसे अच्छा काम करते हैं। कई विक्रेता अपने फजी मैचिंग समाधान के भीतर ऐसी क्षमताओं को पैकेज करते हैं जहां ये पैरामीटर स्वचालित रूप से ट्यून किए जाते हैं लेकिन आपकी आवश्यकताओं के अनुसार अनुकूलित किए जा सकते हैं।
फजी मैचिंग तकनीकें क्या हैं?
आज उपयोग की जाने वाली कई फजी मैचिंग तकनीकें हैं जो तुलना और मैच करने के लिए उपयोग किए जाने वाले सटीक एल्गोरिदम या सूत्र के आधार पर भिन्न होती हैं। अपने डेटा की प्रकृति के आधार पर, आप अपनी आवश्यकताओं के लिए उपयुक्त तकनीक चुन सकते हैं। यहाँ सामान्य फजी मैचिंग तकनीकों की सूची दी गई है:
- चरित्र-आधारित समानता मेट्रिक्स जो स्ट्रिंग्स को मेल खाने के लिए सबसे अच्छे हैं। इनमें शामिल हैं:
- संपादन दूरी: दो स्ट्रिंग्स के बीच की दूरी की गणना करता है, जो अक्षर दर अक्षर होती है।
- अफाइन गैप दूरी: दो स्ट्रिंग्स के बीच की दूरी की गणना करता है, जो स्ट्रिंग्स के बीच के अंतराल को भी ध्यान में रखता है।
- स्मिथ-वाटरमैन दूरी: दो स्ट्रिंग्स के बीच की दूरी की गणना करता है, जो उपसर्ग और प्रत्यय की उपस्थिति या अनुपस्थिति को भी ध्यान में रखता है।
- जारो दूरी: पहले और अंतिम नामों को मेल खाने के लिए सबसे अच्छा है।
- टोकन-आधारित समानता मेट्रिक्स जो स्ट्रिंग्स में पूर्ण शब्दों को मेल खाने के लिए सबसे अच्छे हैं। इनमें शामिल हैं:
- परमाणु स्ट्रिंग्स: लंबी स्ट्रिंग्स को विराम चिह्न द्वारा विभाजित शब्दों में विभाजित करता है और व्यक्तिगत शब्दों पर तुलना करता है।
- व्हर्ल: परमाणु स्ट्रिंग्स के समान है, लेकिन व्हर्ल प्रत्येक शब्द को भी वजन देता है।
- फोनेटिक समानता मेट्रिक्स जो शब्दों की तुलना करते हैं जो समान लगते हैं लेकिन पूरी तरह से अलग वर्ण संरचना होती है। इनमें शामिल हैं:
- साउंडेक्स: उपनामों की तुलना करने के लिए सबसे अच्छा है जो वर्तनी में भिन्न हैं लेकिन समान लगते हैं।
- नीसिस: साउंडेक्स के समान है, लेकिन यह वॉवेल स्थिति के बारे में विवरण भी बनाए रखता है।
- मेटाफोन: अंग्रेजी भाषा में, अमेरिकियों के लिए परिचित अन्य शब्दों और पहले और पारिवारिक नामों की तुलना करता है जो संयुक्त राज्य अमेरिका में सामान्य रूप से उपयोग किए जाते हैं।
- संख्यात्मक समानता मेट्रिक्स जो संख्याओं की तुलना करते हैं, वे एक दूसरे से कितनी दूर हैं, संख्यात्मक डेटा का वितरण, आदि।
फजी मैचिंग की चुनौतियाँ
फजी मैचिंग प्रक्रिया – इसके अद्भुत लाभों के बावजूद – काफी कठिन हो सकती है। व्यवसायों द्वारा सामना की जाने वाली कुछ सामान्य चुनौतियाँ हैं:
1. गलत सकारात्मक और नकारात्मक की उच्च दर
फजी मैचिंग समाधानों में अक्सर गलत सकारात्मक और नकारात्मक की उच्च दर होती है। यह तब होता है जब एल्गोरिदम मैच और नॉन-मैच को गलत तरीके से वर्गीकृत करता है या इसके विपरीत। कॉन्फ़िगरेबल मैच परिभाषाएं और फजी पैरामीटर गलत लिंक को यथासंभव कम करने में मदद कर सकते हैं।
2. गणनात्मक जटिलता
मैचिंग प्रक्रिया के दौरान, प्रत्येक रिकॉर्ड की तुलना डेटासेट में हर दूसरे रिकॉर्ड से की जाती है। और यदि आप कई डेटासेट के साथ काम कर रहे हैं, तो तुलना की संख्या और भी बढ़ जाती है। यह देखा गया है कि तुलना डेटाबेस के आकार के साथ द्विगुणित रूप से बढ़ती है। इस कारण से, आपको एक ऐसी प्रणाली का उपयोग करना चाहिए जो संसाधन-गहन गणना को संभालने में सक्षम हो।
3. मान्यकरण परीक्षण
मिलान किए गए रिकॉर्ड एक पूर्ण 360 दृश्य प्रस्तुत करने के लिए एक साथ मिलाए जाते हैं। इस प्रक्रिया के दौरान कोई भी त्रुटि आपके व्यवसायिक संचालन में जोखिम जोड़ सकती है। यही कारण है कि विश्वसनीयता दर के साथ परिणामों का निरंतर उत्पादन सुनिश्चित करने के लिए विस्तृत मान्यकरण परीक्षण आयोजित किया जाना चाहिए।
निष्कर्ष
व्यवसाय अक्सर फजी मैचिंग समाधानों को जटिल, संसाधन-गहन और पैसा-बर्बाद करने वाली परियोजनाओं के रूप में सोचते हैं जो बहुत लंबे समय तक चलती हैं। सच्चाई यह है कि तेज़ और सटीक परिणाम उत्पन्न करने वाले सही समाधान में निवेश करना कुंजी है। संगठनों को फजी मैचिंग टूल का चयन करते समय कई कारकों पर विचार करना चाहिए, जैसे कि वे समय और पैसा निवेश करने के लिए तैयार हैं, वे जिस स्केलेबिलिटी डिज़ाइन की योजना बना रहे हैं, और उनके डेटासेट की प्रकृति। इससे उन्हें एक ऐसा समाधान चुनने में मदद मिलेगी जो उन्हें अपने डेटा से सबसे अधिक लाभ प्राप्त करने में सक्षम बनाता है।












