एआई मॉडल और प्लेटफ़ॉर्म
लामा इंडेक्स: अपने एलएलएम एप्लिकेशन को आसानी से कस्टम डेटा के साथ बढ़ाएं
बड़े भाषा मॉडल (एलएलएम) जैसे ओपनएआई की जीपीटी श्रृंखला को विभिन्न प्रकार के सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया है, जो पाठ उत्पादन, सारांश, प्रश्न उत्तर, और योजना में उल्लेखनीय क्षमताएं प्रदर्शित करते हैं। उनकी बहुमुखी प्रतिभा के बावजूद, एक बार-बार पूछा जाने वाला प्रश्न इन मॉडलों के साथ कस्टम, निजी या प्रोप्राइटरी डेटा के समाकलन के बारे में है।
व्यवसाय और व्यक्ति विशिष्ट और कस्टम डेटा से भरे हुए हैं, जो अक्सर विभिन्न अनुप्रयोगों जैसे नोटियन, स्लैक, और सेल्सफोर्स में या व्यक्तिगत फाइलों में संग्रहीत होते हैं। इन मॉडलों के साथ इस विशिष्ट डेटा का लाभ उठाने के लिए, कई तरीकों का प्रस्ताव और प्रयोग किया गया है।
फाइन-ट्यूनिंग एक ऐसा तरीका है, जिसमें मॉडल के वजन को विशिष्ट डेटासेट से ज्ञान को शामिल करने के लिए समायोजित किया जाता है। हालांकि, इस प्रक्रिया में डेटा तैयारी में महत्वपूर्ण प्रयास की आवश्यकता होती है, साथ ही एक कठिन अनुकूलन प्रक्रिया की आवश्यकता होती है, जिसके लिए मशीन लर्निंग विशेषज्ञता की आवश्यकता होती है। इसके अलावा, बड़े डेटासेट के साथ वित्तीय परिणाम महत्वपूर्ण हो सकते हैं।
संदर्भ सीखने ने एक विकल्प के रूप में उभरा है, जिसमें एलएलएम को सटीक आउटपुट उत्पन्न करने के लिए आवश्यक संदर्भ प्रदान करने के लिए इनपुट और प्रॉम्प्ट को तैयार करने पर जोर दिया जाता है। यह दृष्टिकोण व्यापक मॉडल पुनः प्रशिक्षण की आवश्यकता को कम करता है, एक अधिक कुशल और सुलभ माध्यम प्रदान करता है जिसके द्वारा निजी डेटा को एकीकृत किया जा सकता है।
लेकिन इसका नुकसान यह है कि यह उपयोगकर्ता की कौशल और विशेषज्ञता पर निर्भर करता है प्रॉम्प्ट इंजीनियरिंग में। इसके अलावा, संदर्भ सीखने में हमेशा फाइन-ट्यूनिंग जितनी सटीकता और विश्वसनीयता नहीं हो सकती है, खासकर जब उच्च विशेषज्ञता वाले या तकनीकी डेटा की बात आती है। मॉडल का पूर्व-प्रशिक्षण विशिष्ट जार्गन या संदर्भ की समझ की गारंटी नहीं देता है, जो असटीक या अप्रासंगिक आउटपुट का कारण बन सकता है।
इसके अलावा, एक प्रॉम्प्ट में प्रदान किए जा सकने वाले संदर्भ की मात्रा सीमित है, और एलएलएम का प्रदर्शन कार्य की जटिलता के साथ खराब हो सकता है। गोपनीयता और डेटा सुरक्षा की भी चुनौती है, क्योंकि प्रॉम्प्ट में प्रदान की गई जानकारी संवेदनशील या गोपनीय हो सकती है।
जैसा कि समुदाय इन तकनीकों का अन्वेषण करता है, लामा इंडेक्स जैसे उपकरण ध्यान आकर्षित कर रहे हैं।
लामा इंडेक्स की शुरुआत जेरी लियू द्वारा की गई थी, जो एक पूर्व उबर अनुसंधान वैज्ञानिक हैं। जब उन्होंने पिछले साल जीपीटी-3 के साथ प्रयोग किया, तो उन्होंने मॉडल की सीमाओं को देखा, खासकर निजी डेटा जैसे कि व्यक्तिगत फाइलों को संभालने में। यह अवलोकन लामा इंडेक्स के ओपन-सोर्स परियोजना की शुरुआत का कारण बना।
इस पहल ने निवेशकों को आकर्षित किया है, जिन्होंने हाल ही में 8.5 मिलियन डॉलर के बीज निधिकरण दौर में सुरक्षित किया है।
लामा इंडेक्स एलएलएम को कस्टम डेटा के साथ बढ़ाने की सुविधा प्रदान करता है, पूर्व-प्रशिक्षित मॉडल और कस्टम डेटा उपयोग के मामलों के बीच की खाई को पाटता है। लामा इंडेक्स के माध्यम से, उपयोगकर्ता अपने स्वयं के डेटा को एलएलएम के साथ एकीकृत कर सकते हैं, जिससे ज्ञान उत्पादन और तर्कसंगतता के साथ व्यक्तिगत अंतर्दृष्टि को अनलॉक किया जा सकता है।
उपयोगकर्ता एलएलएम को अपने स्वयं के डेटा के साथ सुचारू रूप से प्रदान कर सकते हैं, जिससे ज्ञान उत्पादन और तर्कसंगतता के लिए एक वातावरण बनता है जो गहराई से व्यक्तिगत और सूचित है। लामा इंडेक्स संदर्भ सीखने की सीमाओं को दूर करता है, जिससे डेटा इंटरैक्शन के लिए एक अधिक उपयोगकर्ता-मित्र और सुरक्षित मंच प्रदान किया जाता है, यह सुनिश्चित करता है कि मशीन लर्निंग विशेषज्ञता की कमी वाले लोग भी अपने निजी डेटा के साथ एलएलएम की पूरी क्षमता का लाभ उठा सकते हैं।
उच्च-स्तरीय अवधारणाएं और कुछ अंतर्दृष्टि
1. पुनर्प्राप्ति बढ़ाया पीढ़ी (आरएजी):
आरएजी एक दो-गुना प्रक्रिया है जो एलएलएम को कस्टम डेटा के साथ जोड़ने के लिए डिज़ाइन की गई है, जिससे मॉडल की क्षमता अधिक सटीक और सूचित प्रतिक्रियाएं प्रदान करने में बढ़ जाती है। इस प्रक्रिया में शामिल हैं:
- इंडेक्सिंग चरण: यह तैयारी चरण है जहां ज्ञान आधार निर्माण के लिए आधार तैयार किया जाता है।
- प्रश्न चरण: यहां, ज्ञान आधार को प्रश्नों के लिए प्रासंगिक संदर्भ खोजने के लिए खोजा जाता है।
लामा इंडेक्स के साथ इंडेक्सिंग यात्रा:
लामा इंडेक्स में डेटा कनेक्टर्स, डॉक्यूमेंट/नोड्स, और डेटा इंडेक्स शामिल हैं। डेटा कनेक्टर्स आपके डेटा को लामा इंडेक्स में आयात करने में मदद करते हैं, जबकि डॉक्यूमेंट/नोड्स विभिन्न डेटा प्रकारों को पकड़ सकते हैं। डेटा इंडेक्सिंग आपके डेटा को पुनर्प्राप्ति के लिए तैयार करता है।
लामा इंडेक्स में इंडेक्स के प्रकार: व्यवस्थित डेटा की कुंजी
लामा इंडेक्स विभिन्न प्रकार के इंडेक्स प्रदान करता है, प्रत्येक के लिए विभिन्न आवश्यकताओं और उपयोग के मामलों के लिए। इन इंडेक्स के मूल में “नोड्स” होते हैं, जैसा कि पहले चर्चा की गई है। आइए लामा इंडेक्स इंडेक्स को उनकी यांत्रिकी और अनुप्रयोगों के साथ समझने का प्रयास करें:
1. सूची इंडेक्स:
- यांत्रिकी: एक सूची इंडेक्स नोड्स को क्रमिक रूप से सूची में व्यवस्थित करता है। डेटा को नोड्स में विभाजित करने के बाद, वे रैखिक रूप से व्यवस्थित होते हैं, जिससे उन्हें क्रमिक रूप से या कीवर्ड/एम्बेडिंग के माध्यम से प्रश्न किया जा सकता है।
- लाभ: यह इंडेक्स प्रकार तब चमकता है जब क्रमिक प्रश्नों की आवश्यकता होती है। लामा इंडेक्स सुनिश्चित करता है कि आपके पूरे इनपुट डेटा का उपयोग किया जाए, भले ही यह एलएलएम की टोकन सीमा से अधिक हो, प्रत्येक नोड से पाठ को स्मार्ट रूप से प्रश्न करके और उत्तर को नीचे की सूची में नेविगेट करते हुए उत्तर को परिष्कृत करता है।
2. वेक्टर स्टोर इंडेक्स:
- यांत्रिकी: यहां, नोड्स वेक्टर एम्बेडिंग में परिवर्तित हो जाते हैं, जो स्थानीय रूप से या विशेषज्ञ वेक्टर डेटाबेस जैसे मिलवस में संग्रहीत होते हैं। प्रश्न करने पर, यह शीर्ष_के सबसे समान नोड्स को पुनर्प्राप्त करता है, जिन्हें प्रतिक्रिया सिंथेसाइज़र में चैनल किया जाता है।
- लाभ: यदि आपका कार्यप्रवाह पाठ तुलना पर निर्भर करता है जो सेमेंटिक समानता के लिए वेक्टर खोज का उपयोग करता है, तो यह इंडेक्स उपयुक्त हो सकता है।
3. पेड़ इंडेक्स:
- यांत्रिकी: एक पेड़ इंडेक्स में, इनपुट डेटा एक पेड़ संरचना में विकसित होता है, जो नीचे से ऊपर तक पत्ती नोड्स (मूल डेटा चंक्स) से बनता है। माता-पिता नोड्स पत्ती नोड्स के सारांश के रूप में उभरते हैं, जीपीटी का उपयोग करके बनाए जाते हैं। प्रश्न के दौरान, पेड़ इंडेक्स मूल नोड्स से जड़ नोड तक या चयनित पत्ती नोड्स से सीधे प्रतिक्रिया का निर्माण करके नेविगेट कर सकता है।
- लाभ: पेड़ इंडेक्स के साथ, लंबे पाठ चंक्स को प्रश्न करना अधिक कुशल हो जाता है, और विभिन्न पाठ खंडों से जानकारी निकालना सरल हो जाता है।
4. कीवर्ड इंडेक्स:
- यांत्रिकी: एक कीवर्ड इंडेक्स में, कीवर्ड और नोड्स के बीच एक मैप बनाया जाता है। प्रश्न करने पर, कीवर्ड को प्रश्न से निकाला जाता है और केवल मैप किए गए नोड्स को हाइलाइट किया जाता है।
- लाभ: जब आपके पास स्पष्ट उपयोगकर्ता प्रश्न होते हैं, तो कीवर्ड इंडेक्स उपयुक्त हो सकता है। उदाहरण के लिए, स्वास्थ्य से संबंधित दस्तावेजों में खोज करना अधिक कुशल हो जाता है जब आप केवल कोविड-19 से संबंधित दस्तावेजों पर ध्यान केंद्रित करते हैं।
लामा इंडेक्स स्थापित करना
लामा इंडेक्स स्थापित करना एक सरल प्रक्रिया है। आप इसे पिप से सीधे या स्रोत से स्थापित करना चुन सकते हैं। (सुनिश्चित करें कि आपके सिस्टम में पाइथन स्थापित है या आप गूगल कोलाब का उपयोग कर सकते हैं।)
1. पिप से स्थापना:
- निम्नलिखित कमांड को निष्पादित करें:
pip install llama-index
- नोट: स्थापना के दौरान, लामा इंडेक्स एनएलटीके और हगिंग फेस जैसे पैकेजों के लिए स्थानीय फाइलें डाउनलोड और स्टोर कर सकता है। इन फाइलों के लिए एक निर्देशिका निर्दिष्ट करने के लिए, “एलएलएमए_इंडेक्स_कैश_डायर” पर्यावरण переменामान का उपयोग करें।
2. स्रोत से स्थापना:
- लामा इंडेक्स रिपॉजिटरी को गिटहब से क्लोन करें:
git clone https://github.com/jerryjliu/llama_index.git
- एक बार क्लोन हो जाने के बाद, प्रोजेक्ट निर्देशिका में नेविगेट करें।
- आपको पैकेज निर्भरताओं के प्रबंधन के लिए पोएट्री की आवश्यकता होगी।
- पोएट्री का उपयोग करके एक वर्चुअल एनवायरनमेंट बनाएं:
poetry shell - अंत में, पोएट्री के साथ मुख्य पैकेज आवश्यकताओं को स्थापित करें:
poetry install
लामा इंडेक्स के लिए अपने वातावरण की स्थापना
1. ओपनएआई सेटअप:
- डिफ़ॉल्ट रूप से, लामा इंडेक्स ओपनएआई के
गप्टी-3.5-टर्बोको पाठ उत्पादन के लिए औरटेक्स्ट-एम्बेडिंग-एडा-002को पुनर्प्राप्ति और एम्बेडिंग के लिए उपयोग करता है। - इस सेटअप का उपयोग करने के लिए, आपको
ओपनएआई_एपीआई_कीकी आवश्यकता होगी। ओपनएआई की वेबसाइट पर पंजीकरण करके और एक नई एपीआई टोकन बनाकर एक प्राप्त करें। - आपके पास अपनी परियोजना की आवश्यकताओं के अनुसार अंतर्निहित बड़े भाषा मॉडल (एलएलएम) को अनुकूलित करने की लचीलापन है। आपके एलएलएम प्रदाता के आधार पर, आपको अतिरिक्त पर्यावरण कुंजी और टोकन की आवश्यकता हो सकती है।
2. स्थानीय वातावरण सेटअप:
- यदि आप ओपनएआई का उपयोग नहीं करना चाहते हैं, तो लामा इंडेक्स स्वचालित रूप से स्थानीय मॉडलों में स्विच हो जाता है –
लामा सीपीपीऔरलामा2-चैट-13बीपाठ उत्पादन के लिए, औरबीएएआई/बीजई-छोटा-अंग्रेजीपुनर्प्राप्ति और एम्बेडिंग के लिए। लामा सीपीपीका उपयोग करने के लिए, प्रदान किए गए स्थापना गाइड का पालन करें। सुनिश्चित करें कि आपलामा-सीपीपी-पाइथनपैकेज स्थापित करें, जो आदर्श रूप से जीपीयू समर्थन के लिए संकलित किया गया है। यह सेटअप लगभग 11.5 जीबी मेमोरी का उपयोग करेगा जो सीपीयू और जीपीयू में वितरित किया जाएगा।- स्थानीय एम्बेडिंग के लिए,
पिप इंस्टॉल सेंटेंस-ट्रांसफॉर्मर्सनिष्पादित करें। यह स्थानीय सेटअप लगभग 500 एमबी मेमोरी का उपयोग करेगा।
इन सेटअप के साथ, आप अपने वातावरण को ओपनएआई की शक्ति का लाभ उठाने या स्थानीय रूप से मॉडल चलाने के लिए अनुकूलित कर सकते हैं, जो आपकी परियोजना की आवश्यकताओं और संसाधनों के अनुसार होगा।
लामा इंडेक्स और ओपनएआई के साथ वेबपेज क्वेरी करना: एक सरल उपयोग मामला
यहाँ एक सरल पाइथन स्क्रिप्ट है जो दिखाती है कि आप लामा इंडेक्स और ओपनएआई का उपयोग करके वेबपेज से विशिष्ट अंतर्दृष्टि कैसे प्राप्त कर सकते हैं:
“`python
!pip install llama-index html2text
import os
from llama_index import VectorStoreIndex, SimpleWebPageReader
# अपनी ओपनएआई कुंजी नीचे दर्ज करें:
os.environ[“OPENAI_API_KEY”] = “”
# आप जिस यूआरएल को लोड करना चाहते हैं:
url = “http://www.paulgraham.com/fr.html”
# यूआरएल को दस्तावेजों में लोड करें (एक से अधिक दस्तावेज संभव हैं)
documents = SimpleWebPageReader(html_to_text=True).load_data([url])
# दस्तावेजों से वेक्टर स्टोर बनाएं
index = VectorStoreIndex.from_documents(documents)
# प्रश्न इंजन बनाएं ताकि आप इसे प्रश्न पूछ सकें:
query_engine = index.as_query_engine()
# जितने प्रश्न चाहें उत्तर प्राप्त करें:
response = query_engine.query(“पॉल के पैसे बढ़ाने के लिए तीन सर्वश्रेष्ठ सलाह क्या हैं?”)
print(response)
“`
“`text
पॉल के पैसे बढ़ाने के लिए तीन सर्वश्रेष्ठ सलाह हैं:
1. शुरुआत में कम संख्या से शुरू करें। यह लचीलापन प्रदान करता है और दीर्घकालिक में अधिक धन जुटाने की संभावना बढ़ाता है।
2. यदि संभव हो तो लाभदायक बनने का लक्ष्य रखें। लाभदायकता की योजना बनाना निवेशकों के लिए आपकी स्टार्टअप को अधिक आकर्षक बनाता है।
3. मूल्यांकन के लिए अनुकूलन न करें। मूल्यांकन महत्वपूर्ण है, लेकिन यह सबसे महत्वपूर्ण कारक नहीं है। आवश्यक धन प्राप्त करने और अच्छे निवेशकों को खोजने पर ध्यान केंद्रित करें।
“`
इस स्क्रिप्ट के साथ, आपने एक शक्तिशाली उपकरण बनाया है जो वेबपेज से विशिष्ट जानकारी निकालने के लिए केवल एक प्रश्न पूछने की अनुमति देता है। यह लामा इंडेक्स और ओपनएआई के साथ वेब डेटा क्वेरी करने की क्षमता की केवल एक झलक है।
लामा इंडेक्स बनाम लैंगचेन: अपने लक्ष्य के आधार पर चयन
लामा इंडेक्स और लैंगचेन के बीच आपका चयन आपकी परियोजना के उद्देश्य पर निर्भर करेगा। यदि आप एक बुद्धिमान खोज उपकरण विकसित करना चाहते हैं, तो लामा इंडेक्स एक ठोस विकल्प है, जो डेटा पुनर्प्राप्ति के लिए एक स्मार्ट स्टोरेज तंत्र के रूप में उत्कृष्टता प्राप्त करता है। दूसरी ओर, यदि आप एक चैटजीपीटी जैसी प्रणाली बनाना चाहते हैं जिसमें प्लगइन क्षमताएं हों, तो लैंगचेन आपका जाना है। यह न केवल चैटजीपीटी और लामा इंडेक्स के कई उदाहरणों को सुविधाजनक बनाता है, बल्कि यह बहु-कार्य एजेंटों का निर्माण करके कार्यक्षमता का विस्तार भी करता है। उदाहरण के लिए, लैंगचेन के साथ, आप एजेंट बना सकते हैं जो पायथन कोड निष्पादित करते समय एक गूगल खोज भी कर सकते हैं। संक्षेप में, जबकि लामा इंडेक्स डेटा हैंडलिंग में उत्कृष्टता प्राप्त करता है, लैंगचेन एक समग्र समाधान प्रदान करता है जो कई उपकरणों को एकीकृत करता है।












