एजीआई और भविष्य की एआई
बड़ी भाषा मॉडल के साथ स्किट-लर्न: स्किट-एलएलएम के लिए एक व्यापक गाइड
चैटजीपीटी जैसे मॉडल की परिष्कृत भाषा प्रसंस्करण क्षमताओं को स्किट-लर्न फ्रेमवर्क के साथ एकीकृत करके, स्किट-एलएलएम पाठ डेटा की जटिलताओं में गहराई से जाने के लिए एक अनोखा हथियार प्रदान करता है।
स्किट-एलएलएम, जो इसके आधिकारिक गिटहब रिपॉजिटरी पर उपलब्ध है, लार्ज लैंग्वेज मॉडल्स (एलएलएम) जैसे ओपनएआई के जीपीटी-3.5 की उन्नत कृत्रिम बुद्धिमत्ता और स्किट-लर्न के उपयोगकर्ता-मित्र वातावरण का संयोजन है। यह पायथन पैकेज, जो विशेष रूप से पाठ विश्लेषण के लिए डिज़ाइन किया गया है, उन्नत प्राकृतिक भाषा प्रसंस्करण को सुलभ और कुशल बनाता है।
स्किट-एलएलएम क्यों?
स्किट-लर्न के परिदृश्य में熟練 लोगों के लिए, स्किट-एलएलएम एक प्राकृतिक प्रगति की तरह लगता है। यह परिचित एपीआई बनाए रखता है, जिससे उपयोगकर्ता .fit(), .fit_transform(), और .predict() जैसे कार्यों का उपयोग कर सकते हैं। इसकी क्षमता स्कलर्न पाइपलाइन में अनुमानों को एकीकृत करने का एक उदाहरण है, जो उन लोगों के लिए एक वरदान है जो अपने मशीन लर्निंग परियोजनाओं में राज्य-कला भाषा समझ को बढ़ाना चाहते हैं।
इस लेख में, हम स्किट-एलएलएम का अन्वेषण करते हैं, इसकी स्थापना से लेकर विभिन्न पाठ विश्लेषण कार्यों में इसके व्यावहारिक अनुप्रयोग तक। आप सीखेंगे कि पर्यवेक्षित और शून्य-शॉट पाठ वर्गीकरणकर्ता कैसे बनाएं और पाठ वेक्टरीकरण और वर्गीकरण जैसी उन्नत सुविधाओं में गहराई से जाएं।
स्किट-लर्न: मशीन लर्निंग का आधार
स्किट-एलएलएम में गोता लगाने से पहले, आइए इसके आधार – स्किट-लर्न पर एक नज़र डालें। मशीन लर्निंग में एक घरेलू नाम, स्किट-लर्न अपने व्यापक एल्गोरिदमिक सूट, सरलता, और उपयोगकर्ता-मित्रता के लिए प्रसिद्ध है। प्रतिगमन से लेकर क्लस्टरिंग तक की एक श्रृंखला के कार्यों को कवर करते हुए, स्किट-लर्न अधिकांश डेटा वैज्ञानिकों के लिए जाना-माना उपकरण है।
पायथन की वैज्ञानिक पुस्तकालयों (नम्पाई, साइपी, और मैटप्लॉटलिब) के आधार पर निर्मित, स्किट-लर्न पायथन की वैज्ञानिक स्टैक के साथ एकीकरण और नम्पाई सरणियों और साइपी स्पार्स मैट्रिक्स के साथ इसकी दक्षता के लिए खड़ा है।
स्किट-लर्न का मूल सरलता और एकरूपता के बारे में है। चाहे आप कोई भी एल्गोरिदम चुनें, कदम एक ही रहते हैं – क्लास आयात करें, ‘फिट’ विधि का उपयोग अपने डेटा के साथ करें, और ‘प्रेडिक्ट’ या ‘ट्रांसफॉर्म’ लागू करें ताकि मॉडल का उपयोग किया जा सके। यह सरलता सीखने की वक्र को कम करती है, इसे मशीन लर्निंग में नए लोगों के लिए एक आदर्श प्रारंभ बिंदु बनाती है।
पर्यावरण सेट अप करना
विशिष्टताओं में गोता लगाने से पहले, यह महत्वपूर्ण है कि काम करने वाले वातावरण की स्थापना की जाए। इस लेख के लिए, गूगल कोलाब प्लेटफ़ॉर्म का चयन किया जाएगा, जो पायथन कोड चलाने के लिए एक सुलभ और शक्तिशाली वातावरण प्रदान करता है।
स्थापना
%%capture !pip install scikit-llm watermark <p>%load_ext watermark %watermark -a "your-username" -vmp scikit-llm
एपीआई कुंजी प्राप्त करना और कॉन्फ़िगर करना
स्किट-एलएलएम को अंतर्निहित भाषा मॉडल तक पहुंचने के लिए ओपनएआई एपीआई कुंजी की आवश्यकता होती है।
from skllm.config import SKLLMConfig <p>OPENAI_API_KEY = "sk-****" OPENAI_ORG_ID = "org-****"</p> <p>SKLLMConfig.set_openai_key(OPENAI_API_KEY) SKLLMConfig.set_openai_org(OPENAI_ORG_ID)</p>
शून्य-शॉट जीपीटी वर्गीकरणकर्ता
ZeroShotGPTClassifier स्किट-एलएलएम की एक उल्लेखनीय सुविधा है जो चैटजीपीटी की क्षमता का लाभ उठाती है ताकि विवरणात्मक लेबल के आधार पर पाठ को वर्गीकृत किया जा सके, पारंपरिक मॉडल प्रशिक्षण की आवश्यकता के बिना।
लाइब्रेरी और डेटासेट आयात करना
from skllm import ZeroShotGPTClassifier from skllm.datasets import get_classification_dataset <p>X, y = get_classification_dataset()
डेटा तैयार करना
डेटा को प्रशिक्षण और परीक्षण उपसेट में विभाजित करना:
def training_data(data): return data[:8] + data[10:18] + data[20:28] <p>def testing_data(data): return data[8:10] + data[18:20] + data[28:30]</p> <p>X_train, y_train = training_data(X), training_data(y) X_test, y_test = testing_data(X), testing_data(y)</p>
मॉडल प्रशिक्षण और पूर्वानुमान
ZeroShotGPTClassifier को परिभाषित और प्रशिक्षित करना:
clf = ZeroShotGPTClassifier(openai_model="gpt-3.5-turbo") clf.fit(X_train, y_train) predicted_labels = clf.predict(X_test)
मूल्यांकन
मॉडल के प्रदर्शन का मूल्यांकन:
from sklearn.metrics import accuracy_score
<p>print(f"सटीकता: {accuracy_score(y_test, predicted_labels):.2f}")</p>
स्किट-एलएलएम के साथ पाठ सारांश
पाठ सारांश प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक महत्वपूर्ण सुविधा है, और स्किट-एलएलएम अपने GPTSummarizer मॉड्यूल के माध्यम से जीपीटी की इस क्षमता का लाभ उठाता है। यह सुविधा अपनी अनुकूलन के लिए खड़ा है, जो इसे स्टैंडअलोन टूल के रूप में सारांश उत्पन्न करने और व्यापक कार्य प्रवाह में पूर्व-प्रसंस्करण चरण के रूप में उपयोग करने की अनुमति देता है।
जीपीटी सारांशक के अनुप्रयोग:
- स्टैंडअलोन सारांश:
GPTSummarizerस्वतंत्र रूप से विस्तृत दस्तावेजों से संक्षिप्त सारांश बना सकता है, जो त्वरित सामग्री विश्लेषण या बड़े पैमाने पर पाठ से मुख्य जानकारी निकालने के लिए अमूल्य है। - अन्य कार्यों के लिए पूर्व-प्रसंस्करण: कई चरणों वाले पाठ विश्लेषण कार्य प्रवाह में,
GPTSummarizerपाठ डेटा को संक्षिप्त करने के लिए उपयोग किया जा सकता है। इससे गणना भार कम होता है और बाद के विश्लेषण चरणों को सरल बनाया जा सकता है बिना आवश्यक जानकारी खोए।
पाठ सारांश लागू करना:
स्किट-एलएलएम में पाठ सारांश का कार्यान्वयन शामिल है:
GPTSummarizerऔर संबंधित डेटासेट आयात करना।- निर्दिष्ट पैरामीटर जैसे
max_wordsके साथGPTSummarizerका एक उदाहरण बनाना जो सारांश की लंबाई को नियंत्रित करता है। - सारांश उत्पन्न करने के लिए
fit_transformविधि लागू करना।
यह ध्यान रखना महत्वपूर्ण है कि max_words पैरामीटर एक दिशानिर्देश के रूप में कार्य करता है, न कि सख्त सीमा के रूप में। यह सुनिश्चित करता है कि सारांश संक्षिप्तता बनाए रखते हुए सुसंगत और प्रासंगिक रहते हैं, भले ही वे निर्दिष्ट शब्द सीमा से थोड़े अधिक हों।
स्किट-एलएलएम के व्यापक प्रभाव
स्किट-एलएलएम की विशेषताओं की श्रृंखला, जिसमें पाठ वर्गीकरण, सारांश, वेक्टरीकरण, अनुवाद, और अनलेबल्ड डेटा को संभालने की इसकी अनुकूलन क्षमता शामिल है, इसे विविध पाठ विश्लेषण कार्यों के लिए एक व्यापक उपकरण बनाती है। यह लचीलापन और उपयोगकर्ता-मित्रता दोनों नए और अनुभवी पрак्टिशनरों के लिए उपयुक्त है।
संभावित अनुप्रयोग:
- ग्राहक प्रतिक्रिया विश्लेषण: ग्राहक प्रतिक्रिया को सकारात्मक, नकारात्मक, या तटस्थ जैसी श्रेणियों में वर्गीकृत करना, जो ग्राहक सेवा में सुधार या उत्पाद विकास रणनीतियों को सूचित कर सकता है।
- समाचार लेख वर्गीकरण: समाचार लेखों को विभिन्न विषयों में वर्गीकृत करना व्यक्तिगत समाचार फीड या रुझान विश्लेषण के लिए।
- भाषा अनुवाद: बहुराष्ट्रीय संचालन या व्यक्तिगत उपयोग के लिए दस्तावेजों का अनुवाद करना।
- दस्तावेज़ सारांश: लंबे दस्तावेजों का सार तेजी से समझना या प्रकाशन के लिए छोटे संस्करण बनाना।
स्किट-एलएलएम के लाभ:
- सटीकता: शून्य-शॉट पाठ वर्गीकरण और सारांश जैसे कार्यों में इसकी प्रभावशीलता सिद्ध हुई है।
- गति: वास्तविक समय प्रसंस्करण कार्यों के लिए उपयुक्त इसकी दक्षता के कारण।
- स्केलेबिलिटी: बड़े पैमाने पर पाठ को संभालने में इसकी क्षमता, जो इसे बड़े डेटा अनुप्रयोगों के लिए आदर्श बनाती है।
निष्कर्ष: स्किट-एलएलएम को उन्नत पाठ विश्लेषण के लिए अपनाना
सारांश में, स्किट-एलएलएम पाठ विश्लेषण के क्षेत्र में एक शक्तिशाली, बहुमुखी और उपयोगकर्ता-मित्र उपकरण के रूप में खड़ा है। इसकी क्षमता बड़ी भाषा मॉडल को पारंपरिक मशीन लर्निंग कार्य प्रवाह के साथ जोड़ने की, साथ ही इसकी ओपन-सोर्स प्रकृति, इसे शोधकर्ताओं, डेवलपर्स, और व्यवसायों के लिए एक मूल्यवान संपत्ति बनाती है। चाहे यह ग्राहक सेवा को परिष्कृत करना हो, समाचार रुझानों का विश्लेषण करना हो, बहुभाषी संचार को सुविधाजनक बनाना हो, या विस्तृत दस्तावेजों से मुख्य जानकारी निकालना हो, स्किट-एलएलएम एक मजबूत समाधान प्रदान करता है।












