एआई मॉडल और प्लेटफ़ॉर्म
बहुमोडल एआई का विकास जैसे चैटजीपीटी जीपीटी-4वी(िजन) के साथ दृष्टि प्राप्त करता है
मानवों की तरह एआई बनाने के लिए चल रहे प्रयास में, ओपनएआई के जीपीटी मॉडल ने लगातार सीमाओं को आगे बढ़ाया है। जीपीटी-4 अब पाठ और छवियों दोनों के प्रॉम्प्ट स्वीकार कर सकता है।
बहुमोडल जनरेटिव एआई में एक मॉडल की विभिन्न आउटपुट जैसे पाठ, छवियों या ऑडियो का उत्पादन करने की क्षमता शामिल है, जो इनपुट पर आधारित होती है। ये मॉडल, विशिष्ट डेटा पर प्रशिक्षित, अंतर्निहित पैटर्न सीखने के लिए जेनरेट करते हैं ताकि समान नए डेटा को समृद्ध करने के लिए एआई अनुप्रयोगों को समृद्ध किया जा सके।
बहुमोडल एआई में हाल की प्रगति
इस क्षेत्र में एक हालिया उल्लेखनीय छलांग डीएलएल-ई 3 को चैटजीपीटी में एकीकरण के साथ देखी जा सकती है, जो ओपनएआई की पाठ-से-छवि प्रौद्योगिकी में एक महत्वपूर्ण अपग्रेड है। यह मिश्रण एक ऐसे इंटरैक्शन की अनुमति देता है जहां चैटजीपीटी डीएलएल-ई 3 के लिए सटीक प्रॉम्प्ट तैयार करने में मदद करता है, जिससे उपयोगकर्ता के विचारों को जीवंत एआई-जनरेटेड कला में बदल दिया जाता है। इसलिए, जबकि उपयोगकर्ता सीधे डीएलएल-ई 3 के साथ बातचीत कर सकते हैं, चैटजीपीटी को मिश्रण में रखने से एआई कला बनाने की प्रक्रिया बहुत अधिक उपयोगकर्ता-मित्र बन जाती है।
डीएलएल-ई 3 और इसके चैटजीपीटी के साथ एकीकरण के बारे में अधिक जानकारी यहाँ देखें। यह सहयोग न केवल बहुमोडल एआई में प्रगति को प्रदर्शित करता है, बल्कि उपयोगकर्ताओं के लिए एआई कला निर्माण को एक हवा बना देता है।
गूगल के स्वास्थ्य ने इस साल जून में मेड-पीएलएम एम पेश किया। यह एक बहुमोडल जेनरेटिव मॉडल है जो विविध जैव चिकित्सा डेटा को एन्कोड और व्याख्या करने में कुशल है। यह पाम-ई, एक भाषा मॉडल को चिकित्सा डोमेन में बहुमेडबेंच नामक एक ओपन-सोर्स बेंचमार्क का उपयोग करके अनुकूलित करके हासिल किया गया था। यह बेंचमार्क 7 जैव चिकित्सा डेटा प्रकार और 14 कार्यों जैसे चिकित्सा प्रश्न-उत्तर और रेडियोलॉजी रिपोर्ट जेनरेशन में 1 मिलियन से अधिक नमूनों काประกอบ है।
विभिन्न उद्योग नवीन बहुमोडल एआई टूल्स को अपना रहे हैं ताकि व्यवसाय विस्तार, संचालन को सुव्यवस्थित करें और ग्राहक जुड़ाव को बढ़ा सकें। वॉयस, वीडियो और पाठ एआई क्षमताओं में प्रगति बहुमोडल एआई के विकास को बढ़ावा दे रही है।
कंपनियां ऐसे बहुमोडल एआई अनुप्रयोगों की तलाश में हैं जो व्यवसाय मॉडल और प्रक्रियाओं को बदलने में सक्षम हों, जेनरेटिव एआई पारिस्थितिकी तंत्र में विकास के मार्ग खोलते हैं, डेटा टूल से लेकर उभरते एआई अनुप्रयोगों तक।
जीपीटी-4 के मार्च में लॉन्च होने के बाद, कुछ उपयोगकर्ताओं ने समय के साथ इसकी प्रतिक्रिया की गुणवत्ता में गिरावट का अवलोकन किया, जो एक चिंता है जिसे उल्लेखनीय विकासकर्ताओं और ओपनएआई के मंचों पर प्रतिध्वनित किया गया है। शुरू में ओपनएआई द्वारा खारिज कर दिया गया, एक बाद के अध्ययन ने इस मुद्दे की पुष्टि की। यह मार्च और जून के बीच जीपीटी-4 की सटीकता में 97.6% से 2.4% की गिरावट को प्रकट करता है, जो मॉडल अपडेट के साथ उत्तर की गुणवत्ता में कमी का संकेत देता है।
ओपन एआई के चैटजीपीटी के बारे में हype वापस आ गया है। यह अब एक दृष्टि सुविधा जीपीटी-4वी के साथ आता है, जो उपयोगकर्ताओं को जीपीटी-4 को उनके द्वारा दी गई छवियों का विश्लेषण करने की अनुमति देता है। यह नवीनतम सुविधा है जो उपयोगकर्ताओं के लिए खुली है।
बड़े भाषा मॉडल (एलएलएम) जैसे जीपीटी-4 में छवि विश्लेषण जोड़ना कुछ लोगों द्वारा एआई अनुसंधान और विकास में एक बड़ा कदम माना जाता है। इस प्रकार के बहुमोडल एलएलएम नए संभावनाओं को खोलता है, भाषा मॉडल को पाठ से परे ले जाने के लिए नए इंटरफेस प्रदान करता है और नए प्रकार के कार्यों का समाधान करता है, जिससे उपयोगकर्ताओं के लिए ताज़ा अनुभव पैदा होता है।
जीपीटी-4वी का प्रशिक्षण 2022 में पूरा हुआ, और मार्च 2023 में शुरुआती पहुंच शुरू की गई। जीपीटी-4वी में दृश्य सुविधा जीपीटी-4 प्रौद्योगिकी द्वारा संचालित है। प्रशिक्षण प्रक्रिया वही रही। शुरू में, मॉडल को एक बड़े डेटासेट का उपयोग करके पाठ में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था, जिसमें विभिन्न स्रोतों से पाठ और छवियां शामिल थीं।
बाद में, इसे मानव प्रतिक्रिया से प्रबलीकरण सीखने (आरएलएचएफ) नामक एक विधि का उपयोग करके अधिक डेटा के साथ ठीक किया गया, ताकि मानवों द्वारा पसंद किए जाने वाले आउटपुट उत्पन्न किए जा सकें।
जीपीटी-4 दृष्टि यांत्रिकी
जीपीटी-4 की उल्लेखनीय दृष्टि भाषा क्षमताएं, हालांकि प्रभावशाली हैं, लेकिन उनके नीचे तरीके हैं जो सतह पर रहते हैं।
इस परिकल्पना का अन्वेषण करने के लिए, एक नया दृष्टि-भाषा मॉडल, मिनीजीपीटी-4 पेश किया गया था, जो एक उन्नत एलएलएम नामक विकुना का उपयोग करता है। यह मॉडल दृश्य धारण के लिए पूर्व-प्रशिक्षित घटकों वाले एक दृष्टि एनकोडर का उपयोग करता है, जो विकुना भाषा मॉडल के साथ एक एकल प्रोजेक्शन परत के माध्यम से एन्कोडेड दृश्य विशेषताओं को संरेखित करता है। मिनीजीपीटी-4 की वास्तुकला सरल लेकिन प्रभावी है, जो दृश्य और भाषा सुविधाओं को संरेखित करने पर केंद्रित है ताकि दृश्य बातचीत क्षमताओं में सुधार हो।

मिनीजीपीटी-4 की वास्तुकला में एक दृष्टि एनकोडर शामिल है जिसमें पूर्व-प्रशिक्षित वीआईटी और क्यू-फॉर्मर, एक एकल रैखिक प्रोजेक्शन परत, और एक उन्नत विकुना बड़ा भाषा मॉडल है।
दृष्टि-भाषा कार्यों में स्व-रोगात्मक भाषा मॉडल की प्रवृत्ति भी बढ़ रही है, जो क्रॉस-मॉडल ट्रांसफर का लाभ उठाती है ताकि भाषा और बहुमोडल डोमेन के बीच ज्ञान को साझा किया जा सके।
मिनीजीपीटी-4 दृश्य और भाषा डोमेन को एक पूर्व-प्रशिक्षित दृष्टि एनकोडर से दृश्य जानकारी को विकुना के साथ एक उन्नत एलएलएम के साथ संरेखित करके पुल करता है। मॉडल विकुना को भाषा डिकोडर के रूप में उपयोग करता है और एक दो-चरण प्रशिक्षण दृष्टिकोण का अनुसरण करता है। शुरू में, यह छवि-पाठ जोड़े के एक बड़े डेटासेट पर प्रशिक्षित होता है ताकि दृष्टि-भाषा ज्ञान को समझ सके, इसके बाद एक छोटे, उच्च-गुणवत्ता वाले डेटासेट पर ठीक करने के लिए ताकि पीढ़ी की विश्वसनीयता और उपयोगिता में सुधार हो।
मिनीजीपीटी-4 में उत्पन्न भाषा की प्राकृतिकता और उपयोगिता में सुधार करने के लिए, शोधकर्ताओं ने एक दो-चरण संरेखण प्रक्रिया विकसित की, जो दृष्टि-भाषा संरेखण डेटासेट की कमी को संबोधित करती है। उन्होंने इस उद्देश्य के लिए एक विशेष डेटासेट तैयार किया।
प्रारंभिक छवि विवरण प्रॉम्प्ट:
###मानव: <इमेज><इमेजफीचर></इमेज>इस छवि का विवरण विस्तार से दें। जितनी जानकारी संभव हो उत्पादन करें। जो कुछ भी आप देखते हैं उसे कहें। ###सहायक:
डेटा पोस्ट-प्रोसेसिंग के लिए, उत्पन्न विवरणों में कोई भी असंगति या त्रुटियां चैटजीपीटी का उपयोग करके सही की गईं, इसके बाद मैनुअल सत्यापन किया गया ताकि उच्च गुणवत्ता सुनिश्चित की जा सके।
दूसरे चरण के ठीक करने वाले प्रॉम्प्ट:
###मानव: <इमेज><इमेजफीचर></इमेज><निर्देश>###सहायक:
यह अन्वेषण जीपीटी-4 जैसे बहुमोडल जेनरेटिव एआई के यांत्रिकी को समझने के लिए एक खिड़की खोलता है, जो दृष्टि और भाषा मॉडलिटी को प्रभावी ढंग से एकीकृत करने के लिए कैसे काम करता है।
जीपीटी-4 दृष्टि का अन्वेषण
चैटजीपीटी के साथ छवि मूल का निर्धारण
जीपीटी-4 दृष्टि चैटजीपीटी की छवियों का विश्लेषण करने और उनके भौगोलिक मूल की पहचान करने की क्षमता को बढ़ाती है। यह सुविधा उपयोगकर्ता इंटरैक्शन को केवल पाठ से लेकर पाठ और दृश्यों के मिश्रण में स्थानांतरित करती है, जो उन लोगों के लिए एक उपयोगी उपकरण बन जाती है जो छवि डेटा के माध्यम से विभिन्न स्थानों के बारे में जानने में रुचि रखते हैं।
जटिल गणितीय अवधारणाएं
जीपीटी-4 दृष्टि जटिल गणितीय विचारों में उत्कृष्ट है जो ग्राफिकल या हस्तलिखित अभिव्यक्तियों का विश्लेषण करके हासिल किया जाता है। यह सुविधा उन व्यक्तियों के लिए एक उपयोगी उपकरण के रूप में कार्य करती है जो जटिल गणितीय समस्याओं का समाधान करना चाहते हैं, जिससे जीपीटी-4 दृष्टि शैक्षिक और अकादमिक क्षेत्रों में एक उल्लेखनीय सहायता बन जाती है।
हस्तलिखित इनपुट को लेटेक्स कोड में परिवर्तित करना
जीपीटी-4वी की एक उल्लेखनीय क्षमता इसकी हस्तलिखित इनपुट को लेटेक्स कोड में अनुवाद करने की है। यह सुविधा शोधकर्ताओं, अकादमिक और छात्रों के लिए एक वरदान है जिन्हें अक्सर हस्तलिखित गणितीय अभिव्यक्तियों या अन्य तकनीकी जानकारी को डिजिटल प्रारूप में परिवर्तित करने की आवश्यकता होती है। हस्तलिखित से लेटेक्स में परिवर्तन दस्तावेज़ डिजिटलीकरण के क्षितिज को विस्तारित करता है और तकनीकी लेखन प्रक्रिया को सरल बनाता है।
तालिका विवरण निकालना
जीपीटी-4वी तालिकाओं से विवरण निकालने और संबंधित प्रश्नों का उत्तर देने में कुशल है, जो डेटा विश्लेषण में एक महत्वपूर्ण संपत्ति है। उपयोगकर्ता जीपीटी-4वी का उपयोग तालिकाओं को खंगालने, मुख्य अंतर्दृष्टि एकत्र करने और प्रश्नों का समाधान करने के लिए कर सकते हैं, जिससे यह डेटा विश्लेषकों और अन्य पेशेवरों के लिए एक मजबूत उपकरण बन जाता है।
दृश्य संकेत को समझना
जीपीटी-4वी की दृश्य संकेत को समझने की अनोखी क्षमता उपयोगकर्ता इंटरैक्शन में एक नया आयाम जोड़ती है। दृश्य संकेतों को समझकर, जीपीटी-4वी प्रश्नों का उत्तर दे सकता है जो संदर्भ की बेहतर समझ के साथ हैं।
एक ड्राइंग का उपयोग करके सरल मॉक-अप वेबसाइट बनाना
इस ट्वीट से प्रेरित होकर, मैंने यूनाइट.एआई वेबसाइट के लिए एक मॉक-अप बनाने का प्रयास किया।
जबकि परिणाम मेरे प्रारंभिक दृष्टिकोण से मेल नहीं खाता था, यहाँ मुझे जो परिणाम मिला है।
जीपीटी-4वी(िजन) की सीमाएं और खामियां
जीपीटी-4वी का विश्लेषण करने के लिए, ओपन एआई टीम ने गुणात्मक और मात्रात्मक मूल्यांकन किया। गुणात्मक मूल्यांकन में आंतरिक परीक्षण और बाहरी विशेषज्ञ समीक्षा शामिल थे, जबकि मात्रात्मक मूल्यांकन में विभिन्न परिदृश्यों में मॉडल इनकार और सटीकता को मापा गया, जैसे कि हानिकारक सामग्री की पहचान, जनसांख्यिकीय मान्यता, गोपनीयता चिंताएं, भौगोलिक स्थान, साइबर सुरक्षा और बहुमोडल जेलब्रेक।
फिर भी, मॉडल परिपूर्ण नहीं है।
पत्र उल्लेख जीपीटी-4वी की सीमाओं को, जैसे कि छवियों में गलत अनुमान और लापता पाठ या अक्षर, को उजागर करता है। यह कल्पना कर सकता है या तथ्य गढ़ सकता है। विशेष रूप से, यह छवियों में हानिकारक पदार्थों की पहचान के लिए उपयुक्त नहीं है, अक्सर उन्हें गलत तरीके से पहचान लेता है।
चिकित्सा इमेजिंग में, जीपीटी-4वी असंगत प्रतिक्रिया प्रदान कर सकता है और मानक अभ्यास के बारे में जागरूकता की कमी है, जिससे संभावित गलत निदान हो सकते हैं।

चिकित्सा उद्देश्यों के लिए अविश्वसनीय प्रदर्शन (स्रोत)
यह कुछ नफ़रत के प्रतीकों की बारीकियों को भी समझने में विफल रहता है और दृश्य इनपुट के आधार पर अनुचित सामग्री उत्पन्न कर सकता है। ओपनएआई चिकित्सा या संवेदनशील संदर्भों में जीपीटी-4वी का उपयोग करने के खिलाफ सलाह देता है।
निष्कर्ष

फास्ट स्टेबल डिफ्यूजन एक्सएल https://huggingface.co/spaces/google/sdxl का उपयोग करके बनाया गया
जीपीटी-4 दृष्टि (जीपीटी-4वी) का आगमन कई शांत संभावनाओं और नए चुनौतियों को लेकर आता है। इसे रोल आउट करने से पहले, जोखिमों को कम करने के लिए, विशेष रूप से चित्रों में लोगों के लिए, बहुत प्रयास किया गया है। यह देखना प्रभावशाली है कि जीपीटी-4वी ने कैसे प्रगति की है, विशेष रूप से चुनौतीपूर्ण क्षेत्रों जैसे कि चिकित्सा और विज्ञान में बहुत आशा दिखाई है।
अब, कुछ बड़े प्रश्न तालिका पर हैं। उदाहरण के लिए, क्या इन मॉडलों को प्रसिद्ध लोगों को फोटो से पहचानना चाहिए? क्या उन्हें एक व्यक्ति के लिंग, जाति या भावनाओं का अनुमान लगाना चाहिए? और क्या दृष्टि बाधित व्यक्तियों के लिए विशेष समायोजन होने चाहिए? ये प्रश्न गोपनीयता, न्याय, और एआई को हमारे जीवन में कैसे फिट होना चाहिए, जिस पर हर किसी को बोलना चाहिए, के बारे में एक डिब्बे को खोलते हैं।




















