एआई मॉडल और प्लेटफ़ॉर्म

बहुमोडल एआई का विकास जैसे चैटजीपीटी जीपीटी-4वी(िजन) के साथ दृष्टि प्राप्त करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मानवों की तरह एआई बनाने के लिए चल रहे प्रयास में, ओपनएआई के जीपीटी मॉडल ने लगातार सीमाओं को आगे बढ़ाया है। जीपीटी-4 अब पाठ और छवियों दोनों के प्रॉम्प्ट स्वीकार कर सकता है।

बहुमोडल जनरेटिव एआई में एक मॉडल की विभिन्न आउटपुट जैसे पाठ, छवियों या ऑडियो का उत्पादन करने की क्षमता शामिल है, जो इनपुट पर आधारित होती है। ये मॉडल, विशिष्ट डेटा पर प्रशिक्षित, अंतर्निहित पैटर्न सीखने के लिए जेनरेट करते हैं ताकि समान नए डेटा को समृद्ध करने के लिए एआई अनुप्रयोगों को समृद्ध किया जा सके।

बहुमोडल एआई में हाल की प्रगति

इस क्षेत्र में एक हालिया उल्लेखनीय छलांग डीएलएल-ई 3 को चैटजीपीटी में एकीकरण के साथ देखी जा सकती है, जो ओपनएआई की पाठ-से-छवि प्रौद्योगिकी में एक महत्वपूर्ण अपग्रेड है। यह मिश्रण एक ऐसे इंटरैक्शन की अनुमति देता है जहां चैटजीपीटी डीएलएल-ई 3 के लिए सटीक प्रॉम्प्ट तैयार करने में मदद करता है, जिससे उपयोगकर्ता के विचारों को जीवंत एआई-जनरेटेड कला में बदल दिया जाता है। इसलिए, जबकि उपयोगकर्ता सीधे डीएलएल-ई 3 के साथ बातचीत कर सकते हैं, चैटजीपीटी को मिश्रण में रखने से एआई कला बनाने की प्रक्रिया बहुत अधिक उपयोगकर्ता-मित्र बन जाती है।

डीएलएल-ई 3 और इसके चैटजीपीटी के साथ एकीकरण के बारे में अधिक जानकारी यहाँ देखें। यह सहयोग न केवल बहुमोडल एआई में प्रगति को प्रदर्शित करता है, बल्कि उपयोगकर्ताओं के लिए एआई कला निर्माण को एक हवा बना देता है।

गूगल के स्वास्थ्य ने इस साल जून में मेड-पीएलएम एम पेश किया। यह एक बहुमोडल जेनरेटिव मॉडल है जो विविध जैव चिकित्सा डेटा को एन्कोड और व्याख्या करने में कुशल है। यह पाम-ई, एक भाषा मॉडल को चिकित्सा डोमेन में बहुमेडबेंच नामक एक ओपन-सोर्स बेंचमार्क का उपयोग करके अनुकूलित करके हासिल किया गया था। यह बेंचमार्क 7 जैव चिकित्सा डेटा प्रकार और 14 कार्यों जैसे चिकित्सा प्रश्न-उत्तर और रेडियोलॉजी रिपोर्ट जेनरेशन में 1 मिलियन से अधिक नमूनों काประกอบ है।

विभिन्न उद्योग नवीन बहुमोडल एआई टूल्स को अपना रहे हैं ताकि व्यवसाय विस्तार, संचालन को सुव्यवस्थित करें और ग्राहक जुड़ाव को बढ़ा सकें। वॉयस, वीडियो और पाठ एआई क्षमताओं में प्रगति बहुमोडल एआई के विकास को बढ़ावा दे रही है।

कंपनियां ऐसे बहुमोडल एआई अनुप्रयोगों की तलाश में हैं जो व्यवसाय मॉडल और प्रक्रियाओं को बदलने में सक्षम हों, जेनरेटिव एआई पारिस्थितिकी तंत्र में विकास के मार्ग खोलते हैं, डेटा टूल से लेकर उभरते एआई अनुप्रयोगों तक।

जीपीटी-4 के मार्च में लॉन्च होने के बाद, कुछ उपयोगकर्ताओं ने समय के साथ इसकी प्रतिक्रिया की गुणवत्ता में गिरावट का अवलोकन किया, जो एक चिंता है जिसे उल्लेखनीय विकासकर्ताओं और ओपनएआई के मंचों पर प्रतिध्वनित किया गया है। शुरू में ओपनएआई द्वारा खारिज कर दिया गया, एक बाद के अध्ययन ने इस मुद्दे की पुष्टि की। यह मार्च और जून के बीच जीपीटी-4 की सटीकता में 97.6% से 2.4% की गिरावट को प्रकट करता है, जो मॉडल अपडेट के साथ उत्तर की गुणवत्ता में कमी का संकेत देता है।

chatgpt-ai

चैटजीपीटी (नीला) और आर्टिफ़िशियल इंटेलिजेंस (लाल) गूगल सर्च ट्रेंड

ओपन एआई के चैटजीपीटी के बारे में हype वापस आ गया है। यह अब एक दृष्टि सुविधा जीपीटी-4वी के साथ आता है, जो उपयोगकर्ताओं को जीपीटी-4 को उनके द्वारा दी गई छवियों का विश्लेषण करने की अनुमति देता है। यह नवीनतम सुविधा है जो उपयोगकर्ताओं के लिए खुली है।

बड़े भाषा मॉडल (एलएलएम) जैसे जीपीटी-4 में छवि विश्लेषण जोड़ना कुछ लोगों द्वारा एआई अनुसंधान और विकास में एक बड़ा कदम माना जाता है। इस प्रकार के बहुमोडल एलएलएम नए संभावनाओं को खोलता है, भाषा मॉडल को पाठ से परे ले जाने के लिए नए इंटरफेस प्रदान करता है और नए प्रकार के कार्यों का समाधान करता है, जिससे उपयोगकर्ताओं के लिए ताज़ा अनुभव पैदा होता है।

जीपीटी-4वी का प्रशिक्षण 2022 में पूरा हुआ, और मार्च 2023 में शुरुआती पहुंच शुरू की गई। जीपीटी-4वी में दृश्य सुविधा जीपीटी-4 प्रौद्योगिकी द्वारा संचालित है। प्रशिक्षण प्रक्रिया वही रही। शुरू में, मॉडल को एक बड़े डेटासेट का उपयोग करके पाठ में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था, जिसमें विभिन्न स्रोतों से पाठ और छवियां शामिल थीं।

बाद में, इसे मानव प्रतिक्रिया से प्रबलीकरण सीखने (आरएलएचएफ) नामक एक विधि का उपयोग करके अधिक डेटा के साथ ठीक किया गया, ताकि मानवों द्वारा पसंद किए जाने वाले आउटपुट उत्पन्न किए जा सकें।

जीपीटी-4 दृष्टि यांत्रिकी

जीपीटी-4 की उल्लेखनीय दृष्टि भाषा क्षमताएं, हालांकि प्रभावशाली हैं, लेकिन उनके नीचे तरीके हैं जो सतह पर रहते हैं।

इस परिकल्पना का अन्वेषण करने के लिए, एक नया दृष्टि-भाषा मॉडल, मिनीजीपीटी-4 पेश किया गया था, जो एक उन्नत एलएलएम नामक विकुना का उपयोग करता है। यह मॉडल दृश्य धारण के लिए पूर्व-प्रशिक्षित घटकों वाले एक दृष्टि एनकोडर का उपयोग करता है, जो विकुना भाषा मॉडल के साथ एक एकल प्रोजेक्शन परत के माध्यम से एन्कोडेड दृश्य विशेषताओं को संरेखित करता है। मिनीजीपीटी-4 की वास्तुकला सरल लेकिन प्रभावी है, जो दृश्य और भाषा सुविधाओं को संरेखित करने पर केंद्रित है ताकि दृश्य बातचीत क्षमताओं में सुधार हो।

मिनीजीपीटी-4

मिनीजीपीटी-4 की वास्तुकला में एक दृष्टि एनकोडर शामिल है जिसमें पूर्व-प्रशिक्षित वीआईटी और क्यू-फॉर्मर, एक एकल रैखिक प्रोजेक्शन परत, और एक उन्नत विकुना बड़ा भाषा मॉडल है।

दृष्टि-भाषा कार्यों में स्व-रोगात्मक भाषा मॉडल की प्रवृत्ति भी बढ़ रही है, जो क्रॉस-मॉडल ट्रांसफर का लाभ उठाती है ताकि भाषा और बहुमोडल डोमेन के बीच ज्ञान को साझा किया जा सके।

मिनीजीपीटी-4 दृश्य और भाषा डोमेन को एक पूर्व-प्रशिक्षित दृष्टि एनकोडर से दृश्य जानकारी को विकुना के साथ एक उन्नत एलएलएम के साथ संरेखित करके पुल करता है। मॉडल विकुना को भाषा डिकोडर के रूप में उपयोग करता है और एक दो-चरण प्रशिक्षण दृष्टिकोण का अनुसरण करता है। शुरू में, यह छवि-पाठ जोड़े के एक बड़े डेटासेट पर प्रशिक्षित होता है ताकि दृष्टि-भाषा ज्ञान को समझ सके, इसके बाद एक छोटे, उच्च-गुणवत्ता वाले डेटासेट पर ठीक करने के लिए ताकि पीढ़ी की विश्वसनीयता और उपयोगिता में सुधार हो।

मिनीजीपीटी-4 में उत्पन्न भाषा की प्राकृतिकता और उपयोगिता में सुधार करने के लिए, शोधकर्ताओं ने एक दो-चरण संरेखण प्रक्रिया विकसित की, जो दृष्टि-भाषा संरेखण डेटासेट की कमी को संबोधित करती है। उन्होंने इस उद्देश्य के लिए एक विशेष डेटासेट तैयार किया।

प्रारंभिक छवि विवरण प्रॉम्प्ट:

###मानव: <इमेज><इमेजफीचर></इमेज>इस छवि का विवरण विस्तार से दें। जितनी जानकारी संभव हो उत्पादन करें। जो कुछ भी आप देखते हैं उसे कहें। ###सहायक:

डेटा पोस्ट-प्रोसेसिंग के लिए, उत्पन्न विवरणों में कोई भी असंगति या त्रुटियां चैटजीपीटी का उपयोग करके सही की गईं, इसके बाद मैनुअल सत्यापन किया गया ताकि उच्च गुणवत्ता सुनिश्चित की जा सके।

दूसरे चरण के ठीक करने वाले प्रॉम्प्ट:

###मानव: <इमेज><इमेजफीचर></इमेज><निर्देश>###सहायक:

यह अन्वेषण जीपीटी-4 जैसे बहुमोडल जेनरेटिव एआई के यांत्रिकी को समझने के लिए एक खिड़की खोलता है, जो दृष्टि और भाषा मॉडलिटी को प्रभावी ढंग से एकीकृत करने के लिए कैसे काम करता है।

जीपीटी-4 दृष्टि का अन्वेषण

चैटजीपीटी के साथ छवि मूल का निर्धारण

जीपीटी-4 दृष्टि चैटजीपीटी की छवियों का विश्लेषण करने और उनके भौगोलिक मूल की पहचान करने की क्षमता को बढ़ाती है। यह सुविधा उपयोगकर्ता इंटरैक्शन को केवल पाठ से लेकर पाठ और दृश्यों के मिश्रण में स्थानांतरित करती है, जो उन लोगों के लिए एक उपयोगी उपकरण बन जाती है जो छवि डेटा के माध्यम से विभिन्न स्थानों के बारे में जानने में रुचि रखते हैं।

Chatgpt-vision-GPT-4

चैटजीपीटी से पूछते हुए एक लैंडमार्क छवि कहां ली गई है

जटिल गणितीय अवधारणाएं

जीपीटी-4 दृष्टि जटिल गणितीय विचारों में उत्कृष्ट है जो ग्राफिकल या हस्तलिखित अभिव्यक्तियों का विश्लेषण करके हासिल किया जाता है। यह सुविधा उन व्यक्तियों के लिए एक उपयोगी उपकरण के रूप में कार्य करती है जो जटिल गणितीय समस्याओं का समाधान करना चाहते हैं, जिससे जीपीटी-4 दृष्टि शैक्षिक और अकादमिक क्षेत्रों में एक उल्लेखनीय सहायता बन जाती है।

Chatgpt-vision-GPT-4

चैटजीपीटी से एक जटिल गणितीय अवधारणा को समझने के लिए कह रहा है

हस्तलिखित इनपुट को लेटेक्स कोड में परिवर्तित करना

जीपीटी-4वी की एक उल्लेखनीय क्षमता इसकी हस्तलिखित इनपुट को लेटेक्स कोड में अनुवाद करने की है। यह सुविधा शोधकर्ताओं, अकादमिक और छात्रों के लिए एक वरदान है जिन्हें अक्सर हस्तलिखित गणितीय अभिव्यक्तियों या अन्य तकनीकी जानकारी को डिजिटल प्रारूप में परिवर्तित करने की आवश्यकता होती है। हस्तलिखित से लेटेक्स में परिवर्तन दस्तावेज़ डिजिटलीकरण के क्षितिज को विस्तारित करता है और तकनीकी लेखन प्रक्रिया को सरल बनाता है।

जीपीटी-4वी की हस्तलिखित इनपुट को लेटेक्स कोड में परिवर्तित करने की क्षमता

जीपीटी-4वी की हस्तलिखित इनपुट को लेटेक्स कोड में परिवर्तित करने की क्षमता

तालिका विवरण निकालना

जीपीटी-4वी तालिकाओं से विवरण निकालने और संबंधित प्रश्नों का उत्तर देने में कुशल है, जो डेटा विश्लेषण में एक महत्वपूर्ण संपत्ति है। उपयोगकर्ता जीपीटी-4वी का उपयोग तालिकाओं को खंगालने, मुख्य अंतर्दृष्टि एकत्र करने और प्रश्नों का समाधान करने के लिए कर सकते हैं, जिससे यह डेटा विश्लेषकों और अन्य पेशेवरों के लिए एक मजबूत उपकरण बन जाता है।

जीपीटी-4वी तालिका विवरण को समझने और संबंधित प्रश्नों का उत्तर देने में सक्षम

जीपीटी-4वी तालिका विवरण को समझने और संबंधित प्रश्नों का उत्तर देने में सक्षम

दृश्य संकेत को समझना

जीपीटी-4वी की दृश्य संकेत को समझने की अनोखी क्षमता उपयोगकर्ता इंटरैक्शन में एक नया आयाम जोड़ती है। दृश्य संकेतों को समझकर, जीपीटी-4वी प्रश्नों का उत्तर दे सकता है जो संदर्भ की बेहतर समझ के साथ हैं।

जीपीटी-4वी दृश्य संकेत को समझने की विशिष्ट क्षमता का प्रदर्शन

जीपीटी-4वी दृश्य संकेत को समझने की विशिष्ट क्षमता का प्रदर्शन

एक ड्राइंग का उपयोग करके सरल मॉक-अप वेबसाइट बनाना

इस ट्वीट से प्रेरित होकर, मैंने यूनाइट.एआई वेबसाइट के लिए एक मॉक-अप बनाने का प्रयास किया।

जबकि परिणाम मेरे प्रारंभिक दृष्टिकोण से मेल नहीं खाता था, यहाँ मुझे जो परिणाम मिला है।

चैटजीपीटी दृष्टि आधारित आउटपुट एचटीएमएल फ्रंटेंड

चैटजीपीटी दृष्टि आधारित आउटपुट एचटीएमएल फ्रंटेंड

जीपीटी-4वी(िजन) की सीमाएं और खामियां

जीपीटी-4वी का विश्लेषण करने के लिए, ओपन एआई टीम ने गुणात्मक और मात्रात्मक मूल्यांकन किया। गुणात्मक मूल्यांकन में आंतरिक परीक्षण और बाहरी विशेषज्ञ समीक्षा शामिल थे, जबकि मात्रात्मक मूल्यांकन में विभिन्न परिदृश्यों में मॉडल इनकार और सटीकता को मापा गया, जैसे कि हानिकारक सामग्री की पहचान, जनसांख्यिकीय मान्यता, गोपनीयता चिंताएं, भौगोलिक स्थान, साइबर सुरक्षा और बहुमोडल जेलब्रेक।

फिर भी, मॉडल परिपूर्ण नहीं है।

पत्र उल्लेख जीपीटी-4वी की सीमाओं को, जैसे कि छवियों में गलत अनुमान और लापता पाठ या अक्षर, को उजागर करता है। यह कल्पना कर सकता है या तथ्य गढ़ सकता है। विशेष रूप से, यह छवियों में हानिकारक पदार्थों की पहचान के लिए उपयुक्त नहीं है, अक्सर उन्हें गलत तरीके से पहचान लेता है।

चिकित्सा इमेजिंग में, जीपीटी-4वी असंगत प्रतिक्रिया प्रदान कर सकता है और मानक अभ्यास के बारे में जागरूकता की कमी है, जिससे संभावित गलत निदान हो सकते हैं।

चिकित्सा उद्देश्यों के लिए अविश्वसनीय प्रदर्शन।

चिकित्सा उद्देश्यों के लिए अविश्वसनीय प्रदर्शन (स्रोत)

यह कुछ नफ़रत के प्रतीकों की बारीकियों को भी समझने में विफल रहता है और दृश्य इनपुट के आधार पर अनुचित सामग्री उत्पन्न कर सकता है। ओपनएआई चिकित्सा या संवेदनशील संदर्भों में जीपीटी-4वी का उपयोग करने के खिलाफ सलाह देता है।

निष्कर्ष

फास्ट स्टेबल डिफ्यूजन एक्सएल का उपयोग करके बनाया गया

फास्ट स्टेबल डिफ्यूजन एक्सएल https://huggingface.co/spaces/google/sdxl का उपयोग करके बनाया गया

जीपीटी-4 दृष्टि (जीपीटी-4वी) का आगमन कई शांत संभावनाओं और नए चुनौतियों को लेकर आता है। इसे रोल आउट करने से पहले, जोखिमों को कम करने के लिए, विशेष रूप से चित्रों में लोगों के लिए, बहुत प्रयास किया गया है। यह देखना प्रभावशाली है कि जीपीटी-4वी ने कैसे प्रगति की है, विशेष रूप से चुनौतीपूर्ण क्षेत्रों जैसे कि चिकित्सा और विज्ञान में बहुत आशा दिखाई है।

अब, कुछ बड़े प्रश्न तालिका पर हैं। उदाहरण के लिए, क्या इन मॉडलों को प्रसिद्ध लोगों को फोटो से पहचानना चाहिए? क्या उन्हें एक व्यक्ति के लिंग, जाति या भावनाओं का अनुमान लगाना चाहिए? और क्या दृष्टि बाधित व्यक्तियों के लिए विशेष समायोजन होने चाहिए? ये प्रश्न गोपनीयता, न्याय, और एआई को हमारे जीवन में कैसे फिट होना चाहिए, जिस पर हर किसी को बोलना चाहिए, के बारे में एक डिब्बे को खोलते हैं।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।