प्रॉम्प्ट इंजीनियरिंग

ओपनएआई के डीएलएल-ई 3 की गहराई से जांच

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
DALL·E 3

जनरेटिव एआई की दुनिया में, नवीनतम के साथ तालमेल बिठाना नाम का खेल है। और जब छवियों को जनरेट करने की बात आती है, तो स्टेबल डिफ्यूजन और मिडजॉर्नी हर किसी की जुबान पर थे – लेकिन अब नहीं।

ओपनएआई, माइक्रोसॉफ्ट जैसी प्रौद्योगिकी दिग्गज कंपनी द्वारा समर्थित, ने 20 सितंबर, 2023 को डीएलएल-ई 3 की शुरुआत की।

डीएलएल-ई 3 केवल छवियों को बनाने के बारे में नहीं है; यह आपके विचारों को जीवन में लाने के बारे में है, जैसा कि आपने उन्हें कल्पना की थी। और सबसे अच्छा हिस्सा? यह तेज़ है, जैसे कि वास्तव में तेज़। आपके पास एक विचार है, आप इसे डीएलएल-ई 3 को देते हैं, और बूम, आपकी छवि तैयार है।

तो इस लेख में, हम डीएलएल-ई 3 के बारे में गहराई से जानने जा रहे हैं। हम इसके काम करने के तरीके, इसे बाकी से अलग करने वाली चीजों और यह क्यों हो सकता है कि आपको जरूरत है उस उपकरण के बारे में बात करेंगे। चाहे आप एक डिजाइनर, एक कलाकार हों या बस बहुत सारे शांत विचारों वाले कोई, आप इसे यहां रहना चाहेंगे। आइए शुरू करें।

डीएलएल-ई 3 के साथ नया क्या है कि यह संदर्भ को बहुत बेहतर तरीके से समझता है। पहले के संस्करण कुछ विशिष्ट विवरणों पर चूक सकते थे या यहां और वहां कुछ विवरणों को अनदेखा कर सकते थे, लेकिन डीएलएल-ई 3 बिंदु पर है। यह आपके द्वारा मांगे जा रहे विवरणों के बारीकियों को उठाता है, जिससे आपको वह छवि मिलती है जो आपके द्वारा कल्पना की गई थी।

शांत बात? डीएलएल-ई 3 और चैटजीपीटी अब एक साथ एकीकृत हैं। वे आपके विचारों को परिष्कृत करने में मदद करने के लिए एक साथ काम करते हैं। आप एक अवधारणा को निकालते हैं, चैटजीपीटी प्रॉम्प्ट को बारीक करने में मदद करता है, और डीएलएल-ई 3 इसे जीवन में लाता है। यदि आप छवि के प्रशंसक नहीं हैं, तो आप चैटजीपीटी से प्रॉम्प्ट को ट्वीक करने और डीएलएल-ई 3 को फिर से कोशिश करने के लिए कहते हैं। 20 डॉलर के मासिक शुल्क के लिए, आपको जीपीटी -4, डीएलएल-ई 3 और कई अन्य शांत विशेषताएं मिलती हैं।

माइक्रोसॉफ्ट के बिंग चैट ने डीएलएल-ई 3 को हासिल किया भी ओपनएआई के चैटजीपीटी से पहले, और अब यह केवल बड़े उद्यमों के लिए नहीं है, बल्कि हर किसी के लिए मुफ्त में खेलने के लिए है। बिंग चैट और बिंग इमेज क्रिएटर में एकीकरण इसे किसी के लिए भी उपयोग करना आसान बनाता है।

डिफ्यूजन मॉडल्स का उदय

पिछले 3 वर्षों में, दृष्टि एआई ने डिफ्यूजन मॉडल्स का उदय देखा है, जो विशेष रूप से छवि पीढ़ी में एक महत्वपूर्ण छलांग है। डिफ्यूजन मॉडल्स से पहले, जनरेटिव एडवर्सेरियल नेटवर्क (जीएएन) वास्तविक छवियों को जनरेट करने के लिए प्रौद्योगिकी थे।

GANs

GANs

हालांकि, उनके पास विशाल डेटा और गणनात्मक शक्ति की आवश्यकता जैसी अपनी चुनौतियां थीं, जो अक्सर उन्हें संभालना मुश्किल बना देती थीं।

डिफ्यूजन मॉडल्स का आगमन हुआ। वे जीएएन के लिए एक अधिक स्थिर और कुशल विकल्प के रूप में उभरे। जीएएन के विपरीत, डिफ्यूजन मॉडल्स डेटा में शोर जोड़कर काम करते हैं, इसे तब तक धुंधला करते हैं जब तक कि केवल यादृच्छिकता ही शेष न रह जाए। वे फिर इस प्रक्रिया को उल्टा करते हैं, शोर से अर्थपूर्ण डेटा का पुनर्निर्माण करते हैं। यह प्रक्रिया प्रभावी और कम संसाधन-गहन साबित हुई है, जिससे डिफ्यूजन मॉडल्स एआई समुदाय में एक गर्म विषय बन गए हैं।

वास्तविक मोड़ 2020 के आसपास आया, जब नवीन पapers और ओपनएआई की सीएलआईपी प्रौद्योगिकी की शुरुआत हुई, जिसने डिफ्यूजन मॉडल्स की क्षमताओं को काफी आगे बढ़ाया। इससे डिफ्यूजन मॉडल्स को टेक्स्ट-टू-इमेज सिंथेसिस में असाधारण रूप से अच्छा बनाया गया, जिससे वे वास्तविक छवियों को पाठ वर्णनों से जनरेट कर सकते थे। ये सफलता केवल छवि पीढ़ी में नहीं थी, बल्कि संगीत संरचना और जैव चिकित्सा अनुसंधान जैसे क्षेत्रों में भी थी।

आज, डिफ्यूजन मॉडल्स केवल अकादमिक रुचि का विषय नहीं हैं, बल्कि व्यावहारिक, वास्तविक दुनिया के दृश्यों में उपयोग किए जा रहे हैं।

जनरेटिव मॉडलिंग और स्व-ध्यान परतें: डीएलएल-ई 3

इस क्षेत्र में एक महत्वपूर्ण प्रगति जनरेटिव मॉडलिंग की प्रगति रही है, जिसमें सैंपल-आधारित दृष्टिकोण जैसे स्व-रेट्रोग्रेसिव जनरेटिव मॉडलिंग और डिफ्यूजन प्रक्रियाएं अग्रणी रही हैं। उन्होंने टेक्स्ट-टू-इमेज मॉडल्स में नाटकीय प्रदर्शन सुधार किया है। छवि पीढ़ी को विभाजित करके, इन मॉडल्स ने अधिक ट्रैक्टेबल और न्यूरल नेटवर्क के लिए सीखने में आसान बना दिया है।

स्व-ध्यान परतों का उपयोग समानांतर में एक महत्वपूर्ण भूमिका निभाई है। ये परतें, एक साथ ढेर की गई, छवियों को स्पष्ट स्थानिक पूर्वाग्रह की आवश्यकता के बिना उत्पन्न करने में मदद की है, जो कि संवolution के साथ एक सामान्य समस्या है। इस बदलाव ने टेक्स्ट-टू-इमेज मॉडल्स को स्केल और विश्वसनीय रूप से सुधारने की अनुमति दी है, ट्रांसफॉर्मर के स्केलिंग गुणों के कारण।

छवि पीढ़ी में चुनौतियां और समाधान

इन प्रगति के बावजूद, छवि पीढ़ी में नियंत्रण एक चुनौती बनी हुई है। प्रॉम्प्ट का पालन करने जैसे मुद्दे, जहां मॉडल इनपुट पाठ का सख्ती से पालन नहीं कर सकता है, व्यापक रहे हैं। इसे संबोधित करने के लिए, कैप्शन सुधार जैसे नए दृष्टिकोण प्रस्तावित किए गए हैं, जो प्रशिक्षण डेटासेट में टेक्स्ट और छवि जोड़े की गुणवत्ता में सुधार करने के लिए हैं।

कैप्शन सुधार: एक नई दृष्टि

कैप्शन सुधार छवियों के लिए बेहतर गुणवत्ता वाले कैप्शन उत्पन्न करने के बारे में है, जो बदले में अधिक सटीक टेक्स्ट-टू-इमेज मॉडल्स को प्रशिक्षित करने में मदद करता है। यह एक मजबूत छवि कैप्शनर के माध्यम से प्राप्त किया जाता है जो छवियों के विस्तृत और सटीक विवरण उत्पन्न करता है। सिंथेटिक कैप्शन पर प्रशिक्षण देने से डीएलएल-ई 3 ने उल्लेखनीय परिणाम प्राप्त किए हैं, जो मानव द्वारा उत्पादित फोटोग्राफ और कलाकृतियों के समान हैं।

सिंथेटिक डेटा पर प्रशिक्षण

सिंथेटिक डेटा पर प्रशिक्षण की अवधारणा नई नहीं है। हालांकि, यहां का अद्वितीय योगदान एक नए, विवरणात्मक छवि कैप्शनिंग सिस्टम का निर्माण है। सिंथेटिक कैप्शन का उपयोग जनरेटिव मॉडल्स को प्रशिक्षित करने में महत्वपूर्ण सुधार हुआ है, जिससे मॉडल की प्रॉम्प्ट का पालन करने की क्षमता में सुधार हुआ है।

डीएलएल-ई 3 का मूल्यांकन

पिछले मॉडल्स जैसे डीएलएल-ई 2 और स्टेबल डिफ्यूजन एक्सएल के साथ कई मूल्यांकन और तुलना के माध्यम से, डीएलएल-ई 3 ने प्रॉम्प्ट का पालन करने से संबंधित कार्यों में उत्कृष्ट प्रदर्शन प्रदर्शित किया है।

विभिन्न मूल्यांकन पर टेक्स्ट-टू-इमेज मॉडल्स की तुलना

विभिन्न मूल्यांकन पर टेक्स्ट-टू-इमेज मॉडल्स की तुलना

स्वचालित मूल्यांकन और बेंचमार्क का उपयोग करके इसकी क्षमताओं के स्पष्ट प्रमाण प्रदान किए गए हैं, जो इसे एक उत्कृष्ट टेक्स्ट-टू-इमेज जनरेटर के रूप में स्थापित करते हैं।

डीएलएल-ई 3 प्रॉम्प्ट और क्षमताएं

डीएलएल-ई 3 दृश्य बनाने के लिए एक अधिक तार्किक और परिष्कृत दृष्टिकोण प्रदान करता है। जैसे ही आप स्क्रॉल करते हैं, आप देखेंगे कि डीएलएल-ई 3 प्रत्येक छवि को कैसे बनाता है, जिसमें सटीकता और कल्पना का मिश्रण होता है जो दिए गए प्रॉम्प्ट के साथ प्रतिध्वनित होता है।

इसके पूर्ववर्ती के विपरीत, यह उन्नत संस्करण दृश्य में वस्तुओं को प्राकृतिक रूप से व्यवस्थित करने और मानव विशेषताओं को सटीक रूप से चित्रित करने में उत्कृष्ट है, हाथ पर सही संख्या में उंगलियों तक। सुधार विस्तृत विवरण तक भी फैले हुए हैं और अब उच्च रिज़ॉल्यूशन पर उपलब्ध हैं, जिससे एक अधिक वास्तविक और पेशेवर आउटपुट सुनिश्चित होता है।

पाठ रेंडरिंग क्षमताओं में भी महत्वपूर्ण सुधार हुआ है। जहां डीएलएल-ई के पिछले संस्करणों ने अक्षरों का अर्थहीन समूह उत्पन्न किया, डीएलएल-ई 3 अब व्यावसायिक शैली में पठनीय और अक्षरों का उत्पादन कर सकता है (कभी-कभी), और यहां तक कि लोगो को साफ-सुथरा बना सकता है।

जटिल और सूक्ष्म छवि अनुरोधों की समझ में मॉडल की क्षमता में काफी सुधार हुआ है। डीएलएल-ई 3 विस्तृत विवरण का पालन कर सकता है, यहां तक कि कई तत्वों और विशिष्ट निर्देशों वाले दृश्यों में, जो इसकी सुसंगत और संरचित छवियों को उत्पन्न करने की क्षमता को प्रदर्शित करता है। आइए कुछ प्रॉम्प्ट और हमें मिले आउटपुट का अन्वेषण करें:

एक जैविक चाय की पैकेजिंग का डिज़ाइन करें जिसमें उत्पाद का नाम और विवरण शामिल हो।

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां (नोट: बाएं पोस्टर में गलत वर्तनी है)

बाहरी फर्नीचर पर ग्रीष्मकालीन बिक्री के लिए एक वेब बैनर बनाएं। छवि में एक समुद्र तट सेटिंग के साथ विभिन्न बाहरी फर्नीचर के टुकड़े और 'बड़ी ग्रीष्मकालीन बचत!' की घोषणा वाला पाठ शामिल हो।

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पेरिस का एक पुराना यात्रा पोस्टर जिसमें नीचे 'पेरिस की यात्रा करें' कहा गया हो, जो बोल्ड और स्टाइलाइज्ड टेक्स्ट में हो।

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां (नोट: दोनों पोस्टर में गलत वर्तनी है)

भारत में दिवाली त्योहार का एक भीड़-भाड़ वाला दृश्य, जिसमें परिवार रोशनी जला रहे हैं, आसमान में आतिशबाजी हो रही है, और पारंपरिक मिठाइयां और सजावट हैं।
पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

प्राचीन रोम में एक विस्तृत बाजार, जिसमें लोग उस समय के अनुसार कपड़े पहने हुए हैं, विभिन्न सामान बिक्री के लिए हैं, और उस समय की वास्तुकला है।
पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

एक प्रसिद्ध ऐतिहासिक व्यक्ति, जैसे क्लियोपेट्रा या लियोनार्डो दा विंची, को एक समकालीन सेटिंग में रखें, जिसमें आधुनिक प्रौद्योगिकी जैसे स्मार्टफोन या लैपटॉप शामिल हैं।
पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

पाठ प्रॉम्प्ट पर डीएलएल-ई 3 छवियां

डीएलएल-ई 3 की सीमाएं और जोखिम

ओपनएआई ने डीएलएल-ई 3 के प्रशिक्षण डेटा से स्पष्ट सामग्री को फिल्टर करने के लिए महत्वपूर्ण कदम उठाए हैं, जिसका उद्देश्य पूर्वाग्रह को कम करना और मॉडल के आउटपुट में सुधार करना है। इसमें संवेदनशील सामग्री श्रेणियों के लिए विशिष्ट फिल्टर और व्यापक फिल्टर के लिए सीमा में बदलाव शामिल हैं। मिटिगेशन स्टैक में चैटजीपीटी में संवेदनशील विषयों के लिए इनकार तंत्र, प्रॉम्प्ट इनपुट वर्गीकरणकर्ता जो नीति उल्लंघनों को रोकते हैं, ब्लॉकलिस्ट विशिष्ट सामग्री श्रेणियों के लिए, और दिशानिर्देशों के अनुरूप प्रॉम्प्ट को संरेखित करने के लिए परिवर्तन शामिल हैं।

इसके बावजूद, डीएलएल-ई 3 में स्थानिक संबंधों को समझने, लंबे पाठ को सटीक रूप से प्रस्तुत करने और विशिष्ट छवियों को उत्पन्न करने में सीमाएं हैं। ओपनएआई इन चुनौतियों को स्वीकार करता है और भविष्य के संस्करणों में सुधार पर काम कर रहा है।

कंपनी एआई-जनरेटेड छवियों को मानव-निर्मित छवियों से अलग करने के तरीकों पर भी काम कर रही है, जो पारदर्शिता और जिम्मेदार एआई उपयोग के प्रति उनकी प्रतिबद्धता को प्रतिबिंबित करती है।

DALL·E 3

DALL·E 3

डीएलएल-ई 3, नवीनतम संस्करण, विशिष्ट ग्राहक समूहों के साथ चरणों में उपलब्ध होगा, और बाद में अनुसंधान प्रयोगशालाओं और एपीआई सेवाओं तक विस्तारित होगा। हालांकि, एक मुफ्त सार्वजनिक रिलीज़ तिथि अभी तक पुष्टि नहीं की गई है।

ओपनएआई वास्तव में एआई के क्षेत्र में एक नया मानक स्थापित कर रहा है डीएलएल-ई 3 के साथ, जटिशील तकनीकी क्षमताओं और उपयोगकर्ता-मित्र इंटरफेस को निर्बाध रूप से जोड़ रहा है। बिंग जैसे व्यापक रूप से उपयोग किए जाने वाले प्लेटफार्मों में डीएलएल-ई 3 का एकीकरण विशेष अनुप्रयोगों से अधिक व्यापक, अधिक सुलभ रूपों की ओर एक बदलाव को दर्शाता है।

आगामी वर्षों में वास्तविक खेल परिवर्तक नवाचार और उपयोगकर्ता सशक्तिकरण के बीच संतुलन होगा। कंपनियां जो पारंगत होंगी वे न केवल एआई की सीमाओं को आगे बढ़ाएंगी, बल्कि उपयोगकर्ताओं को वे स्वतंत्रता और नियंत्रण भी प्रदान करेंगी जिनकी वे इच्छा रखते हैं। ओपनएआई, नैतिक एआई के प्रति अपनी प्रतिबद्धता के साथ, इस पथ पर सावधानी से आगे बढ़ रहा है। लक्ष्य स्पष्ट है: ऐसे एआई टूल बनाना जो न केवल शक्तिशाली हों, बल्कि विश्वसनीय और समावेशी भी हों, यह सुनिश्चित करते हुए कि एआई के लाभ सभी के लिए सुलभ हों।

मैं पिछले पांच वर्षों से मशीन लर्निंग और डीप लर्निंग की दुनिया में खुद को डूबो रहा हूं। मेरा जुनून और विशेषज्ञता ने मुझे 50 से अधिक विविध सॉफ्टवेयर इंजीनियरिंग परियोजनाओं में योगदान देने के लिए प्रेरित किया है, जिनमें से अधिकांश में एआई/एमएल पर विशेष ध्यान केंद्रित किया गया है। मेरी जारी जिज्ञासा ने मुझे प्राकृतिक भाषा प्रसंस्करण की ओर आकर्षित किया है, जिस क्षेत्र को मैं आगे अन्वेषण करने के लिए उत्सुक हूं।