Anderson का एंगल
क्या DALL-E 2 केवल ‘चीजों को एक साथ चिपकाने’ के लिए है बिना उनके संबंधों को समझे?

हार्वर्ड विश्वविद्यालय के एक नए शोध पत्र से पता चलता है कि ओपनएआई के हेडलाइन-ग्रैबिंग टेक्स्ट-टू-इमेज फ्रेमवर्क DALL-E 2 में यहां तक कि शिशु-स्तरीय संबंधों को पुन: उत्पन्न करने में भी उल्लेखनीय कठिनाई है जो यह सिंथेसाइज्ड फोटो में रचता है, इसके उत्पादन की चमकदार जटिलता के बावजूद।
शोधकर्ताओं ने 169 क्राउडसोर्स्ड प्रतिभागियों के साथ एक उपयोगकर्ता अध्ययन किया, जिन्हें DALL-E 2 छवियों के साथ प्रस्तुत किया गया था जो मानव संबंध सेमांटिक्स के सबसे बुनियादी सिद्धांतों पर आधारित थीं, साथ ही उन्हें बनाने वाले पाठ-प्रोम्प्ट के साथ। जब उनसे पूछा गया कि क्या प्रोम्प्ट और छवियां संबंधित थीं, तो 22% से कम छवियों को उनके संबंधित प्रोम्प्ट के संबंध में प्रासंगिक माना जाता था, DALL-E 2 को जिन सरल संबंधों को दृश्य化 करने के लिए कहा गया था।

एक स्क्रीन-ग्रैब नए पत्र के लिए आयोजित परीक्षण से। प्रतिभागियों को प्रोम्प्ट से मेल खाने वाली सभी छवियों का चयन करने का काम सौंपा गया था। इंटरफ़ेस के नीचे दिखाए गए अस्वीकरण के बावजूद, सभी मामलों में छवियां, प्रतिभागियों को अज्ञात, वास्तव में प्रदर्शित प्रोम्प्ट से उत्पन्न हुई थीं। स्रोत: https://arxiv.org/pdf/2208.00005.pdf
परिणाम यह भी सुझाव देते हैं कि DALL-E की विभिन्न तत्वों को जोड़ने की स्पष्ट क्षमता कम हो सकती है क्योंकि वे वास्तविक दुनिया के प्रशिक्षण डेटा में होने की संभावना कम होती है जो प्रणाली को शक्ति प्रदान करती है।
उदाहरण के लिए, ‘बच्चा एक कटोरे को छूता है’ प्रोम्प्ट के लिए छवियों ने 87% समझौता दर प्राप्त की (अर्थात प्रतिभागियों ने प्रोम्प्ट से संबंधित होने के रूप में अधिकांश छवियों पर क्लिक किया), जबकि ‘एक बंदर एक इगुआना को छूता है’ के समान फोटोरियलिस्टिक रेंडर ने केवल 11% समझौता प्राप्त किया:

DALL-E असंभावित घटना ‘एक बंदर एक इगुआना को छूता है’ को चित्रित करने में संघर्ष करता है, संभवतः इसलिए कि यह प्रशिक्षण सेट में असामान्य है, अधिक संभावना नहीं है।
दूसरे उदाहरण में, DALL-E 2 अक्सर पैमाने और यहां तक कि प्रजाति को गलत प्राप्त करता है, संभवतः वास्तविक दुनिया की छवियों की कमी के कारण जो इस घटना को दर्शाती हैं। इसके विपरीत, यह उम्मीद करना उचित है कि बच्चों और भोजन से संबंधित प्रशिक्षण फोटो की एक उच्च संख्या होगी, और यह उप-डोमेन/क्लास अच्छी तरह से विकसित है।
DALL-E की विलक्षण रूप से विपरीत छवि तत्वों को जोड़ने में कठिनाई सुझाव देती है कि जनता वर्तमान में प्रणाली की फोटोरियलिस्टिक और व्यापक व्याख्यात्मक क्षमताओं से इतनी चकित है कि उन्होंने उन मामलों के लिए एक महत्वपूर्ण आंख विकसित नहीं की है जहां प्रणाली ने प्रभावी रूप से केवल एक तत्व को दूसरे पर चिपका दिया है, जैसे इन उदाहरणों में:
नया पत्र कहता है*:
‘संबंधित समझ मानव बुद्धिमत्ता का एक मूलभूत घटक है, जो विकास में शुरू होता है, और तेजी से और स्वचालित रूप से संज्ञान में गणना की जाती है।
‘DALL-E 2 की मूलभूत स्थानिक संबंधों (जैसे in, on, under) के साथ कठिनाई से पता चलता है कि जो कुछ भी यह सीखा है, उसने अभी तक उन प्रतिनिधित्वों को नहीं सीखा है जो मानव को इतनी लचीली और मजबूती से दुनिया को संरचित करने की अनुमति देते हैं।
‘एक सीधा व्याख्या इस कठिनाई का यह है कि DALL-E 2 जैसी प्रणालियों में संबंधित रचना नहीं है।’
लेखक सुझाव देते हैं कि पाठ-निर्देशित छवि पीढ़ी प्रणालियों जैसे DALL-E श्रृंखला रोबोटिक्स में सामान्य एल्गोरिदम का लाभ उठा सकती है, जो एक ही समय में पहचान और संबंधों का मॉडल बनाती है, क्योंकि एजेंट को वास्तव में पर्यावरण के साथ बातचीत करने की आवश्यकता होती है, न कि केवल विविध तत्वों का मिश्रण बनाने के लिए।
एक ऐसा दृष्टिकोण, जिसे CLIPort कहा जाता है, DALL-E 2 में गुणवत्ता मूल्यांकन तत्व के रूप में कार्य करने वाली同 एक CLIP तंत्र का उपयोग करता है:

CLIPort, वाशिंगटन विश्वविद्यालय और NVIDIA के बीच 2021 का सहयोग, CLIP का उपयोग एक ऐसे संदर्भ में करता है जो इतना व्यावहारिक है कि इस पर प्रशिक्षित प्रणालियों को आवश्यक रूप से भौतिक संबंधों की समझ विकसित करनी होगी, जो प्रेरक है जो DALL-E 2 और इसी तरह के ‘काल्पनिक’ छवि सिंथेसिस फ्रेमवर्क में अनुपस्थित है। स्रोत: https://arxiv.org/pdf/2109.12098.pdf
लेखक आगे सुझाव देते हैं कि ‘एक और संभावित अपग्रेड’ DALL-E जैसी छवि सिंथेसिस प्रणालियों के वास्तुकला में एक ही गणना परत में गुणात्मक प्रभावों को शामिल करना हो सकता है, जो जैविक प्रणालियों की जानकारी संसाधित करने की क्षमताओं से प्रेरित है:
नया पत्र शीर्षक है पाठ-निर्देशित छवि पीढ़ी में संबंधित समझ का परीक्षण, और हार्वर्ड विश्वविद्यालय के मनोविज्ञान विभाग के कोलिन कोनवेल और टॉमर डी। उलमैन से आता है।
प्रारंभिक आलोचना से परे
लेखक DALL-E 2 के आउटपुट की वास्तविकता और अखंडता के पीछे ‘जादू’ पर टिप्पणी करते हैं, पूर्व कार्यों का उल्लेख करते हैं जिन्होंने DALL-E शैली की जनरेटिव इमेज सिस्टम में कमियों को पाया है।
इस साल जून में, यूसी बर्कले नोट किया कि DALL-E प्रतिबिंब और छाया को संभालने में कठिनाई है; उसी महीने, कोरिया से एक अध्ययन ने DALL-E 2 शैली के आउटपुट की ‘अनोखापन’ और मौलिकता की एक महत्वपूर्ण आंख के साथ जांच की; DALL-E 2 छवियों की एक प्रारंभिक विश्लेषण, लॉन्च के तुरंत बाद, NYU और टेक्सास विश्वविद्यालय से, DALL-E 2 छवियों में रचनात्मकता और अन्य आवश्यक कारकों के साथ विभिन्न मुद्दों को पाया; और पिछले महीने, एक संयुक्त कार्य इलिनोइस विश्वविद्यालय और एमआईटी के बीच ऐसी प्रणालियों में रचनात्मकता के संदर्भ में वास्तुकला में सुधार के सुझाव दिए:
शोधकर्ता आगे बताते हैं कि DALL-E के प्रमुख व्यक्तियों जैसे आदित्य रामेश ने स्वीकार किया है कि फ्रेमवर्क को बंधन, सापेक्ष आकार, पाठ, और अन्य चुनौतियों के साथ समस्याएं हैं:
गूगल की प्रतिद्वंद्वी छवि सिंथेसिस प्रणाली इमेजन के पीछे डेवलपर्स ने DrawBench का प्रस्ताव दिया है, एक नई तुलना प्रणाली जो विभिन्न मेट्रिक्स के साथ फ्रेमवर्क में छवि सटीकता को मापती है:
इसके बजाय, नए पत्र के लेखक सुझाव देते हैं कि एक बेहतर परिणाम प्राप्त किया जा सकता है यदि मानव अनुमान – एल्गोरिदमिक मेट्रिक्स के बजाय – परिणामी छवियों के खिलाफ रखा जाए, तो कमजोरियों का पता लगाने और उन्हें दूर करने के लिए क्या किया जा सकता है:
अध्ययन
इस उद्देश्य के लिए, नए परियोजना का दृष्टिकोण मनोवैज्ञानिक सिद्धांतों पर आधारित है, और वर्तमान रुचि की लहर से पीछे हटने की मांग करता है प्रोम्प्ट इंजीनियरिंग में (जो वास्तव में DALL-E 2, या किसी भी तुलनीय प्रणाली की कमियों के लिए एक रियायत है), सीमाओं की जांच और संभावित रूप से उन्हें संबोधित करने के लिए:
पत्र कहता है:
‘वर्तमान कार्य 15 मूलभूत संबंधों के एक सेट पर केंद्रित है, जो पहले संज्ञानात्मक, विकासात्मक, या भाषाई साहित्य में वर्णित, जांचे गए, या प्रस्तावित किए गए हैं। सेट में दोनों आधारित स्थानिक संबंध (जैसे ‘X पर Y’) और अधिक अमूर्त एजेंटिक संबंध (जैसे ‘X मदद Y’) शामिल हैं।
‘प्रोम्प्ट जानबूझकर सरल हैं, बिना विशेषता जटिलता या विस्तार के। अर्थात्, ‘एक गधा और एक ऑक्टोपस एक खेल खेल रहे हैं। गधा एक रस्सी के एक सिरे को पकड़ रहा है, ऑक्टोपस दूसरे सिरे को पकड़ रहा है। गधा अपने मुंह में रस्सी पकड़ रहा है। एक बिल्ली रस्सी पर कूद रही है’ जैसे प्रोम्प्ट के बजाय, हम ‘एक बॉक्स एक चाकू पर’ का उपयोग करते हैं।
‘सरलता अभी भी मानव मनोविज्ञान के विभिन्न उपडोमेन से संबंधों की एक विस्तृत श्रृंखला को पकड़ती है, और संभावित मॉडल विफलताओं को अधिक हड़ताली और विशिष्ट बनाती है।’
अपने अध्ययन के लिए, लेखकों ने 169 प्रतिभागियों को प्रोलिफिक से भर्ती किया, सभी संयुक्त राज्य अमेरिका में स्थित, 33 की औसत आयु के साथ, और 59% महिलाएं।
प्रतिभागियों को 18 छवियों को एक 3×6 ग्रिड में व्यवस्थित किया गया था, जिसमें शीर्ष पर प्रोम्प्ट और नीचे एक अस्वीकरण था, जिसमें कहा गया था कि सभी छवियां, कुछ या कोई भी प्रदर्शित प्रोम्प्ट से उत्पन्न हो सकती हैं, और फिर उन्हें इस तरह से संबंधित छवियों का चयन करने के लिए कहा गया था:
व्यक्तियों को दिखाई गई छवियां भाषाई, विकासात्मक और संज्ञानात्मक साहित्य पर आधारित थीं, जिसमें आठ शारीरिक और सात ‘एजेंटिक’ संबंध शामिल थे (यह एक पल में स्पष्ट हो जाएगा):
भौतिक संबंध
में, पर, नीचे, ढका, निकट, द्वारा ढका हुआ, लटका हुआ, और से जुड़ा हुआ.
एजेंटिक संबंध
धक्का दे रहा है, खींच रहा है, छू रहा है, मार रहा है, लात मार रहा है, मदद कर रहा है, और बाधा डाल रहा है.
इन सभी संबंधों को पहले उल्लिखित गैर-सीएस क्षेत्रों से लिया गया है।
इस प्रयोजन के लिए, बारह इकाइयों को प्रोम्प्ट में उपयोग के लिए व्युत्पन्न किया गया था, जिसमें छह वस्तुएं और छह एजेंट शामिल थे:
वस्तुएं
बॉक्स, सिलेंडर, कंबल, कटोरा, चाय का कप, और चाकू.
एजेंट
व्यक्ति, महिला, बच्चा, रोबोट, बंदर, और इगुआना.
(शोधकर्ता स्वीकार करते हैं कि इगुआना को शामिल करना, जो सामाजिक या मनोवैज्ञानिक अनुसंधान का मुख्य आधार नहीं है, ‘एक इलाज’ था)
प्रत्येक संबंध के लिए, पांच अलग-अलग प्रोम्प्ट बनाए गए थे जो दो इकाइयों को पांच बार यादृच्छिक रूप से नमूना लेते थे, जिसके परिणामस्वरूप 75 कुल प्रोम्प्ट होते थे, प्रत्येक को DALL-E 2 में जमा किया जाता था, और प्रत्येक के लिए जो 18 प्रारंभिक छवियां प्रदान की जाती थीं, कोई भी परिवर्तन या दूसरा मौका नहीं दिया जाता था:
परिणाम
पत्र कहता है*:
‘प्रतिभागियों ने DALL-E 2 की छवियों और उनके द्वारा उत्पन्न प्रोम्प्ट के बीच एक कम समझौता दर की सूचना दी, 75 अलग-अलग प्रोम्प्ट में 22.2% [18.3, 26.6] की औसत।
‘एजेंटिक प्रोम्प्ट, 35 प्रोम्प्ट में 28.4% [22.8, 34.2] की औसत के साथ, शारीरिक प्रोम्प्ट की तुलना में अधिक समझौता उत्पन्न किया, जो 40 प्रोम्प्ट में 16.9% [11.9, 23.0] की औसत थी।’

अध्ययन के परिणाम। ब्लैक में बिंदु सभी प्रोम्प्ट को दर्शाते हैं, प्रत्येक बिंदु एक व्यक्तिगत प्रोम्प्ट है, और रंग यह बताता है कि प्रोम्प्ट विषय एजेंटिक या शारीरिक (अर्थात वस्तु) था या नहीं।
मानव और एल्गोरिदमिक धारणा के बीच अंतर की तुलना करने के लिए, शोधकर्ताओं ने अपने रेंडर को ओपनएआई के ओपन-सोर्स ViT-L/14 CLIP-आधारित फ्रेमवर्क के माध्यम से चलाया। स्कोर को औसत करने पर, उन्होंने दोनों परिणामों के बीच एक ‘मध्यम संबंध’ पाया, जो शायद आश्चर्यजनक है, यह देखते हुए कि CLIP खुद छवियों को उत्पन्न करने में मदद करता है:

मानव प्रतिक्रियाओं के खिलाफ CLIP (ViT-L/14) की तुलना के परिणाम।
शोधकर्ता सुझाव देते हैं कि वास्तुकला में अन्य तंत्र, शायद प्रशिक्षण सेट में डेटा की एक होने की अधिकता (या इसकी कमी) के साथ मिलकर, यह समझा सकते हैं कि CLIP DALL-E की सीमाओं को पहचान सकता है, लेकिन हर मामले में समस्या के बारे में बहुत कुछ नहीं कर सकता है:
लेखक निष्कर्ष निकालते हैं कि DALL-E 2 के पास केवल एक कल्पनात्मक सुविधा है, यदि कोई है, तो संबंधित समझ को पुन: उत्पन्न करने के लिए, जो मानव बुद्धिमत्ता का एक मूलभूत पहलू है जो हमारे लिए बहुत जल्दी विकसित होता है।
‘यह धारणा कि DALL-E 2 जैसी प्रणालियों में रचनात्मकता नहीं है, किसी के लिए भी आश्चर्य की बात हो सकती है जिसने DALL-E 2 के प्रोम्प्ट जैसे ‘एक कार्टून बेबी दाइकॉन रेडिश एक ट्यूटू में एक पूडल को चला रहा है’ के लिए उत्तरदायित्वपूर्ण प्रतिक्रियाओं को देखा है। ऐसे प्रोम्प्ट अक्सर एक संवेदनशील अनुमान उत्पन्न करते हैं जिसमें प्रोम्प्ट के सभी भाग मौजूद होते हैं, और सही स्थानों पर मौजूद होते हैं।
‘हालांकि, रचनात्मकता केवल चीजों को एक साथ चिपकाना नहीं है – यहां तक कि चीजें जो आप पहले एक साथ नहीं देखी हों। रचनात्मकता को उन नियमों की समझ की आवश्यकता होती है जो चीजों को एक साथ बांधते हैं। संबंध ऐसे नियम हैं। ‘
मैन बाइट्स टी-रेक्स
राय ओपनएआई के DALL-E 2 को अधिक उपयोगकर्ताओं के लिए खोलने के बाद, हाल ही में इसके बीटा मोनेटाइजेशन के बाद, और चूंकि अब आपको अधिकांश पीढ़ियों के लिए भुगतान करना होगा, DALL-E 2 की संबंधित समझ में कमियां अधिक स्पष्ट हो सकती हैं क्योंकि प्रत्येक ‘विफल’ प्रयास में एक वित्तीय भार होता है, और रिफंड उपलब्ध नहीं हैं:
जिन लोगों को थोड़ा पहले आमंत्रित किया गया था, उन्हें प्रणाली के साथ खेलने के लिए समय (और, हाल ही में, अधिक अवकाश) मिला है, और उन्होंने DALL-E 2 द्वारा उत्पन्न कुछ ‘संबंध ग्लिच’ देखे हैं:
उदाहरण के लिए, जुरासिक पार्क के प्रशंसक के लिए, यह DALL-E 2 में एक डायनासोर को एक व्यक्ति का पीछा करने के लिए प्राप्त करना बहुत मुश्किल है, भले ही ‘पीछा करने’ की अवधारणा DALL-E 2 के सेंसरशिप प्रणाली में नहीं लगती है, और भले ही डायनासोर फिल्मों का लंबा इतिहास इस अन्यथा असंभव मिलन के लिए पर्याप्त प्रशिक्षण उदाहरण प्रदान करना चाहिए (कम से कम ट्रेलर और प्रचार शॉट्स के रूप में):

DALL-E 2 के लिए ‘एक रंगीन फोटो एक टी-रेक्स एक आदमी को सड़क पर नीचे चला रहा है’ प्रोम्प्ट का एक विशिष्ट प्रतिक्रिया। स्रोत: DALL-E 2
मैंने पाया है कि ऊपर दी गई छवियां ‘[डायनासोर] [एक व्यक्ति] का पीछा करने’ जैसे प्रोम्प्ट डिज़ाइन के लिए विशिष्ट हैं, और प्रोम्प्ट में कोई भी विस्तार इसे टी-रेक्स को वास्तव में पीछा करने के लिए नहीं मिल सकता है। पहली और दूसरी तस्वीरों में, आदमी (मोटे तौर पर) टी-रेक्स का पीछा कर रहा है; तीसरी में, वह इसके पास सुरक्षा के प्रति असावधानी से पहुंच रहा है; और अंतिम छवि में, वह इसके साथ समानांतर दौड़ रहा है। इस विषय पर लगभग 10-15 प्रयासों में, मैंने पाया है कि डायनासोर समान रूप से ‘विचलित’ है:
यह हो सकता है कि DALL-E 2 को जो एकमात्र प्रशिक्षण डेटा मिल सकता था वह ‘मैन फाइट्स डायनासोर’ की तरह था, जो पुरानी फिल्मों जैसे वन मिलियन ईयर्स बी.सी. (1966) के लिए प्रचार शॉट्स से आया था, और जेफ गोल्डब्लम का प्रसिद्ध उड़ान शाही शिकारी से बस उस छोटे से डेटा में एक अपवाद है:
* लेखकों के इनलाइन उद्धरणों को हाइपरलिंक में बदलने का मेरा रूपांतरण।
पहली बार 4 अगस्त 2022 को प्रकाशित।














