Anderson का एंगल

कंप्यूटर विजन साहित्य रुझानों पर एक व्यक्तिगत दृष्टिकोण 2024

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
ChatGPT image: 'A panoramic orthographic-view image of a stylized bunch of SIMs-style scientists working in white coats at a computer research laboratory. Ariel view, orthographic projection, stylized, cartoon-style.'

मैं पिछले पांच वर्षों से आर्क्सिव और अन्य स्थानों पर कंप्यूटर विजन (सीवी) और इमेज सिंथेसिस अनुसंधान दृश्य का अनुसरण कर रहा हूं, इसलिए समय के साथ रुझान स्पष्ट हो जाते हैं और वे हर साल नए दिशाओं में बदल जाते हैं।

इसलिए, 2024 के अंत में, मैंने कंप्यूटर विजन और पैटर्न रिकग्निशन सेक्शन में आर्क्सिव सबमिशन में कुछ नए या विकसित होने वाले विशेषताओं पर एक नज़र डालने के लिए सोचा। ये अवलोकन, जो सैकड़ों घंटों के अध्ययन से सूचित हैं, सख्ती से अनुभवजन्य हैं।

पूर्वी एशिया का निरंतर उदय

2023 के अंत तक, मैंने देखा था कि ‘वॉइस सिंथेसिस’ श्रेणी में साहित्य का अधिकांश भाग चीन और पूर्वी एशिया के अन्य क्षेत्रों से आ रहा था। 2024 के अंत में, मुझे (अनुभवजन्य रूप से) यह देखना होगा कि यह अब छवि और वीडियो सिंथेसिस अनुसंधान दृश्य पर भी लागू होता है।

इसका मतलब यह नहीं है कि चीन और आसपास के देश हमेशा सबसे अच्छा काम कर रहे हैं (वास्तव में, इसके विपरीत साक्ष्य हैं); न ही यह इस बात का ध्यान रखता है कि चीन में (पश्चिम में भी) कुछ सबसे दिलचस्प और शक्तिशाली नए विकसित होने वाले सिस्टम प्रोप्राइटरी हैं और शोध साहित्य से बाहर रखे गए हैं।

लेकिन यह सुझाव देता है कि पूर्वी एशिया इस मामले में पश्चिम को मात दे रहा है। इसका क्या मतलब है यह इस बात पर निर्भर करता है कि आप एडिसन-शैली की दृढ़ता में कितना विश्वास करते हैं, जो आमतौर पर अदूरदर्शी बाधाओं के सामने अप्रभावी साबित होता है।

जनरेटिव एआई में कई ऐसी रुकावटें हैं, और यह जानना मुश्किल है कि कौन सी मौजूदा वास्तुकला को संबोधित करके हल की जा सकती है, और कौन सी शून्य से पुनर्विचार करने की आवश्यकता है।

हालांकि पूर्वी एशिया के शोधकर्ता कंप्यूटर विजन पेपर की एक बड़ी संख्या का उत्पादन कर रहे हैं, मैंने ‘फ्रैंकस्टीन’-शैली की परियोजनाओं की आवृत्ति में वृद्धि देखी है – पहले के काम का मेल, जबकि सीमित वास्तुशिल्प नवाचार (या शायद केवल एक अलग प्रकार के डेटा) जोड़ रहे हैं।

इस वर्ष एक बहुत बड़ी संख्या में पूर्वी एशियाई (मुख्य रूप से चीनी या चीनी सहयोग) प्रविष्टियां मेरे ध्यान में आईं जो योग्यता-संचालित की तुलना में कोटा-संचालित थीं, जो पहले से ही अति-संचालित क्षेत्र में सिग्नल-टू-शोर अनुपात को काफी बढ़ा रही थीं।

एक ही समय में, 2024 में पूर्वी एशियाई पेपरों की एक बड़ी संख्या ने मेरा ध्यान और प्रशंसा आकर्षित की है। इसलिए, यदि यह सभी एक संख्या का खेल है, तो यह विफल नहीं हो रहा है – लेकिन न ही यह सस्ता है।

सबमिशन की बढ़ती मात्रा

पेपरों की मात्रा, सभी मूल देशों में, 2024 में विशेष रूप से बढ़ी है।

सबसे लोकप्रिय प्रकाशन दिन पूरे वर्ष में बदलता रहता है; वर्तमान में यह मंगलवार है, जब कंप्यूटर विजन और पैटर्न रिकग्निशन अनुभाग में सबमिशन की संख्या अक्सर 300-350 के आसपास होती है, एक दिन में ‘पीक’ अवधि (मई-अगस्त और अक्टूबर-दिसंबर, अर्थात सम्मेलन का मौसम और ‘वार्षिक कोटा डेडलाइन’ का मौसम, क्रमशः)।

मेरे अपने अनुभव से परे, आर्क्सिव खुद नवंबर 2024 में मासिक सबमिशन के लिए एक नया रिकॉर्ड रिपोर्ट करता है, जिसमें 6000 कुल नए सबमिशन हैं, और कंप्यूटर विजन अनुभाग मशीन लर्निंग के बाद दूसरा सबसे अधिक जमा किया गया अनुभाग है।

हालांकि, चूंकि आर्क्सिव में मशीन लर्निंग अनुभाग अक्सर एक ‘अतिरिक्त’ या समग्र सुपर-श्रेणी के रूप में उपयोग किया जाता है, यह तर्क देता है कि कंप्यूटर विजन और पैटर्न रिकग्निशन वास्तव में सबसे अधिक जमा किया गया आर्क्सिव श्रेणी है।

आर्क्सिव की स्वयं की सांख्यिकी निश्चित रूप से कंप्यूटर विज्ञान को जमा करने वाले नेता के रूप में चित्रित करती है:

कंप्यूटर साइंस (सीएस) पिछले पांच वर्षों में आर्क्सिव में जमा करने वालों की सांख्यिकी को बढ़ाता है। स्रोत: https://info.arxiv.org/about/reports/submission_category_by_year.html

कंप्यूटर साइंस (सीएस) पिछले पांच वर्षों में आर्क्सिव में जमा करने वालों की सांख्यिकी को बढ़ाता है। स्रोत: https://info.arxiv.org/about/reports/submission_category_by_year.html

स्टैनफोर्ड विश्वविद्यालय की 2024 एआई इंडेक्स, हालांकि हाल के आंकड़ों की रिपोर्ट करने में सक्षम नहीं है, मशीन लर्निंग के आसपास अकादमिक पेपरों की जमा करने की वृद्धि पर भी जोर देता है:

आंकड़े उपलब्ध नहीं होने के बावजूद, स्टैनफोर्ड की रिपोर्ट मशीन लर्निंग पेपरों के लिए जमा करने की मात्रा में वृद्धि को नाटकीय रूप से दिखाती है।

आंकड़े उपलब्ध नहीं होने के बावजूद, स्टैनफोर्ड की रिपोर्ट मशीन लर्निंग पेपरों के लिए जमा करने की मात्रा में वृद्धि को नाटकीय रूप से दिखाती है। स्रोत: https://aiindex.stanford.edu/wp-content/uploads/2024/04/HAI_AI-Index-Report-2024_Chapter1.pdf

डिफ्यूजन>मेश फ्रेमवर्क का प्रसार

एक और स्पष्ट रुझान जो मेरे लिए सामने आया था वह लेटेंट डिफ्यूजन मॉडल (एलडीएम) का लाभ उठाने वाले पेपरों में एक बड़ा उछाल था, जो ‘पारंपरिक’ सीजीआई मॉडल के जनरेटर के रूप में कार्य करते हैं।

इन परियोजनाओं में टेंसेंट का इंस्टेंटमेश3डी, 3डीटोपिया, डिफ्यूजन2, वी3डी, एमवीईडिट, और जीआईएमडिफ्यूजन शामिल हैं, साथ ही कई अन्य समान प्रस्ताव हैं।

3डीटोपिया में एक डिफ्यूजन-आधारित प्रक्रिया के माध्यम से मेश जेनरेशन और रिफाइनमेंट। स्रोत: https://arxiv.org/pdf/2403.02234

3डीटोपिया में एक डिफ्यूजन-आधारित प्रक्रिया के माध्यम से मेश जेनरेशन और रिफाइनमेंट। स्रोत: https://arxiv.org/pdf/2403.02234

यह उभरता हुआ शोध क्षेत्र डिफ्यूजन मॉडल जैसी जनरेटिव सिस्टम की चल रही दुर्गमता के प्रति एक स्पष्ट स्वीकृति के रूप में लिया जा सकता है, जो केवल दो साल पहले सभी सिस्टम के संभावित विकल्प के रूप में प्रचारित किए जा रहे थे जो अब डिफ्यूजन>मेश मॉडल खोजने की कोशिश कर रहे हैं; डिफ्यूजन को प्रौद्योगिकियों और कार्य प्रवाह में एक उपकरण की भूमिका में कम करना जो तीस या अधिक वर्ष पूर्व के हैं।

स्टेबिलिटी.एआई, ओपन सोर्स स्टेबल डिफ्यूजन मॉडल के मूल, ने हाल ही में स्टेबल जीरो123 जारी किया है, जो अन्य बातों के अलावा, एक न्यूरल रेडियंस फील्ड (एनआरएफ) की व्याख्या का उपयोग कर सकता है। एक एआई-जनरेटेड छवि के रूप में एक पुल के रूप में एक स्पष्ट, मेश-आधारित सीजीआई मॉडल बनाने के लिए जो यूनिटी, वीडियो गेम, ऑगमेंटेड रियलिटी और अन्य प्लेटफार्मों में उपयोग किया जा सकता है जो स्पष्ट 3डी निर्देशांक की आवश्यकता होती है, जो निरंतर कार्य के अंतर्निहित (छिपे हुए) निर्देशांक के विपरीत है।

प्ले करने के लिए क्लिक करें। स्टेबल डिफ्यूजन में उत्पन्न छवियों को तर्कसंगत सीजीआई मेश में परिवर्तित किया जा सकता है। यहां हम स्टेबल जीरो 123 का उपयोग करके एक छवि>सीजीआई कार्य प्रवाह का परिणाम देख सकते हैं। स्रोत: https://www.youtube.com/watch?v=RxsssDD48Xc

3डी सेमेंटिक्स

जनरेटिव एआई स्पेस 2डी और 3डी सिस्टम कार्यान्वयन के बीच विजन और जनरेटिव सिस्टम के बीच एक अंतर करता है। उदाहरण के लिए, फेसियल लैंडमार्किंग फ्रेमवर्क, हालांकि 3डी वस्तुओं (चेहरों) का प्रतिनिधित्व करते हैं, सभी मामलों में संबोधित 3डी निर्देशांक की गणना नहीं करते हैं।

लोकप्रिय फैनअलाइन सिस्टम, जो 2017-युग के डीपफेक आर्किटेक्चर (अन्य लोगों के बीच) में व्यापक रूप से उपयोग किया जाता है, दोनों दृष्टिकोणों को समायोजित कर सकता है:

उपर, 2डी लैंडमार्क को केवल मान्यता प्राप्त चेहरे की रेखाओं और विशेषताओं के आधार पर उत्पन्न किया जाता है। नीचे, वे 3डी एक्स/वाई/जेड स्पेस में तर्कसंगत हैं। स्रोत: https://github.com/1adrianb/face-alignment

उपर, 2डी लैंडमार्क को केवल मान्यता प्राप्त चेहरे की रेखाओं और विशेषताओं के आधार पर उत्पन्न किया जाता है। नीचे, वे 3डी एक्स/वाई/जेड स्पेस में तर्कसंगत हैं। स्रोत: https://github.com/1adrianb/face-alignment

तो जैसे ‘डीपफेक’ एक अस्पष्ट और हाईजैक्ड शब्द बन गया है, ‘3डी’ ने भी कंप्यूटर विजन अनुसंधान में एक भ्रमित करने वाला शब्द बना दिया है।

उपभोक्ताओं के लिए, यह आमतौर पर स्टीरियो-सक्षम मीडिया (जैसे मूवी जहां दर्शक को विशेष चश्मा पहनने की आवश्यकता होती है) का संकेत देता है; दृश्य प्रभाव व्यावहारिक और मॉडलर के लिए, यह 2डी कला (जैसे कॉन्सेप्ट स्केच) और मेश-आधारित मॉडल के बीच अंतर को दर्शाता है जो माया या सिनेमा4डी जैसे ‘3डी प्रोग्राम’ में मैनिप्युलेट किया जा सकता है।

लेकिन कंप्यूटर विजन में, यह просто इतना है कि मॉडल के कार्टेशियन निर्देशांक प्रणाली में कहीं लेटेंट स्पेस में मौजूद है – न कि यह सीधे तौर पर उपयोगकर्ता द्वारा संबोधित या मैनिप्युलेट किया जा सकता है; कम से कम, तीसरे पक्ष के व्याख्यात्मक सीजीआई-आधारित सिस्टम जैसे 3डीएमएम या फ्लेम के बिना।

इसलिए, डिफ्यूजन>3डी की धारणा अस्पष्ट है; न केवल किसी भी प्रकार की छवि (एक वास्तविक फोटो सहित) का उपयोग एक जनरेटिव सीजीआई मॉडल का उत्पादन करने के लिए इनपुट के रूप में किया जा सकता है, लेकिन ‘मेश’ शब्द अधिक उपयुक्त है।

हालांकि, इस अस्पष्टता को जोड़ने के लिए, डिफ्यूजन है अधिकांश उभरती परियोजनाओं में स्रोत फोटो को मेश में व्याख्या करने के लिए आवश्यक है। इसलिए, एक बेहतर विवरण इमेज-टू-मेश हो सकता है, जबकि इमेज>डिफ्यूजन>मेश एक और भी सटीक विवरण है।

लेकिन यह एक बोर्ड बैठक में या निवेशकों को आकर्षित करने के लिए डिज़ाइन किए गए प्रचार विज्ञप्ति में एक कठिन बिक्री है।

वास्तुशिल्प रुकावटों के साक्ष्य

पिछले 12 महीनों के पेपरों की फसल, 2023 की तुलना में, डिफ्यूजन-आधारित पीढ़ी पर हार्ड व्यावहारिक सीमाओं को हटाने के लिए एक बढ़ती हताशा प्रदर्शित करती है।

मुख्य रुकावट अभी भी समय-समय पर और कथात्मक रूप से संगत वीडियो का उत्पादन करना है, और विभिन्न वीडियो क्लिप और एक ही उत्पन्न वीडियो क्लिप के दौरान पात्रों और वस्तुओं की उपस्थिति को बनाए रखना है।

डिफ्यूजन-आधारित सिंथेसिस में अंतिम युगल नवाचार लोरा का 2022 में आगमन था। जबकि नए सिस्टम जैसे फ्लक्स ने कुछ आउटलायर समस्याओं में सुधार किया है, जैसे कि स्टेबल डिफ्यूजन की पूर्व असमर्थता उत्पन्न छवि के अंदर टेक्स्ट सामग्री को पुन: उत्पन्न करने के लिए, और समग्र छवि गुणवत्ता में सुधार हुआ है, मैंने 2024 में अध्ययन किए गए अधिकांश पेपर मूल रूप से खाने की मेज पर भोजन को स्थानांतरित कर रहे थे।

ये रुकावटें पहले हो चुकी हैं, जेनरेटिव एडवर्सेरियल नेटवर्क (जीएन) और न्यूरल रेडियंस फील्ड (एनआरएफ) के साथ, जो दोनों अपनी पहली संभावित क्षमता पर खरे नहीं उतरे और दोनों को अब अधिक पारंपरिक प्रणालियों में अधिक से अधिक उपयोग किया जा रहा है (जैसे कि एनआरएफ का उपयोग स्टेबल जीरो 123 में ऊपर देखा गया है)। यह डिफ्यूजन मॉडल के साथ भी हो रहा है।

गॉसियन स्प्लैटिंग अनुसंधान पिवोट्स

यह 2023 के अंत में ऐसा लगता था कि रास्टरीकरण विधि 3डी गॉसियन स्प्लैटिंग (3डीजीएस), जो 1990 के दशक की शुरुआत में एक चिकित्सा इमेजिंग तकनीक के रूप में शुरू हुई थी, मानव छवि सिंथेसिस चुनौतियों (जैसे कि चेहरे की नकल और पुनर्निर्माण, साथ ही पहचान स्थानांतरण) में ऑटोएनकोडर-आधारित प्रणालियों को पार करने वाली थी।

2023 के एएसएच पेपर ने पूर्ण-शरीर 3डीजीएस मानव का वादा किया था, जबकि गॉसियन अवतार ने बड़े पैमाने पर विस्तार से सुधार किया (अन्य प्रतिस्पर्धी विधियों की तुलना में), साथ ही प्रभावशाली क्रॉस-रीनैक्टमेंट की पेशकश की।

हालांकि, इस वर्ष, 3डीजीएस मानव सिंथेसिस के लिए इस तरह के किसी भी प्रकार के सफलता के क्षण बहुत कम थे; अधिकांश पेपर जो इस समस्या का सामना करते थे या तो उपरोक्त कार्यों से व्युत्पन्न थे या उनकी क्षमताओं से अधिक नहीं थे।

इसके बजाय, 3डीजीएस पर जोर इसकी मूल वास्तुशिल्प व्यवहार्यता में सुधार पर केंद्रित था, जिससे 3डीजीएस बाहरी वातावरण में सुधार पर ध्यान केंद्रित करने वाले पेपरों की एक लहर पैदा हुई। विशेष ध्यान सिमुल्टेनियस लोकलाइजेशन एंड मैपिंग (एसएलएएम) 3डीजीएस दृष्टिकोणों पर दिया गया था, जैसे कि गॉसियन स्प्लैटिंग एसएलएएम, स्प्लैट-एसएलएएम, गॉसियन-एसएलएएम, ड्रॉइड-स्प्लैट, अन्य लोगों के बीच में।

जिन परियोजनाओं ने स्प्लैट-आधारित मानव सिंथेसिस को जारी रखने या विस्तारित करने का प्रयास किया, उनमें एमआईजीएस, जेम, ईवीए, ओसीसफ्यूजन, एफएजीहेड, ह्यूमनस्प्लैट, जीजीहेड, एचजीएम, और टोपो4डी शामिल हैं। हालांकि इसके अलावा अन्य हैं, कोई भी इन प्रकार के प्रभाव को प्राप्त नहीं करता है पेपर जो 2023 के अंत में सामने आए थे।

परीक्षण नमूनों का ‘वीनस्टीन युग’ धीरे-धीरे गिरावट में है

दक्षिण पूर्व एशिया से शोध, विशेष रूप से चीन से, अक्सर परीक्षण उदाहरणों की विशेषता है जो एक समीक्षा लेख में पुन: प्रकाशित करने के लिए समस्याग्रस्त हैं क्योंकि वे सामग्री की विशेषता है जो थोड़ी ‘मसालेदार’ है।

यह बहस का विषय है कि क्या यह इसलिए है क्योंकि उस क्षेत्र में शोध वैज्ञानिक अपने आउटपुट के लिए ध्यान आकर्षित करने की कोशिश कर रहे हैं; लेकिन पिछले 18 महीनों में, जनरेटिव एआई (छवि और/या वीडियो) के आसपास एक बढ़ती संख्या में पेपरों ने युवा और कम कपड़ों वाली महिलाओं और लड़कियों को परियोजना के उदाहरणों के रूप में डिफ़ॉल्ट किया है।

सीमा रेखा एनएसएफडब्ल्यू उदाहरणों में शामिल हैं यूनिएनिमेट, कंट्रोलनेक्स्ट, और यहां तक कि बहुत ‘सूखे’ पेपर जैसे मोशन कंसिस्टेंसी का मूल्यांकन फ्रेचेट वीडियो मोशन दूरी द्वारा (एफवीएमडी)।

यह लेटेंट डिफ्यूजन मॉडल (एलडीएम) के आसपास एकत्रित समुदायों के सामान्य रुझानों का अनुसरण करता है, जहां नियम 34 अभी भी बहुत प्रभावी है।

सेलिब्रिटी फेस-ऑफ

यह प्रकार के अनुचित उदाहरण सेलिब्रिटी समानता का शोषण नहीं करने वाले एआई प्रक्रियाओं की बढ़ती मान्यता के साथ ओवरलैप करते हैं – विशेष रूप से, उन अध्ययनों में जो सेलिब्रिटी की समानता का उपयोग करते हैं जो अक्सर महिलाएं होती हैं और उन्हें संदेहास्पद संदर्भों में रखती हैं।

एक उदाहरण एंडीड्रेसिंग है, जो न केवल बहुत कम उम्र की एनीमे शैली की महिला पात्रों की विशेषता है, बल्कि मैरिलिन मोनरो जैसी क्लासिक सेलिब्रिटी और एन हैथवे जैसी वर्तमान सेलिब्रिटी की पहचान का भी स्वतंत्र रूप से उपयोग करता है, जिन्होंने इस तरह के उपयोग की निंदा की है

दक्षिण पूर्व एशिया से पेपर में वर्तमान और 'क्लासिक' सेलिब्रिटी का स्वतंत्र रूप से उपयोग अभी भी आम है, हालांकि यह प्रथा धीरे-धीरे गिरावट में है। स्रोत: https://crayon-shinchan.github.io/AnyDressing/

दक्षिण पूर्व एशिया से पेपर में वर्तमान और ‘क्लासिक’ सेलिब्रिटी का स्वतंत्र रूप से उपयोग अभी भी आम है, हालांकि यह प्रथा धीरे-धीरे गिरावट में है। स्रोत: https://crayon-shinchan.github.io/AnyDressing/

पश्चिमी पेपर में, यह विशेष अभ्यास 2024 के दौरान गिरावट में है, जिसे एफएएएनजी और अन्य उच्च स्तरीय शोध निकायों जैसे ओपनएआई से बड़े रिलीज़ द्वारा नेतृत्व किया जा रहा है। भविष्य के मुकदमेबाजी की संभावना से जागरूक, ये बड़े कॉर्पोरेट खिलाड़ी अब यहां तक कि काल्पनिक फोटोरियलिस्टिक लोगों का प्रतिनिधित्व करने के लिए भी अधिक अनिच्छुक प्रतीत होते हैं।

हालांकि वे प्रणालियां जो वे बना रहे हैं (जैसे इमेजन और वियो2) स्पष्ट रूप से ऐसा आउटपुट उत्पन्न करने में सक्षम हैं, उदाहरण जो पश्चिमी जनरेटिव एआई परियोजनाओं से अब रुझान ‘क्यूट’, डिज़नीफाइड और बेहद ‘सुरक्षित’ छवियों और वीडियो की ओर हैं।

इमेजन की क्षमता को 'फोटोरियलिस्टिक' आउटपुट बनाने के लिए विज्ञापित करने के बावजूद, गूगल रिसर्च द्वारा बढ़ावा दिए गए नमूने आमतौर पर कल्पनात्मक, 'पारिवारिक' किराया होते हैं - फोटोरियलिस्टिक मानव को सावधानी से टाला जाता है या न्यूनतम उदाहरण प्रदान किए जाते हैं। स्रोत: https://imagen.research.google/

इमेजन की क्षमता को ‘फोटोरियलिस्टिक’ आउटपुट बनाने के लिए विज्ञापित करने के बावजूद, गूगल रिसर्च द्वारा बढ़ावा दिए गए नमूने आमतौर पर कल्पनात्मक, ‘पारिवारिक’ किराया होते हैं – फोटोरियलिस्टिक मानव को सावधानी से टाला जाता है या न्यूनतम उदाहरण प्रदान किए जाते हैं। स्रोत: https://imagen.research.google/

फेस-वॉशिंग

पश्चिमी सीवी साहित्य में, यह कपटपूर्ण दृष्टिकोण विशेष रूप से अनुकूलन प्रणालियों के लिए स्पष्ट है – विधियां जो एक विशिष्ट व्यक्ति की सुसंगत समानता को कई उदाहरणों में बनाए रखने में सक्षम हैं (अर्थात जैसे लोरा और पुराने ड्रीमबूथ)।

उदाहरणों में ऑर्थोगोनल विजुअल एम्बेडिंग, लोरा-कंपोज़र, गूगल का इन्स्ट्रक्टबूथ, और कई अन्य शामिल हैं।

गूगल का इन्स्ट्रक्टबूथ क्यूटनेस फैक्टर को 11 तक ले जाता है, हालांकि इतिहास से पता चलता है कि उपयोगकर्ता फोटोरियलिस्टिक मानव बनाने में रुचि रखते हैं न कि फजी या फ्लफी पात्रों में। स्रोत: https://sites.google.com/view/instructbooth

गूगल का इन्स्ट्रक्टबूथ क्यूटनेस फैक्टर को 11 तक ले जाता है, हालांकि इतिहास से पता चलता है कि उपयोगकर्ता फोटोरियलिस्टिक मानव बनाने में रुचि रखते हैं न कि फजी या फ्लफी पात्रों में। स्रोत: https://sites.google.com/view/instructbooth

हालांकि, ‘क्यूट उदाहरण’ का उदय अन्य सीवी और सिंथेसिस अनुसंधान धाराओं में देखा जा सकता है, जैसे कि कॉम्प4डी, वी3डी, डिज़ाइन-एडिट, यूनिएडिट, फेसचेन (जो अपने गिटहब पेज पर वास्तविक उपयोगकर्ता अपेक्षाओं को स्वीकार करता है), और डीपीजी-टी2आई, अन्य लोगों के बीच में।

लोरा (जैसे लोरा एडाप्टर) जैसी प्रणालियों को रिलेटिवली मॉडेस्ट हार्डवेयर के साथ घरेलू उपयोगकर्ताओं द्वारा बनाया जा सकता है, जिससे सिविट.एआई डोमेन और समुदाय में सेलिब्रिटी मॉडल के मुफ्त डाउनलोड का विस्फोट हो सकता है। ऐसा अवैध उपयोग स्टेबल डिफ्यूजन और फ्लक्स जैसे आर्किटेक्चर के ओपन सोर्सिंग के माध्यम से संभव रहता है।

हालांकि अक्सर संभव है कि प्लेटफ़ॉर्म के नियमों का उपयोग करने वाले जनरेटिव टेक्स्ट-टू-इमेज (टी2आई) और टेक्स्ट-टू-वीडियो (टी2वी) सिस्टम की सुरक्षा सुविधाओं को तोड़कर प्रतिबंधित क्षमताओं वाले सिस्टम (जैसे रनवेएमएल और सोरा) की तुलना में अधिक क्षमता वाले सिस्टम (जैसे स्टेबल वीडियो डिफ्यूजन, कोगवीडियो और हुन्युआन के स्थानीय रूप से तैनात) के बीच का अंतर वास्तव में बंद नहीं हो रहा है, जैसा कि कई लोग मानते हैं।

इसके बजाय, ये प्रोप्राइटरी और ओपन-सोर्स सिस्टम, क्रमशः, समान रूप से उपयोगहीन होने की धमकी देते हैं: महंगे और हाइपरस्केल टी2वी सिस्टम मुकदमेबाजी के डर के कारण अत्यधिक प्रतिबंधित हो सकते हैं, जबकि ओपन-सोर्स सिस्टम में लाइसेंसिंग बुनियादी ढांचे और डेटासेट पर्यवेक्षण की कमी उन्हें अधिक सख्त नियमन लागू होने पर बाजार से完全 बाहर कर सकती है।

मंगलवार, 24 दिसंबर, 2024 को पहली बार प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai