Anderson का एंगल

गूगल के Imagic और Runway के ‘Erase and Replace’ के साथ AI-सहायता प्राप्त वस्तु संपादन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

इस सप्ताह दो नई, लेकिन विपरीत AI-चालित ग्राफ़िक्स एल्गोरिदम उपयोगकर्ताओं को फ़ोटो में वस्तुओं में अत्यधिक सूक्ष्म और प्रभावी परिवर्तन करने के नए तरीके प्रदान कर रहे हैं।

पहला है Imagic, जो Google Research द्वारा, इज़राइल के Institute of Technology और Weizmann Institute of Science के सहयोग से विकसित किया गया है। Imagic टेक्स्ट-शर्तीय, सूक्ष्म वस्तु संपादन को डिफ्यूज़न मॉडलों के फाइन‑ट्यूनिंग के माध्यम से प्रदान करता है।

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf

जो आप पसंद करें, उसे बदलें, और बाकी को जैसा है वैसा ही छोड़ें – Imagic केवल उन भागों का सूक्ष्म संपादन करने का वादा करता है जिन्हें आप बदलना चाहते हैं। स्रोत: https://arxiv.org/pdf/2210.09276.pdf

जो भी किसी ने Stable Diffusion के पुनः‑रेंडर में केवल एक तत्व बदलने की कोशिश की है, वह अच्छी तरह जानता है कि हर सफल संपादन के साथ, सिस्टम उन पाँच चीज़ों को बदल देता है जिन्हें आप जैसा था वैसा ही पसंद करते थे। यह कमी वर्तमान में कई सबसे कुशल SD उत्साहियों को लगातार Stable Diffusion और Photoshop के बीच स्विच करते रहने पर मजबूर करती है, ताकि इस प्रकार के ‘सहायक नुकसान’ को ठीक किया जा सके। केवल इस पहलू से ही Imagic की उपलब्धियाँ उल्लेखनीय लगती हैं।

लेखन के समय, Imagic के पास अभी तक कोई प्रचार वीडियो भी नहीं है, और Google की सावधान दृष्टिकोण के कारण, यह अनिश्चित है कि हमें इस प्रणाली को परीक्षण करने का कोई अवसर मिलेगा या नहीं।

दूसरी पेशकश Runway ML की अपेक्षाकृत अधिक सुलभ Erase and Replace सुविधा है, जो नया फीचर है और इसके केवल ऑनलाइन उपलब्ध मशीन लर्निंग‑आधारित विज़ुअल इफ़ेक्ट यूटिलिटीज़ सूट के ‘AI Magic Tools’ अनुभाग में शामिल है।

Runway ML's Erase and Replace feature, already seen in a preview for a text-to-video editing system.

Runway ML की Erase and Replace सुविधा, पहले ही एक टेक्स्ट‑टू‑वीडियो संपादन प्रणाली के प्रीव्यू में देखी जा चुकी है।

चलो पहले Runway की पेशकश को देखें।

Erase and Replace

Imagic की तरह, Erase and Replace केवल स्थिर छवियों के साथ काम करता है, हालांकि Runway ने प्रीव्यू किया है कि वही कार्यक्षमता एक टेक्स्ट‑टू‑वीडियो संपादन समाधान में है जो अभी जारी नहीं हुई है:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232

हालांकि कोई भी नई Erase and Replace को छवियों पर परीक्षण कर सकता है, वीडियो संस्करण अभी सार्वजनिक रूप से उपलब्ध नहीं है। स्रोत: https://twitter.com/runwayml/status/1568220303808991232

भले ही Runway ML ने Erase and Replace के पीछे की तकनीकों के विवरण जारी नहीं किए हैं, लेकिन एक घर के पौधे को तुलनात्मक रूप से विश्वसनीय Ronald Reagan की प्रतिमा से बदलने की गति यह संकेत देती है कि Stable Diffusion (या, बहुत कम संभावना, लाइसेंस प्राप्त DALL‑E 2) जैसे डिफ्यूज़न मॉडल ही वह इंजन है जो Erase and Replace में आपके चुने हुए वस्तु को पुनः निर्मित कर रहा है।

Replacing a house plant with a bust of The Gipper isn't quite as fast as this, but it's pretty fast. Source: https://app.runwayml.com/

एक घर के पौधे को The Gipper की प्रतिमा से बदलना इस जितना तेज़ नहीं है, लेकिन फिर भी काफी तेज़ है। स्रोत: https://app.runwayml.com/

सिस्टम में कुछ DALL‑E 2 प्रकार की प्रतिबंध हैं – ऐसी छवियाँ या टेक्स्ट जो Erase and Replace फ़िल्टर को चिन्हित करती हैं, आगे के उल्लंघन की स्थिति में संभावित खाता निलंबन की चेतावनी उत्पन्न करेंगे – यह व्यावहारिक रूप से OpenAI की चल रही नीतियों का एक बायलरप्लेट क्लोन है।

परिणामों में अक्सर Stable Diffusion की सामान्य खुरदुरे किनारे नहीं दिखते। Runway ML SD के निवेशक और शोध साझेदार हैं, और संभव है कि उन्होंने एक स्वामित्व वाला मॉडल प्रशिक्षित किया हो जो खुले स्रोत के 1.4 चेकपॉइंट वेट्स से बेहतर हो, जिनके साथ हम सभी वर्तमान में जूझ रहे हैं (जैसे कई अन्य विकास समूह, शौकीन और पेशेवर दोनों, वर्तमान में Stable Diffusion मॉडलों को प्रशिक्षित या फाइन‑ट्यून कर रहे हैं)।

Substituting a domestic table for a 'table made of ice' in Runway ML's Erase and Replace.

Runway ML के Erase and Replace में घरेलू मेज़ को ‘बर्फ से बनी मेज़’ से बदलना।

Imagic (नीचे देखें) की तरह, Erase and Replace भी ‘ऑब्जेक्ट‑ओरिएंटेड’ है – आप चित्र के किसी ‘खाली’ भाग को मिटा कर उसे अपने टेक्स्ट प्रॉम्प्ट के परिणाम से इनपेंट नहीं कर सकते; ऐसे में सिस्टम मास्क की दृष्टि रेखा के साथ सबसे निकटतम दिखाई देने वाले वस्तु (जैसे दीवार या टेलीविज़न) को ट्रेस करेगा और वहाँ परिवर्तन लागू करेगा।

As the name indicates, you can't inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the 'replace' area was drawn.

जैसा कि नाम से स्पष्ट है, Erase and Replace में आप खाली स्थान में वस्तुएँ नहीं डाल सकते। यहाँ, सबसे प्रसिद्ध सिथ लॉर्ड को बुलाने की कोशिश ने टीवी पर एक अजीब Vader‑संबंधी म्यूरल बना दिया, लगभग जहाँ ‘replace’ क्षेत्र खींचा गया था।

यह निर्धारित करना कठिन है कि Erase and Replace कॉपीराइटेड छवियों के उपयोग के संबंध में evasive (परहेज़ी) है या नहीं (जो DALL‑E 2 में अभी भी बड़े पैमाने पर प्रतिबंधित हैं, हालांकि सफलता में विविधता है), या बैकएंड रेंडरिंग इंजन में उपयोग किया जा रहा मॉडल बस उस प्रकार की चीज़ के लिए अनुकूलित नहीं है।

The slightly NSFW 'Mural of Nicole Kidman' indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2's former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous ('xenomorph') to the absurd ('the iron throne'). Inset bottom right, the source picture.

थोड़ा NSFW ‘Nicole Kidman की म्यूरल’ दर्शाती है कि (संभवतः) डिफ्यूज़न‑आधारित मॉडल में DALL‑E 2 की पूर्ववर्ती व्यवस्थित वास्तविक चेहरों या कामुक सामग्री को रेंडर करने से रोकने की क्षमता नहीं है, जबकि कॉपीराइटेड कार्यों को दिखाने के प्रयासों के परिणाम अस्पष्ट (‘xenomorph’) से लेकर बेतुके (‘the iron throne’) तक होते हैं। नीचे दाएँ कोने में स्रोत चित्र सम्मिलित है।

यह जानना रोचक होगा कि Erase and Replace किन तरीकों का उपयोग करके उन वस्तुओं को अलग करता है जिन्हें वह बदल सकता है। संभवतः छवि को CLIP के किसी रूपांतरण से गुजारा जा रहा है, जहाँ वस्तु पहचान और बाद की सिमैंटिक सेगमेंटेशन द्वारा अलग‑अलग आइटम पहचाने जाते हैं। इन संचालन में से कोई भी सामान्य Stable Diffusion सेटअप में इतना प्रभावी नहीं है।

परंतु कुछ भी पूर्ण नहीं है – कभी‑कभी सिस्टम केवल मिटाता है और नहीं बदलता, भले ही (जैसा कि हमने ऊपर की छवि में देखा) अंतर्निहित रेंडरिंग तंत्र स्पष्ट रूप से टेक्स्ट प्रॉम्प्ट का अर्थ समझता हो। इस स्थिति में, कॉफ़ी टेबल को xenomorph में बदलना असंभव सिद्ध होता है – बल्कि टेबल बस गायब हो जाता है।

A scarier iteration of 'Where's Waldo', as Erase and Replace fails to produce an alien.

‘Where’s Waldo’ का एक अधिक डरावना संस्करण, क्योंकि Erase and Replace एक एलियन उत्पन्न करने में विफल रहता है।

Erase and Replace एक प्रभावी वस्तु प्रतिस्थापन प्रणाली प्रतीत होती है, जिसमें उत्कृष्ट इनपेंटिंग है। हालांकि, यह मौजूदा देखी गई वस्तुओं को संपादित नहीं कर सकता, केवल उन्हें बदल सकता है। मौजूदा छवि सामग्री को बिना परिवेशीय सामग्री को नुकसान पहुँचाए बदलना संभवतः बहुत कठिन कार्य है, जो लोकप्रिय फ्रेमवर्क के विभिन्न लेटेंट स्पेस में डिसेंटैंगलमेंट की दिशा में कंप्यूटर विज़न अनुसंधान क्षेत्र के लंबे संघर्ष से जुड़ा है।

Imagic

यह वह कार्य है जिसे Imagic संबोधित करता है। नया पेपर कई उदाहरण प्रस्तुत करता है जहाँ संपादन सफलतापूर्वक फोटो के व्यक्तिगत पहलुओं को बदलते हैं जबकि शेष छवि अपरिवर्तित रहती है।

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and 'occlusion guessing' characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.

Imagic में, संशोधित छवियों को उस विशिष्ट खिंचाव, विकृति और ‘ऑक्लूज़न गेसिंग’ से नहीं ग्रस्त होना पड़ता जो डीपफ़ेक पपेट्री में देखी जाती है, जहाँ केवल एक छवि से प्राप्त सीमित प्रायर्स का उपयोग किया जाता है।

सिस्टम तीन‑स्तरीय प्रक्रिया अपनाता है – टेक्स्ट एम्बेडिंग अनुकूलन; मॉडल फाइन‑ट्यूनिंग; और अंत में, संशोधित छवि का निर्माण।

Imagic encode the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.

Imagic लक्ष्य टेक्स्ट प्रॉम्प्ट को एन्कोड करके प्रारंभिक टेक्स्ट एम्बेडिंग प्राप्त करता है, फिर परिणाम को अनुकूलित करके इनपुट छवि बनाता है। उसके बाद, जनरेटिव मॉडल को स्रोत छवि पर फाइन‑ट्यून किया जाता है, विभिन्न पैरामीटर जोड़ते हुए, और फिर अनुरोधित इंटरपोलेशन के लिए उपयोग किया जाता है।

कोई आश्चर्य नहीं कि यह फ्रेमवर्क Google के Imagen टेक्स्ट‑टू‑वीडियो आर्किटेक्चर पर आधारित है, हालांकि शोधकर्ता बताते हैं कि सिस्टम के सिद्धांत व्यापक रूप से लेटेंट डिफ्यूज़न मॉडलों पर लागू होते हैं।

Imagen तीन‑स्तरीय आर्किटेक्चर का उपयोग करता है, जबकि कंपनी के हालिया टेक्स्ट‑टू‑वीडियो संस्करण में सात‑स्तरीय संरचना उपयोग होती है। ये तीन अलग‑अलग मॉड्यूल शामिल हैं: 64×64 पिक्सेल रिज़ॉल्यूशन पर कार्य करने वाला जनरेटिव डिफ्यूज़न मॉडल; एक सुपर‑रिज़ॉल्यूशन मॉडल जो इस आउटपुट को 256×256 पिक्सेल तक बढ़ाता है; और एक अतिरिक्त सुपर‑रिज़ॉल्यूशन मॉडल जो आउटपुट को 1024×1024 पिक्सेल तक ले जाता है।

Imagic इस प्रक्रिया के सबसे प्रारंभिक चरण में हस्तक्षेप करता है, 64px चरण पर अनुरोधित टेक्स्ट एम्बेडिंग को Adam ऑप्टिमाइज़र के साथ स्थिर लर्निंग रेट 0.0001 पर अनुकूलित करता है।

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without 'tearing apart' the consistency of the rest of the image.

डिसेंटैंगलमेंट में एक मास्टर‑क्लास: जो अंतिम‑उपयोगकर्ता डिफ्यूज़न, GAN या NeRF मॉडल में रेंडर की गई वस्तु के रंग जैसे सरल परिवर्तन करने की कोशिश करते हैं, वे जानेंगे कि Imagic इन रूपांतरणों को बिना छवि की शेष स्थिरता को ‘फाड़े’ कैसे कर सकता है, यह कितना महत्वपूर्ण है।

फाइन‑ट्यूनिंग तब Imagen के बेस मॉडल पर किया जाता है, प्रत्येक इनपुट छवि के लिए 1500 चरणों के लिए, संशोधित एम्बेडिंग के आधार पर। साथ ही, द्वितीयक 64px>256px लेयर को समानांतर रूप से कंडीशन की गई छवि पर अनुकूलित किया जाता है। शोधकर्ता नोट करते हैं कि अंतिम 256px>1024px लेयर के लिए समान अनुकूलन का ‘थोड़ा या कोई प्रभाव नहीं’ पड़ता, इसलिए इसे लागू नहीं किया गया है।

पेपर में कहा गया है कि अनुकूलन प्रक्रिया प्रत्येक छवि के लिए द्वि-TPUV4 चिप्स पर लगभग आठ मिनट लेती है। अंतिम रेंडर कोर Imagen में DDIM सैंपलिंग स्कीम के तहत किया जाता है।

Google के DreamBooth जैसी समान फाइन‑ट्यूनिंग प्रक्रियाओं के समान, प्राप्त एम्बेडिंग्स का उपयोग स्टाइलाइज़ेशन के साथ-साथ फोटोरियलिस्टिक संपादन के लिए भी किया जा सकता है, जिसमें Imagen को शक्ति देने वाले व्यापक अंतर्निहित डेटाबेस से निकाली गई जानकारी शामिल होती है (क्योंकि, नीचे पहले कॉलम में दिखाया गया है, स्रोत छवियों में इन रूपांतरणों के लिए आवश्यक सामग्री नहीं है)।

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.

Imagic के माध्यम से लचीली फोटोरियलिस्टिक गति और संपादन प्राप्त किए जा सकते हैं, जबकि प्रक्रिया में प्राप्त किए गए व्युत्पन्न और डिसेंटैंगल्ड कोड्स को स्टाइलाइज़्ड आउटपुट के लिए भी आसानी से उपयोग किया जा सकता है।

शोधकर्ताओं ने Imagic की तुलना पूर्व कार्यों SDEdit (2021 का GAN‑आधारित दृष्टिकोण, Stanford University और Carnegie Mellon University के सहयोग से) और Text2Live (अप्रैल 2022 में Weizmann Institute of Science और NVIDIA के सहयोग से) से की।

A visual comparison between Imagic, SDEdit and Text2Live.

Imagic, SDEdit और Text2Live के बीच एक दृश्य तुलना।

स्पष्ट है कि पूर्ववर्ती दृष्टिकोण संघर्ष कर रहे हैं, लेकिन नीचे की पंक्ति में, जहाँ बड़ी पोज़ परिवर्तन का समावेश है, मौजूदा विधियाँ स्रोत सामग्री को पुनः निर्मित करने में पूरी तरह विफल रहती हैं, जबकि Imagic ने उल्लेखनीय सफलता हासिल की है।

Imagic की संसाधन आवश्यकताएँ और प्रति छवि प्रशिक्षण समय, इस प्रकार के कार्यों के मानकों के मुकाबले छोटा है, फिर भी यह व्यक्तिगत कंप्यूटर पर स्थानीय छवि संपादन एप्लिकेशन में शामिल होने की संभावना कम है – और यह स्पष्ट नहीं है कि फाइन‑ट्यूनिंग प्रक्रिया को उपभोक्ता स्तर तक कितना घटाया जा सकता है।

वर्तमान में, Imagic एक प्रभावशाली प्रस्ताव है जो अधिकतर API के लिए उपयुक्त है – ऐसा वातावरण जिसमें Google Research, डीपफ़ेक को सुविधाजनक बनाने के संबंध में आलोचना से बचता है, संभवतः सबसे आरामदायक हो सकता है।

 

पहली बार प्रकाशित 18 अक्टूबर 2022।

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai