Anderson का एंगल
कॉपीराइटेड एनिमेशन पात्रों को ‘गुप्त पहचान’ देना

चीन से नए शोध में एक गैर-आक्रामक तरीका पेश किया गया है जिसमें अनुमान के समय जेनेरिक प्रतिस्थापन को ‘इंजेक्ट’ करके कॉपीराइटेड एनिमेशन पात्रों की रक्षा की जा सकती है। लेकिन क्या यह तरीका प्रॉम्प्ट-हैकर्स की चतुराई को हरा सकता है?
हाइपरस्केल डेटासेट में मौजूद कॉपीराइटेड सामग्री की मात्रा को देखते हुए (क्योंकि ऐसे उल्लंघनों को निकालने की लागत बहुत अधिक है), इन पर प्रशिक्षित मॉडल कॉपीराइटेड पात्रों को पुनः उत्पन्न करने में सक्षम होते हैं।
प्रशिक्षित मॉडल का सीधा संपादन, या मॉडल के माध्यम से पहुंचे जाने पर कीवर्ड को रोकने के लिए फिल्टर का उपयोग, अक्सर वक्र रूप से कॉपीराइट तत्व का वर्णन करके पराजित किया जा सकता है:
एक लोकप्रिय एआई चैटबॉट द्वारा उत्पन्न एक कॉपीराइट पात्र, जाहिर तौर पर पात्र नामों के सीधे आह्वान के बिना। स्रोत – https://archive.is/HDRKo
मॉडल-मॉडिफिकेशन तकनीकों में एक मजबूत और लगातार धारा प्रयास की गई है मॉडल में पैरामीटर को बदलने के लिए, भिन्न परिणामों के साथ:
2023 के पेपर ‘एब्लेटिंग कॉन्सेप्ट्स इन टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स’ से, अभिनेत्री ब्री लार्सन के ‘कैप्टन मार्वल’ के फोटोरियलिस्टिक प्रतिनिधित्व – एक लोकप्रिय डिफ्यूजन मॉडल में बेक किए गए – उपयोगकर्ता द्वारा अनुरोध किए जाने पर कार्टून छवियों में बदल जाते हैं। स्रोत – https://arxiv.org/pdf/2303.13516
हालांकि, एब्लेशन आमतौर पर एक हानिकारक और अस्पष्ट प्रक्रिया है, और एक ऐसी प्रक्रिया जो अक्सर प्रशिक्षित मॉडल की अन्य विशेषताओं को प्रभावित कर सकती है; साथ ही, इसके आसपास कई तरीके हैं:
एक अन्य लोकप्रिय दृष्टिकोण ‘नकारात्मक प्रॉम्प्टिंग’ है, जिसमें मॉडल को एक अतिरिक्त ‘विरोधी प्रॉम्प्ट’ भेजा जाता है, जो आउटपुट को सीमित करने के लिए डिज़ाइन किया गया है। जब मॉडल को एपीआई के माध्यम से एक्सेस किया जाता है (जैसा कि सभी फ्रंटियर मॉडल होते हैं), एक ‘गुप्त’ नकारात्मक प्रॉम्प्ट को उपयोगकर्ता प्रॉम्प्ट के साथ भेजा जा सकता है, जिसमें एक रूब्रिक शामिल होती है जो मॉडल को उपयोगकर्ता को प्रतिबंधित सामग्री प्रदान करने से रोकने के लिए डिज़ाइन की जाती है। यह दृष्टिकोण, हालांकि लोकप्रिय है, हमेशा काम नहीं करता है:
बॉडी डबल
इस संदर्भ में, चीन से एक नए शोध पत्र में कॉपीराइटेड एनिमेशन पात्रों को छवि पीढ़ी के दौरान जेनेरिक प्रतिस्थापन के साथ बदलने का प्रस्ताव किया गया है – ‘डबल’ जो पात्र के आकार और संरचना को बनाए रखने के लिए पर्याप्त है, जबकि संरक्षित पात्र से जुड़े विशिष्ट विवरण को हटा देता है:
एक प्रशिक्षित मॉडल में मौजूद कॉपीराइटेड सामग्री के ‘नामरूप’ प्रतिनिधित्व, नए एम्बेडिंग विधि द्वारा प्राप्त। स्रोत – https://www.unite.ai/now-nsfw-and-celebrity-poses-are-fodder-for-ai-censorship/
महत्वपूर्ण बात यह है कि यह हस्तक्षेप प्रशिक्षित मॉडल को संशोधित या फाइन-ट्यून किए बिना उत्पन्न के दौरान होता है, और यह निर्धारित करने के लिए समायोजित किया जा सकता है कि मूल पात्र को कितनी व्यापक रूप से मिटा दिया जाना चाहिए।
दृष्टिकोण यह स्वीकार करता है कि मॉडल संशोधन इस उद्देश्य के लिए एक खराब विधि है, और इसके बजाय अनुमान प्रक्रिया में क्राफ्टेड एम्बेडिंग को इंजेक्ट करता है – एम्बेडिंग जो ‘पुनर्गठन’ करने के लिए डिज़ाइन की गई हैं, न कि कॉपीराइटेड संपत्ति को शून्य करने (हटाने) के लिए। प्रक्रिया मूल मॉडल को सीधे तौर पर प्रभावित या संशोधित नहीं करती है, और इसलिए विभिन्न मॉडलों में पुन: उपयोग या अनुकूलित की जा सकती है।
हालांकि विधि का परीक्षण लेखकों द्वारा पुराने स्टेबल डिफ्यूजन मॉडल रेंज पर किया गया था, यह हाल ही में जेड-इमेज आर्किटेक्चर पर भी प्रभावी ढंग से आजमाया गया था, जो दर्शाता है कि लेखकों की अवधारणा विभिन्न पीढ़ी संरचनाओं में लागू है।
पत्र में कहा गया है:
‘[हम] एक नियंत्रित विधि का प्रस्ताव करते हैं जो मॉडल के निरंतर पाठ्यात्मक प्रतिनिधित्व पर काम करती है ताकि उत्पन्न के दौरान लक्ष्य पात्रों को मिटा दिया जा सके। हम [एक एंकर एम्बेडिंग को संरचनात्मक और विस्तृत प्रतिबंधों के माध्यम से अनुकूलित करते हैं] एक पात्र के प्रतिस्थापन के रूप में काम करने के लिए, फिर एक संरचना-जागरूक अनुकूल रणनीति के माध्यम से लक्ष्य-संबंधित एम्बेडिंग को एंकर के साथ बदल देते हैं।
‘प्रयोग यह दिखाते हैं कि हमारी विधि राज्य-оф-द-आर्ट मिटाने की प्रभावशीलता और छवि विश्वसनीयता की रक्षा को प्राप्त करती है, जबकि नियंत्रित मिटाने की डिग्री, मल्टी-टार्गेट हटाने और मॉडल ट्रांसफरेबिलिटी का समर्थन करती है।
‘इसके अलावा, हमारे अनुकूलित एंकर मॉडल संशोधन बेसलाइन के साथ प्लग-एंड-प्ले हैं ताकि उनके मिटाने प्रदर्शन में सुधार किया जा सके।’
लेखकों के अनुसार, नई विधि विभिन्न आर्किटेक्चर को पार करती है और सूक्ष्म नियंत्रण प्रदान करती है।
नई पत्र का शीर्षक मिटाना लेकिन संरक्षित करें: अनुकूलित सेमेंटिक एंकर के माध्यम से कॉपीराइटेड एनिमेशन पात्रों का नियंत्रित हटाना है, और यह चीनी अकादमी ऑफ साइंसेज के इंस्टीट्यूट ऑफ इंफॉर्मेशन इंजीनियरिंग और बीजिंग में चाइनीज अकादमी ऑफ साइंसेज के सात लेखकों से आया है।
विधि
नई विधि के पीछे का मुख्य विचार, जैसा कि नीचे दिखाया गया है, यह है कि प्रत्येक कॉपीराइटेड पात्र के लिए एक प्रतिस्थापन बनाया जाए जो उसके व्यापक आकार और संरचना को बनाए रखता है, जबकि उसे पहचानने वाले विशिष्ट दृश्य विवरण को हटा देता है – और फिर उस प्रतिस्थापन का उपयोग करता है जब भी संरक्षित पात्र का अनुरोध किया जाता है:
नई दृष्टिकोण के लिए स्कीमा।
प्रतिस्थापन, जिसे लेखक एंकर कहते हैं, को इतना डिज़ाइन किया जाता है कि वह मूल पात्र के आकार और संरचना को पर्याप्त रूप से बनाए रखे, जबकि उसे पहचानने वाले विवरण को हटा देता है।
इसे प्रभावित करने के लिए, प्रणाली मूल पात्र के लिए उत्पन्न किए गए स्थूल संरचनात्मक जानकारी की तुलना एंकर के लिए उत्पन्न की जाने वाली जानकारी से करती है, दोनों को एक समान समग्र रूप में धकेलती है:
एक कॉपीराइटेड पात्र के लिए एक गैर-उल्लंघनकारी प्रतिस्थापन का निर्माण करने की विधि। पात्र की व्यापक संरचना बनाए रखी जाती है, जबकि उसके विशिष्ट दृश्य विवरण को दबा दिया जाता है, जिससे उत्पन्न के दौरान उपयोग के लिए एक अनुकूलित ‘एंकर’ तैयार होता है।
परिणामस्वरूप एंकर जानबूझकर एक मध्यवर्ती स्थान पर कब्जा करता है, जो अनुरोधित संरचना को बनाए रखने और संरक्षित पहचान को हटाने के बीच संतुलन बनाता है।
एंकर दूर
एक बार जब ये गुण स्थापित हो जाते हैं, तो एंकर को मॉडल द्वारा समझने योग्य कुछ में अनुवादित किया जाना चाहिए। एंकर* [सिक] शब्द को सीखने योग्य प्रतिनिधित्व दिया जाता है सीएलआईपी पाठ एनकोडर के भीतर, जिससे एक नया कृत्रिम शब्द/संस्था बन जाता है, जिसका अर्थ आकार दिया जा सकता है बिना मूल छवि-पीढ़ी मॉडल को बदले:
यह नया प्रतिनिधित्व बार-बार ऊपर वर्णित संरचनात्मक और विवरण उद्देश्यों के अनुसार समायोजित किया जाता है, एंकर* को सिखाता है कि कुछ ऐसा मतलब है जो संरक्षित पात्र के आकार जैसा दिखता है, लेकिन उसके पहचानने वाले रूप को हटा दिया जाता है।
बाकी टेक्स्ट एनकोडर इस प्रक्रिया के दौरान जमे रहते हैं, जबकि एंकर* के आसपास सामान्य प्रारंभ, अंत और पैडिंग टोकन आवश्यक संदर्भ प्रदान करते हैं जो इस नए सीखे हुए प्स्यूडो-शब्द को अंतिम एम्बेडिंग में बदलने के लिए आवश्यक होते हैं जो उत्पन्न के दौरान उपयोग की जाती हैं।
अनुकूल प्रतिस्थापन
उत्पन्न (अनुमान) के दौरान, एल्गोरिदम एन्कोडेड प्रॉम्प्ट में संरक्षित पात्र से जुड़े शब्दों की खोज करता है, और उनके स्थान पर सीखे हुए एंकर एम्बेडिंग को प्रतिस्थापित करता है, साथ ही साथ संदर्भ जानकारी ले जाने वाले अंत और पैडिंग एम्बेडिंग को भी समायोजित करता है:
इसकी तैयारी के लिए, प्रणाली शोर-हटाने की अनुमति देती है ताकि अनुरोधित छवि की व्यापक संरचना स्थापित की जा सके, इसकी संरचना में परिवर्तनों की निगरानी करते हुए जब यह स्थिर होने लगती है:
उत्पन्न के दौरान एंकर प्रतिस्थापन का प्रतिनिधित्व। शोर-हटाने के दौरान छवि की स्थूल संरचना में परिवर्तनों की निगरानी की जाती है, प्रतिस्थापन को ट्रिगर किया जाता है जब समग्र लेआउट स्थिर हो जाता है और विस्तृत विवरण उभरने लगते हैं।
ऊपर दी गई छवि में, हम इस संक्रमण को लगभग टाइमस्टेप 720 पर होते हुए देखते हैं, जहां मापा गया संरचनात्मक परिवर्तन अपने शिखर पर पहुंच जाता है, और फिर गिरने लगता है। इस बिंदु पर, छवि की व्यापक व्यवस्था मुख्य रूप से बन गई है, जिससे एंकर को संरक्षित पात्र को बदलने की अनुमति मिलती है, स्थापित संरचना को परेशान करने के जोखिम को कम करते हुए।
डेटा और परीक्षण
लेखकों ने अपने दृष्टिकोण की तुलना पांच प्रॉम्प्ट-आधारित बेसलाइन से की: सुरक्षित लेटेंट डिफ्यूजन (एसएलडी); एसटीजी; एसएफ्री; ट्राससी; और नकारात्मक प्रॉम्प्टिंग (एनपी):
अनुकूलित एंकर एम्बेडिंग को चार मौजूदा मॉडल-संशोधन विधियों में एकीकृत किया गया था: मेस; यूसीई; ईएसडी-यू; और एसी. यह उनके प्रस्तावित मॉडल के साथ पात्र हटाने में सुधार करने की उनकी क्षमता का परीक्षण करने के लिए किया गया था।
मूल्यांकन के लिए, 80 एनिमेशन पात्रों का एक डेटासेट इकट्ठा किया गया था, जिसमें 36 मानवाकार पात्र; 23 जानवर-अकार पात्र; और 21 विविध श्रेणियों से – सभी चुने हुए पात्रों को इसलिए चुना गया क्योंकि वे डिफ्यूजन मॉडल द्वारा विश्वसनीय रूप से पुन: उत्पन्न किए जा सकते थे।
प्रत्येक पात्र के लिए 100 छवियां उत्पन्न की गईं, जीपीटी-4ओ द्वारा उत्पन्न प्रॉम्प्ट का उपयोग करके।
स्टेबल डिफ्यूजन वी1.4 मुख्य प्रयोगों के लिए उपयोग किया गया था, साथ ही साथ स्थिरता को आगे के स्टेबल डिफ्यूजन संस्करणों वी1.5; वी2; वी2.1; एक्सएल बेस 1.0; और अधिक हाल ही में डीआईटी-आधारित जेड-इमेज पर भी परीक्षण किया गया। किसी भी प्री-प्रशिक्षित मॉडल के पैरामीटर को फाइन-ट्यून नहीं किया गया था, जिससे प्रत्येक के पैरामीटर अपरिवर्तित रहे।
मेट्रिक्स के लिए, एलएलएवीए-1.5 और बीएलआईपी-3 ने मापा कि लक्ष्य पात्र अभी भी पहचानने योग्य था या नहीं, कम पहचान सटीकता का संकेत देते हुए अधिक पूर्ण हटाने का संकेत देते हुए; संरचनात्मक समानता सूचकांक (एसएसआईएम) ने संरचनात्मक संरक्षण को मापा; सीखे हुए संवेदी समानता मेट्रिक्स (एलपीआईपीएस) ने संवेदी अंतर को मापा; और सौंदर्य सूचक वी2 स्कोर ने संशोधित छवि की दृश्य गुणवत्ता का मूल्यांकन किया।
फ्रेचेट इन्सेप्शन डिस्टेंस (एफआईडी) और सीएलआईपी स्कोर को भी सीओसीओ-30के में असंबंधित प्रॉम्प्ट से गणना की गई, ताकि यह मापा जा सके कि सामान्य छवि पीढ़ी प्रभावित हुई या नहीं:
80 एनिमेशन पात्रों में पात्र हटाने की विधियों की तुलना करने वाले परीक्षण परिणाम। पहले दो कॉलम मापते हैं कि कितनी बार हटाए गए पात्र अभी भी पहचाने जा सकते थे, इसलिए कम स्कोर बेहतर हटाने का संकेत देते हैं। शेष कॉलम मूल छवि और असंबंधित पीढ़ी के संरक्षण को मापते हैं। तीर दिखाते हैं कि उच्च या निम्न स्कोर वांछनीय हैं; बोल्ड सबसे अच्छा परिणाम और अंडरलाइन दूसरा सबसे अच्छा दिखाता है।
इन प्रारंभिक परिणामों में, लेखकों का कहना है:
‘हमारी विधि का उपयोग करके मिटाए गए छवियों ने एलएलएवीए-1.5 (6.0%) और बीएलआईपी-3 (4.0%) दोनों द्वारा सफल लक्ष्य पहचान के लिए सबसे कम सटीकता हासिल की, जो क्रमशः 3.5% और 1.7% की कमी थी, दूसरे सर्वश्रेष्ठ की तुलना में।
‘यह हमारी विधि की मिटाने की प्रभावशीलता को प्रदर्शित करता है, क्योंकि यह वास्तव में बहु-मोडल बड़े मॉडलों को धोखा देता है।’
छवि विश्वसनीयता के लिए, लेखकों की विधि ने एसएसआईएम स्कोर में 0.467 के साथ उच्चतम स्कोर हासिल किया, और 0.505 पर एलपीआईपीएस स्कोर में सबसे कम स्कोर हासिल किया – जो असंबंधित सामग्री और पृष्ठभूमि संरचना के सबसे मजबूत संरक्षण को दर्शाता है जो परीक्षण की जाने वाली विधियों में से किसी के लिए भी है। यह पात्र-हटाने वाली विधियों में से सबसे अच्छा सौंदर्य सूचक वी2 स्कोर भी हासिल किया, 5.18 पर, जो दर्शाता है कि यह संरक्षण समग्र दृश्य गुणवत्ता के खर्चे के बिना नहीं आता है।
एक गुणात्मक परीक्षण का पालन किया गया:
पांच एनिमेशन पात्रों में पात्र हटाने की तुलना करने वाले परीक्षण परिणाम। प्रत्येक पंक्ति एक अलग विधि के परिणाम दिखाती है, मूल स्टेबल डिफ्यूजन वी1.4 पीढ़ी शीर्ष पर और प्रस्तावित विधि नीचे। प्रस्तावित विधि अधिक लगातार रूप से लक्ष्य पात्रों को बदल देती है, आसपास के दृश्य को संरक्षित करते हुए। कृपया बेहतर रिज़ॉल्यूशन के लिए मूल स्रोत पीडीएफ या परियोजना साइट पर जाएं।
लेखकों के अनुसार, उदाहरण विशेष रूप से जटिल आकार और विशेषताओं वाले पात्रों के लिए भिन्नता दिखाते हैं, डोनाल्ड डक और सुपर मारियो का हवाला देते हैं:
‘[हमारी] विधि जटिल आकार और विशेषताओं (जैसे डोनाल्ड डक और सुपर मारियो) वाले पात्रों के लिए भी उत्कृष्ट मिटाने को प्राप्त करती है, जबकि प्रॉम्प्ट-आधारित बेसलाइन अक्सर विफल हो जाते हैं—विशेष रूप से जटिल आकार और विशेषताओं वाले पात्रों के लिए।
‘इसके अलावा, हमारी विधि पृष्ठभूमि की एकरूपता को बनाए रखती है, बिना किसी धुंधलापन या विकृति के कलात्मक कार्य प्रवाह का समर्थन करती है।’
सूक्ष्म नियंत्रण
एक निरंतर एम्बेडिंग स्थान भी पात्र हटाने की ताकत को समायोजित करने की अनुमति देता है, हटाने को एक सभी-या-कुछ-भी नहीं की स्थिति के रूप में नहीं मानते हुए। एंकर और मूल लक्ष्य एम्बेडिंग के बीच अंतरपणन करके, विधि पात्र को अधिक प्रगतिशील रूप से पुनर्स्थापित कर सकती है, जबकि आसपास की छवि संरचना को बनाए रखती है:
पात्र हटाने की विभिन्न डिग्री वाली परीक्षण छवियां। पहले तीन कॉलम मूल पात्र, हटाए गए संस्करण और हटाए गए दृश्य विशेषताओं को दिखाते हैं; शेष कॉलम α = 0.25, 0.5 और 0.75 पर मध्यवर्ती सेटिंग्स को दिखाते हैं। उच्च α मान मूल पात्र के अधिक संरक्षण को बनाए रखते हैं। कृपया बेहतर रिज़ॉल्यूशन के लिए मूल स्रोत पीडीएफ या परियोजना साइट पर जाएं।
जैसा कि ऊपर दिखाया गया है, लेखकों ने विनी द पूह; ओलाफ; मिनी माउस; और स्टिच पात्रों पर भी इस नियंत्रण का परीक्षण किया। संरचनात्मक समानता α के परिवर्तन के साथ अपेक्षाकृत स्थिर रही, जबकि एलएलएवीए-1.5 और बीएलआईपी-3 द्वारा पहचान बढ़ जाती है क्योंकि प्रत्येक पात्र को अधिक पुनर्स्थापित किया जाता है।
विनी द पूह और स्टिच संकीर्ण श्रृंखला में पहचानने योग्य हो गए; ओलाफ और मिनी माउस अधिक क्रमिक रूप से बदल गए; और मिनी माउस अपेक्षाकृत कम पुनर्स्थापना के साथ पहचानने योग्य हो गई, यह दर्शाता है कि उपयुक्त मिटाने की ताकत लक्ष्य पात्र पर निर्भर करती है।
एक ही बार में कई लक्ष्यों को प्रतिस्थापित करने के लिए आगे के प्रयोग सफलतापूर्वक आयोजित किए गए थे, और हम पाठक को इस पर और अन्य परिशिष्ट परिणामों और सामग्री के लिए मूल पत्र के लिए संदर्भित करते हैं।
निष्कर्ष
जैसा कि हमेशा, यह नवीनतम मोड़ कॉपीराइट गार्डरेल के बराबर है जिसे स्थिर दरवाजे को बंद करने के लिए सुरक्षित किया जाता है जब घोड़ा पहले ही भाग चुका होता है।
उन दुर्लभ मामलों में जहां शोधकर्ताओं और कंपनियों ने मांग की है कि एक मॉडल की क्षमता को दबाने के लिए जो नग्नता और/या पोर्न उत्पन्न कर सकता है, वास्तव में डेटासेट से ‘एनएसएफडब्ल्यू’ सामग्री तक पहुंच को काटने से (क्योंकि इसे वास्तव में क्यूरेट करना बहुत महंगा है), यह निकला है कि मॉडल मानव शरीर विज्ञान को ठीक से समझने में सक्षम नहीं है:
यहां प्रस्तावित नई दृष्टिकोण, वास्तव में, एक मॉडल को प्रशिक्षित करने के लिए टनों वेब सामग्री को बिना किसी भेदभाव के स्क्रैप करने के मामले में एक विशिष्ट पोर्न स्टार को ‘एक्सिस’ करने के समान है, जहां एक एनएसएफडब्ल्यू फिल्टर मॉडल के लिए निर्मित किया जा रहा है। इस नई विधि के लिए, एक कॉपीराइटेड पात्र के लिए एक ‘जेनेरिक डबल’ बनाना आवश्यक रूप से मॉडल के प्रशिक्षित स्थान में ‘सुपरहीरो’ डोमेन को संरक्षित करना होगा; और लक्ष्य कॉपीराइटेड पात्र जितना अधिक महत्वपूर्ण है, उतना ही यह अपने डोमेन को प्रशिक्षित स्थान में परिभाषित करता है।
इसलिए, इसे हटाना चीनी चाय से चीनी को हटाने जैसा है, एक बार जब यह मिला जाता है:
तो जबकि यह दृष्टिकोण फ्रंटियर मॉडल की बढ़ती एपीआई फायरवॉल में जोड़े जाने पर कुछ सीमित सफलता का आनंद ले सकता है, जेनएआई मॉडल की अंतर्संबंधित प्रकृति का सुझाव है कि यह विधि द्वारा लक्ष्य की जाने वाली कॉपीराइटेड सामग्री प्रॉम्प्टर्स की पारंपरिक चतुराई के माध्यम से अभी भी सुलभ रह सकती है।
पहली बार शुक्रवार, 14 अगस्त, 2026 को प्रकाशित












