Anderson का एंगल
‘सुरक्षित’ छवियां चोरी करने में आसान, नहीं कठिन, एआई के साथ

नई शोध से पता चलता है कि AI संपादन रोकने के लिए बनाए गए वॉटरमार्क और प्रतिकूल-विक्षोभ उपकरण उलटा असर कर सकते हैं। Stable Diffusion जैसे मॉडल को रोकने के बजाय कुछ सुरक्षा उपाय मॉडल को संपादन निर्देशों का अधिक सटीक पालन करने में मदद करते हैं, जिससे अवांछित बदलाव और आसान हो जाते हैं।
कंप्यूटर विज़न शोध में कॉपीराइट चित्रों को AI प्रशिक्षण या सीधे image-to-image प्रक्रियाओं से बचाने की एक मजबूत धारा है। ये प्रणालियाँ Stable Diffusion और Flux जैसे latent diffusion models (LDMs) को लक्ष्य करती हैं, जो चित्र को encode और decode करने के लिए noise-आधारित प्रक्रिया अपनाते हैं।
सामान्य दिखने वाले चित्र में adversarial noise जोड़कर detector को सामग्री गलत पहचानने और जनरेटिव प्रणाली को कॉपीराइट डेटा का उपयोग करने से रोकने की कोशिश की जाती है।

2023 में वेब से बिना अनुमति चित्र लेने पर कलाकारों के विरोध के बाद, चित्रों को अदृश्य रूप से ‘ज़हरीला’ बनाने के अनेक तरीके सामने आए। लेकिन विक्षोभ जितना तीव्र होता है, सुरक्षा उतनी बढ़ती है और औसत दर्शक के लिए चित्र की गुणवत्ता उतनी घटती है।

कलाकारों के लिए खास रुचि यह है कि ऐसी प्रणाली पहचान छिपाने के साथ प्रशिक्षण को यह विश्वास दिलाए कि वह किसी और शैली को देख रहा है। इससे “Paul Klee की शैली में” जैसे semantic और visual संबंध protected डेटा से न बनें। Mist और Glaze इसी उद्देश्य के लोकप्रिय तरीके हैं।

अपना ही नुकसान
अमेरिकी शोधकर्ताओं ने पाया कि विक्षोभ सुरक्षा देने में विफल ही नहीं होता, बल्कि जिन AI प्रक्रियाओं से बचाना था उनमें चित्र के उपयोग को अधिक सफल बना सकता है। प्राकृतिक दृश्यों और कलाकृतियों पर image-to-image generation तथा style editing में protected चित्र अक्सर साफ, विश्वसनीय और prompt के अनुरूप परिणाम देते थे। noise जोड़ने से चित्र और दिए गए text prompt का संबंध बढ़ सकता है, इसलिए यह मजबूत सुरक्षा समाधान नहीं है।
परीक्षणों में protected चित्रों को सीधे image-to-image बदलाव और style transfer से गुज़ारा गया। मानक फोटो और कला स्रोतों के परिणामों में सुरक्षा ने संपादन बिगाड़ने के बजाय कई बार prompt alignment को तेज किया। लेखकों के अनुसार यह लोकप्रिय तरीका सुरक्षा का झूठा भरोसा दे सकता है और हर प्रणाली को उनके परीक्षणों से जाँचना चाहिए।
विधि
तीन adversarial protection तरीकों—PhotoGuard, Mist और Glaze—का परीक्षण किया गया। PhotoGuard प्राकृतिक दृश्यों पर, जबकि Mist और Glaze कलाकृतियों पर लागू हुए। प्रभावशीलता का मानदंड था कि protected चित्र से AI अब भी यथार्थवादी और prompt-संगत संपादन बना सकता है या नहीं। यदि परिणाम विश्वसनीय था, सुरक्षा विफल मानी गई।

Stable Diffusion v1.5 को संपादक के रूप में प्रयोग किया गया। पुनरुत्पादन के लिए seed 9222, 999, 123, 66 और 42 चुने गए; guidance scale, strength और steps PhotoGuard के default रहे। प्राकृतिक दृश्यों के लिए Flickr8k के 8,000 से अधिक चित्र और प्रति चित्र पाँच तक captions उपयोग हुए।
विपरीत निर्देश
प्रत्येक चित्र के पहले caption से Claude Sonnet 3.5 की सहायता से दो समूह बनाए गए: मूल के संदर्भ में निकट और बहुत दूर। “गुलाबी पोशाक में लकड़ी के केबिन में जाती लड़की” का निकट बदलाव “नीली कमीज़ में ईंट के घर में जाता लड़का” था, जबकि दूर बदलाव “सोफ़े पर आराम करती दो बिल्लियाँ” था। सभी captions की गुणवत्ता और अर्थ-संगति मनुष्यों ने जाँची।
Google Universal Sentence Encoder से similarity मापी गई। निकट captions का औसत लगभग 0.6 और दूर captions का लगभग 0.1 रहा।

हर मूल और protected चित्र को दोनों प्रकार के prompts से संपादित किया गया। BRISQUE से गुणवत्ता मापने पर generated चित्रों का कुल score 17.88 रहा—निकट के लिए 17.82 और दूर के लिए 17.94—जबकि मूल चित्रों का 22.27 था। अर्थात संपादन की गुणवत्ता मूल के करीब रही।

मेट्रिक्स
CLIP-S ने image और text की समानता मापी, जबकि PAC-S++ ने मानव अनुमान से बेहतर मेल के लिए AI-निर्मित अतिरिक्त samples जोड़े। ये image-text alignment (ITA) scores बताते हैं कि protected चित्र संपादित करते समय AI ने निर्देश कितनी सटीकता से माने। ऊँचा alignment सुरक्षा की विफलता है।

Protected और unprotected परिणाम का अंतर ‘Actual Change’ तथा सामान्यीकृत अंतर ‘Percentage Change’ कहलाया। पाँच seeds और छोटे-बड़े दोनों semantic बदलावों में परीक्षण दोहराया गया, जिससे पता चला कि सुरक्षा prompt का पालन कठिन बनाती है या आसान।
कला पर हमला
प्राकृतिक फोटो में style transfer के लिए Flickr1024 के एक हज़ार से अधिक उच्च-गुणवत्ता चित्र लिए गए। “style को [V] में बदलें” prompt में Cubism, Post-Impressionism, Impressionism, Surrealism, Baroque, Fauvism और Renaissance में से एक शैली रखी गई। मूल और PhotoGuard-सुरक्षित चित्रों पर वही संपादन किया गया।

कलाकृतियों के लिए WikiArt प्रयोग हुआ। prompt ने चित्र को किसी असंबंधित यादृच्छिक WikiArt शैली में बदलने को कहा। संपादन से पहले Glaze और Mist लगाए गए ताकि दोनों रक्षा उपायों की क्षमता देखी जा सके।


मात्रात्मक परिणामों ने गंभीर सीमा दिखाई: adversarial perturbation ने alignment रोकने के बजाय कई बार model को prompt के प्रति अधिक responsive बनाया। इससे अनधिकृत सामग्री की नकल करने वाला व्यक्ति अपने लक्ष्य के अधिक निकट परिणाम बना सकता है।
कारण diffusion प्रक्रिया में है। LDM पहले चित्र को compressed latent में बदलता है, अनेक चरणों में noise जोड़ता है और फिर generation के दौरान उसे चरण-दर-चरण हटाता है। हर चरण में text prompt सफाई की दिशा तय करके चित्र को आकार देता है।

Protection मूल चित्र में थोड़ी अतिरिक्त noise पहले ही डाल देती है। मॉडल की अपनी noise परतों के साथ यह विक्षोभ जमा होता है और denoising शुरू होने पर latent के अधिक हिस्से अनिश्चित रहते हैं। तब मॉडल खोई जानकारी भरने के लिए text prompt पर सामान्य से अधिक निर्भर होता है। इस तरह सुरक्षा AI के लिए चित्र को prompt के अनुसार बदलना आसान कर देती है।
अंतिम परीक्षण में crafted perturbations की जगह शुद्ध Gaussian noise डाली गई। सभी tests में Percentage Change सकारात्मक रहा; random और असंरचित noise ने भी generated image और prompt का alignment बढ़ाया।

इससे मूल व्याख्या पुष्ट हुई: किसी भी प्रकार की अतिरिक्त noise generation में अनिश्चितता बढ़ाती है और text prompt को अंतिम चित्र पर अधिक नियंत्रण देती है।
निष्कर्ष
LDM के आने के बाद से adversarial perturbation को कॉपीराइट सुरक्षा के रूप में बहुत शोध मिला, लेकिन टिकाऊ समाधान नहीं निकला। कभी विक्षोभ गुणवत्ता अत्यधिक घटाता है, तो कभी manipulation और transformative processing के सामने टिकता नहीं।
इसे छोड़ना कठिन है, क्योंकि विकल्प Adobe-नेतृत्व वाली C2PA जैसी third-party monitoring और provenance व्यवस्था है, जो camera sensor से chain-of-custody रखती है, पर चित्र में दिख रही सामग्री से उसका स्वाभाविक संबंध नहीं होता। यदि नई शोध के अनुसार perturbation कई मामलों में समस्या और बढ़ाता है, तो इस दिशा में कॉपीराइट सुरक्षा की खोज कहीं ‘alchemy’ तो नहीं बन गई है।
पहली बार सोमवार, 9 जून 2025 को प्रकाशित।
स्रोत और संबंधित लिंक
- https://www.unite.ai/understanding-diffusion-models-a-deep-dive-into-generative-ai/
- https://www.unite.ai/stable-diffusion-3-5-innovations-that-redefine-ai-image-generation/
- https://www.unite.ai/flux-by-black-forest-labs-the-next-leap-in-text-to-image-models-is-it-better-than-midjourney/
- https://www.unite.ai/what-is-noise-in-image-processing-a-primer/
- https://openai.com/index/attacking-machine-learning-with-adversarial-examples/
- https://www.unite.ai/why-adversarial-image-attacks-are-no-joke/
- https://archive.is/1f6Ua
- https://arxiv.org/pdf/2412.11638v1
- https://keras.io/examples/generative/neural_style_transfer/
- https://arxiv.org/pdf/2302.06588
- https://arxiv.org/pdf/2305.12683
- https://arxiv.org/pdf/2302.04222
- https://huggingface.co/bdsqlsz/stable-diffusion-v1-5
- https://www.w3schools.com/python/ref_random_seed.asp
- https://github.com/goodwillyoga/Flickr8k_dataset?tab=readme-ov-file
- https://www.unite.ai/10-things-to-know-about-claude-3-5-sonnet/
- https://aclanthology.org/D18-2029.pdf
- https://live.ece.utexas.edu/publications/2012/TIP%20BRISQUE.pdf
- https://arxiv.org/pdf/2104.08718
- https://arxiv.org/pdf/2410.07336
- https://arxiv.org/abs/1708.09533
- https://archive.is/72T3D
- https://www.linkedin.com/help/linkedin/answer/a6282984












