Anderson का एंगल
अब NSFW और ‘सेलिब्रिटी’ पोज़ AI सेंसरशिप के लिए खाद्य हैं

एक नए AI सुरक्षा उपाय के लिए जनरेटिव वीडियो सिस्टम में शरीर की मुद्रा को सेंसर करने का प्रस्ताव है। शारीरिक मुद्रा (या चेहरे की अभिव्यक्ति) जो यौन सुझावक, ‘अपमानजनक इशारे’ या यहां तक कि कॉपीराइट सेलिब्रिटी या संभावित ट्रेडमार्क मुद्रा के रूप में व्याख्या की जा सकती है, सभी लक्षित हैं।
चीन और सिंगापुर से नए शोध ने ‘असुरक्षित’ छवि और वीडियो जनरेशन के एक कम स्पष्ट डोमेन को संबोधित किया है: एक चित्रित व्यक्ति की मुद्रा का स्वयं चित्रण, जैसे कि शरीर या चेहरे की अभिव्यक्ति की स्थिति में AI-निर्मित आउटपुट में:

नए शोध में प्रस्तावित प्रणाली के लिए अवधारणात्मक योजना। स्रोत: https://arxiv.org/pdf/2508.02476
प्रणाली, जिसे पोज़गार्ड कहा जाता है, फाइन-ट्यूनिंग और लोरास का उपयोग करके मॉडल बनाने के लिए करती है जो स्वाभाविक रूप से ‘प्रतिबंधित’ मुद्रा उत्पन्न नहीं कर सकते हैं। यह दृष्टिकोण इसलिए अपनाया गया था क्योंकि फॉस मॉडल में निर्मित सुरक्षा उपायों को आमतौर पर तुच्छ रूप से पार किया जा सकता है, जोर देकर कहा कि यह नया ‘फिल्टर’ विशेष रूप से स्थानीय स्थापना (क्योंकि एपीआई-केवल मॉडल फिल्टर सकते हैं) को लक्षित करता है इनबाउंड और आउटबाउंड सामग्री और प्रॉम्प्ट, बिना मॉडल वजन की अखंडता को जोखिम में डाले फाइन-ट्यूनिंग द्वारा)।
यह पहला काम नहीं है जो स्वयं में असुरक्षित डेटा के रूप में मुद्रा का इलाज करता है; ‘यौन चेहरे की अभिव्यक्ति’ एक छोटे से अध्ययन के क्षेत्र के लिए कुछ समय से रहा है, जबकि नए काम के कई लेखकों ने भी कम जटिल डॉरमेंट प्रणाली बनाई है।
हालांकि, नए शोध पत्र में पहली बार, जहां तक मुझे पता है, यौन सामग्री से परे मुद्रा के प्रकार को बढ़ाने के लिए, यहां तक कि ‘कॉपीराइट सेलिब्रिटी मूवमेंट’ तक शामिल है:
‘हम ज्यामितीय विशेषताओं के बजाय उत्पन्न आउटपुट के संभावित जोखिमों के आधार पर असुरक्षित मुद्रा को परिभाषित करते हैं। [असुरक्षित] मुद्रा में शामिल हैं: 1) भेदभावपूर्ण मुद्रा (जैसे, घुटने टेकना, अपमानजनक सलाम), 2) यौन सुझावक एनएसएफडब्ल्यू मुद्रा, और 3) कॉपीराइट-संवेदनशील मुद्रा जो सेलिब्रिटी विशिष्ट चित्रों की नकल करती है। ‘
‘इन मुद्राओं को ऑनलाइन स्रोतों (जैसे, विकिपीडिया), एलएलएम-आधारित फिल्टरिंग, और जोखिम-लेबल वाले डेटासेट (जैसे, सिविटाई एनएसएफडब्ल्यू टैग) के माध्यम से एकत्र किया जाता है, जो प्रशिक्षण के लिए एक संतुलित और व्यापक असुरक्षित मुद्रा डेटासेट सुनिश्चित करता है।’

पोज़गार्ड के लिए विकसित कोर 50 मुद्राओं की ‘एनएसएफडब्ल्यू’ श्रेणी।
यह दिलचस्प है कि सेलिब्रिटी मुद्रा ट्रेडमार्क की जा सकती है या कानूनी साधनों द्वारा संरक्षित की जा सकती है, और यह कि पर्याप्त रूप से ‘रचनात्मक’ मुद्रा या स्थिति के संयोजन को विशिष्ट नृत्य क्रम के रूप में संरक्षित किया जा सकता है। हालांकि, एक प्रतिष्ठित एकल मुद्रा संरक्षित नहीं हो सकती है, जैसा कि एक फोटोग्राफर ने खोजा, रेंटमेस्टर बनाम नाइके निर्णय में:

एक फोटोग्राफर ने माइकल जॉर्डन की बाईं ओर की तस्वीर ली, नाइके ने जब तस्वीर (दाईं ओर) को पुनर्निर्मित किया, तो फोटोग्राफर ने मामला दर्ज किया; हालांकि, एक न्यायाधीशों के पैनल ने दावे को खारिज कर दिया। स्रोत: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html
नई पोज़गार्ड प्रणाली दावा करती है कि यह पहली बार है जब यह एक असुरक्षित मुद्रा का पता लगाने पर आउटपुट को खराब करता है; एक जनरेटिव मॉडल में सुरक्षा गार्डरेल को सीधे एम्बेड करता है; ‘असुरक्षित’ मुद्रा को तीन श्रेणियों में परिभाषित करता है; और यह सुनिश्चित करता है कि पीढ़ी गुणवत्ता और अखंडता को बनाए रखती है जब एक अपमानजनक मुद्रा को पर्याप्त रूप से संशोधित किया जाता है ताकि यह फिल्टर से बच जाए।
नई शोध पत्र का शीर्षक पोज़गार्ड: पोज़-गाइडेड जेनरेशन के साथ सुरक्षा गार्डरेल है, और यह चीन और सिंगापुर के छह शोधकर्ताओं से आता है, विश्वविद्यालय विज्ञान और प्रौद्योगिकी के विश्वविद्यालय, (सिंगापुर) विज्ञान, प्रौद्योगिकी और अनुसंधान (ए * स्टार सीएफएआर), और नानयांग प्रौद्योगिकी विश्वविद्यालय से।
विधि
पोज़गार्ड बैकडोर हमलों के तर्क को एक रक्षा तंत्र को सीधे मॉडल में बनाने के लिए पुनर्निर्देशित करता है। एक पारंपरिक बैकडोर हमले में, विशिष्ट इनपुट विशिष्ट दुर्भाग्यपूर्ण आउटपुट को ट्रिगर करते हैं, और पोज़गार्ड इस सेटअप को उलट देता है: असुरक्षित मुद्रा जो अपनी यौन, अपमानजनक या कॉपीराइट-संवेदनशील प्रकृति के कारण असुरक्षित मानी जाती है, को ‘तटस्थ’ लक्ष्य छवियों से जोड़ा जाता है, जैसे कि खाली या धुंधली फ्रेम।
मॉडल को सामान्य और ट्रिगर मुद्रा के संयुक्त डेटासेट पर फाइन-ट्यून करके, प्रणाली सीखती है कि हानिरहित इनपुट के लिए विश्वसनीयता को बनाए रखे और असुरक्षित लोगों के लिए आउटपुट गुणवत्ता को खराब करे:

पोज़गार्ड एक साझा शोर-मुक्त यूनेट का उपयोग करके एक संदर्भ छवि और मुद्रा अनुक्रम को संसाधित करता है, पूर्व-प्रशिक्षित वजन को सुरक्षा-संरेखित फाइन-ट्यूनिंग के साथ जोड़ता है। यह सेटअप मॉडल को असुरक्षित मुद्रा के लिए हानिकारक पीढ़ी को दबाने की अनुमति देता है, जबकि सामान्य इनपुट के लिए आउटपुट गुणवत्ता को बनाए रखता है।
यह ‘इन-मॉडल’ रणनीति बाहरी फिल्टर की आवश्यकता को समाप्त कर देती है, और यहां तक कि विरोधी या ओपन-सोर्स वातावरण में भी प्रभावी रहती है*
डेटा और परीक्षण
हानिरहित बेसलाइन मुद्रा प्राप्त करने के लिए, लेखकों ने यूबीसी फैशन डेटासेट का उपयोग किया:

पोज़गार्ड में हानिरहित मुद्रा के स्रोत के रूप में ब्रिटिश कोलंबिया विश्वविद्यालय फैशन डेटासेट के उदाहरण। स्रोत: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf
असुरक्षित मुद्रा, जैसा कि पहले उल्लेख किया गया था, खुले स्रोत मंचों जैसे सिविटाई से सourced थीं। मुद्रा को डीडब्ल्यूपोज़ फ्रेमवर्क का उपयोग करके निकाला गया था, जिसके परिणामस्वरूप 768x768px मुद्रा छवियां थीं:

प्रशिक्षण के लिए उपयोग की जाने वाली 50 असुरक्षित मुद्राओं के उदाहरण। यहां दिखाए गए एनएसएफडब्ल्यू और कॉपीराइट-संवेदनशील मुद्राएं विकिपीडिया, रेंडर-स्टेट, सिविटाई और गूगल खोज से सourced हैं।
मुद्रा-निर्देशित पीढ़ी मॉडल एनिमेटएनी था।
छह मीट्रिक का उपयोग किया गया था फ्रेचेट वीडियो दूरी (एफवीडी); एफआईडी-वीआईडी; संरचनात्मक समानता सूचकांक (एसएसआईएम); पीक सिग्नल-टू-नॉइज़ रेशियो (पीएसएनआर); सीखा हुआ संवेदी समानता मीट्रिक (एलपीआईपीएस); और फ्रेचेट इन्सेप्शन दूरी (एफआईडी)। परीक्षण एक एनवीडिया ए 6000 जीपीयू पर 48 जीबी के वीआरएएम के साथ, एक बैच आकार 4 और एक सीखने की दर 1×10 -5 पर किया गया था।
परीक्षण की तीन प्राथमिक श्रेणियां थीं प्रभावशीलता, कठोरता, और सामान्यीकरण।
इनमें से पहले, प्रभावशीलता में, लेखकों ने पोज़गार्ड के लिए दो प्रशिक्षण रणनीतियों की तुलना की: शोर-मुक्त यूनेट का पूर्ण फाइन-ट्यूनिंग और पैरामीटर-कुशल फाइन-ट्यूनिंग लोरा मॉड्यूल का उपयोग करके।
दोनों दृष्टिकोण असुरक्षित मुद्रा से आउटपुट को दबाने के लिए पोज़गार्ड को सक्षम करते हैं, जबकि हानिरहित मुद्रा पर आउटपुट गुणवत्ता को बनाए रखते हैं, लेकिन विभिन्न ट्रेड-ऑफ के साथ: पूर्ण फाइन-ट्यूनिंग मजबूत दबाने को प्राप्त करता है और उच्च विश्वसनीयता को बनाए रखता है, विशेष रूप से जब असुरक्षित प्रशिक्षण मुद्रा की संख्या छोटी थी; और लोरा-आधारित ट्यूनिंग में पीढ़ी गुणवत्ता में अधिक गिरावट आती है क्योंकि असुरक्षित मुद्रा की संख्या बढ़ जाती है – लेकिन इसमें काफी कम पैरामीटर और कम कम्प्यूटिंग की आवश्यकता होती है।

पीढ़ी और रक्षा मीट्रिक पर पोज़गार्ड का प्रदर्शन। ऊपर की ओर इशारा करने वाले तीर उन मीट्रिक को इंगित करते हैं जहां उच्च मान बेहतर होते हैं; नीचे की ओर इशारा करने वाले तीर उन मीट्रिक को इंगित करते हैं जहां कम मान बेहतर होते हैं।
गुणात्मक परिणाम (नीचे दी गई छवि देखें) ने दिखाया कि हस्तक्षेप के बिना, मॉडल ने अपमानजनक और एनएसएफडब्ल्यू मुद्रा को उच्च विश्वसनीयता के साथ पुनरुत्पादित किया। पोज़गार्ड को सक्षम करने पर, इन मुद्राओं ने कम गुणवत्ता वाले या खाली आउटपुट को ट्रिगर किया, जबकि हानिरहित इनपुट दृश्य रूप से बरकरार रहे। जैसा कि रक्षा सेट चार से बैंतीस असुरक्षित मुद्रा तक बढ़ गया, हानिरहित आउटपुट गुणवत्ता में मध्यम गिरावट आई, विशेष रूप से लोरा के लिए।

पूर्ण-पैरामीटर फाइन-ट्यूनिंग का उपयोग करके एक असुरक्षित मुद्रा के लिए पोज़गार्ड की प्रतिक्रिया दिखाने वाले दृश्य परिणाम। मॉडल अपमानजनक, एनएसएफडब्ल्यू और कॉपीराइट-संवेदनशील मुद्रा के लिए आउटपुट को दबाने के लिए पोज़गार्ड को निर्देशित करता है, जबकि सामान्य इनपुट के लिए गुणवत्ता को बनाए रखता है।
दूसरे, कठोरता के लिए, पोज़गार्ड को वास्तविक दुनिया के तैनाती की स्थितियों में परीक्षण किया गया था, जहां इनपुट मुद्रा निर्धारित उदाहरणों से मेल नहीं खा सकती है। मूल्यांकन में सामान्य रूपांतरण जैसे अनुवाद, स्केलिंग, और घुमाव शामिल थे, साथ ही साथ जोड़ों के कोणों में मैनुअल समायोजन भी शामिल था ताकि प्राकृतिक भिन्नता का अनुकरण किया जा सके।

सामान्य मुद्रा परिवर्तनों के सामने पोज़गार्ड की कठोरता के परिणाम।
अधिकांश मामलों में, मॉडल ने असुरक्षित पीढ़ी को दबाना जारी रखा, यह दर्शाता है कि रक्षा मध्यम विकृतियों के प्रति मजबूत रहती है। जब परिवर्तनों ने मुद्रा में निहित जोखिम को दूर कर दिया, तो मॉडल ने दबाना बंद कर दिया और सामान्य आउटपुट का उत्पादन किया, यह सुझाव देते हुए कि यह निर्दोष विचलन के तहत झूठे सकारात्मक परिणामों से बचता है।

मुद्रा संशोधनों के प्रति पोज़गार्ड की कठोरता का मूल्यांकन। छवि मॉडल के आउटपुट को दिखाती है असुरक्षित मुद्रा को अनुवाद, स्केलिंग, और घुमाव द्वारा संशोधित किया जाता है, साथ ही मैनुअल लिम्ब समायोजन। पोज़गार्ड हल्के परिवर्तनों के तहत असुरक्षित पीढ़ी को दबाना जारी रखता है, लेकिन जब मुद्रा अब जोखिम भरा सामग्री नहीं ले जाती है तो सामान्य आउटपुट को फिर से शुरू करता है।
अंत में, मुख्य प्रयोगों में, शोधकर्ताओं ने पोज़गार्ड का सामान्यीकरण परीक्षण किया – इसकी विभिन्न परिस्थितियों और वातावरण में प्रभावी ढंग से काम करने की क्षमता।
यहां, पोज़गार्ड को संदर्भ छवि-निर्देशित पीढ़ी के लिए अनिमेटएनी मॉडल के साथ लागू किया गया था। इस सेटिंग में, प्रणाली ने पोज़-आधारित नियंत्रण की तुलना में अनधिकृत आउटपुट के दमन में मजबूती से सुधार दिखाया, कुछ मामलों में उत्पन्न वीडियो में लगभग पूर्ण गिरावट के साथ:

पोज़गार्ड के प्रदर्शन की तुलना पोज़-निर्देशित बनाम संदर्भ छवि-निर्देशित पीढ़ी पर लागू करने के लिए चार असुरक्षित इनपुट पर पूर्ण फाइन-ट्यूनिंग का उपयोग किया गया था।
लेखक इसे संदर्भ छवियों में घने पहचान संबंधी जानकारी के लिए जिम्मेदार ठहराते हैं, जो मॉडल को लक्षित रक्षात्मक व्यवहार सीखने की अनुमति देता है। परिणाम, वे सुझाव देते हैं, यह दर्शाते हैं कि पोज़गार्ड वीडियो को सीधे व्यक्ति की उपस्थिति से उत्पन्न करने वाले परिदृश्यों में व्यक्तिगतीकरण जोखिमों को सीमित कर सकता है।
एक अंतिम परीक्षण के लिए, लेखकों ने पोज़गार्ड को चेहरे की भूमिका-निर्देशित वीडियो सिंथेसिस के लिए एनिपोर्ट्रेट प्रणाली पर लागू किया, जो विशेष रूप से चेहरे की अभिव्यक्ति पर केंद्रित है:

एनिपोर्ट्रेट में असुरक्षित चेहरे की अभिव्यक्तियों को दबाया जा रहा है, नए प्रणाली के साथ।
शोर-मुक्त यूनेट को उसी रक्षा तंत्र के साथ फाइन-ट्यून करके, मॉडल असुरक्षित चेहरे की भूमिका से आउटपुट को दबाने में सक्षम था, जबकि हानिरहित अभिव्यक्तियों को अस्पर्श रखा। परिणाम, लेखकों का सुझाव है, यह दर्शाते हैं कि पोज़गार्ड इनपुट माध्यमों और अधिक स्थानीयकृत, अभिव्यक्ति-संचालित पीढ़ी कार्यों में सामान्यीकृत हो सकता है।

संदर्भ छवि-निर्देशित पीढ़ी के लिए पोज़गार्ड की प्रतिक्रिया को दिखाने वाले दृश्य परिणाम।
निष्कर्ष
यह स्वीकार किया जाना चाहिए कि पत्र द्वारा प्रदान की गई 50 प्रतिबंधित संदर्भ मुद्राओं में से, गतिविधियों जैसे चिकित्सा परीक्षण, या यहां तक कि सुस्त घरेलू कार्यों को भी संश्लेषण-आधारित स्कंथोर्प प्रभाव की तरह ब्लॉक किया जा सकता है।
इस दृष्टिकोण से, और चेहरे की अभिव्यक्ति के मामले में बहुत अधिक, (जो इरादे में बहुत अधिक अस्पष्ट और सूक्ष्म हो सकती है), पोज़गार्ड को एक प्रकार का मोटा उपकरण लगता है। इसके अलावा, एनएसएफडब्ल्यू एआई के आसपास的一般 चिलिंग प्रभाव के कारण, फॉस रिलीज जैसे हाल ही में फ्लक्स कॉन्टेक्स्ट बहुत सेंसर्ड होते हैं, या तो कठोर डेटासेट फिल्टरिंग, वजन-संपादन, या दोनों के माध्यम से।
इसलिए, यहां प्रस्तावित प्रतिबंध जोड़ना स्थानीय-मॉडल सेंसरशिप के बोझ को कम करने का एक सूक्ष्म प्रयास प्रतीत होता है। यह शायद हमें एक भविष्य की ओर ले जाता है जहां स्थानीय मॉडल किसी भी चीज की एक हीन पीढ़ी का उत्पादन कर सकते हैं जो उपयोगकर्ता पसंद करते हैं, जबकि एपीआई मॉडल बेहतर आउटपुट प्रदान करते हैं, यदि केवल वे फिल्टर और सुरक्षा उपायों के गार्ड को नेविगेट कर सकते हैं जो होस्ट कंपनी के कानूनी विभाग को शांत करते हैं।
एक प्रणाली जैसे पोज़गार्ड, जिसमें फाइन-ट्यूनिंग सक्रिय रूप से आधार मॉडल के आउटपुट की गुणवत्ता को प्रभावित करती है (हालांकि यह पत्र में अनदेखा किया जाता है), ऑनलाइन-मॉडल के लिए लक्षित नहीं है; ऑनलाइन-मॉडल वैंगार्ड मॉडल संभवतः अनियंत्रित प्रशिक्षण डेटा का लाभ उठाते रहेंगे, क्योंकि इन मॉडलों की शक्तिशाली एनएसएफडब्ल्यू क्षमताएं महत्वपूर्ण निगरानी उपायों द्वारा नियंत्रित की जाती हैं।
* विधि यहां उतनी ही छोटी है जितनी कि पत्र में है (जो केवल पांच पृष्ठों तक चलती है), और, जैसा कि आम तौर पर होता है, दृष्टिकोण को परीक्षण अनुभाग से सबसे अच्छा समझा जाता है।
पहली बार बुधवार, 6 अगस्त, 2025 को प्रकाशित किया गया।












