Anderson का एंगल
एआई मॉडल चोरी की पहचान करने के लिए गुप्त ट्रैकिंग डेटा के माध्यम से

एक नया तरीका है जो चैटजीपीटी जैसे मॉडलों को कुछ सेकंड में बिना पुनः प्रशिक्षण के गुप्त रूप से वॉटरमार्क कर सकता है, जो सामान्य आउटपुट में कोई निशान नहीं छोड़ता है और सभी संभावित हटाने के प्रयासों को सहन कर सकता है।
वॉटरमार्किंग और ‘कॉपीराइट-बैटिंग’ के बीच का सूक्ष्म अंतर यह है कि वॉटरमार्क – चाहे वह खुला हो या छिपा हुआ – आमतौर पर एक संग्रह (जैसे कि एक छवि डेटासेट) में दिखाई देने के लिए इरादा किया जाता है, जो एक सामान्य प्रतिबंध है जो आकस्मिक प्रतिलिपि बनाता है।
इसके विपरीत, एक काल्पनिक प्रविष्टि एक छोटा सा पाठ का टुकड़ा है, जो आमतौर पर एक शब्द या एक परिभाषा होती है जो एक बड़े और अपेक्षाकृत सामान्य संग्रह में होती है, जो चोरी को साबित करने के लिए डिज़ाइन की जाती है। यह विचार यह है कि जब काम को अवैध रूप से कॉपी किया जाता है, तो या तो स्वयं या एक व्युत्पन्न कार्य के रूप में, मूल स्वामी/स्वामियों द्वारा लगाया गया एक ‘अनोखा’ और काल्पनिक तथ्य की उपस्थिति आसानी से चोरी का कार्य प्रकट करेगी।
एलएलएम (लार्ज लैंग्वेज मॉडल) और वीएलएम (विजन लैंग्वेज मॉडल) में वॉटरमार्क जोड़ने के संदर्भ में, आउटपुट में इन बताऊ संकेतों को शामिल करने की सीमा अक्सर इन दो उद्देश्यों में विभाजित होती है: सभी या अधिकांश आउटपुट में एक स्पष्ट या छिपा हुआ वॉटरमार्क शामिल करने के लिए; या एक ‘गुप्त टोकन’ को पुनर्प्राप्त करने के लिए जो चोरी को साबित करता है – लेकिन जो नियमित आउटपुट में दिखाई नहीं देता है।
सबूत का वजन
बाद की दृष्टिकोण को चीन, इटली और सिंगापुर के बीच एक दिलचस्प नए सहयोग में संबोधित किया जाता है, जो एक ऐसी प्रकटीकरण विधि प्रदान करने का उद्देश्य रखता है ओपन सोर्स मॉडल के लिए, ताकि वे आसानी से व्यावसायिक नहीं किए जा सकें, या मूल लाइसेंस द्वारा अनुमति दी गई तरीकों से उपयोग नहीं किया जा सकता है।
उदाहरण के लिए, एक मॉडल के मूल लाइसेंस में यह कहा जा सकता है कि कोई भी लाभ कमा सकता है काम से तब तक जब तक वे अपने स्वयं के संशोधन या संशोधनों को सार्वजनिक रूप से उपलब्ध कराते हैं उसी उदार लाइसेंस शर्तों के तहत – लेकिन एक कंपनी अपने ‘संशोधनों’ (जैसे फाइन-ट्यून किए गए संस्करण) को गेटकीप करना चाह सकती है, एक मोआत बनाने के लिए जो वास्तव में अनुमति नहीं है।
इस रेखा में अधिकांश शोध बंद-सोर्स, एपीआई-केवल मॉडल, या मॉडल के साथ संबंधित है जिनके लिए केवल अनुकूलित (क्वांटाइज्ड) वज़न उपलब्ध हैं; और जो इसलिए अधिक कठिन हैं कि उन्हें कैसे कुशलता से संपादित और बदला जाए जैसा कि नए पत्र में प्रस्तावित किया गया है (क्योंकि मॉडल की वास्तुकला तक सीधी पहुंच नहीं है)।
इस फॉस्स रिलीज़ पर ध्यान देना शायद चीनी अनुसंधान क्षेत्र से आश्चर्यजनक नहीं है, क्योंकि चीन के एआई आउटपुट को पिछले एक वर्ष में पूर्ण-वजन* मॉडल के रिलीज़ के द्वारा चिह्नित किया गया है जो कम से कम पश्चिमी समकक्षों के बराबर हैं।
नई दृष्टिकोण, जिसे एडिटमार्क कहा जाता है, यह स्वयं को इस तरह से अलग करता है कि यह न तो मॉडल को फाइन-ट्यून करने की आवश्यकता है और न ही डेटा को शामिल करने के लिए प्रशिक्षित करने की आवश्यकता है।
इसके कई फायदे हैं: एक यह है कि एक बार ‘टेल-टेल’ डेटा को प्रशिक्षण डेटासेट में शामिल किया जाता है, एक बार यह खोजा और खुलासा किया जाता है, तो यह प्रभावी नहीं रह जाएगा, क्योंकि यह सीधे हमलावरों द्वारा लक्षित किया जा सकता है; लेकिन एडिटमार्क को हमला करने के लिए, एक दुर्भाग्यपूर्ण व्यक्ति को यह जानने की आवश्यकता होगी कि मॉडल के किस परत को लक्षित करना है, और किस तरह का दृष्टिकोण लेना है। यह एक असंभव परिदृश्य है।
दूसरा, दृष्टिकोण तेज और सस्ता है, क्योंकि यह एक प्रशिक्षित मॉडल पर लागू करने के लिए केवल कुछ सेकंड लेता है (दिन या सप्ताह नहीं), जो फाइन-ट्यूनिंग के गंभीर खर्च को समाप्त करता है (जो मॉडल और डेटा के आकार के साथ रैखिक रूप से बढ़ता है)।
अंत में, दृष्टिकोण सामान्य मॉडल के संचालन को फाइन-ट्यूनिंग या पूर्व संपादन विधियों की तुलना में बहुत कम नुकसान पहुंचाता है।
परीक्षणों में, एडिटमार्क – जो मॉडल वज़न में गणितीय प्रश्नों को एम्बेड करता है जिनके कई संभावित उत्तर हैं – 100% निकासी दर हासिल की।
लेखक कहते हैं:
‘व्यापक प्रयोग एडिटमार्क के असाधारण प्रदर्शन को एलएलएम को वॉटरमार्किंग में प्रदर्शित करते हैं। एडिटमार्क 20 सेकंड से कम समय में 32-बिट वॉटरमार्क एम्बेड करने की असाधारण कुशलता प्राप्त करता है और 100% वॉटरमार्क निकासी दर (ईएसआर) हासिल करता है। ‘
‘विशेष रूप से, वॉटरमार्क एम्बेडिंग समय फाइन-ट्यूनिंग (औसत 6,875 सेकंड) का 1/300 से कम है, जो एडिटमार्क की प्रभावशीलता को उच्च-क्षमता वाले वॉटरमार्क को अभूतपूर्व गति और विश्वसनीयता के साथ लागू करने में उजागर करता है। ‘
‘इसके अलावा, व्यापक प्रयोग एडिटमार्क की लचीलापन, छिपाव और विश्वासworthiness की पुष्टि करते हैं।’
नया पत्र शीर्षक है एडिटमार्क: मॉडल संपादन पर आधारित बड़े भाषा मॉडल को वॉटरमार्किंग, और यह चीन विज्ञान और प्रौद्योगिकी विश्वविद्यालय, सिएना विश्वविद्यालय, और सीएफएआर/आईएचपीसी/ए * स्टार सिंगापुर से आठ लेखकों द्वारा आया है।
विधि
एडिटमार्क दृष्टिकोण में चार घटक होते हैं: एक जनरेटर, एक एनकोडर, एक संपादक, और एक डिकोडर:
[कैप्शन id=”attachment_224904″ align=”alignnone” width=”831″]
जनरेटर एक प्यूडो-रैंडम बीज का उपयोग करके कई-उत्तर गणित प्रश्नों का निर्माण करता है; एनकोडर वॉटरमार्क के आधार पर उत्तरों का चयन करता है, जो तब मॉडल में एक विशेष संपादन प्रक्रिया के माध्यम से एम्बेड किया जाता है। एक बार जब संपादित मॉडल जारी किया जाता है या दुरुपयोग किया जाता है, तो वॉटरमार्क को उन्हीं प्रश्नों का उत्तर देकर और प्रतिक्रियाओं के पैटर्न को डिकोड करके निकाला जा सकता है।
इसके बाद, संपादक मॉडल वज़न को संशोधित करता है ताकि जब उन्हें इन बीज वाले प्रश्न पूछे जाते हैं, तो मॉडल विश्वसनीय रूप से लक्ष्य उत्तर देता है, वॉटरमार्क को सीधे अपने व्यवहार में एम्बेड करता है। डिकोडर तब संदेहास्पद मॉडल को समान प्रश्न प्रदान करके और इसके उत्तरों को वापस छिपी हुई हस्ताक्षर में अनुवाद करके वॉटरमार्क को पुनर्प्राप्त करता है।
थ्रेट मॉडल
पत्र का थ्रेट मॉडल यह मानता है कि वॉटरमार्किंग एक व्हाइट-बॉक्स सेटिंग में किया जाता है। हालांकि यह आमतौर पर सुरक्षा संबंधी शोध में एक अच्छा संकेत नहीं है, यहां यह सामान्य है, क्योंकि विधि उन मालिकों की रक्षा करने का उद्देश्य रखती है जिनके पास अपने स्वयं के काम तक पूरी पहुंच है।
हमलावर को भी मॉडल प्राप्त करने के बाद व्हाइट-बॉक्स एक्सेस माना जाता है, जिसका अर्थ है कि वे इसे संशोधित कर सकते हैं (जैसे कि प्रूनिंग या फाइन-ट्यूनिंग द्वारा)। फिर से, यह परिदृश्य फॉस्स रिलीज़ के मामले में सामान्य और अपेक्षित है। हालांकि, हमलावर को वॉटरमार्क निकासी प्रक्रिया या उपयोग की जाने वाली योजना के बारे में पता नहीं है, और केवल अनुमान और प्रयोग द्वारा इस विधि का पता लगा सकता है (या लीक हो सकता है)।
जनरेटर जीपीटी -4ओ का उपयोग करके तार्किक और तथ्यात्मक रूप से मान्य गणित प्रश्नों का निर्माण करता है जिनमें कई सही उत्तर हैं, और एक प्यूडो-रैंडम बीज का उपयोग करके प्रत्येक प्रश्न को विशिष्ट बनाने के लिए। यह एक ज्ञात वॉटरमार्क को निर्धारित रूप से उत्तर अनुक्रम के माध्यम से एम्बेड करने की अनुमति देता है, जबकि प्रश्नों के बीच ओवरलैप को कम करने के लिए, संपादन जाल से बचने के लिए:
[कैप्शन id=”attachment_224907″ align=”alignnone” width=”714″]
एनकोडर प्रत्येक बाइनरी वॉटरमार्क खंड को एक दिए गए गणित प्रश्न के समाधान सेट से पूर्णांकों की एक विशिष्ट अनुक्रम में परिवर्तित करता है। लेक्सिकोग्राफिकल अनुक्रम सिद्धांत का उपयोग करके, एनकोडर प्रत्येक वॉटरमार्क खंड के दशमलव मान को विशिष्ट क्रमित चयन उत्तर में मैप करता है, यह सुनिश्चित करता है कि वॉटरमार्क मॉडल के व्यवहार में निर्धारित रूप से एम्बेड किया गया है।
संपादक के संबंध में, मूल अल्फाएडिट मॉडल संपादन विधि जो वॉटरमार्किंग के लिए उपयोग की जाती है, वह सटीकता और लचीलापन दोनों में कमी है; समायोजन जो यह करता है वह अक्सर वांछित उत्तर देने में विफल रहता है। कोई भी परिवर्तन जो यह करता है वह आसानी से प्रूनिंग या शोर द्वारा टूट जाता है।
इसे पार करने के लिए, लेखकों ने एक बहु-दौर संपादन रणनीति विकसित की है जो धीरे-धीरे एक ही एमएलपी परत पर मॉडल वज़न को समायोजित करती है, जब तक कि इसके उत्तर वांछित उत्तरों के साथ पर्याप्त रूप से संरेखित नहीं हो जाते। हमलों के खिलाफ संपादन को कठोर बनाने के लिए, वे प्रशिक्षण के दौरान गॉसियन शोर को भी इंजेक्ट करते हैं:
[कैप्शन id=”attachment_224909″ align=”alignnone” width=”743″] एक स्कोरिंग सिस्टम प्रक्रिया को रोकता है जब संपादन पर्याप्त सटीक हो जाते हैं, जबकि नियमितीकरण सुनिश्चित करता है कि अपडेट कई दौरों में स्थिर रहते हैं। डिकोडर मॉडल से उन्हीं विशेष प्रश्नों का उत्तर मांगता है जो वॉटरमार्किंग के दौरान उपयोग किए गए थे, फिर इसके उत्तरों को छिपे हुए आईडी का अनुमान लगाने के लिए पढ़ता है। चूंकि उत्तरों का पैटर्न एक गुप्त नियम का पालन करता है, यह आईडी को मॉडल के आंतरिक भागों की जांच किए बिना पुनर्प्राप्त किया जा सकता है। एडिटमार्क का परीक्षण करने के लिए, पांच एलएलएम का मूल्यांकन किया गया था: जीपीटी 2-एक्स; जीपीटी-जे -6 बी; एलएलएएमए -3-8 बी; बैचुआन -7 बी; और क्वेन -7 बी। उपरोक्त अल्फाएडिट का उपयोग वॉटरमार्क एम्बेड करने के लिए किया गया था, जबकि निकासी सफलता दर (ईएसआर) और एम्बेडिंग समय (ईटी) मेट्रिक्स को अपनाया गया था। बेसलाइन के लिए, लेखकों ने मॉडल वॉटरमार्क (बैकडोर); किमार्क; और बैडएडिट को चुना, एक फ्रेमवर्क जो मूल रूप से बैकडोर इंजेक्शन के लिए डिज़ाइन किया गया था, यहां परियोजना के अपने उद्देश्यों के लिए अनुकूलित किया गया था। लेखकों ने एलएलएएमए -3-8 की 15 वीं परत, जीपीटी 2-एक्सएल और जीपीटी-जे -6 बी की 17 वीं परत, और क्वेन -7 बी और बैचुआन -7 बी की 14 वीं परत को संपादित किया। प्रयोग चार एनवीडिया आरटीएक्स 4090 जीपीयू (प्रत्येक में 24 जीबी वीआरएएम) पर किए गए थे, जिसमें 32- बिट, 64- बिट और 128- बिट लंबाई के वॉटरमार्क एम्बेड किए गए थे। नीचे दी गई छवि में उपयोग किए गए प्रश्न टेम्पलेट विवरण दिए गए हैं: [कैप्शन id=”attachment_224910″ align=”alignnone” width=”578″] यादृच्छिकता के प्रभावों को कम करने के लिए, 1 से 20 तक के बीज का उपयोग विभिन्न वॉटरमार्क क्षमताओं पर परीक्षण के दौरान किया गया था। प्रारंभ में, शोधकर्ताओं ने पांच एलएलएम पर वॉटरमार्क एम्बेड करने के लिए ईएसआर और समय लागत का परीक्षण किया: [कैप्शन id=”attachment_224911″ align=”alignnone” width=”809″] इन परिणामों में, लेखक कहते हैं: ‘[एडिटमार्क] 100% ईएसआर हासिल करता है और सभी मूल्यांकित एलएलएम के लिए 32- बिट वॉटरमार्क एम्बेड करने के लिए 20 सेकंड से कम समय लेता है। विशेष रूप से, बैचुआन -7 बी और क्वेन -7 बी के लिए औसत एम्बेडिंग समय 10 सेकंड से कम है, जो एडिटमार्क की उच्च कुशलता को प्रदर्शित करता है। ‘ 128- बिट वॉटरमार्क के मूल्यांकन के लिए, इस योजना के तहत संभव उच्चतम मूल्य, एडिटमार्क ने ‘अमिटता’ की स्थिति बनाए रखी: [कैप्शन id=”attachment_224912″ align=”alignnone” width=”790″] इसके बाद प्रणाली की वॉटरमार्क विश्वसनीयता को कई बेंचमार्क पर परीक्षण किया गया: [कैप्शन id=”attachment_224913″ align=”alignnone” width=”781″] एडिटमार्क की लचीलापन को छह सामान्य हमला रणनीतियों के खिलाफ परीक्षण किया गया था। मॉडल को पहले 128- बिट वॉटरमार्क के साथ एम्बेड किया गया था, पांच अलग-अलग बीज का उपयोग करके। फाइन-ट्यूनिंग, नीचे दी गई छवि में दिखाया गया है, ने अधिकांश मॉडल के लिए निकासी सफलता दर (ईएसआर) में केवल मामूली गिरावट का कारण बना: [कैप्शन id=”attachment_224914″ align=”alignnone” width=”546″] यहां तक कि कई प्रकरणों के बाद, अधिकांश मॉडल 90% से अधिक ईएसआर बनाए रखते हैं, जो यह दर्शाता है कि एडिटमार्क लोरा-आधारित प्रशिक्षण द्वारा पेश किए गए पैरामीटर ड्रिफ्ट का प्रतिरोध करता है। क्वांटाइजेशन हमलों ने मॉडल की सटीकता को कम कर दिया, लेकिन अधिकांश वॉटरमार्क को बरकरार रखा: [कैप्शन id=”attachment_224915″ align=”alignnone” width=”642″] जैसा कि ऊपर दी गई छवि में देखा जा सकता है, इंट -8 क्वांटाइजेशन ने सभी मॉडल में 100% ईएसआर को बनाए रखा, जबकि इंट -4 क्वांटाइजेशन ने ईएसआर पर एक मामूली प्रभाव डाला, लेकिन अस्वीकार्य प्रदर्शन हानि का परिचय दिया। यह विशेष परिदृश्य हमलावर के लिए सीमित संभावना का सुझाव देता है, क्योंकि यह एक हैक किए गए लेकिन प्रदर्शन से गिरे हुए मॉडल का परिणाम है। शोर और प्रूनिंग के परीक्षण ने चार बेंचमार्क फ्रेमवर्क का मूल्यांकन किया: [कैप्शन id=”attachment_224916″ align=”alignnone” width=”779″] हालांकि, वे बेंचमार्क प्रदर्शन में तेज गिरावट का कारण भी बनते हैं, बीएलआईएमपी पर बैचुआन -7 बी को 27-31% की गिरावट के साथ, जब शोर या प्रूनिंग लागू की जाती है। मॉडल संपादन और अनुकूली हमलों का भी मूल्यांकन किया गया: [कैप्शन id=”attachment_224918″ align=”alignnone” width=”590″] यहां एडिटमार्क 95% से अधिक ईएसआर बनाए रखता है, यहां तक कि जब विशिष्ट एम्बेडिंग परतों को लक्षित किया जाता है। डीआरएम, गुप्त वॉटरमार्क, और अन्य सुरक्षा दृष्टिकोण जो पूर्व-एआई युग में सीमित या आंशिक सफलता का आनंद लेते हैं, मशीन लर्निंग प्रणालियों पर लागू करना मुश्किल है; वर्तमान श्रृंखला की होस्ट आर्किटेक्चर की जानबूझकर कम करने वाली प्रकृति को उपयुक्त टूलिंग की कमी के साथ जोड़ दिया जाता है, जो किसी भी इंजेक्ट किए गए वॉटरमार्क को काफी नाजुक बना देता है। यह देखना प्रभावशाली है कि एक प्रणाली फॉस्स मॉडल वितरण पर लक्षित है, और यह देखना कि यह लगभग सभी परिदृश्यों के खिलाफ बनी हुई है, सिवाय सबसे असंभावित एक के, एक हमलावर की पूर्व जानकारी के संदर्भ में। हालांकि, एडिटमार्क द्वारा पेश की जाने वाली छोटी गिरावट, जो इन प्रयोगों में है, संभावित अपनाने वालों को रोकने का कारण बन सकती है; न कि कम से कम इसलिए कि एक एपीआई-केंद्रित नियंत्रण मॉडल इस तरह के हमलों को लगभग पूरी तरह से रोकता है। * यह साइट दावा करती है कि चीन से ‘ओपन वेट’ रिलीज़ आवश्यक रूप से पूरी तरह से फॉस्स के रूप में योग्य नहीं हैं, क्योंकि अक्सर डेटा वापस रखा जाता है, जो प्रशिक्षण पाइपलाइन की सटीक पुनरावृत्ति को रोकता है। तर्कसंगत रूप से, यह विषय पश्चिम और पूर्व के बीच एआई मॉडल रिलीज़ की राजनीति की एक गहरी जांच के लिए आमंत्रित करता है, जो इस लेख के दायरे से बाहर है। सोमवार, 27 अक्टूबर, 2025 को पहली बार प्रकाशित
डेटा और परीक्षण








निष्कर्ष












