Anderson का एंगल

एआई मॉडल चोरी की पहचान करने के लिए गुप्त ट्रैकिंग डेटा के माध्यम से

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

एक नया तरीका है जो चैटजीपीटी जैसे मॉडलों को कुछ सेकंड में बिना पुनः प्रशिक्षण के गुप्त रूप से वॉटरमार्क कर सकता है, जो सामान्य आउटपुट में कोई निशान नहीं छोड़ता है और सभी संभावित हटाने के प्रयासों को सहन कर सकता है।

 

वॉटरमार्किंग और ‘कॉपीराइट-बैटिंग’ के बीच का सूक्ष्म अंतर यह है कि वॉटरमार्क – चाहे वह खुला हो या छिपा हुआ – आमतौर पर एक संग्रह (जैसे कि एक छवि डेटासेट) में दिखाई देने के लिए इरादा किया जाता है, जो एक सामान्य प्रतिबंध है जो आकस्मिक प्रतिलिपि बनाता है।

इसके विपरीत, एक काल्पनिक प्रविष्टि एक छोटा सा पाठ का टुकड़ा है, जो आमतौर पर एक शब्द या एक परिभाषा होती है जो एक बड़े और अपेक्षाकृत सामान्य संग्रह में होती है, जो चोरी को साबित करने के लिए डिज़ाइन की जाती है। यह विचार यह है कि जब काम को अवैध रूप से कॉपी किया जाता है, तो या तो स्वयं या एक व्युत्पन्न कार्य के रूप में, मूल स्वामी/स्वामियों द्वारा लगाया गया एक ‘अनोखा’ और काल्पनिक तथ्य की उपस्थिति आसानी से चोरी का कार्य प्रकट करेगी।

एलएलएम (लार्ज लैंग्वेज मॉडल) और वीएलएम (विजन लैंग्वेज मॉडल) में वॉटरमार्क जोड़ने के संदर्भ में, आउटपुट में इन बताऊ संकेतों को शामिल करने की सीमा अक्सर इन दो उद्देश्यों में विभाजित होती है: सभी या अधिकांश आउटपुट में एक स्पष्ट या छिपा हुआ वॉटरमार्क शामिल करने के लिए; या एक ‘गुप्त टोकन’ को पुनर्प्राप्त करने के लिए जो चोरी को साबित करता है – लेकिन जो नियमित आउटपुट में दिखाई नहीं देता है।

सबूत का वजन

बाद की दृष्टिकोण को चीन, इटली और सिंगापुर के बीच एक दिलचस्प नए सहयोग में संबोधित किया जाता है, जो एक ऐसी प्रकटीकरण विधि प्रदान करने का उद्देश्य रखता है ओपन सोर्स मॉडल के लिए, ताकि वे आसानी से व्यावसायिक नहीं किए जा सकें, या मूल लाइसेंस द्वारा अनुमति दी गई तरीकों से उपयोग नहीं किया जा सकता है।

उदाहरण के लिए, एक मॉडल के मूल लाइसेंस में यह कहा जा सकता है कि कोई भी लाभ कमा सकता है काम से तब तक जब तक वे अपने स्वयं के संशोधन या संशोधनों को सार्वजनिक रूप से उपलब्ध कराते हैं उसी उदार लाइसेंस शर्तों के तहत – लेकिन एक कंपनी अपने ‘संशोधनों’ (जैसे फाइन-ट्यून किए गए संस्करण) को गेटकीप करना चाह सकती है, एक मोआत बनाने के लिए जो वास्तव में अनुमति नहीं है।

इस रेखा में अधिकांश शोध बंद-सोर्स, एपीआई-केवल मॉडल, या मॉडल के साथ संबंधित है जिनके लिए केवल अनुकूलित (क्वांटाइज्ड) वज़न उपलब्ध हैं; और जो इसलिए अधिक कठिन हैं कि उन्हें कैसे कुशलता से संपादित और बदला जाए जैसा कि नए पत्र में प्रस्तावित किया गया है (क्योंकि मॉडल की वास्तुकला तक सीधी पहुंच नहीं है)।

इस फॉस्स रिलीज़ पर ध्यान देना शायद चीनी अनुसंधान क्षेत्र से आश्चर्यजनक नहीं है, क्योंकि चीन के एआई आउटपुट को पिछले एक वर्ष में पूर्ण-वजन* मॉडल के रिलीज़ के द्वारा चिह्नित किया गया है जो कम से कम पश्चिमी समकक्षों के बराबर हैं।

नई दृष्टिकोण, जिसे एडिटमार्क कहा जाता है, यह स्वयं को इस तरह से अलग करता है कि यह न तो मॉडल को फाइन-ट्यून करने की आवश्यकता है और न ही डेटा को शामिल करने के लिए प्रशिक्षित करने की आवश्यकता है।

इसके कई फायदे हैं: एक यह है कि एक बार ‘टेल-टेल’ डेटा को प्रशिक्षण डेटासेट में शामिल किया जाता है, एक बार यह खोजा और खुलासा किया जाता है, तो यह प्रभावी नहीं रह जाएगा, क्योंकि यह सीधे हमलावरों द्वारा लक्षित किया जा सकता है; लेकिन एडिटमार्क को हमला करने के लिए, एक दुर्भाग्यपूर्ण व्यक्ति को यह जानने की आवश्यकता होगी कि मॉडल के किस परत को लक्षित करना है, और किस तरह का दृष्टिकोण लेना है। यह एक असंभव परिदृश्य है।

दूसरा, दृष्टिकोण तेज और सस्ता है, क्योंकि यह एक प्रशिक्षित मॉडल पर लागू करने के लिए केवल कुछ सेकंड लेता है (दिन या सप्ताह नहीं), जो फाइन-ट्यूनिंग के गंभीर खर्च को समाप्त करता है (जो मॉडल और डेटा के आकार के साथ रैखिक रूप से बढ़ता है)।

अंत में, दृष्टिकोण सामान्य मॉडल के संचालन को फाइन-ट्यूनिंग या पूर्व संपादन विधियों की तुलना में बहुत कम नुकसान पहुंचाता है।

परीक्षणों में, एडिटमार्क – जो मॉडल वज़न में गणितीय प्रश्नों को एम्बेड करता है जिनके कई संभावित उत्तर हैं – 100% निकासी दर हासिल की।

लेखक कहते हैं:

‘व्यापक प्रयोग एडिटमार्क के असाधारण प्रदर्शन को एलएलएम को वॉटरमार्किंग में प्रदर्शित करते हैं। एडिटमार्क 20 सेकंड से कम समय में 32-बिट वॉटरमार्क एम्बेड करने की असाधारण कुशलता प्राप्त करता है और 100% वॉटरमार्क निकासी दर (ईएसआर) हासिल करता है। ‘

‘विशेष रूप से, वॉटरमार्क एम्बेडिंग समय फाइन-ट्यूनिंग (औसत 6,875 सेकंड) का 1/300 से कम है, जो एडिटमार्क की प्रभावशीलता को उच्च-क्षमता वाले वॉटरमार्क को अभूतपूर्व गति और विश्वसनीयता के साथ लागू करने में उजागर करता है। ‘

‘इसके अलावा, व्यापक प्रयोग एडिटमार्क की लचीलापन, छिपाव और विश्वासworthiness की पुष्टि करते हैं।’

नया पत्र शीर्षक है एडिटमार्क: मॉडल संपादन पर आधारित बड़े भाषा मॉडल को वॉटरमार्किंग, और यह चीन विज्ञान और प्रौद्योगिकी विश्वविद्यालय, सिएना विश्वविद्यालय, और सीएफएआर/आईएचपीसी/ए * स्टार सिंगापुर से आठ लेखकों द्वारा आया है।

विधि

एडिटमार्क दृष्टिकोण में चार घटक होते हैं: एक जनरेटर, एक एनकोडर, एक संपादक, और एक डिकोडर:

[कैप्शन id=”attachment_224904″ align=”alignnone” width=”831″]एडिटमार्क पाइपलाइन एक मॉडल को विशिष्ट गणितीय प्रश्नों के उत्तर देने के लिए संपादित करके एक वॉटरमार्क एम्बेड करती है जो छिपी हुई पहचान करने वाली जानकारी को एन्कोड करती है। स्रोत: https://arxiv.org/pdf/2510.16367 एडिटमार्क पाइपलाइन एक मॉडल को विशिष्ट गणितीय प्रश्नों के उत्तर देने के लिए संपादित करके एक वॉटरमार्क एम्बेड करती है जो छिपी हुई पहचान करने वाली जानकारी को एन्कोड करती है। स्रोत: https://arxiv.org/pdf/2510.16367[/caption]

जनरेटर एक प्यूडो-रैंडम बीज का उपयोग करके कई-उत्तर गणित प्रश्नों का निर्माण करता है; एनकोडर वॉटरमार्क के आधार पर उत्तरों का चयन करता है, जो तब मॉडल में एक विशेष संपादन प्रक्रिया के माध्यम से एम्बेड किया जाता है। एक बार जब संपादित मॉडल जारी किया जाता है या दुरुपयोग किया जाता है, तो वॉटरमार्क को उन्हीं प्रश्नों का उत्तर देकर और प्रतिक्रियाओं के पैटर्न को डिकोड करके निकाला जा सकता है।

इसके बाद, संपादक मॉडल वज़न को संशोधित करता है ताकि जब उन्हें इन बीज वाले प्रश्न पूछे जाते हैं, तो मॉडल विश्वसनीय रूप से लक्ष्य उत्तर देता है, वॉटरमार्क को सीधे अपने व्यवहार में एम्बेड करता है। डिकोडर तब संदेहास्पद मॉडल को समान प्रश्न प्रदान करके और इसके उत्तरों को वापस छिपी हुई हस्ताक्षर में अनुवाद करके वॉटरमार्क को पुनर्प्राप्त करता है।

थ्रेट मॉडल

पत्र का थ्रेट मॉडल यह मानता है कि वॉटरमार्किंग एक व्हाइट-बॉक्स सेटिंग में किया जाता है। हालांकि यह आमतौर पर सुरक्षा संबंधी शोध में एक अच्छा संकेत नहीं है, यहां यह सामान्य है, क्योंकि विधि उन मालिकों की रक्षा करने का उद्देश्य रखती है जिनके पास अपने स्वयं के काम तक पूरी पहुंच है।

हमलावर को भी मॉडल प्राप्त करने के बाद व्हाइट-बॉक्स एक्सेस माना जाता है, जिसका अर्थ है कि वे इसे संशोधित कर सकते हैं (जैसे कि प्रूनिंग या फाइन-ट्यूनिंग द्वारा)। फिर से, यह परिदृश्य फॉस्स रिलीज़ के मामले में सामान्य और अपेक्षित है। हालांकि, हमलावर को वॉटरमार्क निकासी प्रक्रिया या उपयोग की जाने वाली योजना के बारे में पता नहीं है, और केवल अनुमान और प्रयोग द्वारा इस विधि का पता लगा सकता है (या लीक हो सकता है)।

जनरेटर जीपीटी -4ओ का उपयोग करके तार्किक और तथ्यात्मक रूप से मान्य गणित प्रश्नों का निर्माण करता है जिनमें कई सही उत्तर हैं, और एक प्यूडो-रैंडम बीज का उपयोग करके प्रत्येक प्रश्न को विशिष्ट बनाने के लिए। यह एक ज्ञात वॉटरमार्क को निर्धारित रूप से उत्तर अनुक्रम के माध्यम से एम्बेड करने की अनुमति देता है, जबकि प्रश्नों के बीच ओवरलैप को कम करने के लिए, संपादन जाल से बचने के लिए:

[कैप्शन id=”attachment_224907″ align=”alignnone” width=”714″]जीपीटी -4ओ द्वारा वॉटरमार्क एम्बेडिंग के लिए प्रश्नों के टेम्पलेट, प्रत्येक एक असमानता से कई मान्य पूर्णांक उत्तर प्राप्त करने के लिए संरचित। जीपीटी -4ओ द्वारा वॉटरमार्क एम्बेडिंग के लिए प्रश्नों के टेम्पलेट, प्रत्येक एक असमानता से कई मान्य पूर्णांक उत्तर प्राप्त करने के लिए संरचित।[/em]</caption]

एनकोडर प्रत्येक बाइनरी वॉटरमार्क खंड को एक दिए गए गणित प्रश्न के समाधान सेट से पूर्णांकों की एक विशिष्ट अनुक्रम में परिवर्तित करता है। लेक्सिकोग्राफिकल अनुक्रम सिद्धांत का उपयोग करके, एनकोडर प्रत्येक वॉटरमार्क खंड के दशमलव मान को विशिष्ट क्रमित चयन उत्तर में मैप करता है, यह सुनिश्चित करता है कि वॉटरमार्क मॉडल के व्यवहार में निर्धारित रूप से एम्बेड किया गया है।

संपादक के संबंध में, मूल अल्फाएडिट मॉडल संपादन विधि जो वॉटरमार्किंग के लिए उपयोग की जाती है, वह सटीकता और लचीलापन दोनों में कमी है; समायोजन जो यह करता है वह अक्सर वांछित उत्तर देने में विफल रहता है। कोई भी परिवर्तन जो यह करता है वह आसानी से प्रूनिंग या शोर द्वारा टूट जाता है।

इसे पार करने के लिए, लेखकों ने एक बहु-दौर संपादन रणनीति विकसित की है जो धीरे-धीरे एक ही एमएलपी परत पर मॉडल वज़न को समायोजित करती है, जब तक कि इसके उत्तर वांछित उत्तरों के साथ पर्याप्त रूप से संरेखित नहीं हो जाते। हमलों के खिलाफ संपादन को कठोर बनाने के लिए, वे प्रशिक्षण के दौरान गॉसियन शोर को भी इंजेक्ट करते हैं:

[कैप्शन id=”attachment_224909″ align=”alignnone” width=”743″]बैचुआन -7 बी, क्वेन -7 बी और एलएलएएमए 3-8 बी से पहले और बाद में के 1 के लिए परिवर्तनों का वितरण। शीर्ष पंक्ति यादृच्छिक शोर इंजेक्शन का प्रभाव दिखाती है; नीचे की पंक्ति मॉडल प्रूनिंग का प्रभाव दिखाती है। सभी परिवर्तन शून्य के करीब रहते हैं, जो सुझाव देते हैं कि हमले मॉडल के आंतरिक व्यवहार को महत्वपूर्ण रूप से बाधित नहीं करते हैं। बैचुआन -7 बी, क्वेन -7 बी और एलएलएएमए 3-8 बी से पहले और बाद में के 1 के लिए परिवर्तनों का वितरण। शीर्ष पंक्ति यादृच्छिक शोर इंजेक्शन का प्रभाव दिखाती है; नीचे की पंक्ति मॉडल प्रूनिंग का प्रभाव दिखाती है। सभी परिवर्तन शून्य के करीब रहते हैं, जो सुझाव देते हैं कि हमले मॉडल के आंतरिक व्यवहार को महत्वपूर्ण रूप से बाधित नहीं करते हैं।[/em]

एक स्कोरिंग सिस्टम प्रक्रिया को रोकता है जब संपादन पर्याप्त सटीक हो जाते हैं, जबकि नियमितीकरण सुनिश्चित करता है कि अपडेट कई दौरों में स्थिर रहते हैं।

डिकोडर मॉडल से उन्हीं विशेष प्रश्नों का उत्तर मांगता है जो वॉटरमार्किंग के दौरान उपयोग किए गए थे, फिर इसके उत्तरों को छिपे हुए आईडी का अनुमान लगाने के लिए पढ़ता है। चूंकि उत्तरों का पैटर्न एक गुप्त नियम का पालन करता है, यह आईडी को मॉडल के आंतरिक भागों की जांच किए बिना पुनर्प्राप्त किया जा सकता है।

डेटा और परीक्षण

एडिटमार्क का परीक्षण करने के लिए, पांच एलएलएम का मूल्यांकन किया गया था: जीपीटी 2-एक्स; जीपीटी-जे -6 बी; एलएलएएमए -3-8 बी; बैचुआन -7 बी; और क्वेन -7 बी। उपरोक्त अल्फाएडिट का उपयोग वॉटरमार्क एम्बेड करने के लिए किया गया था, जबकि निकासी सफलता दर (ईएसआर) और एम्बेडिंग समय (ईटी) मेट्रिक्स को अपनाया गया था।

बेसलाइन के लिए, लेखकों ने मॉडल वॉटरमार्क (बैकडोर); किमार्क; और बैडएडिट को चुना, एक फ्रेमवर्क जो मूल रूप से बैकडोर इंजेक्शन के लिए डिज़ाइन किया गया था, यहां परियोजना के अपने उद्देश्यों के लिए अनुकूलित किया गया था।

लेखकों ने एलएलएएमए -3-8 की 15 वीं परत, जीपीटी 2-एक्सएल और जीपीटी-जे -6 बी की 17 वीं परत, और क्वेन -7 बी और बैचुआन -7 बी की 14 वीं परत को संपादित किया।

प्रयोग चार एनवीडिया आरटीएक्स 4090 जीपीयू (प्रत्येक में 24 जीबी वीआरएएम) पर किए गए थे, जिसमें 32- बिट, 64- बिट और 128- बिट लंबाई के वॉटरमार्क एम्बेड किए गए थे। नीचे दी गई छवि में उपयोग किए गए प्रश्न टेम्पलेट विवरण दिए गए हैं:

[कैप्शन id=”attachment_224910″ align=”alignnone” width=”578″]वॉटरमार्किंग के लिए कई-उत्तर प्रश्न उत्पन्न करने के लिए उपयोग किए जाने वाले टेम्पलेट। प्रत्येक प्रश्न एक अलग प्रकार की गणितीय असमानता पर आधारित है, जिसमें चर के लिए यादृच्छिक मान डाले जाते हैं। मॉडल को पूर्णांक समाधानों की एक सूची लौटाने के लिए कहा जाता है, जिसमें उत्तरों का क्रम वॉटरमार्क बिट्स को एन्कोड या डीकोड करने के लिए उपयोग किया जाता है। चार टेम्पलेट द्विघात, लॉगरिदमिक, तार्किक और अंतराल-आधारित रूपों को कवर करते हैं, और सभी जीपीटी -4ओ का उपयोग करके उत्पन्न किए गए थे। वॉटरमार्किंग के लिए कई-उत्तर प्रश्न उत्पन्न करने के लिए उपयोग किए जाने वाले टेम्पलेट। प्रत्येक प्रश्न एक अलग प्रकार की गणितीय असमानता पर आधारित है, जिसमें चर के लिए यादृच्छिक मान डाले जाते हैं। मॉडल को पूर्णांक समाधानों की एक सूची लौटाने के लिए कहा जाता है, जिसमें उत्तरों का क्रम वॉटरमार्क बिट्स को एन्कोड या डीकोड करने के लिए उपयोग किया जाता है। चार टेम्पलेट द्विघात, लॉगरिदमिक, तार्किक और अंतराल-आधारित रूपों को कवर करते हैं, और सभी जीपीटी -4ओ का उपयोग करके उत्पन्न किए गए थे।[/em]

यादृच्छिकता के प्रभावों को कम करने के लिए, 1 से 20 तक के बीज का उपयोग विभिन्न वॉटरमार्क क्षमताओं पर परीक्षण के दौरान किया गया था।

प्रारंभ में, शोधकर्ताओं ने पांच एलएलएम पर वॉटरमार्क एम्बेड करने के लिए ईएसआर और समय लागत का परीक्षण किया:

[कैप्शन id=”attachment_224911″ align=”alignnone” width=”809″]पांच बड़े भाषा मॉडल पर एडिटमार्क की तुलना तीन पूर्व वॉटरमार्किंग विधियों के साथ। निकासी सफलता दर (ईएसआर) और एम्बेडिंग समय (ईटी) सेकंड में रिपोर्ट किए जाते हैं। एडिटमार्क लगातार 100% सफलता दर हासिल करता है और एम्बेडिंग समय को कई क्रमों से कम करता है, जो मॉडल के आकार और वास्तुकला में भिन्न होने पर सभी बेसलाइन को पार करता है। पांच बड़े भाषा मॉडल पर एडिटमार्क की तुलना तीन पूर्व वॉटरमार्किंग विधियों के साथ। निकासी सफलता दर (ईएसआर) और एम्बेडिंग समय (ईटी) सेकंड में रिपोर्ट किए जाते हैं। एडिटमार्क लगातार 100% सफलता दर हासिल करता है और एम्बेडिंग समय को कई क्रमों से कम करता है, जो मॉडल के आकार और वास्तुकला में भिन्न होने पर सभी बेसलाइन को पार करता है।[/em]

इन परिणामों में, लेखक कहते हैं:

‘[एडिटमार्क] 100% ईएसआर हासिल करता है और सभी मूल्यांकित एलएलएम के लिए 32- बिट वॉटरमार्क एम्बेड करने के लिए 20 सेकंड से कम समय लेता है। विशेष रूप से, बैचुआन -7 बी और क्वेन -7 बी के लिए औसत एम्बेडिंग समय 10 सेकंड से कम है, जो एडिटमार्क की उच्च कुशलता को प्रदर्शित करता है। ‘

128- बिट वॉटरमार्क के मूल्यांकन के लिए, इस योजना के तहत संभव उच्चतम मूल्य, एडिटमार्क ने ‘अमिटता’ की स्थिति बनाए रखी:

[कैप्शन id=”attachment_224912″ align=”alignnone” width=”790″]पांच भाषा मॉडल पर 32-, 64- और 128- बिट वॉटरमार्क की लंबाई के लिए निकासी सफलता दर और एम्बेडिंग समय। सभी मामलों में उत्कृष्ट सफलता दर बनाए रखी जाती है, जबकि एम्बेडिंग समय वॉटरमार्क आकार के साथ बढ़ता है, लेकिन 128 बिट पर भी एक मिनट से कम रहता है। पांच भाषा मॉडल पर 32-, 64- और 128- बिट वॉटरमार्क की लंबाई के लिए निकासी सफलता दर और एम्बेडिंग समय। सभी मामलों में उत्कृष्ट सफलता दर बनाए रखी जाती है, जबकि एम्बेडिंग समय वॉटरमार्क आकार के साथ बढ़ता है, लेकिन 128 बिट पर भी एक मिनट से कम रहता है।[/em]</caption]

इसके बाद प्रणाली की वॉटरमार्क विश्वसनीयता को कई बेंचमार्क पर परीक्षण किया गया:

[कैप्शन id=”attachment_224913″ align=”alignnone” width=”781″]पांच मॉडल पर 32- बिट और 128- बिट क्षमता वाले मॉडल के साथ अप्रमाणित मॉडल की तुलना में वॉटरमार्क विश्वसनीयता का मूल्यांकन। प्रदर्शन सभी कॉन्फ़िगरेशन में स्थिर रहता है, जिसमें वॉटरमार्क सम्मिलन से औसत स्कोर में केवल मामूली उतार-चढ़ाव होते हैं, जो वॉटरमार्क एम्बेडिंग से बेंचमार्क सटीकता पर सीमित प्रभाव को इंगित करता है। पांच मॉडल पर 32- बिट और 128- बिट क्षमता वाले मॉडल के साथ अप्रमाणित मॉडल की तुलना में वॉटरमार्क विश्वसनीयता का मूल्यांकन। प्रदर्शन सभी कॉन्फ़िगरेशन में स्थिर रहता है, जिसमें वॉटरमार्क सम्मिलन से औसत स्कोर में केवल मामूली उतार-चढ़ाव होते हैं, जो वॉटरमार्क एम्बेडिंग से बेंचमार्क सटीकता पर सीमित प्रभाव को इंगित करता है।[/em]

एडिटमार्क की लचीलापन को छह सामान्य हमला रणनीतियों के खिलाफ परीक्षण किया गया था। मॉडल को पहले 128- बिट वॉटरमार्क के साथ एम्बेड किया गया था, पांच अलग-अलग बीज का उपयोग करके। फाइन-ट्यूनिंग, नीचे दी गई छवि में दिखाया गया है, ने अधिकांश मॉडल के लिए निकासी सफलता दर (ईएसआर) में केवल मामूली गिरावट का कारण बना:

[कैप्शन id=”attachment_224914″ align=”alignnone” width=”546″]एक से तीन प्रकरणों के लिए फाइन-ट्यूनिंग से पहले और बाद में वॉटरमार्क की निकासी सफलता दर। जबकि अधिकांश मॉडल पूरे ईएसआर को बनाए रखते हैं, क्वेन -7 बी में गिरावट देखी जाती है, जो पैरामीटर अपडेट के प्रति अधिक भेद्यता का संकेत देता है। एक से तीन प्रकरणों के लिए फाइन-ट्यूनिंग से पहले और बाद में वॉटरमार्क की निकासी सफलता दर। जबकि अधिकांश मॉडल पूरे ईएसआर को बनाए रखते हैं, क्वेन -7 बी में गिरावट देखी जाती है, जो पैरामीटर अपडेट के प्रति अधिक भेद्यता का संकेत देता है।[/em]</caption]

यहां तक कि कई प्रकरणों के बाद, अधिकांश मॉडल 90% से अधिक ईएसआर बनाए रखते हैं, जो यह दर्शाता है कि एडिटमार्क लोरा-आधारित प्रशिक्षण द्वारा पेश किए गए पैरामीटर ड्रिफ्ट का प्रतिरोध करता है।

क्वांटाइजेशन हमलों ने मॉडल की सटीकता को कम कर दिया, लेकिन अधिकांश वॉटरमार्क को बरकरार रखा:

[कैप्शन id=”attachment_224915″ align=”alignnone” width=”642″]इंट -8 और इंट -4 सटीकता का उपयोग करके क्वांटाइजेशन के बाद वॉटरमार्क की निकासी सफलता दर मॉडल। इंट -8 क्वांटाइजेशन के तहत सभी मॉडल में ईएसआर अपरिवर्तित रहता है, जबकि इंट -4 क्वांटाइजेशन आंशिक रूप से ईएसआर को कमजोर करता है, यह दर्शाता है कि कम सटीकता वॉटरमार्क को पूरी तरह से हटा नहीं सकती है। इंट -8 और इंट -4 सटीकता का उपयोग करके क्वांटाइजेशन के बाद वॉटरमार्क की निकासी सफलता दर मॉडल। इंट -8 क्वांटाइजेशन के तहत सभी मॉडल में ईएसआर अपरिवर्तित रहता है, जबकि इंट -4 क्वांटाइजेशन आंशिक रूप से ईएसआर को कमजोर करता है, यह दर्शाता है कि कम सटीकता वॉटरमार्क को पूरी तरह से हटा नहीं सकती है।[/em]</caption]

जैसा कि ऊपर दी गई छवि में देखा जा सकता है, इंट -8 क्वांटाइजेशन ने सभी मॉडल में 100% ईएसआर को बनाए रखा, जबकि इंट -4 क्वांटाइजेशन ने ईएसआर पर एक मामूली प्रभाव डाला, लेकिन अस्वीकार्य प्रदर्शन हानि का परिचय दिया।

यह विशेष परिदृश्य हमलावर के लिए सीमित संभावना का सुझाव देता है, क्योंकि यह एक हैक किए गए लेकिन प्रदर्शन से गिरे हुए मॉडल का परिणाम है।

शोर और प्रूनिंग के परीक्षण ने चार बेंचमार्क फ्रेमवर्क का मूल्यांकन किया:

[कैप्शन id=”attachment_224916″ align=”alignnone” width=”779″]वॉटरमार्क की निकासी सफलता दर और शोर (शीर्ष पंक्ति) और प्रूनिंग (नीचे की पंक्ति) हमलों के बाद वॉटरमार्क मॉडल के बेंचमार्क प्रदर्शन। जैसे ही ईएसआर विकृतियों के साथ गिरता है, बेंचमार्क सटीकता भी घट जाती है, विशेष रूप से उच्च शोर तीव्रता और प्रूनिंग अनुपात पर, जो वॉटरमार्क हटाने और मॉडल उपयोगिता के बीच (आम) तनाव को रेखांकित करता है। वॉटरमार्क की निकासी सफलता दर और शोर (शीर्ष पंक्ति) और प्रूनिंग (नीचे की पंक्ति) हमलों के बाद वॉटरमार्क मॉडल के बेंचमार्क प्रदर्शन। जैसे ही ईएसआर विकृतियों के साथ गिरता है, बेंचमार्क सटीकता भी घट जाती है, विशेष रूप से उच्च शोर तीव्रता और प्रूनिंग अनुपात पर, जो वॉटरमार्क हटाने और मॉडल उपयोगिता के बीच (आम) तनाव को रेखांकित करता है।[/em]</caption]

हालांकि, वे बेंचमार्क प्रदर्शन में तेज गिरावट का कारण भी बनते हैं, बीएलआईएमपी पर बैचुआन -7 बी को 27-31% की गिरावट के साथ, जब शोर या प्रूनिंग लागू की जाती है।

मॉडल संपादन और अनुकूली हमलों का भी मूल्यांकन किया गया:

[कैप्शन id=”attachment_224918″ align=”alignnone” width=”590″]ज्ञात वॉटरमार्क परतों पर लागू किए गए विभिन्न स्तरों के मॉडल संपादन के लिए वॉटरमार्क मॉडल की निकासी सफलता दर। सभी मॉडल में 50 संपादन लागू करने के बाद भी ईएसआर 95% से अधिक रहता है, जो सीधे पैरामीटर संशोधनों के वॉटरमार्क हटाने पर सीमित प्रभाव को इंगित करता है। ज्ञात वॉटरमार्क परतों पर लागू किए गए विभिन्न स्तरों के मॉडल संपादन के लिए वॉटरमार्क मॉडल की निकासी सफलता दर। सभी मॉडल में 50 संपादन लागू करने के बाद भी ईएसआर 95% से अधिक रहता है, जो सीधे पैरामीटर संशोधनों के वॉटरमार्क हटाने पर सीमित प्रभाव को इंगित करता है।[/em]</caption]

यहां एडिटमार्क 95% से अधिक ईएसआर बनाए रखता है, यहां तक कि जब विशिष्ट एम्बेडिंग परतों को लक्षित किया जाता है।

निष्कर्ष

डीआरएम, गुप्त वॉटरमार्क, और अन्य सुरक्षा दृष्टिकोण जो पूर्व-एआई युग में सीमित या आंशिक सफलता का आनंद लेते हैं, मशीन लर्निंग प्रणालियों पर लागू करना मुश्किल है; वर्तमान श्रृंखला की होस्ट आर्किटेक्चर की जानबूझकर कम करने वाली प्रकृति को उपयुक्त टूलिंग की कमी के साथ जोड़ दिया जाता है, जो किसी भी इंजेक्ट किए गए वॉटरमार्क को काफी नाजुक बना देता है।

यह देखना प्रभावशाली है कि एक प्रणाली फॉस्स मॉडल वितरण पर लक्षित है, और यह देखना कि यह लगभग सभी परिदृश्यों के खिलाफ बनी हुई है, सिवाय सबसे असंभावित एक के, एक हमलावर की पूर्व जानकारी के संदर्भ में। हालांकि, एडिटमार्क द्वारा पेश की जाने वाली छोटी गिरावट, जो इन प्रयोगों में है, संभावित अपनाने वालों को रोकने का कारण बन सकती है; न कि कम से कम इसलिए कि एक एपीआई-केंद्रित नियंत्रण मॉडल इस तरह के हमलों को लगभग पूरी तरह से रोकता है।

 

* यह साइट दावा करती है कि चीन से ‘ओपन वेट’ रिलीज़ आवश्यक रूप से पूरी तरह से फॉस्स के रूप में योग्य नहीं हैं, क्योंकि अक्सर डेटा वापस रखा जाता है, जो प्रशिक्षण पाइपलाइन की सटीक पुनरावृत्ति को रोकता है। तर्कसंगत रूप से, यह विषय पश्चिम और पूर्व के बीच एआई मॉडल रिलीज़ की राजनीति की एक गहरी जांच के लिए आमंत्रित करता है, जो इस लेख के दायरे से बाहर है।

सोमवार, 27 अक्टूबर, 2025 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai