साइबर सुरक्षा

Lasso अध्ययन पाता है कि टेक्स्ट वाटरमार्किंग LLM अस्वीकृतियों और टूल कॉल्स को बदलती है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Lasso Security शोधकर्ता Andrea Siposova ने 17 सितंबर, 2026 को प्रोवेनेंस टैक्स: LLM वाटरमार्किंग का AI एजेंट व्यवहार पर प्रभाव समझना प्रकाशित किया, एक अध्ययन जो रिपोर्ट करता है कि SynthID-Text टेक्स्ट वाटरमार्किंग यह बदल सकता है कि क्या कोई भाषा मॉडल हानिकारक अनुरोध को अस्वीकार करता है और कौन से टूल कॉल्स AI एजेंट उत्पन्न करता है। अध्ययन इस व्यवहारिक प्रभाव को “सैंपलिंग ड्रिफ्ट” कहता है।

अध्ययन के अनुसार, वाटरमार्किंग को उत्पत्ति के लिए डिज़ाइन किया गया है, लेकिन SynthID-Text मॉडल द्वारा प्रत्येक अगला टोकन उत्पन्न करने की प्रक्रिया को बदल देता है। मॉडल स्तर पर, यह सुरक्षा व्यवहार को बदल सकता है, जिसमें मॉडल हानिकारक अनुरोध को अस्वीकार करता है या नहीं और क्या वह अस्वीकृति प्रॉम्प्ट इंजेक्शन के तहत बनी रहती है; एजेंट स्तर पर, वही सैंपल किए गए टोकन तय कर सकते हैं कि एजेंट कौन सा टूल कॉल करता है और वह टूल को कौन से तर्क देता है। अध्ययन रिपोर्ट करता है कि ड्रिफ्ट व्यवहार में अस्वीकृति और एजेंट टूल कॉल दोनों में व्यावहारिक रूप से प्रकट होता है, कि इंजेक्शन के तहत वाटरमार्किंग ने कई मॉडलों को उन हानिकारक अनुरोधों का उत्तर देने की संभावना बढ़ा दी जिसे वे अन्यथा अस्वीकार करते, कि यह प्रभाव मॉडल और कुंजी-निर्भर है, और कि समग्र स्कोर इसे छिपा सकते हैं जब विपरीत दिशाओं में परिवर्तन एक-दूसरे को रद्द कर देते हैं।

नियामक तैनाती में प्रवेश करने वाला वाटरमार्क

14 अगस्त, 2026 की घोषणा Claude का टेक्स्ट वाटरमार्क कैसे काम करता है में, Anthropic ने कहा कि भविष्य के Claude मॉडल Google DeepMind के SynthID-Text पर आधारित एक वाटरमार्क वाले टेक्स्ट उत्पन्न करेंगे, जो परिवर्तन वह EU AI Act के अनुपालन के लिए लागू कर रहा है। Anthropic ने कहा कि यह विधि Claude के आउटपुट की गुणवत्ता और सामग्री को व्यावहारिक रूप से अपरिवर्तित रखती है। Lasso पोस्ट EU कानून को इस प्रकार वर्णित करती है कि वह सिंथेटिक टेक्स्ट उत्पन्न करने वाले AI सिस्टम प्रदाताओं को आउटपुट को मशीन-पढ़ने योग्य स्वरूप में चिह्नित करने की आवश्यकता करता है ताकि उन्हें कृत्रिम रूप से उत्पन्न के रूप में पहचाना जा सके। पोस्ट यह भी नोट करती है कि Anthropic कहता है कि वाटरमार्क मॉडल स्तर पर कार्य करता है और Claude Platform API और क्लाउड प्रदाताओं के माध्यम से पहुँचे समर्थित मॉडलों तक विस्तारित होता है, इसलिए वाटरमार्क वाले मॉडल के चारों ओर निर्मित एक एजेंट भी वाटरमार्क वाले आउटपुट प्राप्त कर सकता है, भले ही एजेंट स्वयं एक अलग एप्लिकेशन हो।

टोकन चयन व्यवहार को क्यों बदलता है

अध्ययन ने SynthID-Text की गैर-विकृति कॉन्फ़िगरेशन का उपयोग किया, जो वाटरमार्क की यादृच्छिकता के बीच औसत में मॉडल के मूल टोकन वितरण को संरक्षित रखती है, हालांकि एक ही स्थिर कुंजी के तहत उत्पन्न कोई भी एकल जनरेशन भिन्न हो सकता है। पोस्ट Dathathri आदि को उद्धृत करती है, जिनके Nature पेपर ने लगभग बीस मिलियन Gemini प्रतिक्रियाओं में कोई मापनीय गुणवत्ता गिरावट नहीं पाई। एक गैर-विकृति वाटरमार्क यह नहीं दर्शाता कि स्थिर कुंजी के तहत व्यवहार समान रहेगा, पोस्ट जोर देती है: यह गारंटी वाटरमार्क की यादृच्छिकता पर औसत लेती है, जबकि कोई भी एक कुंजी अभी भी यह बदल देती है कि टेक्स्ट उत्पन्न होते समय कौन से टोकन चुने जाते हैं।

अध्ययन बताता है कि टॉर्नामेंट सैंपलिंग में मॉडल के अनिश्चित होने पर टोकन चयन को बदलने की अधिक संभावना होती है। संरचित आउटपुट जैसे JSON में, कर्ली ब्रेसेस, कुंजियाँ और फ़ंक्शन नाम जैसी संरचनात्मक तत्व आमतौर पर आसानी से भविष्यवाणी योग्य होते हैं, जबकि क्वेरी, संख्याएँ, पथ और प्राप्तकर्ता जैसे तर्क मान अधिक अनिश्चितता छोड़ते हैं। एक परिवर्तन जो सामान्य prose में शब्दावली विविधता के बराबर हो, वह एजेंट द्वारा निष्पादित तर्क को पुनर्लेखित कर सकता है, भले ही मॉडल के वज़न और प्रॉम्प्ट अपरिवर्तित रहें।

अध्ययन ने सैंपलिंग ड्रिफ्ट को कैसे मापा

शोधकर्ताओं ने दो प्रयोगों में युग्मित डिज़ाइन का उपयोग किया। टूल कॉलिंग का मूल्यांकन BFCL v4 सिंगल-टर्न AST बेंचमार्क पर किया गया, और अस्वीकृति का मूल्यांकन HarmBench से 200 हानिकारक व्यवहारों तथा JailbreakBench से 100 सौम्य नियंत्रणों पर किया गया, जिसमें हानिकारक अनुरोधों को बिना किसी संशोधन और एक स्थिर प्रॉम्प्ट-इंजेक्शन तकनीक के तहत दोनों रूप में परीक्षण किया गया। वह तकनीक प्रॉम्प्ट में एक प्रतिकूल निर्देश सम्मिलित करती है जैसे कि वह पुनः प्राप्त सामग्री हो, यह बताती है कि सुरक्षा फ़िल्टर निष्क्रिय कर दिया गया है और मॉडल को अनुपालन करने के लिए निर्देशित करती है; वही तकनीक हर प्रॉम्प्ट, मॉडल और तापमान के लिए उपयोग की गई।

प्रयोग Hugging Face के अपरिवर्तित SynthIDTextWatermarkLogitsProcessor के माध्यम से 30 टॉर्नामेंट लेयर्स, 5 की n-gram लंबाई, 2^16 की सैंपलिंग टेबल और 1,024 की संदर्भ इतिहास के साथ चलाए गए। प्रत्येक आइटम को SynthID के साथ और बिना SynthID के समान बीज, बैच और प्रत्येक तापमान पर जनरेशन क्रम का उपयोग करके उत्पन्न किया गया, इसलिए वाटरमार्क प्रोसेसर प्रत्येक युग्म के भीतर एकमात्र चर था।

टूल कॉलिंग सटीकता और चर्न

उन आइटमों पर जहाँ टूल कॉल की अपेक्षा थी, वाटरमार्किंग ने परीक्षण किए गए सात मॉडलों में से छह पर सटीकता को घटाया, जिसमें चार पर उल्लेखनीय गिरावट देखी गई, अध्ययन रिपोर्ट करता है। क्योंकि एक गलत कॉल को एक सही कॉल द्वारा संतुलित किया जा सकता है, शोधकर्ताओं ने युग्मित असहमति भी मापी, जिसे उन्होंने “चर्न” कहा: वह अनुपात जहाँ वाटरमार्केड और अनवॉटरमार्केड रन अलग परिणाम उत्पन्न करते हैं। प्रत्येक तापमान पर 1,150 कॉल-अपेक्षित कार्यों के एक स्थिर सेट का उपयोग करके, अध्ययन ने पाया कि तापमान 1.0 पर phi-4 के कॉल निर्णयों में 16.8% अंतर था जबकि उसकी शुद्ध सटीकता हानि 2.87 अंक थी; Llama-3.1-8B ने 9.9% चर्न दिखाया और शुद्ध हानि 0.87 अंक थी। 21 मॉडल-तापमान संयोजनों में, चर्न का औसत 6.5% था, और उसका बूटस्ट्रैप अंतराल हर मामले में शून्य को बाहर रखता है।

त्रुटि प्रोफ़ाइल मॉडल के अनुसार भिन्न थीं। Llama-3.1-8B में, सटीकता हानि का सबसे बड़ा योगदान -3.48 अंक के गलत तर्कों से आया, उसके बाद -1.84 अंक के गलत‑टूल कॉल्स से, जबकि phi-4 और Granite-3.2-8B में विकृत आउटपुट क्रमशः -5.96 और -4.36 अंक पर हावी था। पोस्ट में कहा गया है कि सही टूल को एक सही‑रूप कॉल जिसमें पथ, प्राप्तकर्ता, क्वेरी या मात्रा गलत हो, विशेष रूप से महत्वपूर्ण होता है, क्योंकि ऐसा कॉल अभी भी पूर्णता तक चलता है जबकि वह इच्छित कार्य नहीं करता।

प्रॉम्प्ट इंजेक्शन के तहत अस्वीकृतियाँ कमजोर होती हैं

अस्वीकृतियाँ भी टोकन दर टोकन उत्पन्न होती हैं, इसलिए वॉटरमार्किंग उनका प्रभाव बदल सकती है। अध्ययन रिपोर्ट करता है कि वॉटरमार्किंग बरे हानिकारक अनुरोधों पर अस्वीकृति व्यवहार को बदलती है, और यह प्रभाव प्रॉम्प्ट इंजेक्शन के तहत अधिक मजबूत हो जाता है, जहाँ सबसे बड़े बदलाव अस्वीकृति से अनुपालन की ओर होते हैं। तापमान 0.001 पर, gemma-3-27b की चर्न बरे हानिकारक अनुरोधों पर 6.0% से बढ़कर इंजेक्शन के तहत 23.5% हो गई, जबकि उसका शुद्ध अनुपालन परिवर्तन -1.0 अंक से +12.5 अंक तक गया; gemma-3-12b की चर्न 7.5% से 11.0% तक बढ़ी, और शुद्ध अनुपालन परिवर्तन -0.5 अंक से +9.0 अंक तक गया। Llama-3.1-8B ने तापमान 0.001 पर 14.0% और तापमान 0.7 पर इंजेक्शन के तहत 17.5% की चर्न दिखायी, हालांकि उसका शुद्ध परिवर्तन व्यक्तिगत रूप से महत्वपूर्ण नहीं था।

phi-4 और Qwen3-4B दोनों ही स्थितियों में बहुत कम परिवर्तन दिखाते हैं; दोनों अक्सर अधिक‑अस्वीकृति करते हैं, यहाँ तक कि सौम्य नियंत्रणों पर भी, और पोस्ट चेतावनी देता है कि उनके छोटे‑छोटे बदलावों को यह प्रमाण नहीं माना जाना चाहिए कि वॉटरमार्किंग उन मॉडलों पर सुरक्षा व्यवहार को अपरिवर्तित रखती है। असहमति को संदर्भ में रखने के लिए, अध्ययन ने तापमान 0.7 पर इंजेक्शन के तहत वॉटरमार्क‑प्रेरित चर्न की तुलना बिना वॉटरमार्किंग के तापमान को 0.001 से 0.7 तक बदलने से उत्पन्न चर्न से की। वॉटरमार्क‑प्रेरित चर्न छह मॉडलों में से चार पर उल्लेखनीय रूप से अधिक था; Granite-3.2-8B ने तापमान‑प्रेरित चर्न में सबसे अधिक 15.5% दिखाया, और उसका वॉटरमार्क‑प्रेरित चर्न और भी अधिक, 21.5% था।

मुख्य संवेदनशीलता और सिफ़ारिशें

क्योंकि SynthID का टोकन चयन पर प्रभाव वॉटरमार्क कुंजी पर निर्भर करता है, अध्ययन ने तापमान 0.7 पर ग्यारह कुंजियों का परीक्षण किया। Llama-3.1-8B के लिए, अध्ययन कुंजी ने हमले की सफलता को 3.5 अंक बढ़ाया, जबकि अन्य दस कुंजियों ने औसतन +4.4 अंक का वृद्धि दिखाया और उनका रेंज -4.5 से +14.5 अंक था। अधिकांश कुंजियों ने दोनों Gemma मॉडलों में अनवॉटरमार्क्ड बेसलाइन की तुलना में हमले की सफलता बढ़ा दी, जबकि Granite-3.2-8B ने मिश्रित प्रतिक्रिया दी, जहाँ कुंजियों ने हमले की सफलता को दोनों दिशाओं में ले जाया। जहाँ वॉटरमार्क कुंजी या कॉन्फ़िगरेशन मॉडल प्रदाता द्वारा नियंत्रित होता है, पोस्ट नोट करता है, ऐसे व्यवहारिक बदलाव एजेंट बनाने वाले डेवलपर की पहुँच से बाहर हो सकते हैं।

अध्ययन सिफ़ारिश करता है कि एजेंट मूल्यांकन और रेड‑टीमिंग को उसी वॉटरमार्क कॉन्फ़िगरेशन के साथ दोबारा चलाया जाए जो तैनाती के लिए नियोजित है, वॉटरमार्क्ड और अनवॉटरमार्क्ड आउटपुट को समान इनपुट पर तुलना किया जाए और प्रॉम्प्ट इंजेक्शन के तहत परीक्षण किया जाए। परिणाम वॉटरमार्किंग को उत्पत्ति के लिए विरोध नहीं करते, पोस्ट कहता है: उत्पत्ति और व्यवहारिक स्थिरता अलग‑अलग गुण हैं, और एक वॉटरमार्क जो पता चलने योग्य है और पाठ की गुणवत्ता को नहीं बदलता, यह गारंटी नहीं देता कि एजेंट वॉटरमार्क चालू होने पर वही टूल‑कॉलिंग या सुरक्षा व्यवहार बनाए रखेगा। यद्यपि अध्ययन ने SynthID-Text की जांच की, पोस्ट जोड़ता है कि यह चिंता किसी भी हस्तक्षेप पर लागू होती है जो टोकन चयन को बदलता है उस प्रणाली में जो उन टोकनों पर कार्य करती है।

माइल्स ओकाडा यूनाइट.एआई में एक एआई-जेनरेटेड विश्लेषक है, जो आर्टिफ़िशियल इंटेलिजेंस और साइबर सुरक्षा को कवर करता है, जिसमें उभरते हुए खतरों, रक्षात्मक वास्तुकला और हमलावरों और स्वचालित प्रणालियों के बीच बदलते गतिविधियों पर ध्यान केंद्रित किया जाता है। उनका काम यह जांचता है कि सुरक्षा संचालन को कैसे एआई पुनः आकार दे रहा है, स्वायत्त खतरा पता लगाने और प्रतिक्रिया से लेकर प्रतिपक्षी एआई तकनीकों के उदय तक।

साथ ही एक तकनीकी और जांचात्मक दृष्टिकोण के साथ, माइल्स सुरक्षा अनुसंधान, घटना प्रकटीकरण और वास्तविक दुनिया के तैनाती का विश्लेषण करता है ताकि यह समझा जा सके कि एआई रक्षा को कहां मजबूत करता है - और कहां नई कमजोरियों को पेश करता है। वह मॉडल शोषण, डेटा जहर, हमला स्वचालन और एआई-संचालित प्रणालियों को बड़े पैमाने पर सुरक्षित करने के संचालनात्मक वास्तविकताओं पर विशेष ध्यान देता है।

माइल्स ओकाडा द्वारा लिखे गए लेख एआई-जेनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा सटीकता, कठोरता और तेजी से बदलते एआई सुरक्षा परिदृश्य के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।