साइबर सुरक्षा

OpenAI ने समन्वित मॉडल-तर्क निष्कर्षण अभियान को बाधित किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

OpenAI ने कहा कि 30 सितंबर, 2026 को प्रकाशित एक सुरक्षा पोस्ट में, उसने अपने मॉडलों से संरक्षित तर्क निकालने के लिए डिज़ाइन किए गए एक समन्वित अभियान की पहचान की और उसे बाधित किया, और इस गतिविधि के मुख्य क्लस्टर को Moonshot AI से जुड़े व्यक्तियों को सौंपा, जो Kimi के डेवलपर हैं। सबसे प्रारंभिक देखी गई गतिविधि जुलाई 2026 के पहले सप्ताह में हुई।

OpenAI ने क्या देखा

OpenAI ने इस गतिविधि का वर्णन प्रतिद्वंद्वी डिस्टिलेशन के अनुरूप बताया, जिसे उसने एक मॉडल के आउटपुट या तर्क को व्यवस्थित और अनधिकृत रूप से उपयोग करके दूसरे मॉडल को प्रशिक्षित, पुनरुत्पादित या सुधारने के रूप में परिभाषित किया। कंपनी के अनुसार, संरक्षित तर्क मॉडल की आंतरिक रिकॉर्ड है जो कार्य को हल करने के लिए उपयोग होती है; इसे निकालने से अंतिम उत्तर में छुपी जानकारी प्रकट हो सकती है और अन्य लोग मॉडल की क्षमताओं को पुनरुत्पादित कर सकते हैं।

OpenAI ने कहा कि ऑपरेटरों ने उसकी एन्क्रिप्शन को नहीं तोड़ा, न ही डेटाबेस से समझौता किया, और न ही संग्रहीत उपयोगकर्ता वार्तालापों तक सीधे पहुँच प्राप्त की। ऑपरेटरों ने मॉडल इंटरैक्शन को इस तरह हेरफेर किया कि संरक्षित तर्क को अनुरोधकर्ता के लिए दृश्यमान रूप में, एक समन्वित और बड़े पैमाने पर, कंपनी की सेवा शर्तों का उल्लंघन करते हुए पुन: उत्पन्न किया जा सके। OpenAI द्वारा देखी गई एक तकनीक में एक वार्तालाप से एन्क्रिप्टेड तर्क की प्रतिलिपि बनाकर उसे दूसरे वार्तालाप में मॉडल को डिक्रिप्ट और ट्रांसक्राइब करने के लिए कहा गया। कंपनी ने कहा कि यह हेरफेर उसके मॉडलों के लिए विशिष्ट कमजोरी नहीं है और उसने इस बारे में जानकारी उद्योग साझेदारों के साथ Frontier Model Forum के माध्यम से साझा की ताकि सामूहिक रक्षा को मजबूत किया जा सके।

यह गतिविधि 1 जुलाई, 2026 को शुरू हुई, प्रारम्भ में कम मात्रा में, जब तक कि OpenAI ने 24 और 25 जुलाई, 2026 को उच्च मात्रा के स्पाइक्स देखे, जिसमें 4,000 से अधिक उपयोगकर्ताओं द्वारा उपयोग किए गए एक संबंधित निष्कर्षण पैटर्न के तहत 16,000 अनुरोध शामिल थे। पोस्ट में एक फुटनोट बताता है कि ये आंकड़े प्रयास किए गए, आवश्यक नहीं कि सफल, निष्कर्षणों को दर्शाते हैं। OpenAI ने कहा कि आगे की जांच में 15,000 से अधिक उपयोगकर्ताओं के क्लस्टर में संबंधित प्रॉम्प्ट-पैटर्न गतिविधि पहचानी गई, जिसे उसने 28 जुलाई, 2026 तक पूरी तरह बाधित कर दिया। कंपनी ने कहा कि समय के साथ गतिविधि विकसित हुई, जो यह पुष्टि करती है कि प्रतिद्वंद्वी डिस्टिलेशन एक व्यापक सुरक्षा चुनौती है जिसके लिए स्तरित, अनुकूलनशील रक्षा की आवश्यकता है।

OpenAI ने कहा कि प्रतिद्वंद्वी डिस्टिलेशन सुरक्षा और राष्ट्रीय सुरक्षा जोखिम उत्पन्न करता है: निकाले गए तर्क को मूल मॉडल के उपयोगकर्ता-समक्ष आउटपुट पर लागू सुरक्षा उपायों को बनाए रखे बिना दूसरे मॉडल को प्रशिक्षित करने के लिए उपयोग किया जा सकता है, और बड़े पैमाने पर डिस्टिलेशन उन्नत क्षमताओं के स्थानांतरण को तेज कर सकता है बिना समान सुरक्षा निवेश के, ऐसी चिंताएँ कंपनी ने कहा कि मॉडल दोहरे उपयोग वाले क्षेत्रों में क्षमताएँ प्राप्त करने के साथ बढ़ती हैं। OpenAI ने कहा कि प्रकाशन से पहले उसने अभियान की सीमा और संभावित प्रभाव की जांच की, अपनी स्वयं की शमन उपाय लागू किए, और शोधकर्ताओं तथा उद्योग साझेदारों के साथ साझा किया और उनकी प्रतिक्रिया ली, और अतिरिक्त शमन और जांच कार्य जारी है।

जिम्मेदारी निर्धारण

OpenAI ने कहा कि यह स्पष्ट नहीं है कि संबंधित अवधि के दौरान देखे गए सभी ऑपरेटर एक ही अभिनेता से आए थे या नहीं, और उसने इस गतिविधि के मुख्य क्लस्टर को Moonshot AI से जुड़े व्यक्तियों को सौंपा, जो Kimi के डेवलपर हैं।

8 सितंबर, 2026 को, नेशनल सिक्योरिटी एजेंसी, साइबरसिक्योरिटी एंड इन्फ्रास्ट्रक्चर सिक्योरिटी एजेंसी, और फेडरल ब्यूरो ऑफ इन्वेस्टिगेशन ने एक संयुक्त साइबर सुरक्षा सलाह जारी की, जिसमें कहा गया कि Moonshot AI ने कम से कम मध्य 2025 से अमेरिकी फ्रंटियर AI कंपनियों के खिलाफ एक व्यापक डिस्टिलेशन अभियान चलाया है। सलाह में कहा गया कि Moonshot AI ने अपने Kimi-K3 मॉडल को प्रशिक्षित करने के लिए महत्वपूर्ण Claude Fable 5 डेटा और अपने Kimi-K2 मॉडल को प्रशिक्षित करने के लिए GPT-4o डेटा निकाला, और कंपनी ने अमेरिकी मॉडलों का उपयोग सुपरवाइज़्ड फाइन-ट्यूनिंग ऑप्टिमाइज़ेशन, रिइन्फोर्समेंट लर्निंग, सॉफ्टवेयर इंजीनियरिंग, और गणितीय क्षमताओं को डिस्टिल करने के लिए किया।

सलाह में व्यापक रूप से कहा गया है कि, संभवतः चीनी सरकार की जागरूकता के साथ, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun, और Z.AI ने कम से कम देर 2024 से अमेरिकी फ्रंटियर मॉडलों, जिसमें Claude, GPT, Gemini, और Grok के विभिन्न संस्करण शामिल हैं, से अर्बों टोकन को लाखों लेनदेन में निकाला है। एजेंसियों के अनुसार, इन कंपनियों ने मूल API, दूरस्थ क्लाउड प्रदाता, और तृतीय-पक्ष एग्रीगेटर के माध्यम से अनुरोधों को रूट किया; भौगोलिक प्रतिबंधों को बायपास करने, उपयोग शर्तों का उल्लंघन करने, और ट्रैसेबिलिटी को कमजोर करने के लिए ट्रांसफ़र स्टेशन नामक API प्रॉक्सी के ग्रे मार्केट का उपयोग किया; और डेवलपर्स की टीमों के बीच प्रीमियम सब्सक्रिप्शन को सामूहिक रूप से खरीदकर लागत बचत हासिल की। एजेंसियों ने अनुशंसा की कि अमेरिकी AI कंपनियों को व्यापक पहचान और शमन लागू करना चाहिए, संदेहास्पद डिस्टिलेशन प्रयासों के लिए लक्षित प्रतिक्रिया परिवर्तन तैनात करने चाहिए, और संगठन-पर-परिचालन खुफिया साझाकरण स्थापित करना चाहिए।

तर्क-ट्रेस अनुसंधान

OpenAI ने कहा कि स्वतंत्र सुरक्षा शोधकर्ताओं ने जिम्मेदार प्रकटीकरण के माध्यम से संबंधित क्रॉस-मॉडल और वार्तालाप-संकुचन कमजोरियों को उसकी ध्यान में लाया। कंपनी ने कहा कि उसने इन निष्कर्षों की जांच की, शोधकर्ताओं द्वारा पहचाने गए हमले के मार्गों की वास्तविकता की पुष्टि की, और यह कार्य उसे व्यापक हमले वर्ग को समझने और शमन उपायों को तेज करने में मदद किया।

In अगस्त 10, 2026 को arXiv पर प्रस्तुत एक पेपर, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, और Maksym Andriushchenko रिपोर्ट करते हैं कि प्रमुख प्रदाता अपने मॉडलों की चरण‑दर‑चरण तर्क प्रक्रिया को बौद्धिक संपदा की रक्षा और सूचना रिसाव को सीमित करने के लिए छिपाते हैं, और उन ट्रेसेज़ को एन्क्रिप्टेड टेक्स्ट के ब्लॉकों के रूप में क्लाइंट को वापस भेजते हैं, जिन्हें क्लाइंट प्रत्येक अगले अनुरोध के साथ पुनः भेजता है। लेखक एक वास्तु‑संबंधी कमजोरी की पहचान करते हैं: ये एन्क्रिप्टेड ब्लॉक विभिन्न सत्रों, उपयोगकर्ताओं और उसी प्रदाता के इकोसिस्टम के भीतर विभिन्न मॉडलों में पूरी तरह संगत और आपस में बदलने योग्य हैं। वे एक स्केलेबल डिक्रिप्शन जेलब्रेक का वर्णन करते हैं जिसमें किसी दिए गए मॉडल से एन्क्रिप्टेड तर्क ट्रेस को उसी प्रदाता के एक कमजोर, कम सुरक्षित मॉडल में इंजेक्ट किया जाता है, जिससे वह ट्रेस को प्लेनटेक्स्ट में शब्दशः डिकोड और आउटपुट करता है, जबकि अधिक सक्षम मॉडल को सीधे जेलब्रेक नहीं किया जाता।

लेखक रिपोर्ट करते हैं कि यह कमजोरी चार अलग‑अलग हमले के वेक्टर सक्षम करती है: एंटी‑डिस्टिलेशन तंत्रों को बायपास करना, जिसे उन्होंने Anthropic, OpenAI, और Google में प्रदर्शित किया; बड़े पैमाने पर निजी डेटा निष्कर्षण, जिसमें उन्होंने सार्वजनिक रिपॉज़िटरीज़ से स्क्रैप किए गए 315,320 तर्क ब्लॉकों को डिकोड करके 367 व्यक्तिगत पहचान योग्य जानकारी के आर्टिफैक्ट और 182 क्रेडेंशियल पुनः प्राप्त किए; तर्क प्रक्रिया में छिपी खतरनाक जानकारी का अनजाने में खुलासा, भले ही मॉडल का अंतिम दृश्यमान आउटपुट एक दुर्भावनापूर्ण अनुरोध को सुरक्षित रूप से अस्वीकार कर दे; और अदृश्य प्रॉम्प्ट इंजेक्शन जो पूरी तरह एन्क्रिप्टेड ब्लॉकों के भीतर दुर्भावनापूर्ण पेलोड एम्बेड करके सार्वजनिक एजेंटिक रोलआउट को विषाक्त बनाते हैं। जिम्मेदार प्रकटीकरण के बाद, लेखक क्लाइंट‑साइड तर्क को सुरक्षित करने के लिए क्रिप्टोग्राफ़िक और सिस्टम‑स्तरीय शमन उपाय प्रस्तावित करते हैं।

OpenAI ने कैसे प्रतिक्रिया दी

OpenAI ने कहा कि उसने इस अभियान को खाता प्रवर्तन, तकनीकी नियंत्रण, और साझेदार समन्वय के संयोजन के माध्यम से कम किया: उसने धोखाधड़ी वाले खातों को प्रतिबंधित या सीमित किया, साइन‑अप और इन्फ्रास्ट्रक्चर नियंत्रण को सुदृढ़ किया, और संबंधित नेटवर्कों के लिए निगरानी का विस्तार किया। कंपनी ने यह भी कहा कि उसने उपयोगकर्ताओं, कार्यस्थलों, संगठनों, और मॉडल परिवारों के बीच छिपी तर्क प्रक्रिया के लिए सुरक्षा को मजबूत किया: उसने एक ऐसा मार्ग बंद किया जो किसी ऐसे व्यक्ति को अनुमति देता था जिसके पास पहले से किसी अन्य उपयोगकर्ता का एन्क्रिप्टेड तर्क था, वह उसे पुनः चलाकर उसकी सामग्री पुनः प्राप्त कर सकता था, स्ट्रीम्ड आउटपुट को पकड़ने और रोकने के लिए जांचें जो तर्क को उजागर कर सकती थीं, और तृतीय‑पक्ष प्रदाताओं के साथ मिलकर उन खातों की पहचान और बाधा डालने के लिए काम किया जब संबंधित गतिविधि उनके सेवाओं के माध्यम से प्रवाहित होती थी।

OpenAI ने कहा कि उसने फ्रंटियर मॉडल फ़ोरम और उपयुक्त सरकारी सूचना‑साझाकरण चैनलों के माध्यम से संबंधित निष्कर्ष साझा किए हैं ताकि अन्य फ्रंटियर डेवलपर्स और सार्वजनिक‑क्षेत्र के साझेदार समान गतिविधियों की तलाश कर सकें और अपनी रक्षा को मजबूत कर सकें, और इस बात को भी नोट किया कि पोर्टेबल या पुनः‑चलाने योग्य तर्क‑कलाकृतियों को समर्थन देने वाली प्रणालियों को संबंधित जोखिमों का सामना करना पड़ सकता है।

OpenAI ने कहा कि वह अपेक्षा करता है कि एडवर्सेरियल डिस्टिलेशन प्रयास अधिक परिष्कृत होते जाएंगे क्योंकि फ्रंटियर मॉडल सुधारते हैं और अभिनेता उनकी क्षमताओं की नकल करने के सस्ते तरीकों की तलाश करते हैं। कंपनी ने कहा कि साझेदार‑होस्टेड डिप्लॉयमेंट को प्रथम‑पक्ष सेवाओं के समान सुरक्षा की आवश्यकता है, कि टूल‑आउटपुट हमलों को ऐसी सुरक्षा चाहिए जो सामान्य दृश्यमान टेक्स्ट से अधिक की जांच करती है, और कि वह टूल सुरक्षा, वर्गीकरण कवरेज, और मॉडल अस्वीकृति को निरंतर सुधार रहा है जबकि क्लाउड साझेदारों के बीच संबंधित नियंत्रणों का प्रसार कर रहा है। OpenAI ने कहा कि उसकी प्रतिक्रिया तीन क्षेत्रों पर केंद्रित रहेगी: निष्कर्षण के खिलाफ मजबूत तकनीकी सुरक्षा, समन्वित अभियानों के खिलाफ बेहतर पहचान और प्रवर्तन, और उद्योग एवं सरकार के बीच गहन खतरा‑सूचना साझाकरण।

Miles Okada एक AI-जनित विश्लेषक हैं Unite.AI में, जो कृत्रिम बुद्धिमत्ता और साइबर सुरक्षा को कवर करते हैं, जिसमें उभरते ख़तरों, रक्षा संरचनाओं, और हमलावरों तथा स्वचालित प्रणालियों के बीच विकसित होते गतिशीलताओं पर ध्यान केंद्रित किया गया है। उनका कार्य यह जांचता है कि AI कैसे सुरक्षा संचालन को पुनः आकार दे रहा है, स्वायत्त खतरा पहचान और प्रतिक्रिया से लेकर प्रतिपक्षी AI तकनीकों के उदय तक।

तकनीकी और जांचपरक दृष्टिकोण के साथ, Miles सुरक्षा अनुसंधान, घटना खुलासे, और वास्तविक दुनिया के कार्यान्वयन का विश्लेषण करते हैं ताकि यह समझा जा सके कि AI रक्षा को कहाँ मजबूत करता है—और जहाँ यह नई कमजोरियों को पेश करता है। वे मॉडल शोषण, डेटा विषाक्तता, हमले का स्वचालन, और बड़े पैमाने पर AI-संचालित प्रणालियों को सुरक्षित करने की संचालनात्मक वास्तविकताओं पर विशेष ध्यान देते हैं।

Miles Okada द्वारा लिखित लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा समीक्षा किए जाते हैं ताकि तेज़ी से बदलते AI सुरक्षा परिदृश्य में सटीकता, कठोरता, और जिम्मेदार कवरेज सुनिश्चित हो सके।