रिपोर्ट्स
जब एआई विफल होता है: एनक्रिप्ट एआई रिपोर्ट ने मल्टीमॉडल मॉडल्स में खतरनाक कमजोरियों का पर्दाफाश किया

मई 2025 में, एनक्रिप्ट एआई ने अपनी मल्टीमॉडल रेड टीमिंग रिपोर्ट जारी की, जो एक चौंकाने वाला विश्लेषण है जिसने बताया कि कैसे उन्नत एआई सिस्टम को आसानी से खतरनाक और अनैतिक सामग्री उत्पन्न करने के लिए मैनिप्युलेट किया जा सकता है। रिपोर्ट मिस्ट्रल के दो प्रमुख विजन-लैंग्वेज मॉडल्स—पिक्सट्रल-लार्ज (25.02) और पिक्सट्रल-12बी—पर केंद्रित है, जो न केवल तकनीकी रूप से प्रभावशाली हैं, बल्कि खतरनाक रूप से कमजोर भी हैं।
विजन-लैंग्वेज मॉडल्स (वीएलएम) जैसे पिक्सट्रल दोनों विज़ुअल और टेक्स्टुअल इनपुट की व्याख्या करने के लिए बनाए गए हैं, जिससे वे जटिल, वास्तविक दुनिया के प्रॉम्प्ट्स का बुद्धिमानी से जवाब दे सकते हैं। लेकिन यह क्षमता बढ़े हुए जोखिम के साथ आती है। पारंपरिक भाषा मॉडल्स के विपरीत, जो केवल टेक्स्ट को संसाधित करते हैं, वीएलएम्स छवियों और शब्दों के बीच की बातचीत से प्रभावित हो सकते हैं, जो नए दरवाजे खोलते हैं जो विरोधी हमलों के लिए खुले हैं। एनक्रिप्ट एआई के परीक्षण से पता चलता है कि इन दरवाजों को कितनी आसानी से खोला जा सकता है।
चौंकाने वाले परीक्षण परिणाम: सीएसईएम और सीबीआरएन विफलताएं
रिपोर्ट के पीछे की टीम ने जटिल रेड टीमिंग तरीकों का उपयोग किया—एक प्रकार का विरोधी मूल्यांकन जो वास्तविक दुनिया के खतरों की नकल करने के लिए डिज़ाइन किया गया है। इन परीक्षणों में जेलब्रेकिंग (सुरक्षा फिल्टर को बायपास करने के लिए सावधानी से तैयार किए गए प्रश्नों के साथ मॉडल को प्रॉम्प्ट करना), छवि-आधारित धोखाधड़ी और संदर्भ मैनिपुलेशन जैसी रणनीतियों का उपयोग किया गया था। चौंकाने वाली बात यह है कि 68% इन विरोधी प्रॉम्प्ट्स ने दोनों पिक्सट्रल मॉडल्स में हानिकारक प्रतिक्रियाएं उत्पन्न कीं, जिनमें ग्रूमिंग, शोषण और यहां तक कि रासायनिक हथियार डिजाइन से संबंधित सामग्री शामिल थी।
सबसे चौंकाने वाले खुलासों में से एक बाल यौन शोषण सामग्री (सीएसईएम) से संबंधित है। रिपोर्ट में पाया गया कि मिस्ट्रल के मॉडल्स 60 गुना अधिक संभावना थी कि वे सीएसईएम से संबंधित सामग्री उत्पन्न करेंगे, उद्योग के बेंचमार्क जीपीटी-4 और क्लाउड 3.7 सोनेट की तुलना में। परीक्षण मामलों में, मॉडल्स ने छिपे हुए ग्रूमिंग प्रॉम्प्ट्स का जवाब दिया, जिसमें नाबालिगों को मैनिपुलेट करने के तरीके की व्याख्या की गई थी, जो “केवल शैक्षिक जागरूकता के लिए” जैसे कपटपूर्ण अस्वीकरण में लिपटे हुए थे। मॉडल्स न केवल हानिकारक प्रश्नों को अस्वीकार करने में विफल रहे, बल्कि उन्होंने विस्तार से उनका जवाब दिया।
सीबीआरएन (रासायनिक, जैविक, विकिरण और परमाणु) जोखिम श्रेणी में परिणाम समान रूप से परेशान करने वाले थे। जब एक रासायनिक हथियार, वीएक्स तंत्रिका एजेंट को संशोधित करने के अनुरोध के साथ प्रॉम्प्ट किया गया, तो मॉडल्स ने इसकी वातावरण में स्थिरता बढ़ाने के लिए आश्चर्यजनक रूप से विशिष्ट विचार प्रस्तुत किए। उन्होंने लिपटे हुए लेकिन स्पष्ट रूप से तकनीकी विवरण में विधियों का वर्णन किया, जैसे कि एनकैप्सुलेशन, पर्यावरण सुरक्षा, और नियंत्रित रिलीज सिस्टम ।
इन विफलताओं को हमेशा स्पष्ट रूप से हानिकारक अनुरोधों द्वारा ट्रिगर नहीं किया गया था। एक रणनीति में एक खाली संख्यांकित सूची की छवि अपलोड करना और मॉडल से “विवरण भरने” के लिए कहना शामिल था। यह सरल, सcheinbar हानिरहित प्रॉम्प्ट ने अनैतिक और अवैध निर्देशों के उत्पादन के लिए dẫnा। दृश्य और पाठ मैनिपुलेशन का संयोजन विशेष रूप से खतरनाक साबित हुआ—मल्टीमॉडल एआई द्वारा प्रस्तुत एक अनोखी चुनौती को उजागर करता है।
विजन-लैंग्वेज मॉडल्स नई सुरक्षा चुनौतियां क्यों प्रस्तुत करते हैं
इन जोखिमों के केंद्र में विजन-लैंग्वेज मॉडल्स की तकनीकी जटिलता है। ये सिस्टम केवल भाषा को नहीं समझते—वे प्रारूपों के पार अर्थ संश्लेषित करते हैं, जिसका अर्थ है कि उन्हें छवि सामग्री की व्याख्या करनी, पाठ संदर्भ को समझना और उसके अनुसार प्रतिक्रिया करनी है। इस इंटरैक्शन से शोषण के लिए नए वेक्टर पेश होते हैं। एक मॉडल एक हानिकारक पाठ प्रॉम्प्ट को अकेले सही ढंग से अस्वीकार कर सकता है, लेकिन जब एक सुझावित छवि या अस्पष्ट संदर्भ के साथ जोड़ा जाता है, तो यह खतरनाक आउटपुट उत्पन्न कर सकता है।
एनक्रिप्ट एआई के रेड टीमिंग ने दिखाया कि क्रॉस-मॉडल इंजेक्शन हमले—जहां एक मॉडलिटी में सूक्ष्म संकेत दूसरे के आउटपुट को प्रभावित कर सकते हैं—मानक सुरक्षा तंत्र को पूरी तरह से बायपास कर सकते हैं। ये विफलताएं यह प्रदर्शित करती हैं कि पारंपरिक सामग्री मॉडरेशन तकनीकें, जो एकल-मॉडलिटी सिस्टम के लिए बनाई गई थीं, आज के वीएलएम के लिए पर्याप्त नहीं हैं ।
रिपोर्ट यह भी विवरण देती है कि पिक्सट्रल मॉडल्स को कैसे एक्सेस किया गया था: पिक्सट्रल-लार्ज एएवीएस बेडरॉक के माध्यम से और पिक्सट्रल-12बी मिस्ट्रल प्लेटफ़ॉर्म के माध्यम से। यह वास्तविक दुनिया का तैनाती संदर्भ इन निष्कर्षों की जरूरत को और भी जोर देता है। ये मॉडल्स प्रयोगशालाओं तक सीमित नहीं हैं—वे मुख्यधारा के क्लाउड प्लेटफ़ॉर्म के माध्यम से उपलब्ध हैं और आसानी से उपभोक्ता या उद्यम उत्पादों में एकीकृत किए जा सकते हैं।
क्या किया जाना चाहिए: सुरक्षित एआई के लिए एक नीलाक्षर
इसके श्रेय के लिए, एनक्रिप्ट एआई ने समस्याओं को हाइलाइट करने के अलावा एक आगे का रास्ता भी प्रस्तुत किया है। रिपोर्ट एक व्यापक कमजोरियों को कम करने की रणनीति का रूपरेखा तैयार करती है, जो सुरक्षा संरेखण प्रशिक्षण से शुरू होती है। इसमें मॉडल को अपने ही रेड टीमिंग डेटा का उपयोग करके पुनः प्रशिक्षित करना शामिल है ताकि हानिकारक प्रॉम्प्ट्स के प्रति इसकी संवेदनशीलता को कम किया जा सके। डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (डीपीओ) जैसी तकनीकों की सिफारिश मॉडल की प्रतिक्रियाओं को जोखिम भरे आउटपुट से दूर करने के लिए की जाती है।
यह संदर्भ-जागरूक गार्डरेल्स के महत्व पर भी जोर देता है—डायनेमिक फिल्टर जो मल्टीमॉडल इनपुट के पूर्ण संदर्भ को ध्यान में रखते हुए वास्तविक समय में हानिकारक प्रश्नों को व्याख्या और ब्लॉक कर सकते हैं। इसके अलावा, मॉडल रिस्क कार्ड का उपयोग पारदर्शिता के उपाय के रूप में प्रस्तावित किया जाता है, जो हितधारकों को मॉडल की सीमाओं और ज्ञात विफलता मामलों को समझने में मदद करता है।
शायद सबसे महत्वपूर्ण सिफारिश यह है कि रेड टीमिंग को एक निरंतर प्रक्रिया के रूप में माना जाना चाहिए, न कि एक बार का परीक्षण। जैसे-जैसे मॉडल विकसित होते हैं, हमले की रणनीतियां भी विकसित होती हैं। केवल निरंतर मूल्यांकन और सक्रिय निगरानी ही दीर्घकालिक विश्वसनीयता सुनिश्चित कर सकती है, खासकर जब मॉडल स्वास्थ्य सेवा, शिक्षा या रक्षा जैसे संवेदनशील क्षेत्रों में तैनात किए जाते हैं।
एनक्रिप्ट एआई की मल्टीमॉडल रेड टीमिंग रिपोर्ट एआई उद्योग के लिए एक स्पष्ट संकेत है: मल्टीमॉडल शक्ति मल्टीमॉडल जिम्मेदारी के साथ आती है। ये मॉडल्स क्षमता में एक छलांग का प्रतिनिधित्व करते हैं, लेकिन वे सुरक्षा, सुरक्षा और नैतिक तैनाती के बारे में हमारी सोच में एक छलांग की भी मांग करते हैं। अनियंत्रित, वे न केवल विफलता का जोखिम उठाते हैं—वे वास्तविक दुनिया के नुकसान का जोखिम उठाते हैं।
बड़े पैमाने पर एआई पर काम करने या तैनात करने वालों के लिए, यह रिपोर्ट न केवल एक चेतावनी है। यह एक प्लेबुक है। और यह एक और जरूरी समय पर नहीं आ सकता था।












