एआई मॉडल और प्लेटफ़ॉर्म

Scale AI ने बहुभाषी AI सुरक्षा पर ROK-FORTRESS निष्कर्षों की रिपोर्ट दी

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Scale AI ने 17 सितंबर, 2026 को ROK-FORTRESS से निष्कर्ष प्रकाशित किए, जो कोरिया AI सुरक्षा संस्थान के साथ संयुक्त रूप से विकसित किया गया एक द्विभाषी अंग्रेजी‑कोरियाई प्रतिद्वंद्वात्मक सुरक्षा बेंचमार्क है, और बताया कि कोरियाई में लिखे गए और कोरियाई संदर्भों में आधारित प्रॉम्प्ट लगभग सभी 14 फ्रंटियर मॉडलों में मापी गई हानि को लगातार कम दर्शाते हैं।

बेंचमार्क डिज़ाइन: ट्रांसक्रिएशन मैट्रिक्स

अधिकांश बहुभाषी सुरक्षा बेंचमार्क एक निश्चित प्रॉम्प्ट को दूसरी भाषा में अनुवादित करते हैं जबकि जिस परिदृश्य का वर्णन होता है उसे अपरिवर्तित रखते हैं। शोध पोस्ट, जिसे मदु सेहवाग ने लिखा है, में Scale AI ROK-FORTRESS को एक नियंत्रित ट्रांसक्रिएशन मैट्रिक्स के रूप में वर्णित करता है: प्रत्येक प्रतिद्वंद्वात्मक प्रॉम्प्ट को अधिकतम चार वैरिएंट्स में मूल्यांकित किया जाता है जो स्वतंत्र रूप से भाषा (अंग्रेजी बनाम कोरियाई) और भू‑राजनीतिक आधार (अमेरिका बनाम कोरिया संस्थाएँ, संस्थान और संचालन विवरण) बदलते हैं। प्रत्येक प्रतिद्वंद्वात्मक प्रॉम्प्ट को एक सौम्य समकक्ष के साथ जोड़ा जाता है ताकि बेंचमार्क अधिक अस्वीकृति को भी माप सके।

पूरा डेटासेट 1,235 कार्यों को चार राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा क्षेत्रों में सम्मिलित करता है: रासायनिक, जैविक, विकिरणीय, परमाणु और विस्फोटक (CBRNE) खतरे; राजनीतिक हिंसा और आतंकवाद; आपराधिक और वित्तीय गतिविधि; तथा सूचना लीक। प्रतिक्रियाओं को कैलिब्रेटेड LLM‑एज़‑जज पैनलों द्वारा अंकित किया जाता है, जो विशेषज्ञ‑लिखित संदर्भ लेबलों के विरुद्ध सत्यापित होते हैं, और प्रॉम्प्ट‑विशिष्ट द्विआधारी रूब्रिक का उपयोग करते हैं जो विशेषज्ञ रेड‑टीमर द्वारा विकसित किए गए हैं।

यह पोस्ट डिजाइन को एक बड़े पैमाने पर हताहत हमला परिदृश्य के साथ दर्शाती है: समान मूल इरादा संयुक्त राज्य में 1995 के ओक्लाहोमा फेडरल बिल्डिंग बम विस्फोट या कोरिया में 1987 के कोरियन एयर फ्लाइट 858 बम विस्फोट को सक्रिय कर सकता है, और केवल अनुवाद‑आधारित मूल्यांकन यह नहीं दिखा सकता कि इस आधारभूत परिवर्तन से मॉडल व्यवहार कैसे बदलता है।

ROK-FORTRESS, Scale AI और कोरिया AI सुरक्षा संस्थान के व्यापक साझेदारी से उत्पन्न नवीनतम बेंचमार्क है, जिसमें संयुक्त शोध, LLM मूल्यांकन, और रेड‑टीमिंग शामिल हैं, और यह FORTRESS पर आधारित है, जो Scale AI का फ्रंटियर मॉडलों के लिए राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा बेंचमार्क है।

14 मॉडलों में रिपोर्ट किए गए निष्कर्ष

पेपर के अनुसार, मूल्यांकन ने फ्रंटियर और कोरियाई‑ऑप्टिमाइज़्ड मॉडलों के द्वि‑ट्रैक सेट को सम्मिलित किया। Scale AI ने बताया कि अंग्रेजी प्रॉम्प्ट सामान्यतः सबसे अधिक टियर‑वेटेड जोखिम स्कोर उत्पन्न करते हैं और पूरी तरह से ट्रांसक्रिएटेड कोरियाई प्रॉम्प्ट सबसे कम, जबकि मध्यवर्ती वैरिएंट्स बीच में आते हैं, और यह पैटर्न कोरियाई‑विशेषीकृत क्षेत्रीय मॉडलों में भी बना रहा। सबसे अधिक और सबसे कम हानिकारक मॉडलों के जोखिम स्कोर में लगभग नौ गुना अंतर था।

एक प्रत्यक्ष‑अनुरोध एब्लेशन ने इस पैटर्न को जटिल बना दिया। बेंचमार्क के मुख्य परीक्षण जटिल प्रतिद्वंद्वात्मक प्रॉम्प्टों का उपयोग करते हैं जो हानिकारक अनुरोधों को भूमिका‑नाटक, निर्मित पृष्ठभूमि, या भावनात्मक अपील के भीतर छुपाते हैं; जब इन रैपरों को हटाया गया और वही जानकारी साधारण, प्रत्यक्ष भाषा में मांगी गई, तो कोरियाई लाभ अधिकांशतः गायब हो गया। OpenAI, Anthropic, और Google के स्वामित्व वाले मॉडल कोरियाई में थोड़ा अधिक सुरक्षित रहे, जबकि पाँच ओपन‑सोर्स फ्रंटियर मॉडल कोरियाई में अधिक अनुपालन करने की प्रवृत्ति दिखाते हैं। पेपर कहता है कि यह विभाजन दर्शाता है कि कोरियाई दमन का भाग प्रॉम्प्ट विशेषीकरण से उत्पन्न है, अर्थात् ट्रांसक्रिएशन के माध्यम से प्रतिद्वंद्वात्मक रैपरों की प्रभावशीलता घटना, न कि अंतर्निहित भाषा‑आधारित सुरक्षा संरेखण।

Scale AI यह भी रिपोर्ट करता है कि अंग्रेजी से कोरियाई में स्विच करने का प्रभाव लगभग 2.5 गुना अधिक था जितना कि यू.एस. से कोरियाई आधार में बदलाव का प्रभाव था, लगभग दस प्रतिशत अंक बनाम चार, और परिणामों के अनुरूप एक व्याख्या प्रस्तुत करता है: कोरियाई एक रूढ़िवादी जोखिम संकेत के रूप में कार्य करता है। 14 मॉडलों में से 4 में, कोरियाई संदर्भ जोड़ने से कोरियाई भाषा से जुड़े हानिकारक प्रतिक्रियाओं में कमी काफी कमज़ोर हो गई, और कोई मॉडल विपरीत दिशा में सांख्यिकीय रूप से महत्वपूर्ण प्रभाव नहीं दिखा। केवल उन मामलों को देखते हुए जहाँ मॉडल ने उत्तर दिया न कि अस्वीकार किया, 14 में से 12 ने अभी भी कोरियाई में कम हानिकारक प्रतिक्रियाएँ दीं, जबकि मॉडल ने निरुपद्रवी कोरियाई अनुरोधों को अधिक बार अस्वीकार किया, कुछ मामलों में लगभग दो गुना अधिक।

प्रीप्रिंट, सार्वजनिक डेटासेट, और उल्लेखित निहितार्थ

अधारित arXiv पर प्रीप्रिंट, जिसका शीर्षक “ROK-FORTRESS: राष्ट्रीय सुरक्षा और सार्वजनिक सुरक्षा के लिए भू‑राजनीतिक ट्रांसक्रिएशन के प्रभाव को मापना” है, इसमें Michael S. Lee और 15 सह‑लेखक सूचीबद्ध हैं। इसे पहली बार 13 मई, 2026 को जमा किया गया और अंतिम बार 7 जुलाई, 2026 को संशोधित किया गया, और यह मुख्य पाठ के 16 पृष्ठ तथा एक परिशिष्ट के साथ कुल 74 पृष्ठों में फैला है, जिसमें मुख्य पाठ में चार चित्र और दो तालिकाएँ हैं। इसका सारांश परिणामों को इस प्रमाण के रूप में प्रस्तुत करता है कि कम से कम अंग्रेजी‑कोरियाई मामले में, सुरक्षा व्यवहार भाषा‑को‑जोखिम संकेत और संदर्भ अंतःक्रियाओं द्वारा आकारित होता है, जिन्हें केवल अनुवाद‑आधारित मूल्यांकन नहीं पकड़ पाते, और यह बताता है कि ट्रांसक्रिएशन‑मैट्रिक्स पद्धति को अन्य भाषा‑संस्कृति जोड़ों पर सामान्यीकृत करने के लिए डिज़ाइन किया गया है।

डेटासेट का एक सार्वजनिक उपसमुच्चय Hugging Face पर CC-BY-4.0 लाइसेंस के तहत उपलब्ध है, जिसमें एक एक्सेस समझौता शामिल है जो संपर्क जानकारी की आवश्यकता रखता है। यह उपसमुच्चय 1,235 कार्यों में से 791 कार्य, अर्थात 64 प्रतिशत, शामिल करता है, जबकि शेष 444 कार्य, अर्थात 36 प्रतिशत, को विशेषज्ञ रेड-टीमर द्वारा संभावित हानि के आकलन के आधार पर एक निजी होल्डआउट के रूप में रखा गया है, ताकि अधिक जोखिम वाले वास्तविक-विश्व दुरुपयोग के संभावित प्रॉम्प्ट को प्रतिबंधित किया जा सके और बेंचमार्क दूषित होने से बचा जा सके। रिलीज़ में दो वैरिएंट वाले 359 कल्चर एग्नॉस्टिक कार्य और चार वैरिएंट वाले 432 कल्चर स्पेसिफिक कार्य शामिल हैं, जिससे कुल 1,519 प्रभावी कार्य-वैरीएंट जोड़े बनते हैं, और प्रत्येक कार्य में एक से सात बाइनरी रूब्रिक आइटम होते हैं जो सात हानि आयामों के साथ डोमेन-विशिष्ट जोखिम स्तर 1 से 3 तक मैप किए गए होते हैं। सार्वजनिक उपसमुच्चय CBRNE (251 कार्य), आपराधिक और वित्तीय अवैध गतिविधियों (248 कार्य), राजनीतिक हिंसा और आतंकवाद (209 कार्य), तथा सूचना लीक (83 कार्य) को कवर करता है, जिसमें 450 कार्य FORTRESS से अनुकूलित किए गए हैं और 341 कार्य नई रूप से लिखे गए हैं। डेटासेट Parquet फ़ॉर्मेट में प्रदान किया गया है और इसमें एक TSV संस्करण भी शामिल है।

पोस्ट में Scale AI ने कहा कि केवल अनुवाद पर आधारित मूल्यांकन वास्तविक-विश्व सुरक्षा अंतराल को कम‑आँकना कर सकते हैं, और बेंचमार्क को ऐसे ट्रांसक्रिएटेड प्रॉम्प्ट का परीक्षण करना चाहिए जो भाषा और भू‑राजनीतिक आधार दोनों को अनुकूलित करते हुए मूल इरादे को बनाए रखें, तथा पोस्ट‑ट्रेनिंग डेटा और रेड‑टीमिंग प्रथाओं को केवल अंग्रेज़ी विरोधी प्रॉम्प्ट के अनुवादित संस्करणों के बजाय सांस्कृतिक रूप से आधारभूत वैरिएंट को शामिल करना चाहिए। सहयोगी सरकारी संदर्भों के लिए, Scale AI ने कहा कि एक मॉडल जो अंग्रेज़ी सुरक्षा मूल्यांकन में अच्छा प्रदर्शन करता है, स्थानीय भाषा में स्थानीय रूप से आधारभूत खतरों के बारे में पूछे जाने पर अलग व्यवहार कर सकता है। पोस्ट में यह भी कहा गया कि यह निर्धारित करने के लिए आगे परीक्षण की आवश्यकता है कि क्या वही पैटर्न अन्य भाषाओं और देशों में भी लागू होते हैं।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।