साइबर सुरक्षा
Perplexity ने PII-TRACE बेंचमार्क और PII-Tracer ऑन-डिवाइस डिटेक्टर पेश किया

Perplexity ने 1 सितंबर 2026 को PII-TRACE पेश किया, जो व्यक्तिगत पहचान योग्य जानकारी (PII) के डिटेक्टरों का मूल्यांकन करने के लिए एक बेंचमार्क है, और PII‑Tracer, एक कॉम्पैक्ट 0.6B‑परामीटर मॉडल है जिसे उपयोगकर्ता के डिवाइस पर टेक्स्ट क्लाउड मॉडलों को भेजे जाने से पहले PII को चिह्नित करने के लिए बनाया गया है। घोषणा दोनों रिलीज़ को कंपनी के हाइब्रिड कंप्यूट आर्किटेक्चर के लिए गोपनीयता बुनियादी ढाँचे के रूप में प्रस्तुत करता है, जिसमें क्लाउड एजेंट शोध, तर्क और योजना संभालते हैं जबकि एक स्थानीय मॉडल निजी फ़ाइलों के साथ काम करता है।
उस आर्किटेक्चर के तहत, एक स्थानीय गोपनीयता गेट मैक पर संवेदनशील सामग्री को रखता है, पहचानी गई निजी जानकारी को हटाता है, या क्लाउड को भेजने से पहले अनुमोदन का अनुरोध करता है। Perplexity ने कहा कि यह सीमा केवल तभी गोपनीयता की रक्षा करती है जब डिवाइस टेक्स्ट को रिमोट मॉडल को भेजने से पहले PII को पहचान सके, और लंबी, बहुभाषी बातचीत में जहाँ एक ही पहचानकर्ता विभिन्न टर्न में कई बार प्रकट हो सकता है, पहचान अधिक कठिन हो जाती है। एक चूक गया उल्लेख उस जानकारी को उजागर कर सकता है जिसे सिस्टम संरक्षित करने के लिए बनाया गया है।
PII‑Tracer मॉडल रूटिंग के लिए एक स्थानीय नियंत्रण संकेत प्रदान करता है, जो PII शामिल होने की भविष्यवाणी किए गए स्पैन को चिह्नित करता है। फिर एप्लिकेशन रूटिंग नीति को लागू करता है: यह संबंधित इनपुट को स्थानीय रखता है, पहचाने गए स्पैन को हटाता है, या क्लाउड मॉडल तक बढ़ाने से पहले स्पष्ट अनुमोदन का अनुरोध करता है।
PII‑TRACE बेंचमार्क
PII‑TRACE, जिसका अर्थ है Tracing Recurring PII Across Conversational Exchanges, में 13 148 सिंथेटिक उपयोगकर्ता‑सहायक वार्तालाप 13 भाषाओं और 10 लेखन प्रणालियों में शामिल हैं, जिसमें 37 431 पहचानकर्ता उल्लेख चर स्तर पर नौ PII प्रकारों में लेबल किए गए हैं। कुल 41 % वार्तालापों में संरचित सामग्री है। 5 645 लेबल किए गए PII वाले वार्तालापों में, 63.8 % में वह पहचानकर्ता है जो एक से अधिक बार प्रकट होता है, और 28.7 % में वह पहचानकर्ता है जो कई टर्न में प्रकट होता है।
Perplexity ने कहा कि उन्होंने बेंचमार्क को तीन व्यवहारों के आसपास डिजाइन किया जो सहायक वार्तालापों की स्क्रीनिंग के समय महत्वपूर्ण होते हैं। पहला है निरंतर कवरेज: जब एक पहचानकर्ता कई बार या उपयोगकर्ता और सहायक टर्न के बीच पार करता है, तो डिटेक्टर को हर उल्लेख खोजना चाहिए। दूसरा है लंबी संदर्भ के प्रति मजबूती, जहाँ वार्तालाप 1 000 से कम से लेकर 100 000 से अधिक अक्षरों तक हो सकते हैं। तीसरा है कई भाषाओं और मिश्रित‑फ़ॉर्मेट सामग्री को संभालना, क्योंकि एक वार्तालाप भाषा बदल सकता है और गद्य को कोड, तालिकाओं या संरचित रिकॉर्ड के साथ मिलाकर प्रस्तुत कर सकता है।
बेंचमार्क दो स्तरों पर प्रदर्शन मापता है। पहचानकर्ता स्तर पर, एक निरंतर पहचान स्कोर पूछता है कि क्या डिटेक्टर ने एक ही पहचानकर्ता के हर उल्लेख के हर अक्षर को कवर किया, जिसे कई उल्लेख वाले पहचानकर्ताओं और टर्न में दोहराए जाने वाले पहचानकर्ताओं के लिए अलग‑अलग रिपोर्ट किया जाता है। अक्षर स्तर पर, प्रिसीजन मापता है कि डिटेक्टर द्वारा चिह्नित टेक्स्ट में कितना भाग लेबल किया गया PII है, रिकॉल मापता है कि वह कितना लेबल किया गया PII ढूँढ़ता है, और F1 दोनों को संतुलित करता है।
डेटासेट सिंथेटिक है लेकिन उत्पादन वार्तालापों से निकाला गया है। कंपनी के अनुसार, कई भाषा मॉडल पहले उत्पादन उपयोगकर्ता‑सहायक वार्तालापों में नौ प्रकार के PII को चिह्नित करते हैं, और एक नियम‑आधारित पास समान प्रकार के दोहराए गए पहचानकर्ताओं को एक ही एंटिटी ID के तहत समूहित करता है। प्रत्येक चिह्नित मान को एक टाइप्ड प्लेसहोल्डर से बदला जाता है, प्रत्येक टर्न को प्लेसहोल्डर बनाए रखते हुए पैराफ़्रैज़ किया जाता है, और प्रत्येक पहचानकर्ता के प्रकार और फ़ॉर्मेट से मेल खाने वाले सिंथेटिक मान डाले जाते हैं। तीन स्वचालित गेट यह जांचते हैं कि प्रतिस्थापन संग्रहीत स्पैन से मेल खाते हैं, दोहराए गए उल्लेख एक ही मान उपयोग करते हैं, और चिह्नित स्रोत मान Presidio और रेगुलर‑एक्सप्रेशन पुनः‑स्कैन के तहत अनुपस्थित हैं। एक दूसरा भाषा मॉडल नमूना ऑडिट करता है, और मानव उन सभी को समीक्षा करते हैं जिन्हें वह PII के रूप में चिह्नित करता है।
स्थानीय उपयोग के लिए एक कॉम्पैक्ट डिटेक्टर
PII‑Tracer एक 0.6B द्विदिश एन्कोडर है जो Qwen3 बैकबोन से अनुकूलित है। Perplexity ने कहा कि गोपनीयता स्क्रीनिंग टेक्स्ट जेनरेशन से अलग है क्योंकि इसे संबंधित PII स्पैन खोजने और उनके सीमाओं को लौटाने की आवश्यकता होती है, इसलिए मॉडल Qwen3 के कारणात्मक मास्क को पैडिंग‑आधारित द्विदिश एटेंशन से बदलता है, जिससे प्रत्येक टोकन 4 096‑टोकन विंडो के भीतर पहले और बाद के टर्न दोनों पर ध्यान दे सकता है।
प्रत्येक टोकन के लिए, एन्कोडर 1 024‑आयामी प्रतिनिधित्व उत्पन्न करता है, और एक रैखिक टैगिंग हेड BIOES योजना के तहत 37 संभावित लेबल स्कोर करता है, जिसमें प्रत्येक नौ PII प्रकार के लिए चार स्पैन‑स्थिति लेबल और PII स्पैन के बाहर के टेक्स्ट के लिए एक लेबल शामिल है। एक सहायक हेड यह भविष्यवाणी करता है कि वार्तालाप में संवेदनशील सामग्री है या नहीं, जैसे स्वास्थ्य या धार्मिक जानकारी। कंपनी ने कहा कि उसने मॉडल को लगभग 714 000 प्रशिक्षण नमूनों पर तीन युगों के लिए प्रशिक्षित किया, जिसमें बहुभाषी सहायक वार्तालापों को एकल‑रिकॉर्ड उदाहरणों के साथ मिलाया गया। अनुमान चरण में, एक प्रतिबंधित विटरबी डिकोडर सबसे अधिक स्कोर वाले वैध लेबल अनुक्रम की खोज करता है और परिणाम को सटीक अक्षर स्पैन में मैप करता है ताकि हटाने या स्थानीय रूटिंग के लिए उपयोग किया जा सके।
मूल्यांकन परिणाम
Perplexity ने रिपोर्ट किया कि PII‑Tracer ने 12 मूल्यांकित प्रणालियों में सबसे उच्च अक्षर F1 (0.629) हासिल किया, साथ ही दूसरा सबसे उच्च स्पैन‑ओवरलैप F1 और स्पैन‑कंटेन्मेंट F1। कंपनी ने कहा कि फ्रंटियर मॉडल, अर्थात् GPT‑5.6‑sol और Claude Sonnet 5, ने तुलनीय समग्र प्रदर्शन दिखाया, जहाँ GPT‑5.6‑sol ने दोनों स्पैन‑स्तर मीट्रिक पर अधिक स्कोर किया लेकिन अक्षर F1 पर कम। उन्होंने नोट किया कि ये फ्रंटियर मॉडल सैकड़ों अरब या यहाँ तक कि ट्रिलियन पैरामीटर वाले बंद‑स्रोत मॉडल हैं जो क्लाउड में होस्टेड हैं, जिससे वे उन टेक्स्ट की स्क्रीनिंग के लिए उपयुक्त नहीं हैं जिन्हें स्थानीय रखना आवश्यक है, जबकि अन्य ओपन‑सोर्स PII डिटेक्टर PII‑Tracer की तुलना में काफी खराब प्रदर्शन करते हैं।
संगति परीक्षण में, मूल्यांकन सेट में 899 पहचानकर्ता एक बार प्रकट होते हैं और 959 कई बार, जिनमें 790 कई टर्न में फैले होते हैं। Perplexity ने रिपोर्ट किया कि PII‑Tracer ने 79.4 % दोहराए जाने वाले पहचानकर्ताओं और 77.6 % क्रॉस‑टर्न पहचानकर्ताओं के हर उल्लेख को पाया, जबकि GPT‑5.6‑sol ने समान दो मापों पर क्रमशः 57.0 % और 55.1 % हासिल किए। PII‑Tracer का स्कोर एकल‑उल्लेख पहचानकर्ताओं के लिए 0.917 से छह से दस बार प्रकट होने वाले पहचानकर्ताओं के लिए 0.691 तक गिरता है।
लंबाई एक सीमा बनी रहती है। एकल‑विंडो रिकॉल 1 000 अक्षरों से कम वार्तालापों के लिए 0.975 है और 1 000 से 10 000 के बीच 0.955, लेकिन 10 000 अक्षरों या उससे अधिक पर 0.687 तक गिरता है। कंपनी ने कहा कि समान चेकपॉइंट को 50 % ओवरलैप स्लाइडिंग विंडो के साथ डिकोड करने से समग्र अक्षर रिकॉल 0.830 से 0.965 तक बढ़ जाता है और कई‑उल्लेख निरंतर पहचान 0.794 से 0.954 तक, बिना पुनः प्रशिक्षण के।
छह‑भाषा स्लाइस में, जो लैटिन, सिरिलिक और हैंगुल लिपियों को कवर करता है, PII‑Tracer ने जर्मन (0.735), फ्रेंच (0.633), इटालियन (0.676), और रूसी (0.651) में अक्षर F1 में अग्रणी रहा, और अंग्रेजी और कोरियन में सर्वोत्तम परिणामों से क्रमशः 0.016 और 0.036 के अंतर पर रहा, कंपनी ने बताया। पाँच बाहरी एकल‑रिकॉर्ड बेंचमार्क पर, Perplexity ने कहा कि PII‑Tracer ने प्रत्येक डेटासेट पर OpenAI Privacy Filter से अधिक अक्षर F1 दर्ज किया, जिसमें ai4privacy पर 0.950 बनाम 0.907, Nemotron‑PII पर 0.847 बनाम 0.709, और TAB पर 0.594 बनाम 0.350 शामिल हैं, जो समूह में वास्तविक, मानव‑लेबल्ड टेक्स्ट से बना एकमात्र बेंचमार्क है।
शोध पत्र चेतावनी देता है कि वार्तालाप सिंथेटिक पुनर्निर्माण हैं जो उत्पादन सहायक ट्रैफ़िक की संरचना से निकाले गए हैं, इसलिए परिणामों को वार्तालापीय PII पहचान के माप के रूप में पढ़ा जाना चाहिए, न कि किसी विशिष्ट उत्पादन कार्यभार के अनुमान के रूप में। पेपर यह भी नोट करता है कि टूल कॉल, एजेंट‑के‑बीच संदेश, और मल्टीमॉडल इनपुट बेंचमार्क के दायरे से बाहर हैं, और प्रत्येक बेसलाइन को एकल अनुमान कॉन्फ़िगरेशन के तहत मूल्यांकित किया गया था। Perplexity ने कहा कि वह जल्द ही PII‑TRACE और PII‑Tracer दोनों को रिलीज़ करने की योजना बना रहा है; पेपर में कहा गया है कि दोनों को MIT लाइसेंस के तहत जारी किया जाएगा।












