PII-TRACE: डिवाइस से बाहर निकलने से पहले व्यक्तिगत डेटा का पता लगाना

लंबी चलने वाली बातचीत में सुसंगत PII डिटेक्शन के लिए 13-भाषा बेंचमार्क, स्थानीय रूप से चलने के लिए डिज़ाइन किए गए कॉम्पैक्ट 0.6B डिटेक्टर के साथ जुड़ा हुआ है।

लेखकPerplexity Secure Intelligence Institute

Mac पर हाइब्रिड कंप्यूट Perplexity Computer कार्यों को क्लाउड में फ़्रंटियर मॉडल और Mac पर एक स्थानीय मॉडल के बीच विभाजित करता है। क्लाउड एजेंट अनुसंधान, तर्क और योजना को संभालते हैं, जबकि स्थानीय मॉडल निजी फ़ाइलों और संवेदनशील जानकारी के साथ काम करता है।

यह सीमा डिवाइस से बाहर निकलने से पहले व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) का पता लगाने पर निर्भर करती है। एक स्थानीय प्राइवेसी गेट संवेदनशील सामग्री को Mac पर रखता है, खोजी गई निजी जानकारी को रिडैक्ट करता है, या इसे क्लाउड पर भेजने से पहले अनुमोदन का अनुरोध करता है।

लंबी, बहुभाषी बातचीत में डिटेक्शन अधिक कठिन हो जाता है। एक ही पहचानकर्ता विभिन्न मोड़ों पर कई बार दिखाई दे सकता है। एक छूटा हुआ उल्लेख उस जानकारी को उजागर कर सकता है जिसे सिस्टम को सुरक्षित रखने के लिए बनाया गया है।

परिचय

आज, हम पेश कर रहे हैं PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) डिटेक्टरों का मूल्यांकन करने के लिए एक नया बेंचमार्क, और PII-Tracer, PII डिटेक्शन के लिए एक कॉम्पैक्ट 0.6B मॉडल।

क्लाउड-फर्स्ट एजेंट उपयोगकर्ताओं को संदर्भ, बुद्धिमत्ता और गोपनीयता को संतुलित करने के लिए मजबूर करते हैं। अधिक व्यक्तिगत संदर्भ एक एजेंट को उपयोगकर्ता को समझने और बेहतर परिणाम देने में मदद कर सकता है। लेकिन इस संदर्भ को प्रदान करने का अक्सर मतलब एक दूरस्थ सेवा को निजी जानकारी भेजना है और व्यक्तिगत जानकारी लीक हो सकती है। जो जानकारी एक सहायक को उपयोगी बनाती है, वही ठीक वही हो सकती है जिसे उपयोगकर्ता सबसे अधिक निजी रखना चाहता है।

हाइब्रिड AI उपयोगकर्ता के डिवाइस और क्लाउड मॉडल के बीच काम को विभाजित करके इस ट्रेड-ऑफ़ को आसान बनाता है। लेकिन वह सीमा केवल तभी गोपनीयता की रक्षा करती है जब डिवाइस किसी दूरस्थ मॉडल को पाठ भेजे जाने से पहले PII को पहचान सके। उपयोगकर्ताओं को खुद हर संदेश का निरीक्षण नहीं करना होगा। डिवाइस को अपने प्राइवेसी गेट के रूप में स्थानीय PII डिटेक्टर की आवश्यकता है। लंबी बातचीत में, एक ही पहचानकर्ता टर्न में पुनरावृत्ति कर सकता है, और व्यक्तिगत जानकारी के पारित होने के लिए एक छूटा हुआ उल्लेख पर्याप्त है।

प्राइवेसी गेट वर्कफ़्लो को स्पष्ट करने वाला आरेख, यह दर्शाता है कि संवेदनशील डेटा स्थानीय डिवाइस पर कैसे रहता है जबकि स्वीकृत अनुरोधों को प्रोसेसिंग के लिए क्लाउड मॉडल पर भेजा जाता है।
हाइब्रिड AI में प्राइवेसी गेट के रूप में PII-Tracer

Perplexity ने एक हाइब्रिड स्थानीय-सर्वर अनुमान ऑर्केस्ट्रेटर पेश किया जो तय करता है कि कौन सा काम डिवाइस पर चलना चाहिए और कौन सा काम क्लाउड में एजेंटों के पास जाना चाहिए। मॉडल, एजेंट हार्नेस, बातचीत और निष्पादन प्रक्षेपवक्र सभी उपयोगकर्ता की मशीन पर रहते हैं। बाहरी दुनिया तक पहुँच की आवश्यकता वाले कार्यों को केवल तभी调用 किया जाता है जब आवश्यक हो और उपयोगकर्ता की अनुमति द्वारा नियंत्रित किया जाता है। परिणामस्वरूप, जब तक उपयोगकर्ता स्वीकृत नहीं करता, वह सामग्री डिवाइस पर ही रहती है।

PII-Tracer PII शामिल होने के लिए अनुमानित स्पैन को फ़्लैग करके मॉडल रूटिंग के लिए एक स्थानीय नियंत्रण संकेत प्रदान करता है। फिर एप्लिकेशन रूटिंग नीति लागू करता है। यह प्रासंगिक इनपुट को स्थानीय रखता है, पता लगाए गए स्पैन को रिडैक्ट करता है, या क्लाउड मॉडल पर जाने से पहले स्पष्ट अनुमोदन का अनुरोध करता है। इससे रूटिंग अधिक चयनात्मक हो जाती है। पता लगाया गया PII डिवाइस पर रहता है जबकि स्वीकृत संदर्भ अभी भी फ़्रंटियर क्लाउड मॉडल से लाभान्वित होता है।

चयनात्मक रूटिंग पूरी बातचीत में लगातार डिटेक्शन पर निर्भर करती है। एक ही पहचानकर्ता टर्न में पुनरावृत्ति कर सकता है, और एक छूटा हुआ उल्लेख अभी भी प्रसारित हो सकता है।

12 डिटेक्टरों में, PII-Tracer उच्चतम कैरेक्टर F1 और आवर्ती पहचानकर्ताओं का सबसे अधिक लगातार कवरेज रिकॉर्ड करता है। बेंचमार्क बताता है कि दोनों परिणाम क्यों मायने रखते हैं: लंबी बातचीत पर, अधिकांश PII ढूंढना इसके हर कॉपी को ढूंढने के समान नहीं है।

हाइब्रिड AI में PII डिटेक्शन के सामने नई चुनौतियाँ

PII डिटेक्शन एक लंबे समय से चली आ रही सुरक्षा समस्या है, और कई बेंचमार्क और डिटेक्टर पहले से मौजूद हैं। हालांकि, हाइब्रिड AI सेटिंग्स में PII डिटेक्शन नई चुनौतियां पेश करता है। विशेष रूप से, डिटेक्टरों को लंबी, बहु-टर्न बातचीत में PII की पहचान करनी चाहिए, जहाँ संवादात्मक संदर्भ यह निर्धारित करता है कि क्या किसी स्ट्रिंग को PII माना जाना चाहिए। उदाहरण के लिए, एक नाम एक बातचीत में उपयोगकर्ता की पहचान कर सकता है, दूसरे में किसी सार्वजनिक हस्ती को संदर्भित कर सकता है, या केवल एक सहायक द्वारा उत्पन्न एक प्लेसहोल्डर हो सकता है। यह निर्धारित करने के लिए कि क्या किसी स्ट्रिंग को PII के रूप में फ़्लैग किया जाना चाहिए, अकेला सतही रूप अपर्याप्त है।

एक चैट इंटरफ़ेस एक सहायक को कई मोड़ों पर उपयोगकर्ता का नाम, फ़ोन नंबर, अपॉइंटमेंट विवरण और ईमेल पता बनाए रखते हुए दिखाता है।
एक नाम, फ़ोन नंबर और ईमेल पता बातचीत के दौरान बार-बार आते हैं। PII-TRACE किसी पहचानकर्ता को केवल तभी लगातार पहचाने जाने के रूप में गिनता है जब हर उल्लेख मिल जाता है।

मौजूदा PII डिटेक्टर और बेंचमार्क मुख्य रूप से व्यक्तिगत रिकॉर्ड को लक्षित करते हैं। हम पाते हैं कि एक समय में एक रिकॉर्ड को प्रोसेस करने के लिए डिज़ाइन किए गए डिटेक्टर लंबी, जटिल बातचीत पर खराब प्रदर्शन करते हैं। इसके अलावा, मौजूदा बेंचमार्क आम तौर पर टर्न के बीच संगति का मूल्यांकन नहीं करते हैं। परिणामस्वरूप, इन बेंचमार्कों पर मजबूत प्रदर्शन जरूरी नहीं कि लंबी, बहु-टर्न बातचीत में प्रभावी PII डिटेक्शन में परिवर्तित हो।

PII-TRACE: तैनाती-महत्वपूर्ण PII पहचान के लिए एक बेंचमार्क

हमने तीन व्यवहारों के आसपास PII-TRACE को डिज़ाइन किया है जो तब मायने रखते हैं जब सहायक वार्ता पर PII डिटेक्टर का उपयोग किया जाता है। पहला सुसंगत कवरेज है: जब कोई पहचानकर्ता कई बार दिखाई देता है या उपयोगकर्ता और सहायक के मोड़ों को पार करता है, तो डिटेक्टर को हर उल्लेख को खोजने की आवश्यकता होती है। दूसरा लंबे संदर्भ के लिए मजबूती है: बातचीत 1,000 से कम से लेकर 100,000 से अधिक कैरेक्टर तक होती है, जिससे यह मापना संभव हो जाता है कि इतिहास बढ़ने पर क्या होता है। तीसरा कई भाषाओं और मिश्रित-प्रारूप सामग्री को संभालना है: एक बातचीत भाषाएं बदल सकती है और कोड, तालिकाओं या संरचित रिकॉर्ड के साथ गद्य को जोड़ सकती है। PII-TRACE इसे अलग-अलग रिकॉर्ड में विभाजित करने के बजाय प्रत्येक पूर्ण संवाद का मूल्यांकन करके इन पैटर्न को संरक्षित करता है।

बेंचमार्क दो पूरक स्तरों पर प्रदर्शन को मापता है। पहचानकर्ता स्तर पर, सुसंगत पहचान सख्त सवाल पूछती है: क्या डिटेक्टर ने समान पहचानकर्ता के हर उल्लेख में हर कैरेक्टर को कवर किया है? हम इस स्कोर को कई उल्लेखों वाले पहचानकर्ताओं के लिए और टर्न में दोहराए जाने वाले पहचानकर्ताओं के लिए अलग से रिपोर्ट करते हैं। कैरेक्टर स्तर पर, प्रिसिजन यह मापता है कि डिटेक्टर द्वारा चिह्नित कितना पाठ PII के रूप में लेबल किया गया है, रिकॉल यह मापता है कि यह कितना लेबल किया गया PII पाता है, और F1 दोनों को संतुलित करता है।

PII-TRACE में 13 भाषाओं और 10 लेखन प्रणालियों में 13,148 सिंथेटिक उपयोगकर्ता-सहायक बातचीत शामिल हैं, जिसमें नौ PII प्रकारों में कैरेक्टर स्तर पर 37,431 पहचानकर्ता उल्लेख लेबल किए गए हैं। कुल 41% बातचीत में संरचित सामग्री होती है। लेबल किए गए PII वाली 5,645 वार्ताओं में से, 63.8% में एक ऐसा पहचानकर्ता शामिल है जो एक से अधिक बार दिखाई देता है, और 28.7% में एक ऐसा पहचानकर्ता शामिल है जो कई मोड़ों पर दिखाई देता है।

उत्पादन वार्ताओं से एक सिंथेटिक डेटासेट का निर्माण

PII-TRACE मूल को प्रकाशित किए बिना स्रोत वार्ताओं की टर्न संरचना को सुरक्षित रखता है। पाइपलाइन प्रत्येक टर्न को दोबारा लिखती है और प्रत्येक लेबल किए गए पहचानकर्ता को एक सिंथेटिक मान से बदल देती है।

आरेख दिखाता है कि कैसे PII-TRACE टेम्प्लेटिंग, पैराफ्रेज़िंग, लगातार सिंथेटिक मानों के साथ प्रतिस्थापन, और सत्यापन जांच के माध्यम से लेबल किए गए उत्पादन वार्ताओं को सिंथेटिक डेटासेट में परिवर्तित करता है।
IPII-TRACE लेबल किए गए स्रोत पाठ को एक टेम्प्लेट में बदल देता है, प्रत्येक टर्न को दोबारा लिखता है, लगातार सिंथेटिक मान सम्मिलित करता है, और परिणाम पर रिलीज़ जांच चलाता है।

सबसे पहले, कई भाषा मॉडल उत्पादन उपयोगकर्ता-सहायक बातचीत में नौ प्रकार के PII को चिह्नित करते हैं। एक नियम-आधारित पास एक इकाई आईडी के तहत एक ही प्रकार के बार-बार आने वाले पहचानकर्ताओं को समूहीकृत करता है। फिर प्रत्येक चिह्नित मान को एक टाइप किए गए प्लेसहोल्डर द्वारा प्रतिस्थापित किया जाता है, जिससे एक टेम्प्लेट बच जाता है जो टर्न ऑर्डर, PII प्रकार और उल्लेखों के बीच लिंक को बरकरार रखता है लेकिन चिह्नित मूल मानों में से कोई नहीं।

सिस्टम उन प्लेसहोल्डर को बरकरार रखते हुए प्रत्येक टर्न को पैराफ्रेज़ करता है, फिर सिंथेटिक मान सम्मिलित करता है जो पहचानकर्ता के प्रकार और प्रारूप से मेल खाते हैं। बार-बार उल्लेखों को एक बातचीत के भीतर एक ही मान प्राप्त होता है, जबकि विभिन्न बातचीत स्वतंत्र रूप से उत्पन्न मूल्यों का उपयोग करती हैं। अंतिम संरेखण पास प्रत्येक कैरेक्टर ऑफ़सेट की पुनर्गणना करता है।

तीन स्वचालित गेट जाँचते हैं कि प्रतिस्थापन संग्रहीत स्पैन से मेल खाते हैं, बार-बार उल्लेख समान मान का उपयोग करते हैं, और चिह्नित स्रोत मान Presidio और नियमित-अभिव्यक्ति पुनरीक्षण के तहत अनुपस्थित हैं। एक संग्रहीत ऑफ़सेट को सटीक सिंथेटिक सबस्ट्रिंग को भी पुनर्प्राप्त करना चाहिए। जो रिकॉर्ड विफल होते हैं उन्हें पुनर्जीवित या गिरा दिया जाता है। एक दूसरा भाषा मॉडल एक नमूने का ऑडिट करता है, और मनुष्य इसके द्वारा PII के रूप में फ़्लैग की गई किसी भी चीज़ की समीक्षा करते हैं।

PII-Tracer: स्थानीय उपयोग के लिए एक कॉम्पैक्ट डिटेक्टर

PII-Tracer Qwen3 बैक बोन से अनुकूलित 0.6B द्व દિਸ਼ात्मक एनकोडर है। प्राइवेसी स्क्रीनिंग टेक्स्ट जनरेशन से अलग है और इसके लिए प्रासंगिक PII स्पैन खोजने और उनकी सीमाओं को वापस करने की आवश्यकता होती है। परिणामस्वरूप, PII-Tracer Qwen3 के कॉज़ल मास्क को पैडिंग-अवेयर बाइडायरेक्शनल अटेंशन से बदल देता है, ताकि प्रत्येक टोकन 4,096-टोकन विंडो के भीतर पहले और बाद के दोनों मोड़ों पर आकर्षित हो सके।

प्रत्येक टोकन के लिए, एनकोडर 1,024-आयामी प्रतिनिधित्व उत्पन्न करता है। एक रैखिक टैगिंग हेड 37 संभावित लेबलों के लिए स्कोर उत्पन्न करता है: PII स्पैन के बाहर के पाठ के लिए एक विशेष लेबल (जिसे हम दर्शाने के लिए O का उपयोग करते हैं), साथ ही नौ PII प्रकारों में से प्रत्येक के लिए चार स्पैन-स्थिति लेबल। नामित इकाई पहचान के लिए BIOES योजना में, B (शुरुआत), I (अंदर), और E (अंत) एक बहु-टोकन स्पैन को चिह्नित करते हैं, जबकि S (एकल) एक एक-टोकन स्पैन को चिह्नित करता है। एक सहायक हेड यह भी भविष्यवाणी करता है कि क्या बातचीत में स्वास्थ्य या धार्मिक जानकारी जैसी संवेदनशील सामग्री है।

हम लगभग 714,000 प्रशिक्षण नमूनों पर तीन युगों के लिए PII-Tracer को प्रशिक्षित करते हैं, बहुभाषी सहायक वार्ताओं को एकल-रिकॉर्ड उदाहरणों के साथ जोड़ते हैं। साझा बाइडायरेक्शनल एनकोडर में दो प्रशिक्षण प्रमुख हैं: एक 37-वर्ग BIOES टोकन हेड जो PII स्पैन का पता लगाता है और उन्हें टाइप करता है, और एक बाइनरी वार्ता-स्तरीय हेड जो यह भविष्यवाणी करता है कि क्या बातचीत में संवेदनशील सामग्री है। हम L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}} का उपयोग करके दोनों सिरों को संयुक्त रूप से प्रशिक्षित करते हैं। यहाँ, Ltag\mathcal{L}_{\mathrm{tag}} दुर्लभ PII लेबल को अधिक वजन देता है ताकि बार-बार आने वाला `O` लेबल हावी न हो, जबकि Lsens\mathcal{L}_{\mathrm{sens}} वार्ता-स्तरीय प्रशिक्षण संकेत की आपूर्ति करता है; 1.5 और 0.3 गुणांक स्पैन डिटेक्शन को मुख्य कार्य के रूप में रखते हैं। यह सहायक संकेत संदर्भ-जागरूक डिटेक्शन को मजबूत करता है: मॉडल एक अलग स्ट्रिंग के रूप में नहीं बल्कि बातचीत के भीतर एक उम्मीदवार स्पैन का न्याय करना सीखता है, जिससे रिकॉल में केवल एक छोटे से ट्रेडऑफ़ के साथ गलत सकारात्मक को कम करने में मदद मिलती है।

अनुमान के समय, प्रत्येक टोकन को स्वतंत्र रूप से लेबल करने के बजाय एक विवश विटेर्बी डिकोडर उच्चतम स्कोर वाले वैध BIOES अनुक्रम की खोज करता है। उदाहरण के लिए, B-private_person, I-private_person के साथ जारी रह सकता है या E-private_person के साथ बंद हो सकता है, लेकिन I-private_email पर स्विच नहीं कर सकता है। डिकोडर परिणाम को रिडैकशन या स्थानीय रूटिंग के लिए सटीक कैरेक्टर स्पैन में मैप करता है।

PII-Tracer कैरेक्टर F1 और आवर्ती PII पर अग्रणी है

हम कैरेक्टर और स्पैन दोनों स्तरों पर डिटेक्टरों की तुलना करते हैं। कैरेक्टर F1 हर कैरेक्टर के आधार पर डिटेक्शन का मूल्यांकन करता है। स्पैन-ओवरलैप F1 यह मापता है कि क्या डिटेक्टर किसी PII आइटम के किसी भी हिस्से की पहचान करता है, जबकि स्पैन-कंटेनमेंट F1 यह मापता है कि क्या यह पूरे आइटम को कैप्चर करता है।

मूल्यांकित 12 प्रणालियों में से PII-Tracer ने सबसे अधिक कैरेक्टर F1 (0.629) हासिल किया, और दूसरा सबसे अधिक स्पैन-ओवरलैप F1 और स्पैन-कंटेनमेंट F1 हासिल किया। फ़्रंटियर मॉडल, अर्थात् GPT-5.6-sol और Claude Sonnet 5 ने तुलनीय समग्र प्रदर्शन हासिल किया। GPT-5.6-sol ने दोनों स्पैन-स्तरीय F1 मेट्रिक्स पर उच्च स्कोर प्राप्त किया, लेकिन कम कैरेक्टर F1 प्राप्त किया। हालांकि, इन फ़्रंटियर मॉडल में सैकड़ों अरबों या खरबों पैरामीटर हैं और ये क्लाउड में होस्ट किए गए बंद-स्रोत मॉडल हैं। परिणामस्वरूप, वे हाइब्रिड AI सेटिंग्स में संवेदनशील स्थानीय डेटा की सुरक्षा के लिए अनुपयुक्त हैं जहाँ अनस्क्रीन किए गए पाठ को स्थानीय रहना चाहिए। इसके विपरीत, PII-Tracer केवल 0.6B मापदंडों के साथ फ़्रंटियर-के-करीब स्पैन-स्तरीय डिटेक्शन प्रदान करता है और अनस्क्रीन किए गए पाठ को पूरी तरह से स्थानीय रूप से प्रोसेस कर सकता है। अन्य ओपन-सोर्स PII डिटेक्टर PII-Tracer से काफी खराब प्रदर्शन करते हैं।

12 PII-डिटेक्शन सिस्टम की तुलना करने वाले तीन बार चार्ट। PII-Tracer 0.6B कैरेक्टर F1 में पहले स्थान पर है और GPT-5.6-sol के पीछे स्पैन-ओवरलैप और स्पैन-कंटेनमेंट F1 में दूसरे स्थान पर है।
सभी बारह प्रणालियों में कैरेक्टर F1, स्पैन-ओवरलैप F1 और स्पैन-कंटेनमेंट F1।

हर आवर्ती उल्लेख को ढूंढना

संगति प्रयोग समान भविष्यवाणियों पर एक सख्त परीक्षण लागू करता है। परीक्षण सेट में 899 पहचानकर्ता शामिल हैं जो एक बार दिखाई देते हैं और 959 जो एक से अधिक बार दिखाई देते हैं; आवर्ती पहचानकर्ताओं में से 790 कई मोड़ों में फैले हुए हैं। यह आंकड़ा चार उल्लेख-गणना बाल्टियों (एक, दो, तीन से पांच, और छह से दस) की रिपोर्ट करता है और किसी पहचानकर्ता को केवल तभी गिनता है जब उसके सभी लेबल किए गए कैरेक्टर मिल जाते हैं। यह तीन चयनित बेसलाइन के साथ PII-Tracer को प्लॉट करता है, जबकि कुल तालिका सभी बारह प्रणालियों के लिए आवर्ती और क्रॉस-टर्न स्कोर की रिपोर्ट करती है।

लाइन चार्ट दिखाता है कि PII-Tracer सभी उल्लेख-गणना समूहों में GPT-5.6-sol, GLiNER2-PII, और Claude Opus 4.8 की तुलना में अधिक लगातार आवर्ती पहचानकर्ताओं के हर उल्लेख को ढूंढता है, जो एक उल्लेख के लिए 91.7% से गिरकर 6–10 उल्लेखों के लिए 69.1% हो जाता है।
उन पहचानकर्ताओं का हिस्सा जिनका हर उल्लेख मिल जाता है। PII-Tracer सभी चार तुलना बाल्टियों का नेतृत्व करता है।

जैसे-जैसे पुनरावृत्ति बढ़ती है, PII-Tracer आगे रहता है: एक उल्लेख के लिए इसका स्कोर 0.917 से बढ़कर दो के लिए 0.873, तीन से पांच के लिए 0.796 और छह से दस के लिए 0.691 हो जाता है। अंतिम बकेट में, GPT-5.6-sol 0.464 तक पहुँच जाता है, जबकि GLiNER2-PII और Claude Opus 4.8 0.073 और 0.045 तक पहुँच जाते हैं। संपूर्ण मूल्यांकन में, PII-Tracer 79.4% आवर्ती पहचानकर्ताओं और 77.6% क्रॉस-टर्न पहचानकर्ताओं के हर उल्लेख को ढूंढता है; GPT-5.6-sol उन्हीं दो उपायों पर 57.0% और 55.1% तक पहुँचता है।

लंबी बातचीत को कवर करना

हम पहले सभी 1,922 परीक्षण वार्ताओं को कैरेक्टर लंबाई के आधार पर समूहीकृत करते हैं और 4,096-टोकन विंडो के साथ PII-Tracer को डिकोड करते हैं। समूहों में 1,000 कैरेक्टर से नीचे 167 बातचीत, 1,000 से 10,000 तक 1,292, और 10,000 या उससे अधिक पर 463 शामिल हैं।

बातचीत की लंबाई के अनुसार PII-Tracer प्रदर्शन का समूहीकृत बार चार्ट। 1,000–10,000-कैरेक्टर की बातचीत के लिए F1 67.0% पर पीक पर पहुंच जाता है, जबकि रिकॉल 1,000 कैरेक्टर से कम की बातचीत के लिए 97.5% से गिरकर 10,000 से अधिक की बातचीत के लिए 68.7% हो जाता है।
बातचीत की लंबाई के अनुसार कैरेक्टर प्रिसिजन, रिकॉल और F1

सिंगल-विंडो रिकॉल 1,000 कैरेक्टर से नीचे 0.975 है और 1,000 से 10,000 तक 0.955 है, लेकिन 10,000 कैरेक्टर या उससे अधिक की बातचीत के लिए गिरकर 0.687 हो जाता है। दो लंबे समूहों में प्रिसिजन 0.51 के करीब रहता है, जो मुख्य समस्या के रूप में इनपुट कवरेज की ओर इशारा करता है।

इनपुट हैंडलिंग के प्रभाव का अध्ययन करने के लिए, हम 50%-ओवरलैप स्लाइडिंग-विंडो डिकोडिंग के साथ उसी चेकपॉइंट का मूल्यांकन करते हैं। यह बिना पुनर्प्रशिक्षण के कुल कैरेक्टर रिकॉल को 0.830 से बढ़ाकर 0.965 और बहु-उल्लेख सुसंगत पहचान को 0.794 से बढ़ाकर 0.954 कर देता है।

भाषाओं में सुसंगत

PII-TRACE 13 भाषाओं को कवर करता है; भाषा प्रयोग लैटिन, सिरिलिक और हंगुल लिपियों में फैले छह-भाषा स्लाइस की रिपोर्ट करता है: अंग्रेजी, जर्मन, फ्रेंच, इतालवी, रूसी और कोरियाई। हम प्रत्येक भाषा में सभी परीक्षण वार्ताओं पर समान 12 डिटेक्टर चलाते हैं। प्रत्येक भाषा के भीतर, हम अनुमानित और स्वर्ण कैरेक्टर को पूल करते हैं और कैरेक्टर F1 की गणना करते हैं।

अंग्रेजी, जर्मन, फ्रेंच, इतालवी, रूसी और कोरियाई में 12 PII-डिटेक्शन सिस्टम के लिए कैरेक्टर F1 स्कोर की तुलना करने वाला हीटमैप। PII-Tracer जर्मन, फ्रेंच, इतालवी और रूसी में आगे है, और सभी छह भाषाओं में लगातार मजबूत परिणाम देता है।
लैटिन, सिरिलिक और हंगुल लिपियों को कवर करते हुए, PII वाले छह भाषा उपसमुच्चयों पर कैरेक्टर F1।

PII-Tracer छह में से चार भाषाओं में कैरेक्टर F1 का नेतृत्व करता है, जर्मन (0.735), फ्रेंच (0.633), इतालवी (0.676), और रूसी (0.651), और अंग्रेजी और कोरियाई में सर्वश्रेष्ठ परिणामों के 0.016 और 0.036 के भीतर है। साथी विश्लेषण में, यह सभी छह भाषा उपसमुच्चयों में लगातार डिटेक्शन की ओर ले जाता है, 0.80–0.93 स्कोर करता है। प्रति-भाषा दृश्य अंग्रेजी से परे लाभ दिखाता है।

पाँच मानक बेंचमार्क पर प्राइवेसी फ़िल्टर से उच्च कैरेक्टर F1

अंतिम प्रयोग PII-TRACE के बाहर जाता है। हम ai4privacy सत्यापन विभाजन (47,728 दस्तावेज़), Nemotron-PII परीक्षण विभाजन (100,000), एक निश्चित बीज SPY सेट (8,688), ग्रेटेल PII परीक्षण विभाजन (5,000), और TAB ECHR परीक्षण विभाजन (127) पर PII-Tracer और OpenAI प्राइवेसी फ़िल्टर चलाते हैं।

पाँच बाहरी बेंचमार्क में OpenAI प्राइवेसी फ़िल्टर F1 के साथ PII-Tracer की प्रिसिजन, रिकॉल और कैरेक्टर F1 की तुलना करने वाला समूहीकृत बार चार्ट। PII-Tracer हर बेंचमार्क पर उच्च F1 स्कोर प्राप्त करता है।
पाँच बाहरी PII बेंचमार्क पर कैरेक्टर-स्तरीय परिणाम, श्रेणी के नामों के मिलान की आवश्यकता के बिना स्कोर किए गए। धूसर बार समान मूल्यांकन के तहत OpenAI प्राइवेसी फ़िल्टर दिखाते हैं।

PII-Tracer के पास हर डेटासेट पर उच्च कैरेक्टर F1 है: ai4privacy पर 0.907 के मुकाबले 0.950, Nemotron-PII पर 0.709 के मुकाबले 0.847, SPY पर 0.543 के मुकाबले 0.585, Gretel PII पर 0.895 के मुकाबले 0.952, और TAB पर 0.350 के मुकाबले 0.594। TAB इस समूह का एकमात्र बेंचमार्क है जो वास्तविक, मानव-लेबल वाले पाठ से निर्मित है। वहां, PII-Tracer 0.982 प्रिसिजन के मुकाबले 0.986 और 0.213 रिकॉल के मुकाबले 0.425 तक पहुंच जाता है—आवश्यक रूप से समान प्रिसिजन पर दोगुना रिकॉल (विवरण पेपर में)। इसलिए उच्च F1 PII-TRACE बातचीत से इस तुलना के सभी पांच पारंपरिक एकल-रिकॉर्ड बेंचमार्क में ले जाया जाता है।

निष्कर्ष

हाइब्रिड AI अनुमान स्टैक में उपयोगकर्ता के डिवाइस को एकीकृत करता है, मजबूत गोपनीयता और कम लागत की पेशकश करता है। क्लाउड में फ़्रंटियर मॉडल अनुसंधान, तर्क और योजना को संभाल सकते हैं, जबकि स्थानीय मॉडल उन फ़ाइलों और व्यक्तिगत डेटा के साथ काम करते हैं जो डिवाइस पर रहने चाहिए। यह विभाजन क्लाउड पर जाने से पहले संवेदनशील डेटा को पहचानने पर निर्भर करता है।

PII-Tracer बहु-टर्न बातचीत में PII का पता लगाने के लिए एक कॉम्पैक्ट मॉडल है, जबकि PII-TRACE मूल्यांकन करता है कि क्या डिटेक्टर लगातार पूरी बातचीत में आवर्ती PII की पहचान कर सकते हैं।

एक साथ, PII-TRACE और PII-Tracer बहु-टर्न बातचीत और अन्य लंबे-संदर्भ सेटिंग्स में PII डिटेक्शन को आगे बढ़ाने के लिए एक बेंचमार्क और संदर्भ मॉडल प्रदान करते हैं।

एजेंट लंबे कार्यों को संभाल रहे हैं और अधिक व्यक्तिगत संदर्भ के साथ काम कर रहे हैं। परिणामस्वरूप, गोपनीयता नियंत्रणों को केवल प्रारंभिक इनपुट पर ही नहीं, बल्कि पूरी बातचीत में होना चाहिए। संवेदनशील संदर्भ को डिवाइस पर रखने के लिए हाइब्रिड AI विश्वसनीय स्थानीय डिटेक्शन पर निर्भर करता है।

PII-TRACE बेंचमार्क, PII-Tracer मॉडल और हमारे मूल्यांकन के विवरण के लिए arXiv पेपर पढ़ें। हम जल्द ही PII-TRACE और PII-Tracer दोनों को रिलीज़ करने की योजना बना रहे हैं।

  1. Mac पर हाइब्रिड कंप्यूट पेश हैसमाचार1 सित॰ 2026
  2. डेटा सेंटर आपकी मशीन पर चला जाता हैसमाचार2 जून 2026