PII-TRACE: சாதனத்தை விட்டு வெளியேறும் முன் தனிப்பட்ட தரவைக் கண்டறிதல்
நீண்ட காலமாக இயங்கும் உரையாடல்களில் சீரான PII கண்டறிதலுக்கான 13-மொழி பெஞ்ச்மார்க், locally இயக்க வடிவமைக்கப்பட்ட கச்சிதமான 0.6B டிடெக்டருடன் இணைக்கப்பட்டுள்ளது.
Mac இல் ஹைப்ரிட் கணக்கீடு Perplexity Computer பணிகளை கிளவுட்டில் உள்ள எல்லை மாதிரிகள் மற்றும் Mac இல் உள்ள உள்ளூர் மாதிரிக்கு இடையே பிரிக்கிறது. கிளவுட் முகவர்கள் ஆராய்ச்சி, பகுத்தறிவு மற்றும் திட்டமிடல் ஆகியவற்றைக் கையாளுகின்றன, அதே நேரத்தில் உள்ளூர் மாதிரி தனிப்பட்ட கோப்புகள் மற்றும் உணர்திறன் தகவல்களுடன் வேலை செய்கிறது.
இந்த எல்லை சாதனத்தை விட்டு வெளியேறும் முன் தனிப்பட்ட முறையில் அடையாளம் காணக்கூடிய தகவலை (PII) கண்டறிவதை நம்பியுள்ளது. உள்ளூர் தனியுரிம நுழைவாயில் உணர்திறன் மிக்க உள்ளடக்கத்தை Mac இல் வைத்திருக்கிறது, கண்டறியப்பட்ட தனிப்பட்ட தகவலைத் திருத்துகிறது அல்லது கிளவுட்டுக்கு அனுப்புவதற்கு முன்பு ஒப்புதலைக் கோருகிறது.
நீண்ட, பன்மொழி உரையாடல்களில் கண்டறிதல் கடினமாகிறது. ஒரே அடையாளங்காட்டி வெவ்வேறு திருப்பங்களில் பலமுறை தோன்றலாம். விடுபட்ட ஒரு குறிப்பு, அமைப்பு பாதுகாக்க விரும்பும் தகவலை வெளிப்படுத்தலாம்.
அறிமுகம்
இன்று, நாங்கள் அறிமுகப்படுத்துகிறோம் PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), தனிப்பட்ட முறையில் அடையாளம் காணக்கூடிய தகவல் (PII) கண்டறிதல் கருவிகளை மதிப்பிடுவதற்கான புதிய பெஞ்ச்மார்க், மற்றும் PII-Tracer, PII கண்டறிதலுக்கான கச்சிதமான 0.6B மாதிரி.
கிளவுட்-முதல் முகவர்கள் பயனர்களை சூழல், நுண்ணறிவு மற்றும் தனியுரிமை ஆகியவற்றை சமநிலைப்படுத்த கட்டாயப்படுத்துகின்றன. அதிக தனிப்பட்ட சூழல் ஒரு முகவர் பயனரைப் புரிந்துகொள்ளவும் சிறந்த முடிவுகளை உருவாக்கவும் உதவும். ஆனால் இந்த சூழலை வழங்குவது பெரும்பாலும் தனியார் தகவலை தொலைதூர சேவைக்கு அனுப்புவதைக் குறிக்கிறது மற்றும் தனிப்பட்ட தகவலை கசியவிடலாம். ஒரு உதவியாளரை பயனுள்ளதாக்கும் தகவலே ஒரு பயனர் மிகவும் தனிப்பட்டதாக வைத்திருக்க விரும்பும் ஒன்றாக இருக்கலாம்.
ஹைப்ரிட் AI பயனரின் சாதனம் மற்றும் கிளவுட் மாடல்களுக்கு இடையே வேலையைப் பிரிப்பதன் மூலம் இந்த வர்த்தகத்தைக் குறைக்கிறது. ஆனால் தொலைதூர மாதிரிக்கு உரை அனுப்பப்படுவதற்கு முன்பு சாதனம் PII ஐ அடையாளம் காண முடிந்தால் மட்டுமே அந்த எல்லை தனியுரிமையைப் பாதுகாக்கும். பயனர்கள் ஒவ்வொரு செய்தியையும் தாங்களே ஆய்வு செய்ய வேண்டியதில்லை. சாதனத்திற்கு அதன் தனியுரிம வாயிலாக உள்ளூர் PII டிடெக்டர் தேவைப்படுகிறது. நீண்ட உரையாடல்களில், அதே அடையாளங்காட்டி திருப்பங்கள் முழுவதும் மீண்டும் நிகழலாம், மேலும் தனிப்பட்ட தகவல் கடந்து செல்ல விடுபட்ட ஒரு குறிப்பு போதும்.

Perplexity ஒரு கலப்பின உள்ளூர்-சர்வர் அனுமான ஒருங்கிணைப்பாளரை அறிமுகப்படுத்தியுள்ளது, இது சாதனத்தில் என்ன வேலை செய்ய வேண்டும் மற்றும் கிளவுட்டில் உள்ள முகவர்களுக்கு என்ன வேலை செல்ல வேண்டும் என்பதை தீர்மானிக்கிறது. மாதிரி, முகவர் சேணம், உரையாடல்கள் மற்றும் மரணதண்டனை பாதைகள் அனைத்தும் பயனரின் கணினியில் உள்ளன. வெளி உலகத்திற்கான அணுகல் தேவைப்படும் பணிகள் அவசியமான போது மட்டுமே அழைக்கப்படும் மற்றும் பயனர் அனுமதியால் கட்டுப்படுத்தப்படும். இதன் விளைவாக, பயனர் ஒப்புதல் அளிக்கும் வரை, அந்த உள்ளடக்கம் சாதனத்திலேயே இருக்கும்.
PII-ஐக் கொண்டிருப்பதாகக் கணிக்கப்பட்ட இடைவெளிகளைக் குறிப்பதன் மூலம் மாதிரி ரூட்டிங் செய்வதற்கான ஒரு உள்ளூர் கட்டுப்பாட்டு சமிக்ஞையை PII-Tracer வழங்குகிறது. பயன்பாடு பின்னர் ரூட்டிங் கொள்கையைச் செயல்படுத்துகிறது. இது தொடர்புடைய உள்ளீட்டை உள்ளூரில் வைத்திருக்கிறது, கண்டறியப்பட்ட இடைவெளிகளைத் திருத்துகிறது அல்லது கிளவுட் மாடலுக்கு மாறுவதற்கு முன்பு வெளிப்படையான ஒப்புதலைக் கோருகிறது. இது ரூட்டிங் செய்வதை மிகவும் தேர்ந்தெடுக்கப்பட்டதாக ஆக்குகிறது. கண்டறியப்பட்ட PII சாதனத்தில் இருக்கும், அதே நேரத்தில் அங்கீகரிக்கப்பட்ட சூழல் இன்னும் எல்லை கிளவுட் மாடல்களிலிருந்து பயனடைகிறது.
தேர்ந்தெடுக்கப்பட்ட ரூட்டிங் முழு உரையாடலிலும் சீரான கண்டறிதலைப் பொறுத்தது. அதே அடையாளங்காட்டி திருப்பங்கள் முழுவதும் மீண்டும் நிகழலாம், மேலும் விடுபட்ட குறிப்பு இன்னும் அனுப்பப்படலாம்.
12 டிடெக்டர்களில், PII-Tracer மிக உயர்ந்த எழுத்து F1 மற்றும் மீண்டும் நிகழும் அடையாளங்காட்டிகளின் மிக உயர்ந்த சீரான கவரேஜைப் பதிவு செய்கிறது. இரண்டு முடிவுகளும் ஏன் முக்கியம் என்பதை பெஞ்ச்மார்க் விளக்குகிறது: நீண்ட உரையாடலில், பெரும்பாலான PII ஐக் கண்டுபிடிப்பதும், அதன் ஒவ்வொரு நகலையும் கண்டுபிடிப்பதும் ஒன்றல்ல.
ஹைப்ரிட் AI இல் PII கண்டறிதல் புதிய சவால்களை எதிர்கொள்கிறது
PII கண்டறிதல் என்பது நீண்டகால பாதுகாப்புப் 문제입니다, மேலும் பல பெஞ்ச்மார்க்குகள் மற்றும் டிடெக்டர்கள் ஏற்கனவே বিদ্যমান உள்ளன. இருப்பினும், கலப்பின AI அமைப்புகளில் PII கண்டறிதல் புதிய சவால்களை அறிமுகப்படுத்துகிறது. குறிப்பாக, டிடெக்டர்கள் நீண்ட, பல-திருப்ப உரையாடல்களில் PII ஐ அடையாளம் காண வேண்டும், அங்கு உரையாடல் சூழல் ஒரு சரம் PII ஆக கருதப்பட வேண்டுமா என்பதை தீர்மானிக்கிறது. உதாரணமாக, ஒரு பெயர் ஒரு உரையாடலில் பயனரை அடையாளம் காணக்கூடும், மற்றொன்றில் பொது நபவைக் குறிக்கலாம், அல்லது உதவியாளரால் உருவாக்கப்பட்ட இடধারராக இருக்கலாம். மேற்பரப்பு வடிவம் மட்டுமே ஒரு சரம் PII எனக் குறிக்கப்பட வேண்டுமா என்பதைத் தீர்மானிக்க போதுமானதாக இல்லை.

ஏற்கனவே உள்ள PII கண்டறிதல் கருவிகள் மற்றும் பெஞ்ச்மார்க்குகள் முதன்மையாக தனிப்பட்ட பதிவுகளை இலக்காகக் கொண்டுள்ளன. ஒரே நேரத்தில் ஒரு பதிவைச் செயலாக்க வடிவமைக்கப்பட்ட டிடெக்டர்கள், நீண்ட, சிக்கலான உரையாடல்களில் மோசமாகச் செயல்படுகின்றன என்பதை நாங்கள் காண்கிறோம். மேலும், ஏற்கனவே உள்ள பெஞ்ச்மார்க்குகள் பொதுவாக திருப்பங்கள் முழுவதும் நிலைத்தன்மையை மதிப்பீடு செய்வதில்லை. இதன் விளைவாக, இந்த பெஞ்ச்மார்க்குகளில் வலுவான செயல்திறன் என்பது நீண்ட, பல-திருப்ப உரையாடல்களில் பயனுள்ள PII கண்டறிதலாக அவசியமாக மொழிபெயர்க்கப்படாது.
PII-TRACE: வரிசைப்படுத்தல்-முக்கியமான PII கண்டறிதலுக்கான பெஞ்ச்மார்க்
உதவியாளர் உரையாடல்களில் PII டிடெக்டர் பயன்படுத்தப்படும்போது முக்கியமான மூன்று நடத்தைகளைச் சுற்றி PII-TRACE ஐ வடிவமைத்துள்ளோம். முதலாவது தொடர்ச்சியான கவரேஜ்: ஒரு அடையாளங்காட்டி பலமுறை தோன்றும் போது அல்லது பயனர் மற்றும் உதவியாளர் திருப்பங்களைக் கடக்கும்போது, டிடெக்டர் ஒவ்வொரு குறிப்பையும் கண்டுபிடிக்க வேண்டும். இரண்டாவதாக நீண்ட சூழலுக்கான வலிமை: உரையாடல்கள் 1,000 க்கும் குறைவான எழுத்துக்களிலிருந்து 100,000 க்கும் மேற்பட்ட எழுத்துக்கள் வரை இருக்கும், வரலாறு வளரும்போது என்ன நடக்கிறது என்பதை அளவிடுவதை சாத்தியமாக்குகிறது. மூன்றாவது பல மொழிகள் மற்றும் கலப்பு-வடிவடக்க உள்ளடக்கம்: ஒரு உரையாடல் மொழிகளை மாற்றலாம் மற்றும் குறியீடு, அட்டவணைகள் அல்லது கட்டமைக்கப்பட்ட பதிவுகளுடன் உரையைக் இணைக்கலாம். PII-TRACE ஆனது ஒவ்வொரு முழு உரையாடலையும் தனிமைப்படுத்தப்பட்ட பதிவுகளாகப் பிரிப்பதற்குப் பதிலாக மதிப்பிடுவதன் மூலம் இந்த வடிவங்களைப் பாதுகாக்கிறது.
பெஞ்ச்மார்க் செயல்திறனை இரண்டு நிரப்பு மட்டங்களில் அளவிடுகிறது. அடையாளங்காட்டி மட்டத்தில், கட்டுப்பாடான கண்டறிதல் கடுமையான கேள்ியைக் கேட்கிறது: அதே அடையாளங்காட்டியின் ஒவ்வொரு குறிப்பிலும் உள்ள ஒவ்வொரு எழுத்தையும் டிடெக்டர் கவர் செய்ததா? பல குறிப்புகளைக் கொண்ட அடையாளங்காட்டிகளுக்கும், திருப்பங்கள் முழுவதும் மீண்டும் மீண்டும் வரும் அடையாளங்காட்டிகளுக்கும் இந்த மதிப்பெண்ணைப் தனித்தனியாகப் புகாரளிக்கிறோம். எழுத்து மட்டத்தில், டிடெக்டரால் குறிக்கப்பட்ட உரையின் எவ்வளவு PII என லேபிளிடப்பட்டுள்ளது என்பதை துல்லியம் அளவிடுகிறது, அது கண்டறியப்பட்ட லேபிளிடப்பட்ட PII இன் அளவை நினைவூட்டுகிறது, மற்றும் F1 இரண்டையும் சமநிலைப்படுத்துகிறது.
PII-TRACE ஆனது 13 மொழிகள் மற்றும் 10 எழுத்து முறைமைகள் முழுவதும் 13,148 செயற்கையான பயனர்-உதவியாளர் உரையாடல்களைக் கொண்டுள்ளது, ஒன்பது PII வகைகளில் எழுத்து மட்டத்தில லேபிளிடப்பட்ட 37,431 அடையாளங்காட்டி குறிப்புகளுடன். உரையாடல்களில் மொத்தம் 41% கட்டமைக்கப்பட்ட உள்ளடக்கத்தைக் கொண்டுள்ளன. லேபிளிடப்பட்ட PII உடன் 5,645 உரையாடிகளில், 63.8% க்கும் அதிகமானவை ஒன்றுக்கு மேற்பட்ட முறை தோன்றும் அடையாளங்காட்டியையும், 28.7% பல திருப்பங்களில் தோன்றும் அடையாளங்காட்டியையும் உள்ளடக்கியது.
உற்பத்தி உரையாடல்களிலிருந்து செயற்கை தரவுத்தொகுப்பை உருவாக்குதல்
PII-TRACE அசல் பதிவுகளை வெளியிடாமல் மூல உரையாடல்களின் திருப்ப கட்டமைப்பைப் பாதுகாக்கிறது. பைப்லைன் ஒவ்வொரு திருப்பத்தையும் மீண்டும் எழுதுகிறது மற்றும் லேபிளிடப்பட்ட ஒவ்வொரு அடையாளங்காட்டியையும் செயற்கை மதிப்பால் மாற்றுகிறது.

முதலாவதாக, பல மொழி மாதிரிகள் உற்பத்தி பயனர்-உதவியாளர் உரையாடல்களில் ஒன்பது வகையான PII ஐக் குறிக்கின்றன. ஒரு விதி அடிப்படையிலான பாஸ் ஒரே வகையின் மீண்டும் மீண்டும் வரும் அடையாளங்காட்டிகளை ஒரு நிறுவன ஐடியின் கீழ் தொகுக்கிறது. குறிக்கப்பட்ட ஒவ்வொரு மதிப்பும் தட்டச்சு செய்யப்பட்ட இடধারரால் மாற்றப்படுகிறது, இது திருப்ப வரிசை, PII வகை மற்றும் குறிப்புகளுக்கு இடையேயான இணைப்புகளைத் தக்க வைத்துக் கொள்ளும் டெம்ப்ளேட்டை விட்டுச்செல்கிறது, ஆனால் குறிக்கப்பட்ட அசல் மதிப்புகள் எதுவும் இல்லை.
கட்டமைப்புகளை அப்படியே வைத்திருக்கும் போது கணினி ஒவ்வொரு திருப்பத்தையும் வெளிப்படுத்துகிறது, பின்னர் அடையாளங்காட்டியின் வகை மற்றும் வடிவத்துடன் பொருந்தக்கூடிய செயற்கை மதிப்புகளைச் செருகுகிறது. மீண்டும் மீண்டும் வரும் குறிப்புகள் ஒரு உரையாடலுக்குள் ஒரே மதிப்பைப் பெறுகின்றன, அதே நேரத்தில் வெவ்வேறு உரையாடல்கள் சுயாதீனமாக உருவாக்கப்பட்ட மதிப்புகளைப் பயன்படுத்துகின்றன. இறுதி சீரமைப்பு பாஸ் ஒவ்வொரு எழுத்து ஆஃப்சேட்டையும் மீண்டும் கணக்கிடுகிறது.
மாற்றீடுகள் சேமிக்கப்பட்ட இடைவெளிகளுடன் பொருந்துகின்றனவா, மீண்டும் மீண்டும் வரும் குறிப்புகள் ஒரே மதிப்பெங்கைப் பயன்படுத்துகின்றனவா, மற்றும் குறிக்கப்பட்ட மூல மதிப்பெங்குகள் Presidio மற்றும் வழக்கமான-வெளிப்பாடு மறு ஸ்கேன் கீழ் இல்லை என்பதை மூன்று தானியங்கு வாயில்கள் சரிபார்க்கின்றன. சேமிக்கப்பட்ட ஆஃப்செட் சரியான செயற்கை துணைச்சரத்தையும் மீட்க வேண்டும். தோல்வியடையும் பதிவுகள் மீளுருவாக்கம் செய்யப்படுகின்றன அல்லது கைவிடப்படுகின்றன. இரண்டாவது மொழி மாதிரி ஒரு மாதிரியை தணிக்கை செய்கிறது, மேலும் அது PII எனக் குறிக்கும் எதையும் மனிதர்கள் மதிப்பாய்வு செய்கிறார்கள்.
PII-Tracer: உள்ளூர் பயன்பாட்டிற்கான கச்சிதமான டிடெக்டர்
PII-Tracer என்பது Qwen3 முதுகெலும்பிலிருந்து மாற்றியமைக்கப்பட்ட 0.6B இரு திசை குறியாக்கியாகும். தனியுரிமத் திரையிடல் என்பது உரை உருவாக்கத்திலிருந்து வேறுபட்டது மற்றும் தொடர்புடைய PII இடைவெளிகளைக் கண்டுபிடித்து அவற்றின் எல்லைகளைத் திருப்புவது தேவைப்படுகிறது. இதன் விளைவாக, PII-Tracer ஆனது Qwen3 இன் காரண முகமூடியை பேடிங்-அவர் இரு திசை கவனத்துடன் மாற்றுகிறது, எனவே ஒவ்வொரு டோக்கனும் 4,096-டோக்கன் சாளரத்திற்குள் முந்தைய மற்றும் பிந்தைய திருப்பங்கள் இரண்டையும் ஈர்க்கலாம்.
ஒவ்வொரு டோக்கனுக்கும், குறியாக்கி 1,024-பரிமாண பிரதிநிதித்துவத்தை உருவாக்குகிறது. ஒரு நேரியல் குறிக்கும் தலை 37 சாத்தியமான லேபிள்களுக்கான மதிப்பெண்களை உருவாக்குகிறது: ஒரு சிறப்பு லேபிள் (PII இடைவெளிக்கு வெளியே உள்ள உரைக்கு நாம் O ஐப் பயன்படுத்தப் பயன்படுகிறோம்), மேலும் ஒன்பது PII வகைகளில் ஒவ்வொன்றிற்கும் நான்கு ஸ்பான்-பொசிஷன் லேபிள்கள். பெயரிடப்பட்ட நிறுவன அங்கீகாரத்திற்கான BIOES திட்டத்தில், B (தொடக்கம்), I (உள்ளே) மற்றும் E (முடிவு) ஆகியவை பல-டோக்கன் இடைவெளியைக் குறிக்கின்றன, அதே நேரத்தில் S (ஒற்றை) ஒரு டோக்கன் இடைவெளியைக் குறிக்கிறது. உடல்நலம் அல்லது மதம் சார்ந்த தகவல் போன்ற உணர்திறன் மிக்க பொருள் உரையாடலில் உள்ளதா என்பதையும் ஒரு துணைத் தலை கணிக்கிறது.
பன்மொழி உதவியாளர் உரையாடல்களை ஒற்றை-பதிவு எடுத்துக்காட்டுகளுடன் இணைத்து, தோராயமாக 714,000 பயிற்சி மாதிரிகளில் PII-Tracer ஐ மூன்று சகாப்தங்களுக்கு பயிற்றுவிக்கிறோம். பகிரப்பட்ட இரு திசை குறியாக்கியில் இரண்டு பயிற்சி தலைகள் உள்ளன: PII இடைவெளிகளைக் கண்டறிந்து தட்டச்சு செய்யும் 37-வகுப்பு BIOES டோக்கன் தலை, மற்றும் உரையாடலில் உணர்திறன் மிக்க பொருள் உள்ளதா என்பதைக் கணிக்கும் இருபரிமாண உரையாடல்-நிலை தலை. ஐப் பயன்படுத்தி இரண்டு தலைகளையும் கூட்டாகப் பயிற்றுவிக்கிறோம். இங்கே, அரிதான PII லேபிள்களுக்கு அதிக எடையைக் கொடுக்கிறது, இதனால் அடிக்கடி வரும் `O` லேபிள் ஆதிக்கம் செலுத்தாது, அதே நேரத்தில் உரையாடல்-நிலை பயிற்சி சமிக்ஞையை வழங்குகிறது; 1.5 மற்றும் 0.3 குணகங்கள் ஸ்பான் கண்டறிதலை முக்கிய பணியாக வைத்திருக்கின்றன. இந்த துணை சமிக்ஞையானது சூழல்-விழிப்புணர்வு கண்டறிதலை வலுப்படுத்துகிறது: மாதிரி ஒரு தனிமைப்படுத்தப்பட்ட சரமாக இல்லாமல் உரையாடலுக்குள் ஒரு வேட்பாளர் இடைவெளியை மதிப்பிட்டுக் கற்றுக்கொள்கிறது, இது நினைவூட்டலில் சிறிய வர்த்தகத்துடன் தவறான நேர்மறைகளைக் குறைக்க உதவுகிறது.
অনুமான நேரத்தில், ஒரு குறிப்பிட்ட Viterbi decoder ஒவ்வொரு டோக்கனையும் தனித்தனியாக லேபிளிடுவதற்குப் பதிலாக, மிக உயர்ந்த மதிப்பெண் பெற்ற செல்லுபடியாகும் BIOES வரிசையைத் தேடுகிறது. உதாரணமாக, B-private_person என்பது I-private_person உடன் தொடரலாம் அல்லது E-private_person உடன் மூடலாம், ஆனால் I-private_email க்கு மாறக்கூடாது. டீகோடர் முடிவை மறுசீரமைப்பு அல்லது உள்ளூர் ரூட்டிங் செய்வதற்கான சரியான எழுத்து இடைவெளிகளாக மாற்றுகிறது.
எழுத்து F1 மற்றும் மீளுருவாக்கம் செய்யும் PII இல் PII-Tracer முன்னணியில் உள்ளது
எழுத்து மற்றும் ஸ்பான் (span) மட்டங்களில் கண்டறிதல் கருவிகளை நாங்கள் ஒப்பிடுகிறோம். எழுத்து F1 என்பது எழுத்து வாரியாக கண்டறிதலை மதிப்பிடுகிறது. ஸ்பான்-மேல்வெட்டு F1 ஆனது, டிடெக்டர் PII உருப்படியின் ஏதேனும் ஒரு பகுதியைக் கண்டறிகிறதா என்பதை அளவிடுகிறது, அதே நேரத்தில் ஸ்பான்-கட்டுப்பாட்டு F1 முழு உருப்படியையும் கைப்பற்றுகிறதா என்பதை அளவிடுகிறது.
மதிப்பீடு செய்யப்பட்ட 12 அமைப்புகளில் PII-Tracer அதிகபட்ச எழுத்து F1 (0.629) ஐ அடைந்தது, மேலும் இரண்டாவது மிக உயர்ந்த ஸ்பான்-ஓவர்லேப் F1 மற்றும் ஸ்பான்-கண்டெய்ன்மென்ட் F1. எல்லை மாதிரிகள், அதாவது GPT-5.6-sol மற்றும் Claude Sonnet 5, ஒப்பிடக்கூடிய ஒட்டுமொத்த செயல்திறனை அடைந்தன. GPT-5.6-sol இரண்டு ஸ்பான்-நிலை F1 மெட்ரிக்குகளிலும் அதிக மதிப்பெண்களைப் பெற்றது, ஆனால் குறைந்த எழுத்து F1. இருப்பினும், இந்த எல்லை மாதிரிகள் நூற்றுக்கணக்கான பில்லியன் அல்லது அதற்கு மேற்பட்ட அளவுருக்களைக் கொண்டுள்ளன மற்றும் கிளவுட்டில் ஹோஸ்ட் செய்யப்பட்ட ஓப்பன் சோர்ஸ் அல்லாத மாதிரிகள் ஆகும். இதன் விளைவாக, திரையிடப்படாத உரை உள்ளூரில் இருக்க வேண்டிய கலப்பின AI அமைப்புகளில் உணர்திறன் உள்ளூர் தரவைப் பாதுகாப்பதற்கு அவை பொருத்தமற்றவை. இதற்கு நேர்மாறாக, PII-Tracer ஆனது 0.6B அளவுருக்களுடன் எல்லைக்கு அருகிலுள்ள ஸ்பான்-நிலை கண்டறிதலை வழங்குகிறது மற்றும் திரையிடப்படாத உரையை முழுமையாக உள்ளூரில் செயலாக்க முடியும். மற்ற ஓப்பன் சோர்ஸ் PII டிடெக்டர்கள் PII-Tracer ஐ விட கணிசமாக மோசமாக செயல்படுகின்றன.

ஒவ்வொரு மீளுருவாக்கம் குறிப்பையும் கண்டறிதல்
நிலைத்தன்மை பரிசோதனையானது அதே கணிப்புகளுக்கு கடுமையான சோதனையைப் பயன்படுத்துகிறது. சோதனைத் தொகுப்பில் ஒருமுறை தோன்றும் 899 அடையாளங்காட்டிகளும், ஒன்றுக்கு மேற்பட்ட முறை தோன்றும் 959 அடையாளங்காட்டிகளும் உள்ளன; மீளுருவாக்கம் செய்யும் அடையாளங்காட்டிகளில் 790 பல திருப்பங்களைக் கொண்டுள்ளது. படம் நான்கு குறிப்பு-எண்ணிக்கை வாளிகளைக் புகாரளிக்கிறது (ஒன்று, இரண்டு, மூன்று முதல் ஐந்து, மற்றும் ஆறு முதல் பத்து) மற்றும் அதன் லேபிளிடப்பட்ட எழுத்துக்கள் அனைத்தும் கண்டறியப்படும் போது மட்டுமே அடையாளங்காட்டியை கணக்கிடுகிறது. இது PII-Tracer ஐ மூன்று தேர்ந்தெடுக்கப்பட்ட அடிப்படை கோடுகளுடன் திட்டமிடுகிறது, அதே நேரத்தில் மொத்த அட்டவணை அனைத்து பன்னிரண்டு அமைப்புகளுக்கும் மீளுருவாக்கம் மற்றும் குறுக்கு-டர்ன் மதிப்பெண்களைப் புகாரளிக்கிறது.

மறுபடியும் கூறும்போது PII-Tracer முன்னணியில் உள்ளது: இதன் மதிப்பெண் ஒரு முறை குறிப்பிடுவதற்கு 0.917-லிருந்து இரண்டு முறைக்கு 0.873 ஆகவும், மூன்று முதல் ஐந்து வரை 0.796 ஆகவும், ஆறு முதல் பத்து வரை 0.691 ஆகவும் மாறுகிறது. கடைசி தொகுப்பில், GPT-5.6-sol 0.464 ஐ அடைகிறது, அதே நேரத்தில் GLiNER2-PII மற்றும் Claude Opus 4.8 முறையே 0.073 மற்றும் 0.045 ஐ அடைகின்றன. முழு மதிப்பீட்டிலும், PII-Tracer ஆனது 79.4% தொடர்ச்சியான அடையாளங்காட்டிகள் மற்றும் 77.6% குறுக்கு-டர்ன் அடையாளங்காட்டிகளின் ஒவ்வொரு குறிப்பையும் கண்டறிகிறது; GPT-5.6-sol அதே இரண்டு நடவடிக்கைகளில் 57.0% மற்றும் 55.1% அடევს.
நீண்ட உரையாடல்களை உள்ளடக்கியது
நாங்கள் முதலில் அனைத்து 1,922 சோதனை உரையாடல்களையும் எழுத்து நீளத்தின் அடிப்படையில் தொகுத்து, 4,096-டோக்கன் சாளரத்துடன் PII-Tracer ஐ டிகோட் செய்கிறோம். குழுக்களில் 1,000 எழுத்துகளுக்குக் கீழே 167 உரையாடல்களும், 1,000 முதல் 10,000 வரை 1,292 உரையாடல்களும், 10,000 அல்லது அதற்கு மேற்பட்டவற்றில் 463 உரையாடல்களும் உள்ளன.

ஒற்றை-சாளர நினைவூட்டல் 1,000 எழுத்துகளுக்கு கீழே 0.975 மற்றும் 1,000 முதல் 10,000 வரை 0.955 ஆகும், ஆனால் 10,000 எழுத்துகள் அல்லது அதற்கு மேற்பட்ட உரையாடல்களுக்கு 0.687 ஆக குறைகிறது. நீண்ட இரண்டு குழுக்களில் துல்லியம் 0.51 க்கு அருகில் உள்ளது, இது உள்ளீட்டு கவரேஜை முக்கிய சிக்கலாக சுட்டிக்காட்டுகிறது.
உள்ளீட்டு கையாளுதலின் விளைவைப் படிக்க, 50%-ஓவர்லேப் ஸ்லைடிங்-விண்டோ டிகோடிங்குடன் அதே செக்பாயிண்ட்டை மதிப்பிடுகிறோம். இது ஒட்டுமொத்த எழுத்து நினைவூட்டலை 0.830 இலிருந்து 0.965 ஆகவும், பல-குறிப்பு சீரான கண்டறிதலை 0.794 இலிருந்து 0.954 ஆகவும் உயர்த்துகிறது, மறுபயிற்சி இல்லாமல்.
மொழிகள் முழுவதும் சீரானது
PII-TRACE 13 மொழிகளை உள்ளடக்கியது; மொழி சோதனையானது லத்தீன், சிரிலிக் மற்றும் ஹங்குல் எழுத்துக்களை உள்ளடக்கிய ஆறு மொழி துண்டுகளைப் புகாரளிக்கிறது: ஆங்கிலம், ஜெர்மன், பிரெஞ்சு, இத்தாலியன், ரஷ்யன் மற்றும் கொரியன். ஒவ்வொரு மொழியிலும் உள்ள அனைத்து சோதனை உரையாடல்களிலும் ஒரே மாதிரியான 12 டிடெக்டர்களை இயக்குகிறோம். ஒவ்வொரு மொழிக்குள்ளும், கணிக்கப்பட்ட மற்றும் தங்க எழுத்துக்களை தொகுத்து எழுத்து F1 ஐ கணக்கிடுகிறோம்.

PII-Tracer ஆனது ஆறு மொழிகளில் நான்கில் எழுத்து F1 இல் முன்னணியில் உள்ளது, ஜெர்மன் (0.735), பிரெஞ்சு (0.633), இத்தாலியன் (0.676) மற்றும் ரஷ்யன் (0.651), மற்றும் ஆங்கிலம் மற்றும் கொரிய மொழிகளில் சிறந்த முடிவுகளில் 0.016 மற்றும் 0.036க்குள் உள்ளது. துணைப் பகுப்பாய்வில், இது அனைத்து ஆறு மொழி துணைக்குழுக்களிலும் சீரான கண்டறிதலுக்கு வழிவகுக்கிறது, 0.80-0.93 மதிப்பெண் பெற்றது. மொழி வாரியான பார்வை ஆங்கிலத்தைத் தாண்டிய லாபங்களைக் காட்டுகிறது.
ஐந்து நிலையான பெஞ்ச்மார்க்குகளில் தனியுரிம வடிகட்டியை விட அதிக எழுத்து F1
இறுதி பரிசோதனையானது PII-TRACE க்கு வெளியே நகர்கிறது. ai4privacy சரிபார்ப்புப் பிளவு (47,728 ஆவணங்கள்), Nemotron-PII சோதனைப் பிளவு (100,000), நிலையான விதை SPY தொகுப்பு (8,688), Gretel PII சோதனைப் பிளவு (5,000), மற்றும் TAB ECHR சோதனைப் பிளவு (127) ஆகியவற்றில் PII-Tracer மற்றும் OpenAI தனியுரிம வடிகட்டியை இயக்குகிறோம்.

PII-Tracer ஒவ்வொரு தரவுத்தொகுப்பிலும் அதிக எழுத்து F1 ஐக் கொண்டுள்ளது: ai4privacy இல் 0.907 க்கு எதிராக 0.950, Nemotron-PII இல் 0.709 க்கு எதிராக 0.847, SPY இல் 0.543 க்கு எதிராக 0.585, Gretel PII இல் 0.895 க்கு எதிராக 0.952, மற்றும் TAB இல் 0.350 க்கு எதிராக 0.594. TAB என்பது இந்த குழுவில் உள்ள உண்மையான, மனிதனால் லேபிளிடப்பட்ட உரையிலிருந்து கட்டமைக்கப்பட்ட ஒரே பெஞ்ச்மார்க் ஆகும். அங்கு, PII-Tracer ஆனது 0.982 துல்லியம் மற்றும் 0.213 நினைவூட்டலுக்கு எதிராக 0.986 மற்றும் 0.425 ஐ எட்டுகிறது - அடிப்படையில் அதே துல்லியத்தில் இரண்டு மடங்கு நினைவூட்டல் (விவரங்கள் காகிதத்தில் உள்ளன). எனவே அதிக F1 ஆனது PII-TRACE உரையாடல்களிலிருந்து இந்த ஒப்பீட்டில் உள்ள அனைத்து ஐந்து வழக்கமான ஒற்றை-பதிவு பெஞ்ச்மார்க்குகளுக்கும் செல்கிறது.
முடிவுரை
கலப்பின AI ஆனது பயனரின் சாதனத்தை அனுமான ஸ்டாக்கில் ஒருங்கிணைக்கிறது, இது வலுவான தனியுரிமை மற்றும் குறைந்த விலையை வழங்குகிறது. கிளவுட்டில் உள்ள எல்லை மாதிரிகள் ஆராய்ச்சி, பகுத்தறிவு மற்றும் திட்டமிடல் ஆகியவற்றைக் கையாள முடியும், அதே நேரத்தில் உள்ளூர் மாதிரிகள் சாதனத்தில் இருக்க வேண்டிய கோப்புகள் மற்றும் தனிப்பட்ட தரவுகளுடன் வேலை செய்கின்றன. இந்த பிரிவு எந்தவொரு உணர்திறன் தரவுகளும் கிளவுட்டுக்கு செல்வதற்கு முன்பு உணர்திறன் தகவலை அடையாளம் காண்பதை நம்பியுள்ளது.
PII-Tracer என்பது பல திருப்ப உரையாடல்களில் PII ஐக் கண்டறிவதற்கான ஒரு கச்சிதமான மாதிரியாகும், அதே நேரத்தில் PII-TRACE ஆனது டிடெக்டர்கள் முழு உரையாடலிலும் தொடர்ச்சியாக மீண்டும் நிகழும் PII ஐக் கண்டறிய முடியுமா என்பதை மதிப்பிடுகிறது.
ஒன்றாக, PII-TRACE மற்றும் PII-Tracer ஆகியவை பல-திருப்பு உரையாடல்கள் மற்றும் பிற நீண்ட சூழல் அமைப்புகளில் PII கண்டறிதலை மேம்படுத்துவதற்கான பெஞ்ச்மார்க் மற்றும் குறிப்பு மாதிரியை வழங்குகின்றன.
முகவர்கள் நீண்ட பணிகளை மேற்கொள்கின்றனர் மற்றும் அதிக தனிப்பட்ட சூழலுடன் வேலை செய்கின்றன. இதன் விளைவாக, தனியுரிமக் கட்டுப்பாடுகள் ஆரம்ப உள்ளீட்டிற்கு மட்டும் இல்லாமல் முழு உரையாடலிலும் இருக்க வேண்டும். உணர்திறன் சூழலை சாதனத்தில் வைத்திருக்க ஹைப்ரிட் AI நம்பகமான உள்ளூர் கண்டறிதலை நம்பியுள்ளது.
PII-TRACE பெஞ்ச்மார்க், PII-Tracer மாதிரி மற்றும் எங்கள் மதிப்பீடு பற்றிய விவரங்களுக்கு arXiv ஆவணத்தைப் படிக்கவும். PII-TRACE மற்றும் PII-Tracer இரண்டையும் விரைவில் வெளியிட திட்டமிட்டுள்ளோம்.