PII-TRACE: ഉപകരണം വിട്ടുപോകുന്നതിന് മുമ്പ് വ്യക്തിഗത ഡാറ്റ കണ്ടെത്തുന്നു
ലോക്കലായി പ്രവർത്തിക്കാൻ രൂപകൽപ്പന ചെയ്ത ഒതുക്കമുള്ള 0.6B ഡിറ്റക്ടറുമായി ജോടിയാക്കിയ, നീണ്ടുനിൽക്കുന്ന സംഭാഷണങ്ങളിലുടനീളം സ്ഥിരമായ PII ഡിറ്റക്ഷനായുള്ള 13 ഭാഷാ ബെഞ്ച്മാർക്ക്.
മാക്കിലെ ഹൈബ്രിഡ് കമ്പ്യൂട്ട് Perplexity Computer ടാസ്കുകളെ ക്ലൗഡിലെ ഫ്രണ്ടിയർ മോഡലുകൾക്കും മാക്കിലെ ഒരു ലോക്കൽ മോഡലിനുമിടയിൽ വിഭജിക്കുന്നു. ക്ലൗഡ് ഏജന്റുകൾ ഗവേഷണം, ന്യായവാദം, ആസൂത്രണം എന്നിവ കൈകാര്യം ചെയ്യുമ്പോൾ, ലോക്കൽ മോഡൽ സ്വകാര്യ ഫയലുകളിലും സെൻസിറ്റീവ് വിവരങ്ങളിലും പ്രവർത്തിക്കുന്നു.
ഉപകരണത്തിൽ നിന്ന് പുറത്തുപോകുന്നതിന് മുമ്പ് വ്യക്തിഗതമായി തിരിച്ചറിയാൻ കഴിയുന്ന വിവരങ്ങൾ (PII) കണ്ടെത്തുന്നതിനെ ഈ അതിർത്തി ആശ്രയിച്ചിരിക്കുന്നു. ഒരു ലോക്കൽ പ്രൈവസി ഗേറ്റ് സെൻസിറ്റീവ് ഉള്ളടക്കം മാക്കിൽ സൂക്ഷിക്കുന്നു, കണ്ടെത്തിയ സ്വകാര്യ വിവരങ്ങൾ റിഡക്ട് ചെയ്യുന്നു, അല്ലെങ്കിൽ ക്ലൗഡിലേക്ക് അയക്കുന്നതിന് മുമ്പ് അനുമതി അഭ്യർത്ഥിക്കുന്നു.
നീളമുള്ള, ബഹുഭാഷാ സംഭാഷണങ്ങളിൽ ഡിറ്റക്ഷൻ കൂടുതൽ ബുദ്ധിമുട്ടായി മാറുന്നു. വ്യത്യസ്ത ടേണുകളിൽ ഒരേ ഐഡന്റിഫയർ പലതവണ ദൃശ്യമായേക്കാം. നഷ്ടപ്പെടുന്ന ഒരു പരാമർശം പോലും സംരക്ഷിക്കാൻ സിസ്റ്റം ഉദ്ദേശിക്കുന്ന വിവരങ്ങൾ പുറത്തുകൊണ്ടുവന്നേക്കാം.
ആമുഖം
വ്യക്തിഗതമായി തിരിച്ചറിയാൻ കഴിയുന്ന വിവരങ്ങളുടെ (PII) ഡിറ്റക്ടറുകൾ വിലയിരുത്തുന്നതിനുള്ള ഒരു പുതിയ ബെഞ്ച്മാർക്കായ PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), PII ഡിറ്റക്ഷനായുള്ള 0.6B ഒതുക്കമുള്ള മോഡലായ PII-Tracer എന്നിവ ഞങ്ങൾ ഇന്ന് അവതരിപ്പിക്കുന്നു.
ക്ലൗഡ്-ഫസ്റ്റ് ഏജന്റുകൾ കോൺടെക്സ്റ്റ്, ബുദ്ധിശക്തി, സ്വകാര്യത എന്നിവ സന്തുലിതമാക്കാൻ ഉപയോക്താക്കളെ നിർബന്ധിക്കുന്നു. കൂടുതൽ വ്യക്തിഗത കോൺടെക്സ്റ്റിന് ഉപയോക്താവിനെ മനസ്സിലാക്കാനും മികച്ച ഫലങ്ങൾ ഉണ്ടാക്കാനും ഒരു ഏജന്റിനെ സഹായിക്കാൻ കഴിയും. എന്നാൽ ഈ കോൺടെക്സ്റ്റ് നൽകുന്നത് പലപ്പോഴും സ്വകാര്യ വിവരങ്ങൾ ഒരു റിമോട്ട് സേവനത്തിലേക്ക് അയക്കുന്നതിനാണ് അർത്ഥമാക്കുന്നത് കൂടാതെ വ്യക്തിഗത വിവരങ്ങൾ ചോർന്നേക്കാം. ഒരു അസിസ്റ്റന്റിനെ ഉപയോഗപ്രദമാക്കുന്ന വിവരങ്ങൾ തന്നെയാണ് ഉപയോക്താവ് ഏറ്റവും കൂടുതൽ സ്വകാര്യമായി സൂക്ഷിക്കാൻ ആഗ്രഹിക്കുന്നത്.
ഹൈബ്രിഡ് AI ഉപയോക്താവിന്റെ ഉപകരണത്തിനും ക്ലൗഡ് മോഡലുകൾക്കുമിടയിൽ ജോലി വിഭജിച്ച് ഈ ട്രേഡ്-ഓഫ് എളുപ്പമാക്കുന്നു. എന്നാൽ റിമോട്ട് മോഡലിലേക്ക് ടെക്സ്റ്റ് അയക്കുന്നതിന് മുമ്പ് ഉപകരണത്തിന് PII തിരിച്ചറിയാൻ കഴിഞ്ഞാൽ മാത്രമേ ആ അതിർത്തി സ്വകാര്യത സംരക്ഷിക്കൂ. ഉപയോക്താക്കൾ ഓരോ സന്ദേശവും സ്വന്തമായി പരിശോധിക്കേണ്ടതില്ല. ഉപകരണത്തിന് അതിന്റെ പ്രൈവസി ഗേറ്റായി ഒരു ലോക്കൽ PII ഡിറ്റക്ടർ ആവശ്യമാണ്. നീളമുള്ള സംഭാഷണങ്ങളിൽ, ഒരേ ഐഡന്റിഫയർ ടേണുകളിൽ ആവർത്തിച്ചേക്കാം, വ്യക്തിഗത വിവരങ്ങൾ കടന്നുപോകാൻ നഷ്ടപ്പെട്ട ഒരു പരാമർശം തന്നെ ധാരാളമാണ്.

ഏത് ജോലിയാണ് ഉപകരണത്തിൽ പ്രവർത്തിക്കേണ്ടത്, ഏത് ജോലിയാണ് ക്ലൗഡിലെ ഏജന്റുകളിലേക്ക് പോകേണ്ടത് എന്ന് തീരുമാനിക്കുന്ന ഒരു ഹൈബ്രിഡ് ലോക്കൽ-സെർവർ ഇൻഫറൻസ് ഓർക്കെസ്ട്രേറ്റർ Perplexity അവതരിപ്പിച്ചു. മോഡൽ, ഏജന്റ് ഹാർനെസ്, സംഭാഷണങ്ങൾ, എക്സിക്യൂഷൻ ട്രാജക്ടറികൾ എന്നിവയെല്ലാം ഉപയോക്താവിന്റെ മെഷീനിൽ വസിക്കുന്നു. പുറംലോകത്തേക്ക് പ്രവേശനം ആവശ്യമുള്ള ടാസ്ക്കുകൾ ആവശ്യമുള്ളപ്പോൾ മാത്രം വിളിക്കപ്പെടുകയും ഉപയോക്തൃ അനുമതി മുഖേന നിയന്ത്രിക്കപ്പെടുകയും ചെയ്യുന്നു. തൽഫലമായി, ഉപയോക്താവ് അംഗീകരിക്കുന്നതുവരെ, ആ ഉള്ളടക്കം ഉപകരണത്തിൽ തന്നെ തുടരുന്നു.
PII അടങ്ങിയിട്ടുണ്ടെന്ന് പ്രവചിക്കപ്പെട്ട സ്പാനുകൾ ഫ്ലാഗ് ചെയ്തുകൊണ്ട് മോഡൽ റൂട്ടിംഗിനായി PII-Tracer ഒരു ലോക്കൽ കൺട്രോൾ സിഗ്നൽ നൽകുന്നു. ആപ്ലിക്കേഷൻ പിന്നീട് റൂട്ടിംഗ് പോളിസി നടപ്പിലാക്കുന്നു. ഇത് പ്രസക്തമായ ഇൻപുട്ട് ലോക്കലായി സൂക്ഷിക്കുന്നു, കണ്ടെത്തിയ സ്പാനുകൾ റിഡക്ട് ചെയ്യുന്നു, അല്ലെങ്കിൽ ക്ലൗഡ് മോഡലിലേക്ക് ഉയർത്തുന്നതിന് മുമ്പ് വ്യക്തമായ അനുമതി അഭ്യർത്ഥിക്കുന്നു. ഇത് റൂട്ടിംഗിനെ കൂടുതൽ സെലക്ടീവ് ആക്കുന്നു. കണ്ടെത്തിയ PII ഉപകരണത്തിൽ തന്നെ തുടരുമ്പോൾ, അംഗീകൃത കോൺടെക്സ്റ്റ് ഇപ്പോഴും ഫ്രണ്ടിയർ ക്ലൗഡ് മോഡലുകളിൽ നിന്ന് പ്രയോജനം നേടുന്നു.
സെലക്ടീവ് റൂട്ടിംഗ് മുഴുവൻ സംഭാഷണത്തിലുടനീളമുള്ള സ്ഥിരമായ ഡിറ്റക്ഷനെ ആശ്രയിച്ചിരിക്കുന്നു. ഒരേ ഐഡന്റിഫയർ ടേണുകളിൽ ആവർത്തിച്ചേക്കാം, കൂടാതെ നഷ്ടമായ ഒരു പരാമർശം ഇപ്പോഴും കൈമാറപ്പെട്ടേക്കാം.
12 ഡിറ്റക്ടറുകളിൽ, PII-Tracer ഉയർന്ന ക്യാരക്ടർ F1 ഉം ആവർത്തിച്ചുള്ള ഐഡന്റിഫയറുകളുടെ ഏറ്റവും ഉയർന്ന സ്ഥിരമായ കവറേജും രേഖപ്പെടുത്തുന്നു. രണ്ട് ഫലങ്ങളും പ്രധാനമായിരിക്കുന്നത് എന്തുകൊയാണെന്ന് ബെഞ്ച്മാർക്ക് വിശദീകരിക്കുന്നു: ഒരു നീളമുള്ള സംഭാഷണത്തിൽ, ഭൂരിഭാഗം PII-യും കണ്ടെത്തുന്നത് അതിന്റെ എല്ലാ പകർപ്പുകളും കണ്ടെത്തുന്നതിന് തുല്യമല്ല.
ഹൈബ്രിഡ് AI-ൽ PII ഡിറ്റക്ഷൻ പുതിയ വെല്ലുവിളികൾ നേരിടുന്നു
PII ഡിറ്റക്ഷൻ ദീർഘകാലമായി നിലനിൽക്കുന്ന ഒരു സുരക്ഷാ പ്രശ്നമാണ്, കൂടാതെ നിരവധി ബെഞ്ച്മാർക്കുകളും ഡിറ്റക്ടറുകളും ഇതിനകം നിലവിലുണ്ട്. എന്നിരുന്നാലും, ഹൈബ്രിഡ് AI ക്രമീകരണങ്ങളിലെ PII ഡിറ്റക്ഷൻ പുതിയ വെല്ലുവിളികൾ അവതരിപ്പിക്കുന്നു. പ്രത്യേകിച്ചും, നീളമുള്ള, മൾട്ടി-ടേൺ സംഭാഷണങ്ങളിൽ ഡിറ്റക്ടറുകൾ PII തിരിച്ചറിയേണ്ടതുണ്ട്, അവിടെ ഒരു സ്ട്രിംഗ് PII ആയി കണക്കാക്കണമോ എന്ന് സംഭാഷണ കോൺടെക്സ്റ്റ് നിർണ്ണയിക്കുന്നു. ഉദാഹരണത്തിന്, ഒരു പേര് ഒരു സംഭാഷണത്തിൽ ഉപയോക്താവിനെ തിരിച്ചറിയാം, മറ്റൊന്നിൽ ഒരു പൊതു വ്യക്തിയെ പരാമർശിക്കാം, അല്ലെങ്കിൽ ഒരു അസിസ്റ്റന്റ് ജനറേറ്റ് ചെയ്ത പ്ലേസ്ഹോൾഡർ ആകാം. ഒരു സ്ട്രിംഗ് PII ആയി ഫ്ലാഗ് ചെയ്യേണ്ടതുണ്ടോ എന്ന് നിർണ്ണയിക്കാൻ ഉപരിതല രൂപം മാത്രം പര്യാപ്തമല്ല.

നിലവിലുള്ള PII ഡിറ്റക്ടറുകളും ബെഞ്ച്മാർക്കുകളും പ്രാഥമികമായി വ്യക്തിഗത റെക്കോർഡുകളെയാണ് ലക്ഷ്യമിടുന്നത്. ഒരു സമയം ഒരു റെക്കോർഡ് വീതം പ്രോസസ്സ് ചെയ്യാൻ രൂപകൽപ്പന ചെയ്തിട്ടുള്ള ഡിറ്റക്ടറുകൾ നീളമുള്ളതും സങ്കീർണ്ണവുമായ സംഭാഷണങ്ങളിൽ മോശമായി പ്രവർത്തിക്കുന്നുവെന്ന് ഞങ്ങൾ കണ്ടെത്തുന്നു. കൂടാതെ, നിലവിലുള്ള ബെഞ്ച്മാർക്കുകൾ പൊതുവെ ടേണുകളിലുടനീളമുള്ള സ്ഥിരത വിലയിരുത്തുന്നില്ല. ഫലമായി, ഈ ബെഞ്ച്മാർക്കുകളിലെ മികച്ച പ്രകടനം നീളമുള്ള, മൾട്ടി-ടേൺ സംഭാഷണങ്ങളിൽ ഫലപ്രദമായ PII ഡിറ്റക്ഷനിലേക്ക് എല്ലായ്പ്പോഴും വിവർത്തനം ചെയ്യപ്പെടണമെന്നില്ല.
PII-TRACE: ഡിപ്ലോയ്മെന്റ്-ക്രിട്ടിക്കൽ PII ഡിറ്റക്ഷനായുള്ള ഒരു ബെഞ്ച്മാർക്ക്
ഒരു അസിസ്റ്റന്റ് സംഭാഷണങ്ങളിൽ PII ഡിറ്റക്ടർ ഉപയോഗിക്കുമ്പോൾ പ്രാധാന്യമുള്ള മൂന്ന് പെരുമാറ്റങ്ങൾക്ക് ചുറ്റും ഞങ്ങൾ PII-TRACE രൂപകൽപ്പന ചെയ്തിട്ടുണ്ട്. ആദ്യത്തേത് consistent coverage ആണ്: ഒരു ഐഡന്റിഫയർ പലതവണ ദൃശ്യമാകുമ്പോഴോ ഉപയോക്താവിന്റെയും അസിസ്റ്റന്റിന്റെയും ടേണുകൾ കടന്നുപോകുമ്പോഴോ, ഡിറ്റക്ടർ ഓരോ പരാമർശവും കണ്ടെത്തേണ്ടതുണ്ട്. രണ്ടാമത്തേത് robustness to long context ആണ്: സംഭാഷണങ്ങൾ 1,000-ൽ താഴെ മുതൽ 100,000-ത്തിലധികം ക്യാരക്ടറുകൾ വരെ വ്യത്യാസപ്പെടുന്നു, ചരിത്രം വളരുമ്പോൾ എന്ത് സംഭവിക്കുന്നു എന്ന് അളക്കുന്നത് സാധ്യമാക്കുന്നു. മൂന്നാമത്തേത് multiple languages and mixed-format content കൈകാര്യം ചെയ്യുകയാണ്: ഒരു സംഭാഷണം ഭാഷകൾ മാറുകയും കോഡ്, ടേബിളുകൾ അല്ലെങ്കിൽ ഘടനാപരമായ റെക്കോർഡുകൾ എന്നിവയുമായി ഗദ്യം സംയോജിപ്പിക്കുകയും ചെയ്തേക്കാം. PII-TRACE ഒറ്റപ്പെട്ട റെക്കോർഡുകളായി വിഭജിക്കുന്നതിന് പകരം ഓരോ പൂർണ്ണ ഡയലോഗും വിലയിരുത്തി ഈ പാറ്റേണുകൾ സംരക്ഷിക്കുന്നു.
ബെഞ്ച്മാർക്ക് രണ്ട് കോംപ്ലിമെന്ററി ലെവലുകളിൽ പ്രകടനം അളക്കുന്നു. ഐഡന്റിഫയർ ലെവലിൽ, consistent detection എന്നത് കർശനമായ ചോദ്യം ചോദിക്കുന്നു: ഒരേ ഐഡന്റിഫയറിന്റെ ഓരോ പരാമർശത്തിലെയും എല്ലാ ക്യാരക്ടറുകളും ഡിറ്റക്ടർ കവർ ചെയ്തിട്ടുണ്ടോ? ഒന്നിലധികം പരാമർശങ്ങളുള്ള ഐഡന്റിഫയറുകൾക്കും ടേണുകളിലുടനീളം ആവർത്തിക്കുന്ന ഐഡന്റിഫയറുകൾക്കുമായി ഞങ്ങൾ ഈ സ്കോർ വെവ്വേറെ റിപ്പോർട്ട് ചെയ്യുന്നു. ക്യാരക്ടർ ലെവലിൽ, ഒരു ഡിറ്റക്ടർ അടയാളപ്പെടുത്തിയ ടെക്സ്റ്റിന്റെ എത്ര ഭാഗം PII ആയി ലേബൽ ചെയ്തിട്ടുണ്ടെന്ന് പ്രിസിഷൻ അളക്കുന്നു, ലേബൽ ചെയ്ത എത്ര PII അത് കണ്ടെത്തുന്നു എന്ന് റീകോൾ അളക്കുന്നു, കൂടാതെ ഇവ രണ്ടിനെയും F1 ബാലൻസ് ചെയ്യുന്നു.
PII-TRACE-ൽ 13 ഭാഷകളിലായി 13,148 സിന്തറ്റിക് യൂസർ-അസിസ്റ്റന്റ് സംഭാഷണങ്ങളും 10 റൈറ്റിംഗ് സിസ്റ്റങ്ങളും അടങ്ങിയിരിക്കുന്നു, ഒമ്പത് PII തരംകളിലായി ക്യാരക്ടർ ലെവലിൽ ലേബൽ ചെയ്ത 37,431 ഐഡന്റിഫയർ പരാമർശങ്ങളും ഇതിലുണ്ട്. സംഭാഷണങ്ങളുടെ ആകെ 41% ഘടനാപരമായ ഉള്ളടക്കം ഉൾക്കൊള്ളുന്നു. ലേബൽ ചെയ്ത PII ഉള്ള 5,645 സംഭാഷണങ്ങളിൽ, 63.8% ഒന്നിലധികം തവണ ദൃശ്യമാകുന്ന ഒരു ഐഡന്റിഫയറും, 28.7% ഒന്നിലധികം ടേണുകളിൽ ദൃശ്യമാകുന്ന ഒരു ഐഡന്റിഫയറും ഉൾപ്പെടുത്തുന്നു.
പ്രൊഡക്ഷൻ സംഭാഷണങ്ങളിൽ നിന്ന് ഒരു സിന്തറ്റിക് ഡാറ്റാസെറ്റ് നിർമ്മിക്കുന്നു
യഥാർത്ഥ പകർപ്പുകൾ പ്രസിദ്ധീകരിക്കാതെ തന്നെ PII-TRACE ഉറവിട സംഭാഷണങ്ങളുടെ ടേൺ ഘടന സംരക്ഷിക്കുന്നു. പൈപ്പ്ലൈൻ ഓരോ ടേണും റൈറ്റ് ചെയ്യുകയും ലേബൽ ചെയ്ത ഓരോ ഐഡന്റിഫയറിനും പകരം ഒരു സിന്തറ്റിക് മൂല്യം നൽകുകയും ചെയ്യുന്നു.

ആദ്യം, ഒന്നിലധികം ഭാഷാ മോഡലുകൾ പ്രൊഡക്ഷൻ യൂസർ-അസിസ്റ്റന്റ് സംഭാഷണങ്ങളിൽ ഒമ്പത് തരം PII അടയാളപ്പെടുത്തുന്നു. ഒരു റൂൾ-ബേസ്ഡ് പാസ് ഒരേ തരത്തിലുള്ള ആവർത്തിച്ചുള്ള ഐഡന്റിഫയറുകളെ ഒരു എൻ്റിറ്റി ID-ക്ക് കീഴിൽ ഗ്രൂപ്പ് ചെയ്യുന്നു. അടയാളപ്പെടുത്തിയ ഓരോ മൂല്യവും പിന്നീട് ടൈപ്പ് ചെയ്ത പ്ലേസ്ഹോൾഡർ ഉപയോഗിച്ച് മാറ്റിസ്ഥാപിക്കപ്പെടുന്നു, ഇത് ടേൺ ഓർഡർ, PII തരം, പരാമർശങ്ങൾ തമ്മിലുള്ള ലിങ്കുകൾ എന്നിവ നിലനിർത്തുന്ന എന്നാൽ അടയാളപ്പെടുത്തിയ യഥാർത്ഥ മൂല്യങ്ങളൊന്നും ഇല്ലാത്ത ഒരു ടെംപ്ലേറ്റ് അവശേഷിപ്പിക്കുന്നു.
ആ പ്ലേസ്ഹോൾഡറുകൾ കേടുകൂടാതെ സൂക്ഷിച്ചുകൊണ്ട് സിസ്റ്റം ഓരോ ടേണും പാരഫ്രേസ് ചെയ്യുന്നു, തുടർന്ന് ഐഡന്റിഫയറിന്റെ തരവുമായി പൊരുത്തപ്പെടുന്ന സിന്തറ്റിക് മൂല്യങ്ങൾ ചേർക്കുന്നു. ആവർത്തിച്ചുള്ള പരാമർശങ്ങൾക്ക് ഒരു സംഭാഷണത്തിനുള്ളിൽ ഒരേ മൂല്യം ലഭിക്കുന്നു, അതേസമയം വ്യത്യസ്ത സംഭാഷണങ്ങൾ സ്വതന്ത്രമായി ജനറേറ്റുചെയ്ത മൂല്യങ്ങൾ ഉപയോഗിക്കുന്നു. അവസാന അലൈൻമെന്റ് പാസ് ഓരോ ക്യാരക്ടർ ഓഫ്സെറ്റും റീകാൽക്കുലേറ്റ് ചെയ്യുന്നു.
പകരക്കാര സ്പാനുകളുമായി പൊരുത്തപ്പെടുന്നുണ്ടെന്നും, ആവർത്തിച്ചുള്ള പരാമർശങ്ങൾ ഒരേ മൂല്യം ഉപയോഗിക്കുന്നുണ്ടെന്നും, അടയാളപ്പെടുത്തിയ ഉറവിട മൂല്യങ്ങൾ Presidio, റെഗുലർ എക്സ്പ്രഷൻ റീസ്കാൻ എന്നിവയ്ക്ക് കീഴിൽ ലഭ്യമല്ലെന്നും മൂന്ന് ഓട്ടോമേറ്റഡ് ഗേറ്റുകൾ പരിശോധിക്കുന്നു. ഒരു സ്റ്റോറഡ് ഓഫ്സെറ്റും കൃത്യമായ സിന്തറ്റിക് സബ്സ്ട്രിംഗ് വീണ്ടെടുക്കണം. പരാജയപ്പെടുന്ന റെക്കോർഡുകൾ പുനർനിർമ്മിക്കുകയോ ഒഴിവാക്കുകയോ ചെയ്യുന്നു. രണ്ടാമത്തെ ഭാഷാ മോഡൽ ഒരു സാമ്പിൾ ഓഡിറ്റ് ചെയ്യുന്നു, അത് PII ആയി ഫ്ലാഗ് ചെയ്യുന്ന എന്തും മനുഷ്യർ അവലോകനം ചെയ്യുന്നു.
PII-Tracer: ലോക്കൽ ഉപയോഗത്തിനായുള്ള ഒരു ഒതുക്കമുള്ള ഡിറ്റക്ടർ
Qwen3 ബാക്ക്ബോണിൽ നിന്ന് അഡാപ്റ്റ് ചെയ്ത 0.6B ബിഡയറക്ഷണൽ എൻകോഡറാണ് PII-Tracer. പ്രൈവസി സ്ക്രീനിംഗ് എന്നത് ടെക്സ്റ്റ് ജനറേഷനിൽ നിന്ന് വ്യത്യസ്തമാണ്, കൂടാതെ പ്രസക്തമായ PII സ്പാനുകൾ കണ്ടെത്തുകയും അവയുടെ അതിർത്തികൾ തിരികെ നൽകുകയും ചെയ്യേണ്ടതുണ്ട്. തൽഫലമായി, PII-Tracer എന്നത് Qwen3-ന്റെ കോസൽ മാസ്കിനെ പാഡിംഗ്-അവെയർ ബിഡയറക്ഷണൽ അറ്റൻഷൻ ഉപയോഗിച്ച് മാറ്റിസ്ഥാപിക്കുന്നു, അതിനാൽ ഓരോ ടോണിനും 4,096-ടോൺ വിൻഡോയ്ക്കുള്ളിൽ നേരത്തെയുള്ളതും പിന്നീട് വരുന്നതുമായ ടേണുകളിൽ നിന്ന് വരയ്ക്കാൻ കഴിയും.
ഓരോ ടോണിനും, എൻകോഡർ 1,024-ഡൈമൻഷണൽ പ്രതിനിധാനം നിർമ്മിക്കുന്നു. ഒരു ലീനിയർ ടാഗ്ഗിംഗ് ഹെഡ് 37 സാധ്യമായ ലേബലുകൾക്കായി സ്കോറുകൾ നിർമ്മിക്കുന്നു: PII സ്പാനിന് പുറത്തുള്ള ടെക്സ്റ്റിനായി ഞങ്ങൾ O ഉപയോഗിക്കുന്ന ഒരു പ്രത്യേക ലേബൽ, കൂടാതെ ഒമ്പത് PII തരങ്ങളിൽ ഓരോന്നിനും നാല് സ്പാൻ-പൊസിഷൻ ലേബലുകൾ. നാമ്ഡ് എൻ്റിറ്റി റെക്കഗ്നിഷനിലെ BIOES സ്കീമിൽ, B (Beginning), I (Inside), E (End) എന്നിവ മൾട്ടി-ടോൺ സ്പാൻ അടയാളപ്പെടുത്തുന്നു, അതേസമയം S (Single) ഒരു സിംഗിൾ-ടോൺ സ്പാൻ അടയാളപ്പെടുത്തുന്നു. ആരോഗ്യം അല്ലെങ്കിൽ മതാപരമായ വിവരങ്ങൾ പോലുള്ള സെൻസിറ്റീവ് മെറ്റീരിയൽ സംഭാഷണത്തിൽ അടങ്ങിയിട്ടുണ്ടോ എന്ന് ഒരു ഓക്സിലറി ഹെഡും പ്രവചിക്കുന്നു.
മൾട്ടിലിംഗവൽ അസിസ്റ്റന്റ് സംഭാഷണങ്ങളും സിംഗിൾ-റെക്കോർഡ് ഉദാഹരണങ്ങളും സംയോജിപ്പിച്ച് ഏകദേശം 714,000 ട്രെയിനിങ് സാമ്പിളുകളിൽ മൂന്ന് എപ്പോക്കുകൾക്കായി ഞങ്ങൾ PII-Tracer പരിശീലിപ്പിക്കുന്നു. പങ്കിട്ട ബിഡയറക്ഷണൽ എൻകോഡറിന് രണ്ട് ട്രെയിനിങ് ഹെഡുകൾ ഉണ്ട്: PII സ്പാനുകൾ കണ്ടെത്തി തരംതിരിക്കുന്ന 37-ക്ലാസ് BIOES ടോക്കൺ ഹെഡും, സംഭാഷണത്തിൽ സെൻസിറ്റീവ് മെറ്റീരിയൽ അടങ്ങിയിട്ടുണ്ടോ എന്ന് പ്രവചിക്കുന്ന ബൈനറി സംഭാഷണ-ലെവൽ ഹെഡും. ഉപയോഗിച്ച് ഞങ്ങൾ രണ്ട് ഹെഡുകളും സംയുക്തമായി പരിശീലിപ്പിക്കുന്നു. ഇവിടെ, അപൂർപ്പമായ PII ലേബലുകൾക്ക് കൂടുതൽ ഭാരം നൽകുന്നു, അങ്ങനെ പതിവുള്ള `O` ലേബൽ ആധിപത്യം പുലർത്തുന്നില്ല, അതേസമയം സംഭാഷണ-ലെവൽ ട്രെയിനിങ് സിഗ്നൽ നൽകുന്നു; 1.5, 0.3 കോഎഫിഷ്യന്റുകൾ സ്പാൻ ഡിറ്റക്ഷനെ പ്രധാന ടാസ്കായി നിലനിർത്തുന്നു. ഈ സഹായ സിഗ്നൽ context-aware ഡിറ്റക്ഷനെ ശക്തിപ്പെടുത്തുന്നു: ഒറ്റപ്പെട്ട ഒരു സ്ട്രിംഗ് എന്നതിലുപരി സംഭാഷണത്തിനുള്ളിൽ ഒരു കാൻഡിഡേറ്റ് സ്പാൻ വിലയിരുത്താൻ മോഡൽ പഠിക്കുന്നു, ഇത് റീകോളിൽ ചെറിയൊരു ട്രേഡ്ഓഫ് മാത്രം വരുത്തിക്കൊണ്ട് ഫോൾസ് പോസിറ്റീവുകൾ കുറയ്ക്കാൻ സഹായിക്കുന്നു.
ഇൻഫറൻസ് സമയത്ത്, ഓരോ ടോണും സ്വതന്ത്രമായി ലേബൽ ചെയ്യുന്നതിന് പകരം, ഉയർന്ന സ്കോറുള്ള സാധുവായ BIOES സീക്വൻസിനായി നിയന്ത്രിത Viterbi decoder തിരയുന്നു. ഉദാഹരണത്തിന്, B-private_person എന്നത് I-private_person ഉപയോഗിച്ച് തുടരാം അല്ലെങ്കിൽ E-private_person ഉപയോഗിച്ച് അവസാനിപ്പിക്കാം, എന്നാൽ I-private_email എന്നതിലേക്ക് മാറാൻ കഴിയില്ല. ഡീകോഡർ ഫലം റിഡക്ഷൻ അല്ലെങ്കിൽ ലോക്കൽ റൂട്ടിംഗിനായി കൃത്യമായ ക്യാരക്ടർ സ്പാനുകളിലേക്ക് തിരികെ മാപ്പ് ചെയ്യുന്നു.
ക്യാരക്ടർ F1-ലും ആവർത്തിച്ചുള്ള PII-ലും PII-Tracer മുന്നിലാണ്
ചെറാക്ടർ, സ്പാൻ ലെവലുകളിൽ ഞങ്ങൾ ഡിറ്റക്ടറുകളെ താരതമ്യം ചെയ്യുന്നു. ക്യാരക്ടർ F1 എന്നത് ഓരോ ക്യാരക്ടറായും ഡിറ്റക്ഷൻ വിലയിരുത്തുന്നു. ഒരു PII ഐറ്റത്തിന്റെ ഏതെങ്കിലും ഭാഗം ഡിറ്റക്ടർ തിരിച്ചറിയുന്നുണ്ടോ എന്ന് സ്പാൻ-ഓവർലാപ്പ് F1 അളക്കുന്നു, അതേസമയം മുഴുവൻ ഐറ്റവും ക്യാപ്ചർ ചെയ്യുന്നുണ്ടോ എന്ന് സ്പാൻ-കണ്ടെയ്ൻമെന്റ് F1 അളക്കുന്നു.
വിലയിരുത്തിയ 12 സിസ്റ്റങ്ങളിൽ ഏറ്റവും ഉയർന്ന ക്യാരക്ടർ F1 (0.629) PII-Tracer കൈവരിച്ചു, കൂടാതെ രണ്ടാഴ്ച ഉയർന്ന സ്പാൻ-ഓവർലാപ്പ് F1 ഉം സ്പാൻ-കണ്ടെയ്ൻമെന്റ് F1 ഉം നേടി. ഫ്രണ്ടിയർ മോഡലുകൾ, അതായത് GPT-5.6-sol, Claude Sonnet 5 എന്നിവ താരതമ്യപ്പെടുത്താവുന്ന മൊത്തത്തിലുള്ള പ്രകടനം കൈവരിച്ചു. GPT-5.6-sol രണ്ട് സ്പാൻ-ലെവൽ F1 മെട്രിക്സുകളിലും ഉയർന്ന സ്കോറുകൾ നേടി, എന്നാൽ കുറഞ്ഞ ക്യാരക്ടർ F1 നേടി. എന്നിരുന്നാലും, ഈ ഫ്രണ്ടിയർ മോഡലുകൾക്ക് നൂറുകണക്കിന് ബില്യൺ അല്ലെങ്കിൽ ട്രില്യൺ കണക്കിന് പാരാമീറ്ററുകൾ ഉണ്ട് കൂടാതെ ക്ലൗഡിൽ ഹോസ്റ്റ് ചെയ്യുന്ന ക്ലോസ്ഡ്-സോഴ്സ് മോഡലുകളാണ്. തൽഫലമായി, സ്ക്രീൻ ചെയ്യാത്ത ടെക്സ്റ്റ് ലോക്കലായി തുടരേണ്ട ഹൈബ്രിഡ് AI ക്രമീകരണങ്ങളിൽ സെൻസിറ്റീവ് ലോക്കൽ ഡാറ്റ സംരക്ഷിക്കുന്നതിന് അവ അനുയോജ്യമല്ല. ഇതിനു വിപരീതമായി, PII-Tracer 0.6B പാരാമീറ്ററുകൾ മാത്രം ഉപയോഗിച്ച് ഫ്രണ്ടിയർ-ലെവൽ സ്പാൻ-ഡിറ്റക്ഷൻ നൽകുകയും സ്ക്രീൻ ചെയ്യാത്ത ടെക്സ്റ്റ് പൂർണ്ണമായി ലോക്കലായി പ്രോസസ്സ് ചെയ്യുകയും ചെയ്യാം. മറ്റ് ഓപ്പൺ സോഴ്സ് PII ഡിറ്റക്ടറുകൾ PII-Tracer-നേക്കാൾ വളരെ മോശമായി പ്രവർത്തിക്കുന്നു.

ആവർത്തിച്ചുള്ള ഓരോ പരാമർശവും കണ്ടെത്തുന്നു
സ്ഥിരത പരീക്ഷണം അതേ പ്രവചനങ്ങൾക്കുമേൽ കർശനമായ ഒരു പരിശോധന പ്രയോഗിക്കുന്നു. ടെസ്റ്റ് സെറ്റിൽ ഒരു തവണ ദൃശ്യമാകുന്ന 899 ഐഡന്റിഫയറുകളും ഒന്നിലധികം തവണ ദൃശ്യമാകുന്ന 959 എണ്ണവും അടങ്ങിയിരിക്കുന്നു; ആവർത്തിച്ചുള്ള ഐഡന്റിഫയറുകളിൽ 790 എണ്ണം ഒന്നിലധികം ടേണുകളിൽ വ്യാപിച്ച് കിടക്കുന്നു. ഫിഗർ നാല് മെൻഷൻ-കൗണ്ട് ബക്കറ്റുകൾ (ഒന്ന്, രണ്ട്, മൂന്ന് മുതൽ അഞ്ച് വരെ, ആറ് മുതൽ പത്ത് വരെ) റിപ്പോർട്ട് ചെയ്യുന്നു കൂടാതെ ലേബൽ ചെയ്ത എല്ലാ ക്യാരക്ടറുകളും കണ്ടെത്തുമ്പോൾ മാത്രം ഒരു ഐഡന്റിഫയർ കണക്കാക്കുന്നു. ഇത് തിരഞ്ഞെടുത്ത മൂന്ന് ബേസ്ലൈനുകൾക്കൊപ്പം PII-Tracer പ്ലോട്ട് ചെയ്യുന്നു, അതേസമയം അഗ്രഗേറ്റ് ടേബിൾ പന്ത്രണ്ട് സിസ്റ്റങ്ങൾക്കും ആവർത്തിച്ചുള്ളതും ക്രോസ്-ടേൺ സ്കോറുകളും റിപ്പോർട്ട് ചെയ്യുന്നു.

ആവർത്തനം കൂടുമ്പോൾ PII-Tracer മുന്നിൽ നിൽക്കുന്നു: ഇതിന്റെ സ്കോർ ഒരു പരാമർശത്തിന് 0.917 എന്നതിൽ നിന്ന് രണ്ടെണ്ണത്തിന് 0.873 ആയും, മൂന്ന് മുതൽ അഞ്ച് വരെ ഉള്ളവയ്ക്ക് 0.796 ആയും, ആറ് മുതൽ പത്ത് വരെ ഉള്ളവയ്ക്ക് 0.691 ആയും മാറുന്നു. അവസാന ബക്കറ്റിൽ, GPT-5.6-sol 0.464-ൽ എത്തുമ്പോൾ, GLiNER2-PII, Claude Opus 4.8 എന്നിവ 0.073-லும் 0.045-லும் എത്തുന്നു. പൂർണ്ണമായ വിലയിരുത്തലിൽ, ആവർത്തിച്ചുള്ള ഐഡന്റിഫയറുകളിൽ 79.4% ഉം ക്രോസ്-ടേൺ ഐഡന്റിഫയറുകളിൽ 77.6% ഉം ആയ എല്ലാ പരാമർശങ്ങളും PII-Tracer കണ്ടെത്തുന്നു; അതേ രണ്ട് അളവുകളിൽ GPT-5.6-sol 57.0% ഉം 55.1% ഉം എത്തുന്നു.
നീളമുള്ള സംഭാഷണങ്ങൾ ഉൾക്കൊള്ളുന്നു
ഞങ്ങൾ ആദ്യം 1,922 ടെസ്റ്റ് സംഭാഷണങ്ങളും ക്യാരക്ടർ നീളം അനുസരിച്ച് ഗ്രൂപ്പ് ചെയ്യുകയും 4,096-ടോൺ വിൻഡോ ഉപയോഗിച്ച് PII-Tracer ഡീകോഡ് ചെയ്യുകയും ചെയ്യുന്നു. ഗ്രൂപ്പുകളിൽ 1,000 ക്യാരക്ടറുകൾക്ക് താഴെയുള്ള 167 സംഭാഷണങ്ങളും, 1,000 മുതൽ 10,000 വരെയുള്ള 1,292 സംഭാഷണങ്ങളും, 10,000 അല്ലെങ്കിൽ അതിൽ കൂടുതലുള്ള 463 സംഭാഷണങ്ങളും അടങ്ങിയിരിക്കുന്നു.

സിംഗിൾ-വിൻഡോ റീകോൾ 1,000 ക്യാരക്ടറുകൾക്ക് താഴെ 0.975 ഉം 1,000 മുതൽ 10,000 വരെ 0.955 ഉം ആണ്, എന്നാൽ 10,000 അല്ലെങ്കിൽ അതിൽ കൂടുതൽ ക്യാരക്ടറുകളുള്ള സംഭാഷണങ്ങൾക്ക് ഇത് 0.687 ആയി കുറയുന്നു. രണ്ട് നീളമുള്ള ഗ്രൂപ്പുകളിലും പ്രിസിഷൻ 0.51-ന് അടുത്ത് തുടരുന്നു, ഇത് പ്രധാന പ്രശ്നമായി ഇൻപുട്ട് കവറേജിനെ ചൂണ്ടിക്കാണിക്കുന്നു.
ഇൻപുട്ട് കൈകാര്യം ചെയ്യുന്നതിന്റെ പ്രഭാവം പഠിക്കാൻ, 50%-ഓവർലാപ്പ് സ്ലൈഡിംഗ്-വിൻഡോ ഡീകോഡിംഗ് ഉപയോഗിച്ച് ഞങ്ങൾ അതേ ചെക്ക്പോയിന്റ് വിലയിരുത്തുന്നു. ഇത് റീട്രെയിനിംഗ് ഇല്ലാതെ മൊത്തത്തിലുള്ള ക്യാരക്ടർ റീകോൾ 0.830-ൽ നിന്ന് 0.965 ആയും മൾട്ടി-മെൻഷൻ സ്ഥിരമായ ഡിറ്റക്ഷൻ 0.794-ൽ നിന്ന് 0.954 ആയും ഉയർത്തുന്നു.
ഭാഷകളിലുടനീളം സ്ഥിരതയുള്ളത്
PII-TRACE 13 ഭാഷകൾ ഉൾക്കൊള്ളുന്നു; ഭാഷാ പരീക്ഷണം ലാറ്റിൻ, സിറിൽറിക്, ഹാംഗൂൾ ലിപികൾ ഉൾക്കൊള്ളുന്ന ആറ് ഭാഷകളുടെ സ്ലൈസ് റിപ്പോർട്ട് ചെയ്യുന്നു: ഇംഗ്ലീഷ്, ജർമ്മൻ, ഫ്രഞ്ച്, ഇറ്റാലിയൻ, റഷ്യൻ, കൊറിയൻ. ഓരോ ഭാഷയിലെയും എല്ലാ ടെസ്റ്റ് സംഭാഷണങ്ങളിലും ഞങ്ങൾ അതേ 12 ഡിറ്റക്ടറുകൾ പ്രവർത്തിപ്പിക്കുന്നു. ഓരോ ഭാഷയ്ക്കുള്ളിലും, ഞങ്ങൾ പ്രവചിച്ചതും ഗോൾഡ് ക്യാരക്ടറുകളും പൂൾ ചെയ്യുകയും ക്യാരക്ടർ F1 കണക്കാക്കുകയും ചെയ്യുന്നു.

ആറ് ഭാഷകളിൽ നൽക്കണ്ണിലും, ജർമ്മൻ (0.735), ഫ്രഞ്ച് (0.633), ഇറ്റാലിയൻ (0.676), റഷ്യൻ (0.651) എന്നീ നാല് ഭാഷകളിൽ PII-Tracer ക്യാരക്ടർ F1-ൽ മുന്നിലാണ്, കൂടാതെ ഇംഗ്ലീഷிலும் കൊറിയനിലും മികച്ച ഫലങ്ങളുടെ 0.016, 0.036 ഉള്ളിലുമാണ്. സഹായ വിശകലനത്തിൽ, ഇത് ആറ് ഭാഷാ ഉപവിഭാഗങ്ങളിലും സ്ഥിരമായ ഡിറ്റക്ഷനിലേക്ക് നയിക്കുന്നു, 0.80–0.93 സ്കോർ ചെയ്യുന്നു. പ്രതിഭാഷാ കാഴ്ച ഇംഗ്ലീഷിനപ്പുറമുള്ള നേട്ടങ്ങൾ കാണിക്കുന്നു.
അഞ്ച് സ്റ്റാൻഡേർഡ് ബെഞ്ച്മാർക്കുകളേക്കാൾ ഉയർന്ന ക്യാരക്ടർ F1 പ്രൈവസി ഫിൽട്ടറിനേക്കാൾ മികച്ചത്
അവസാന പരീക്ഷണം PII-TRACE-ന് പുറത്തേക്ക് നീങ്ങുന്നു. ai4privacy വാലിഡേഷൻ സ്പ്ലിറ്റ് (47,728 ഡോക്യുമെന്റുകൾ), Nemotron-PII ടെസ്റ്റ് സ്പ്ലിറ്റ് (100,000), ഒരു നിശ്ചിത സീഡ് SPY സെറ്റ് (8,688), Gretel PII ടെസ്റ്റ് സ്പ്ലിറ്റ് (5,000), TAB ECHR ടെസ്റ്റ് സ്പ്ലിറ്റ് (127) എന്നിവയിൽ ഞങ്ങൾ PII-Tracer ഉം OpenAI പ്രൈവസി ഫിൽട്ടറും പ്രവർത്തിപ്പിക്കുന്നു.

എല്ലാ ഡാറ്റാസെറ്റിലും PII-Tracer ഉയർന്ന ക്യാരക്ടർ F1 ഉണ്ട്: ai4privacy-ൽ 0.907-ന് എതിരായി 0.950, Nemotron-PII-ൽ 0.709-ന് എതിരായി 0.847, SPY-ൽ 0.543-ന് എതിരായി 0.585, Gretel PII-ൽ 0.895-ന് എതിരായി 0.952, TAB-ൽ 0.350-ന് എതിരായി 0.594. യഥാർത്ഥ, മനുഷ്യർ ലേബൽ ചെയ്ത ടെക്സ്റ്റിൽ നിന്ന് നിർമ്മിച്ച ഈ ഗ്രൂപ്പിലെ ഒരേയൊരു ബെഞ്ച്മാർക്ക് TAB ആണ്. അവിടെ, PII-Tracer 0.982 പ്രിസിഷനും 0.213 റീകോളും എതിരായി 0.986 പ്രിസിഷനും 0.425 റീകോളും നേടുന്നു - ഒരേ പ്രിസിഷനിൽ ഇരട്ടി റീകോൾ (വിശദാംശങ്ങൾ പേപ്പറിൽ). അതിനാൽ ഉയർന്ന F1 എന്നത് PII-TRACE സംഭാഷണങ്ങളിൽ നിന്ന് ഈ താരതമ്യത്തിലെ അഞ്ച് പരമ്പരാഗത സിംഗിൾ-റെക്കോർഡ് ബെഞ്ച്മാർക്കുകളിലേക്കും വ്യാപിക്കുന്നു.
ഉപസംഹാരം
ഹൈബ്രിഡ് AI ഉപയോക്താവിന്റെ ഉപകരണത്തെ ഇൻഫറൻസ് സ്റ്റാക്കിലേക്ക് സംയോജിപ്പിക്കുന്നു, ഇത് ശക്തമായ സ്വകാര്യതയും കുറഞ്ഞ ചെലവും വാഗ്ദാനം ചെയ്യുന്നു. ക്ലൗഡിലെ ഫ്രണ്ടിയർ മോഡലുകൾക്ക് ഗവേഷണം, ന്യായവാദം, ആസൂത്രണം എന്നിവ കൈകാര്യം ചെയ്യാൻ കഴിയും, അതേസമയം ലോക്കൽ മോഡലുകൾ ഉപകരണത്തിൽ തന്നെ തുടരേണ്ട ഫയലുകളിലും വ്യക്തിഗത ഡാറ്റയിലും പ്രവർത്തിക്കുന്നു. സെൻസിറ്റീവ് ഡാറ്റയൊന്നും ക്ലൗഡിലേക്ക് പോകുന്നതിന് മുമ്പ് സെൻസിറ്റീവ് വിവരങ്ങൾ തിരിച്ചറിയുന്നതിനെ ഈ വിഭജനം ആശ്രയിച്ചിരിക്കുന്നു.
മൾട്ടി-ടേൺ സംഭാഷണങ്ങളിലെ PII കണ്ടെത്താൻ രൂപകൽപ്പന ചെയ്ത ഒരു ഒതുക്കമുള്ള മോഡലാണ് PII-Tracer, അതേസമയം സംഭാഷണത്തിലുടനീളം ആവർത്തിച്ചുള്ള PII സ്ഥിരമായി തിരിച്ചറിയാൻ ഡിറ്റക്ടറുകൾക്ക് കഴിയുമോ എന്ന് PII-TRACE വിലയിരുത്തുന്നു.
മൾട്ടി-ടേൺ സംഭാഷണങ്ങളിലും മറ്റ് ലോംഗ്-കോൺടെക്സ്റ്റ് ക്രമീകരണങ്ങളിലും PII ഡിറ്റക്ഷൻ മുന്നോട്ട് കൊണ്ടുപോകുന്നതിനുള്ള ഒരു ബെഞ്ച്മാർക്കും റെഫറൻസ് മോഡലുമായി PII-TRACE ഉം PII-Tracer ഉം ഒരുമിച്ച് പ്രവർത്തിക്കുന്നു.
ഏജന്റുകൾ നീളമുള്ള ടാസ്ക്കുകൾ ഏറ്റെടുക്കുകയും കൂടുതൽ വ്യക്തിഗത കോൺടെക്സ്റ്റിൽ പ്രവർത്തിക്കുകയും ചെയ്യുന്നു. തൽഫലമായി, പ്രൈവസി നിയന്ത്രണങ്ങൾ പ്രാരംഘ ഇൻപുട്ട് മാത്രമല്ല, മുഴുവൻ സംഭാഷണത്തിലുടനീളം നിലനിൽക്കണം. സെൻസിറ്റീവ് കോൺടെക്സ്റ്റ് ഉപകരണത്തിൽ നിലനിർത്താൻ ഹൈബ്രിഡ് AI വിശ്വസനീയമായ ലോക്കൽ ഡിറ്റക്ഷനെ ആശ്രയിച്ചിരിക്കുന്നു.
PII-TRACE ബെഞ്ച്മാർക്ക്, PII-Tracer മോഡൽ, ഞങ്ങളുടെ വിലയിരുത്തൽ എന്നിവയെക്കുറിച്ചുള്ള വിശദാംശങ്ങൾക്ക് arXiv പേപ്പർ വായിക്കുക. PII-TRACE ഉം PII-Tracer ഉം ഉടൻ പുറത്തിറക്കാൻ ഞങ്ങൾ പദ്ധതിയിടുന്നു.