PII-TRACE: పరికరం నుండి నిష్క్రమించే ముందు వ్యక్తిగత డేటాను గుర్తించడం

స్థానికంగా అమలు చేయడానికి రూపొందించబడిన కాంపాక్ట్ 0.6B డిటెక్టర్‌తో జత చేయబడిన, సుదీర్ఘకాలిక సంభాషణల అంతటా స్థిరమైన PII డిటెక్షన్ కోసం 13-భాషల బెంచ్‌మార్క్.

రచయితలుPerplexity Secure Intelligence Institute

Hybrid compute on Mac క్లౌడ్‌లోని ఫ్రాంటియర్ మోడల్స్ మరియు Macలోని స్థానిక మోడల్ మధ్య Perplexity Computer టాస్క్‌లను విభజిస్తుంది. క్లౌడ్ ఏజెంట్లు పరిశోధన, తార్కికం మరియు ప్రణాళికను నిర్వహిస్తాయి, అయితే స్థానిక మోడల్ ప్రైవేట్ ఫైళ్లు మరియు సున్నితమైన సమాచారంతో పని చేస్తుంది.

ఈ సరిహద్దు పరికరం నుండి బయలుదేరే ముందు వ్యక్తిగతంగా గుర్తించదగిన సమాచారాన్ని (PII) గుర్తించడంపై ఆధారపడి ఉంటుంది. స్థానిక ప్రైవసీ గేట్ సున్నితమైన కంటెంట్‌ను Macలో ఉంచుతుంది, గుర్తించబడిన ప్రైవేట్ సమాచారాన్ని రెడాక్ట్ చేస్తుంది లేదా క్లౌడ్‌కు పంపే ముందు ఆమోదాన్ని అభ్యర్థిస్తుంది.

సుదీర్ఘమైన, బహుభాషా సంభాషణలలో డిటెక్షన్ కష్టమవుతుంది. వేర్వేరు టర్న్‌లలో అదే ఐడెంటిఫైయర్ అనేక సార్లు కనిపించవచ్చు. మిస్ అయిన ఒక ప్రస్తావన సిస్టమ్ రక్షించాలనుకునే సమాచారాన్ని బహిర్గతం చేయవచ్చు.

పరిచయం

నేడు, మేము PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), వ్యక్తిగతంగా గుర్తించదగిన సమాచార (PII) డిటెక్టర్లను మూల్యాంకనం చేయడానికి ఒక కొత్త బెంచ్‌మార్క్, మరియు PII డిటెక్షన్ కోసం 0.6B కాంపాక్ట్ మోడల్ అయిన PII-Tracerని పరిచయం చేస్తున్నాము.

క్లౌడ్-ఫర్ట్ ఏజెంట్లు వినియోగదారులు సందర్భం, మేధస్సు మరియు గోప్యతను బ్యాలెన్స్ చేయవలసి వస్తుంది. మరింత వ్యక్తిగత సందర్భం ఏజెంట్‌కు వినియోగదారుని అర్థం చేసుకోవడానికి మరియు మెరుగైన ఫలితాలను అందించడానికి సహాయపడుతుంది. కానీ ఈ సందర్భాన్ని అందించడం అంటే తరచుగా రిమోట్ సేవకు ప్రైవేట్ సమాచారాన్ని పంపడం మరియు వ్యక్తిగత సమాచారాన్ని లీక్ చేయవచ్చు. అసిస్టెంట్‌ను ఉపయోగకరంగా మార్చే సమాచారమే వినియోగదారు అత్యంత ప్రైవేట్‌గా ఉంచాలనుకునేది కావచ్చు.

Hybrid AI వినియోగదారు పరికరం మరియు క్లౌడ్ మోడల్స్ మధ్య పనిని విభజించడం ద్వారా ఈ ట్రేడ్‌ఆఫ్‌ను సులభతరం చేస్తుంది. కానీ రిమోట్ మోడల్‌కు టెక్స్ట్ పంపే ముందు పరికరం PIIని గుర్తించగలిగితేనే ఆ సరిహద్దు గోప్యతను రక్షిస్తుంది. వినియోగదారులు ప్రతి సందేశాన్ని స్వయంగా తనిఖీ చేయనవసరం లేదు. పరికరానికి దాని ప్రైవసీ గేట్‌గా స్థానిక PII డిటెక్టర్ అవసరం. సుదీర్ఘ సంభాషణలలో, అదే ఐడెంటిఫైయర్ టర్న్‌ల అంతటా పునరావృతమవ్వవచ్చు, మరియు వ్యక్తిగత సమాచారం గుండా వెళ్లడానికి మిస్ అయిన ఒక ప్రస్తావన చాలు.

ప్రైవసీ గేట్ వర్క్‌ఫ్లోను వివరించే రేఖాచిత్రం, సున్నితమైన డేటా స్థానిక పరికరంలో ఎలా ఉంటుందో చూపుతుంది, అయితే ఆమోదించబడిన అభ్యర్థనలు ప్రాసెసింగ్ కోసం క్లౌడ్ మోడల్‌లకు పంపబడతాయి.
హైబ్రిడ్ AIలో ప్రైవసీ గేట్‌గా PII-Tracer

Perplexity ఒక హైబ్రిడ్ లోకల్-సర్వర్ ఇన్ఫరెన్స్ ఆర్కెస్ట్రేటర్‌ను పరిచయం చేసింది, ఇది ఏ పని పరికరంలో రన్ కావాలి మరియు ఏ పని క్లౌడ్‌లోని ఏజెంట్లకు వెళ్లాని నిర్ణయిస్తుంది. మోడల్, ఏజెంట్ హార్నెస్, సంభాషణలు మరియు ఎగ్జిక్యూషన్ ట్రాజెంటరీలు అన్నీ వినియోగదారు యంత్రంలో నివసిస్తాయి. వెలుపలి ప్రపంచానికి యాక్సెస్ అవసరమైన టాస్క్‌లు అవసరమైనప్పుడు మాత్రమే పిలువబడతాయి మరియు వినియోగదారు అనుమతి ద్వారా గేట్ చేయబడతాయి. ఫలితంగా, వినియోగదారు ఆమోదించే వరకు, ఆ కంటెంట్ పరికరంలోనే ఉంటుంది.

PIIగా προβλεπόμενα spans ని గుర్తించడం ద్వారా మోడల్ రూటింగ్ కోసం PII-Tracer ఒక స్థానిక నియంత్రణ సిగ్నల్‌ను అందిస్తుంది. అప్లికేషన్ ఆపై రూటింగ్ విధానాన్ని అమలు చేస్తుంది. ఇది సంబంధిత ఇన్‌పుట్‌ను స్థానికంగా ఉంచుతుంది, గుర్తించబడిన స్పాన్‌లను రెడాక్ట్ చేస్తుంది లేదా క్లౌడ్ మోడల్‌కు వెళ్లే ముందు స్పష్టమైన ఆమోదాన్ని అభ్యర్థిస్తుంది. ఇది రూటింగ్‌ను మరింత ఎంపిక చేసుకునేలా చేస్తుంది. గుర్తించబడిన PII పరికరంలోనే ఉంటుంది, అయితే ఆమోదించబడిన సందర్భం ఇప్పటికీ ఫ్రాంటియర్ క్లౌడ్ మోడల్‌ల ప్రయోజనాన్ని పొందుతుంది.

సెలెక్టివ్ రూటింగ్ మొత్తం సంభాషణ అంతటా స్థిరమైన డిటెక్షన్‌పై ఆధారపడి ఉంటుంది. అదే ఐడెంటిఫైయర్ టర్న్‌ల అంతటా పునరావృతమవ్వవచ్చు, మరియు మిస్ అయిన ప్రస్తావన ఇప్పటికీ ప్రసారం చేయబడవచ్చు.

12 డిటెక్టర్లలో, PII-Tracer అత్యధిక క్యారెక్టర్ F1 మరియు పునరావృత ఐడెంటిఫైయర్‌ల అత్యధిక స్థిరమైన కవరేజ్‌ను రికార్డ్ చేస్తుంది. రెండు ఫలితాలు ఎందుకు ముఖ్యమో బెంచ్‌మార్క్ వివరిస్తుంది: సుదీర్ఘ సంభాషణలో, చాలా PIIని కనుగొనడం అంటే దాని ప్రతి కాపీని కనుగొనడం కాదు.

హైబ్రిడ్ AIలో PII డిటెక్షన్ కొత్త సవాళ్లను ఎదుర్కొంటుంది

PII డిటెక్షన్ అనేది దీర్ఘకాలిక భద్రతా సమస్య, మరియు అనేక బెంచ్‌మార్క్‌లు మరియు డిటెక్టర్లు ఇప్పటికే ఉన్నాయి. అయినప్పటికీ, హైబ్రిడ్ AI సెట్టింగ్‌లలో PII డిటెక్షన్ కొత్త సవాళ్లను పరిచయం చేస్తుంది. ప్రత్యేకించి, డిటెక్టర్లు సుదీర్ఘమైన, బహుళ-టర్న్ సంభాషణలలో PIIని గుర్తించాలి, ఇక్కడ సంభాషణ సందర్భం ఒక స్ట్రింగ్ PIIగా పరిగణించబడాలా వద్దా అని నిర్ణయిస్తుంది. ఉదాహరణకు, ఒక పేరు ఒక సంభాషణలో వినియోగదారుని గుర్తించవచ్చు, మరొక సంభాషణలో పబ్లిక్ ఫిగర్‌ను సూచించవచ్చు లేదా అసిస్టెంట్ ద్వారా ఉత్పత్తి చేయబడిన ప్లేస్‌హోల్డర్ కావచ్చు. ఒక స్ట్రింగ్‌ను PIIగా ఫ్లాగ్ చేయాలా వద్దా అని నిర్ణయించడానికి ఉపరితల రూపం మాత్రమే సరిపోదు.

అసిస్టెంట్ అనేక టర్న్‌లలో వినియోగదారు పేరు, ఫోన్ నంబర్, అపాయింట్‌మెంట్ వివరాలు మరియు ఇమెయిల్ చిరునామాను నిలుపుకోవడాన్ని ఒక చాట్ ఇంటర్‌ఫేస్ చూపుతుంది.
ఒక పేరు, ఫోన్ నంబర్ మరియు ఇమెయిల్ చిరునామా సంభాషణ అంతటా పునరావృతమవుతాయి. ప్రతి ప్రస్తావన కనుగొనబడితే మాత్రమే PII-TRACE ఒక ఐడెంటిఫైయర్‌ను స్థిరంగా గుర్తించబడినట్లు లెక్కిస్తుంది.

ఇప్పటికే ఉన్న PII డిటెక్టర్లు మరియు బెంచ్‌మార్క్‌లు ప్రాథమికంగా వ్యక్తిగత రికార్డులను లక్ష్యంగా చేసుకుంటాయి. ఒక సమయంలో ఒక రికార్డును ప్రాసెస్ చేయడానికి రూపొందించబడిన డిటెక్టర్లు సుదీర్ఘమైన, సంక్లిష్టమైన సంభాషణలపై పేలవంగా పనిచేస్తాయని మేము కనుగొన్నాము. అలాగే, ఇప్పటికే ఉన్న బెంచ్‌మార్క్‌లు సాధారణంగా టర్న్‌ల అంతటా స్థిరత్వాన్ని మూల్యాంకనం చేయవు. ఫలితంగా, ఈ బెంచ్‌మార్క్‌లపై బలమైన పనితీరు దీర్ఘకాలిక, బహుళ-టర్న్ సంభాషణలలో ప్రభావవంతమైన PII డిటెక్షన్‌కు అవసరంగా అనువదించబడదు.

PII-TRACE: డిప్లాయ్‌మెంట్-క్రిటికల్ PII డిటెక్షన్ కోసం ఒక బెంచ్‌మార్క్

అసిస్టెంట్ సంభాషణలపై PII డిటెక్టర్ ఉపయోగించినప్పుడు ముఖ్యం అయిన మూడు ప్రవర్తనల చుట్టూ మేము PII-TRACEని设计 చేశాము. మొదటిది consistent coverage: ఒక ఐడెంటిఫైయర్ అనేక సార్లు కనిపించినప్పుడు లేదా యూజర్ మరియు అసిస్టెంట్ టర్న్‌లను దాటినప్పుడు, డిటెక్టర్ ప్రతి ప్రస్తావనను కనుగొనాలి. రెండవది robustness to long context: సంభాషణలు 1,000 కంటే తక్కువ నుండి 100,000 క్యారెక్టర్ల కంటే ఎక్కువ ఉంటాయి, చరిత్ర పెరిగే కొద్దీ ఏమి జరుగుతుందో కొలవడాన్ని సాధ్యం చేస్తుంది. మూడవది multiple languages and mixed-format contentని నిర్వహించడం: ఒక సంభాషణ భాషలను మార్చవచ్చు మరియు కోడ్, పట్టికలు లేదా స్ట్రక్చర్డ్ రికార్డులతో ప్రోస్‌ను మిళితం చేయవచ్చు. PII-TRACE ప్రతి పూర్తి డైలాగ్‌ను ఒంటరి రికార్డులుగా విభజించడానికి బదులుగా మూల్యాంకనం చేయడం ద్వారా ఈ నమూనాలను సంరక్షిస్తుంది.

బెంచ్‌మార్క్ రెండు పూరక స్థాయిలలో పనితీరును కొలుస్తుంది. ఐడెంటిఫైయర్ స్థాయిలో, consistent detection మరింత కఠినమైన ప్రశ్నను అడుగుతుంది: డిటెక్టర్ అదే ఐడెంటిఫైయర్ యొక్క ప్రతి ప్రస్తావనలోని ప్రతి క్యారెక్టర్‌ను కవర్ చేసిందా? బహుళ ప్రస్తావనలు ఉన్న ఐడెంటిఫైయర్‌ల కోసం మరియు టర్న్‌ల అంతటా పునరావృతమయ్యే ఐడెంటిఫైయర్‌ల కోసం మేము ఈ స్కోర్‌ను విడిగా నివేదిస్తాము. క్యారెక్టర్ స్థాయిలో, డిటెక్టర్ ద్వారా గుర్తించబడిన టెక్స్ట్ ఎంతవరకు PIIగా లేబుల్ చేయబడిందో ప్రెసిషన్ కొలుస్తుంది, అది ఎంత లేబుల్ చేయబడిన PIIని కనుగొంటుందో రీకాల్ కొలుస్తుంది మరియు F1 రెండింటినీ బ్యాలెన్స్ చేస్తుంది.

PII-TRACE 13 భాషలు మరియు 10 రైటింగ్ సిస్టమ్‌లలో 13,148 సింథటిక్ యూజర్-అసిస్టెంట్ సంభాషణలను కలిగి ఉంది, తొమ్మిది PII రకాల అంతటా క్యారెక్టర్ స్థాయిలో 37,431 ఐడెంటిఫైయర్ ప్రస్తావనలు లేబుల్ చేయబడ్డాయి. మొత్తం 41% సంభాషణలు స్ట్రక్చర్డ్ కంటెంట్‌ను కలిగి ఉన్నాయి. లేబుల్ చేయబడిన PIIతో కూడిన 5,645 సంభాషణలలో, 63.8% ఒకటి కంటే ఎక్కువసార్లు కనిపించే ఐడెంటిఫైయర్‌ను కలిగి ఉన్నాయి మరియు 28.7% బహుళ టర్న్‌లలో కనిపించే ఐడెంటిఫైయర్‌ను కలిగి ఉన్నాయి.

ప్రొడక్షన్ సంభాషణల నుండి సింథటిక్ డేటాసెట్‌ను నిర్మించడం

PII-TRACE అసలు వాటిని ప్రచురించకుండా సోర్స్ సంభాషణల టర్న్ స్ట్రక్చర్‌ను సంరక్షిస్తుంది. పైప్‌లైన్ ప్రతి టర్న్‌ను రీరైట్ చేస్తుంది మరియు లేబుల్ చేయబడిన ప్రతి ఐడెంటిఫైయర్‌ను సింథటిక్ విలువతో భర్తీ చేస్తుంది.

టెంప్లేటింగ్, పారాఫ్రేజింగ్, స్థిరమైన సింథటిక్ విలువలతో భర్తీ చేయడం మరియు ధ్రువీకరణ తనిఖీల ద్వారా PII-TRACE లేబుల్ చేయబడిన ప్రొడక్షన్ సంభాషణలను సింథటిక్ డేటాసెట్‌లుగా ఎలా మారుస్తుందో చూపే రేఖాచిత్రం.
IPII-TRACE లేబుల్ చేయబడిన సోర్స్ టెక్స్ట్‌ను టెంప్లేట్‌గా మారుస్తుంది, ప్రతి టర్న్‌ను రీరైట్ చేస్తుంది, స్థిరమైన సింథటిక్ విలువలను చొప్పిస్తుంది మరియు ఫలితంపై విడుదల తనిఖీలను రన్ చేస్తుంది.

మొదట, బహుళ భాషా మోడల్స్ ప్రొడక్షన్ యూజర్-అసిస్టెంట్ సంభాషణలలో తొమ్మిది రకాల PIIని గుర్తಿಸುತ್ತాయి. రూల్-బేస్డ్ పాస్ ఒకే రకానికి చెందిన పునరావృత ఐడెంటిఫైయర్‌లను ఒక ఎంటిటీ ID క్రింద సమూహం చేస్తుంది. గుర్తించబడిన ప్రతి విలువ ఆపై టైప్ చేయబడిన ప్లేస్‌హోల్డర్‌తో భర్తీ చేయబడుతుంది, టర్న్ ఆర్డర్, PII రకం మరియు ప్రస్తావనల మధ్య లింక్‌లను ఉంచే టెంప్లేట్‌ను వదిలివేస్తుంది కానీ గుర్తించబడిన అసలు విలువలు ఏవీ ఉండవు.

సిస్టమ్ ఆ ప్లేస్‌హోల్డర్‌లను అలాగే ఉంచుతూ ప్రతి టర్న్‌ను పారాఫ్రేజ్ చేస్తుంది, ఆపై ఐడెంటిఫైయర్ రకం మరియు ఫార్మాట్‌తో సరిపోలే సింథటిక్ విలువలను చొప్పిస్తుంది. పునరావృత ప్రస్తావనలు ఒక సంభాషణలో అదే విలువను అందుకుంటాయి, అయితే వేర్వేరు సంభాషణలు స్వతంత్రంగా उत्पन्न చేయబడిన విలువలను ఉపయోగిస్తాయి. చివరి అలైన్‌మెంట్ పాస్ ప్రతి క్యారెక్టర్ ఆఫ్‌సెట్‌ను మళ్లీ లెక్కిస్తుంది.

భర్తీలు నిల్వ చేయబడిన స్పాన్‌లతో సరిపోలుతున్నాయని, పునరావృత ప్రస్తావనలు అదే విలువను ఉపయోగిస్తాయని మరియు గుర్తించబడిన మూల విలువలు Presidio మరియు రెగ్యులర్-ఎక్స్‌ప్రెషన్ రీస్కాన్ కింద లేవని మూడు ఆటోమేటెడ్ గేట్లు తనిఖీ చేస్తాయి. నిల్వ చేయబడిన ఆఫ్‌సెట్ కూడా ఖచ్చితమైన సింథటిక్ సబ్‌స్ట్రింగ్‌ను పునరుద్ధరించాలి. విఫలమయ్యే రికార్డులు పునరుత్పత్తి చేయబడతాయి లేదా తొలగించబడతాయి. రెండవ భాషా మోడల్ నమూనాను ఆడిట్ చేస్తుంది మరియు అది PIIగా గుర్తించే దేనినైనా మానవులు సమీక్షిస్తారు.

PII-Tracer: స్థానిక ఉపయోగం కోసం ఒక కాంపాక్ట్ డిటెక్టర్

PII-Tracer అనేది Qwen3 బ్యాక్‌బోన్ నుండి స్వీకరించబడిన 0.6B బైడైరెక్షనల్ ఎన్కోడರ್. ప్రైవసీ స్క్రీనింగ్ అనేది టెక్స్ట్ జనరేషన్ భిన్నంగా ఉంటుంది మరియు సంబంధిత PII స్పాన్‌లను కనుగొని వాటి సరిహద్దులను తిరిగి ఇవ్వడం అవసరం. ఫలితంగా, PII-Tracer Qwen3 యొక్క కాజల్ మాస్క్‌ను పాడింగ్-అవేర్ బైడైరెక్షనల్ అటెన్షన్‌తో భర్తీ చేస్తుంది, కాబట్టి ప్రతి టోకెన్ 4,096-టోకెన్ విండోలోని మునుపటి మరియు తరువాతి టర్న్‌ల నుండి గీయవచ్చు.

ప్రతి టోకెన్ కోసం, ఎన్కోడర్ 1,024-డైమెన్షనల్ ప్రాతినిధ్యాన్ని ఉత్పత్తి చేస్తుంది. లీనియర్ ట్యాగింగ్ హెడ్ 37 సాధ్యమయ్యే లేబుళ్లకు స్కోర్‌లను ఉత్పత్తి చేస్తుంది: PII స్పాన్ వెలుపల ఉన్న టెక్స్ట్ కోసం ఒక ప్రత్యేక లేబుల్ (దీన్ని సూచಿಸಲು మేము Oని ఉపయోగిస్తాము), అలాగే తొమ్మిది PII రకాలలో ప్రతిదానికీ నాలుగు స్పాన్-పొజిషన్ లేబుళ్లు. నేమ్డ్ ఎంటిటీ రికగ్నిషన్ కోసం BIOES స్కీమ్‌లో, B (Beginning), I (Inside), మరియు E (End) బహుళ-టోకెన్ స్పాన్‌ను సూచిస్తాయి, అయితే S (Single) ఒక-టోకెన్ స్పాన్‌ను సూచిస్తుంది. ఆరోగ్య లేదా మతపరమైన సమాచారం వంటి సంభాషణలో సున్నితమైన మెటీరియల్ ఉందా లేదా అని సహాయక హెడ్ కూడా అంచనా వేస్తుంది.

బహుభాషా అసిస్టెంట్ సంభాషణలను একক-రికార్డ్ ఉదాహరణలతో మిళితం చేస్తూ సుమారు 714,000 శిక్షణ నమూనాలపై మేము PII-Tracerకి మూడు ఎపోక్‌ల కోసం శిక్షణ ఇస్తాము. భాగస్వామ్య బైడైరెక్షనల్ ఎన్కోడర్ రెండు శిక్షణ హెడ్‌లను కలిగి ఉంది: PII స్పాన్‌లను గుర్తించి టైప్ చేసే 37-క్లాస్ BIOES టోకెన్ హెడ్, మరియు సంభాషణలో సున్నితమైన మెటీరియల్ ఉందా లేదా అని అంచనా వేసే బైనరీ సంభాషణ-స్థాయి హెడ్. L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}} ఉపయోగించి మేము రెండు హెడ్‌లను ఉమ్మడిగా శిక్షణ ఇస్తాము. ఇక్కడ, Ltag\mathcal{L}_{\mathrm{tag}} అరుదైన PII లేబుళ్లకు ఎక్కువ బరువును ఇస్తుంది తద్వారా తరచుగా ఉండే `O` లేబుల్ ఆధిపత్యం చెలాయించదు, అయితే Lsens\mathcal{L}_{\mathrm{sens}} సంభాషణ-స్థాయి శిక్షణ సిగ్నల్‌ను అందిస్తుంది; 1.5 మరియు 0.3 గుణకాలు స్పాన్ డిటెక్షన్‌ను ప్రధాన టాస్క్‌గా ఉంచుతాయి. ఈ సహాయక సిగ్నల్ context-aware డిటెక్షన్‌ను బలపరుస్తుంది: మోడల్ ఒంటరి స్ట్రింగ్‌గా కాకుండా సంభాషణలోని అభ్యర్థి స్పాన్‌ను అంచనా వేయడం నేర్చుకుంటుంది, రీకాల్‌లో కేవలం చిన్న ట్రేడ్‌ఆఫ్‌తో ఫాల్స్ పాజిటివ్‌లను తగ్గించడంలో సహాయపడుతుంది.

ఇన్ఫరెన్స్ సమయంలో, పరిమితం చేయబడిన Viterbi decoder ప్రతి టోకెన్‌ను స్వతంత్రంగా లేబుల్ చేయడానికి బదులుగా అత్యధిక స్కోర్ సాధించిన చెల్లుబాటు అయ్యే BIOES సీక్వెన్స్ కోసం శోధిస్తుంది. ఉదాహరణకు, B-private_person అనేది I-private_personతో కొనసాగవచ్చు లేదా E-private_personతో ముగియవచ్చు, కానీ I-private_emailకి మారదు. డికోడర్ ఫలితాన్ని రెడాక్షన్ లేదా లోకల్ రూటింగ్ కోసం ఖచ్చితమైన క్యారెక్టర్ స్పాన్‌లకు మ్యాప్ చేస్తుంది.

క్యారెక్టర్ F1 మరియు పునరావృత PIIపై PII-Tracer లీడ్స్

మేము డిటెక్టర్లను క్యారెక్టర్ మరియు స్పాన్ స్థాయిలలో పోల్చుతాము. క్యారెక్టర్ F1 డిటెక్షన్‌ను క్యారెక్టర్ వారీగా అంచనా వేస్తుంది. స్పాన్-ఓవర్‌లాప్ F1 అనేది డిటెక్టర్ ఏదైనా PII అంశం యొక్క భాగాన్ని గుర్తిస్తుందా లేదా అని కొలుస్తుంది, అయితే స్పాన్-కంటైన్మెంట్ F1 అది మొత్తం అంశాన్ని క్యాప్చర్ చేస్తుందో లేదో కొలుస్తుంది.

మూల్యాంకనం చేయబడిన 12 సిస్టమ్‌లలో PII-Tracer అత్యధిక క్యారెక్టర్ F1 (0.629) సాధించింది, మరియు రెండవ అత్యధిక స్పాన్-ఓవర్‌లాప్ F1 మరియు స్పాన్-కంటైన్మెంట్ F1 సాధించింది. ఫ్రాంటియర్ మోడల్స్, అనగా GPT-5.6-sol మరియు క్లాడ్ సోనెట్ 5, పోల్చదగిన మొత్తం పనితీరును సాధించాయి. GPT-5.6-sol రెండు స్పాన్-స్థాయి F1 మెట్రిక్‌లపై అధిక స్కోర్‌లను పొందింది, కానీ తక్కువ క్యారెక్టర్ F1ని పొందింది. అయినప్పటికీ, ఈ ఫ్రాంటియర్ మోడల్స్ వందల బిలియన్ల లేదా ట్రిలియన్ల పారామీటర్లను కలిగి ఉన్నాయి మరియు క్లౌడ్‌లో హోస్ట్ చేయబడిన క్లోజ్డ్-సోర్స్ మోడల్స్. ఫలితంగా, స్క్రీన్ చేయని టెక్స్ట్ స్థానికంగా ఉండవలసిన హైబ్రిడ్ AI సెట్టింగ్‌లలో సున్నితమైన స్థానిక డేటాను రక్షించడానికి ఇవి సరిపోవు. దీనికి విరుద్ధంగా, PII-Tracer కేవలం 0.6B పారామీటర్లతో ఫ్రాంటియర్-సమీప స్పాన్-స్థాయి డిటెక్షన్‌ను అందిస్తుంది మరియు స్క్రీన్ చేయని టెక్స్ట్ పూర్తిగా స్థానికంగా ప్రాసెస్ చేయగలదు. ఇతర ఓపెన్-సోర్స్ PII డిటెక్టర్లు PII-Tracer కంటే గణనీయంగా అధ్వాన్నంగా పనిచేస్తాయి.

12 PII-డిటెక్షన్ సిస్టమ్‌లను పోల్చే మూడు bar charts. PII-Tracer 0.6B క్యారెక్టర్ F1లో మొదటి స్థానంలో మరియు GPT-5.6-sol తర్వాత స్పాన్-ఓవర్‌లాప్ మరియు స్పాన్-కంటైన్మెంట్ F1లో రెండవ స్థానంలో నిలిచింది.
పన్నెండు సిస్టమ్‌ల అంతటా క్యారెక్టర్ F1, స్పాన్-ఓవర్‌లాప్ F1 మరియు స్పాన్-కంటైన్మెంట్ F1.

ప్రతి పునరావృత ప్రస్తావనను కనుగొనడం

స్థిరత్వ ప్రయోగం అదే అంచనాలకు మరింత కఠినమైన పరీక్షను వర్తిస్తుంది. టెస్ట్ సెట్‌లో ఒకసారి కనిపించే 899 ఐడెంటిఫైయర్‌లు మరియు ఒకటి కంటే ఎక్కువసార్లు కనిపించే 959 ఐడెంటిఫైయర్‌లు ఉన్నాయి; పునరావృత ఐడెంటిఫైయర్‌లలో 790 బహుళ టర్న్‌లను విస్తరించాయి. ఈ చిత్రం నాలుగు ప్రస్తావన-గణన బకెట్‌లను (ఒకటి, రెండు, మూడు నుండి ఐదు మరియు ఆరు నుండి పది) నివేదిస్తుంది మరియు దాని లేబుల్ చేయబడిన క్యారెక్టర్లన్నీ కనుగొనబడినప్పుడు మాత్రమే ఐడెంటిఫైయర్‌ను లెక్కిస్తుంది. ఇది ఎంచుకున్న మూడు బేస్‌లైన్‌లతో PII-Tracerని ప్లాట్ చేస్తుంది, అయితే అగ్రిగేట్ టేబుల్ పన్నెండు సిస్టమ్‌లకూ పునరావృత మరియు క్రాస్-టర్న్ స్కోర్‌లను నివేదిస్తుంది.

ప్రతి ప్రస్తావన-గణన సమూహాలలో GPT-5.6-sol, GLiNER2-PII మరియు Claude Opus 4.8 కంటే PII-Tracer పునరావృత ఐడెంటిఫైయర్‌ల ప్రతి ప్రస్తావనను మరింత స్థిరంగా కనుగొంటుందని చూపే లైన్ చార్ట్, ఒక ప్రస్తావనకు 91.7% నుండి 6–10 ప్రస్తావనలకు 69.1%కి తగ్గుతుంది.
ప్రతి ప్రస్తావన కనుగొనబడిన ఐడెంటిఫైయర్‌ల వాటా. PII-Tracer అన్ని నాలుగు పోలిక బకెట్లలో ముందంజలో ఉంది.

పునరావృతం పెరిగినప్పుడు PII-Tracer ముందుంటుంది: దీని స్కోర్ ఒక ప్రస్తావనకు 0.917 నుండి రెండింటికి 0.873కి, మూడు నుండి ఐదు వరకు 0.794కి మరియు ఆరు నుండి పది వరకు 0.691కి మారుతుంది. చివరి బకెట్‌లో, GPT-5.6-sol 0.464కి చేరుకుంటుంది, అయితే GLiNER2-PII మరియు Claude Opus 4.8 0.073 మరియు 0.045కి చేరుకుంటాయి. పూర్తి మూల్యాంకనంలో, PII-Tracer 79.4% పునరావృత ఐడెంటిఫైయర్‌లు మరియు 77.6% క్రాస్-టర్న్ ఐడెంటిఫైయర్‌ల ప్రతి ప్రస్తావనను కనుగొంటుంది; అదే రెండు కొలతలపై GPT-5.6-sol 57.0% మరియు 55.1%కి చేరుకుంటుంది.

సుదీర్ఘ సంభాషణలను కవర్ చేయడం

మేము మొదట అన్ని 1,922 టెస్ట్ సంభాషణలను క్యారెక్టర్ పొడవు వారీగా సమూహం చేస్తాము మరియు 4,096-టోకెన్ విండోతో PII-Tracerని డీకోడ్ చేస్తాము. సమూహాలలో 1,000 క్యారెక్టర్ల కంటే తక్కువ ఉన్న 167 సంభాషణలు, 1,000 నుండి 10,000 వరకు ఉన్న 1,292 సంభాషణలు మరియు 10,000 లేదా అంతకంటే ఎక్కువ ఉన్న 463 సంభాషణలు ఉన్నాయి.

సంభాషణ పొడవు వారీగా PII-Tracer పనితీరు యొక్క సమూహ bar chart. 1,000–10,000-క్యారెక్టర్ సంభాషణల కోసం F1 67.0% వద్ద గరిష్ట స్థాయికి చేరుకుంటుంది, అయితే రీకాల్ 1,000 క్యారెక్టర్ల కంటే తక్కువ ఉన్న సంభాషణల కోసం 97.5% నుండి 10,000 కంటే ఎక్కువ ఉన్న వాటికి 68.7%కి తగ్గుతుంది.
సంభాషణ పొడవు వారీగా క్యారెక్టర్ ప్రెసిషన్, రీకాల్ మరియు F1

సింగిల్-విండో రీకాల్ 1,000 క్యారెక్టర్ల కంటే తక్కువ వద్ద 0.975 మరియు 1,000 నుండి 10,000 వరకు 0.955, కానీ 10,000 క్యారెక్టర్లు లేదా అంతకంటే ఎక్కువ ఉన్న సంభాషణలకు 0.687కి పడిపోతుంది. ప్రెసిషన్ రెండు పొడవైన సమూహాలలో 0.51 వద్ద ఉంటుంది, ఇది ప్రధాన సమస్యగా ఇన్‌పుట్ కవరేజ్‌ను సూచిస్తుంది.

ఇన్‌పుట్ హ్యాండ్లింగ్ ప్రభావాన్ని అధ్యయనం చేయడానికి, మేము 50%-ఓవర్‌లాప్ స్లైడింగ్-విండో డీకోడింగ్‌తో అదే చెక్‌పాయింట్‌ను మూల్యాంకనం చేస్తాము. ఇది పునర్శిక్షణ లేకుండా, మొత్తం క్యారెక్టర్ రీకాల్‌ను 0.830 నుండి 0.965కి మరియు బహుళ-ప్రస్తావన స్థిరమైన డిటెక్షన్‌ను 0.794 నుండి 0.954కి పెంచుతుంది.

భాషల అంతటా స్థిరంగా ఉంటుంది

PII-TRACE 13 భాషలను కవర్ చేస్తుంది; భాషా ప్రయోగం లాటిన్, సిరిలిక్ మరియు హంగుల్ స్క్రిప్ట్‌లను విస్తరించే ఆరు-భాషల స్లైస్‌ను నివేదిస్తుంది: ఇంగ్లీష్, జర్మన్, ఫ్రెంచ్, ఇటాలియన్, రష్యన్ మరియు కొరియన్. మేము ప్రతి భాషలోని అన్ని టెస్ట్ సంభాషణలపై అదే 12 డిటెక్టర్లను రన్ చేస్తాము. ప్రతి భాషలో, మేము ఊహించిన మరియు గోల్డ్ క్యారెక్టర్లను పూల్ చేస్తాము మరియు క్యారెక్టర్ F1ని గణిస్తాము.

ఇంగ్లీష్, జర్మన్, ఫ్రెంచ్, ఇటాలియన్, రష్యన్ మరియు కొరియన్ అంతటా 12 PII-డిటెక్షన్ సిస్టమ్‌ల కోసం క్యారెక్టర్ F1 స్కోర్‌లను పోల్చే హీట్‌మ్యాప్. PII-Tracer జర్మన్, ఫ్రెంచ్, ఇటాలియన్ మరియు రష్యన్ భాషలలో ముందంజలో ఉంది, ఆరు భాషలన్నింటిలోనూ స్థిరంగా బలమైన ఫలితాలను ఇస్తుంది.
లాటిన్, సిరిలిక్ మరియు హంగుల్ స్క్రిప్ట్‌లను కవర్ చేస్తూ, PIIని కలిగి ఉన్న ఆరు భాషా ఉపసమితులపై క్యారెక్టర్ F1.

PII-Tracer ఆరు భాషలలో నాలుగింటిలో క్యారెక్టర్ F1లో ముందంజలో ఉంది: జర్మన్ (0.735), ఫ్రెంచ్ (0.633), ఇటాలియన్ (0.676) మరియు రష్యన్ (0.651), మరియు ఇంగ్లీష్ మరియు కొరియన్‌లో ఉత్తమ ఫలితాలకు 0.016 మరియు 0.036 లోపు ఉంది. సహచర విశ్లేషణలో, ఇది ఆరు భాషా ఉపసమితులన్నింటిలో స్థిరమైన డిటెక్షన్‌కు దారితీస్తుంది, 0.80–0.93 స్కోర్ చేస్తుంది. ప్రతి-భాషా వీక్షణ ఇంగ్లీష్ దాటి లాభాలను చూపుతుంది.

ఐదు ప్రామాణిక బెంచ్‌మార్క్‌లపై ప్రైవసీ ఫిల్టర్ కంటే అధిక క్యారెక్టర్ F1

చివరి ప్రయోగం PII-TRACE వెలుపలకు వెళ్తుంది. మేము ai4privacy ధ్రువీకరణ విభజన (47,728 పత్రాలు), Nemotron-PII పరీక్ష విభజన (100,000), స్థిరమైన సీడ్ SPY సెట్ (8,688), Gretel PII పరీక్ష విభజన (5,000) మరియు TAB ECHR పరీక్ష విభజన (127)పై PII-Tracer మరియు OpenAI ప్రైవసీ ఫిల్టర్‌ను రన్ చేస్తాము.

ఐదు బాహ్య బెంచ్‌మార్క్‌లలో OpenAI ప్రైవసీ ఫిల్టర్ F1తో PII-Tracer యొక్క ప్రెసిషన్, రీకాల్ మరియు క్యారెక్టర్ F1ని పోల్చే సమూహ bar chart. PII-Tracer ప్రతి బెంచ్‌మార్క్‌లో అధిక F1 స్కోర్‌ను సాధిస్తుంది.
వర్గ పేర్లు సరిపోలాల్సిన అవసరం లేకుండా స్కోర్ చేయబడిన ఐదు బాహ్య PII బెంచ్‌మార్క్‌లపై క్యారెక్టర్-స్థాయి ఫలితాలు. గ్రే బార్లు అదే మూల్యాంకనం క్రింద OpenAI ప్రైవసీ ఫిల్టర్‌ను చూపుతాయి.

PII-Tracer ప్రతి డేటాసెట్‌లో అధిక క్యారెక్టర్ F1ని కలిగి ఉంది: ai4privacyపై 0.950 వర్సెస్ 0.907, Nemotron-PIIపై 0.847 వర్సెస్ 0.709, SPYపై 0.585 వర్సెస్ 0.543, Gretel PIIపై 0.952 వర్సెస్ 0.895 మరియు TABపై 0.594 వర్సెస్ 0.350. ఈ బృందంలో నిజమైన, మానవ-లేబుల్ చేయబడిన టెక్స్ట్ నుండి నిర్మించబడిన एकमात्र బెంచ్‌మార్క్ TAB. అక్కడ, PII-Tracer 0.986 వర్సెస్ 0.982 ప్రెసిషన్ మరియు 0.425 వర్సెస్ 0.213 రీకాల్‌ను చేరుకుంటుంది—సరిగ్గా అదే ప్రెసిషన్ వద్ద రెట్టింపు రీకాల్ (వివరాలు పేపర్‌లో ఉన్నాయి). అందువల్ల అధిక F1 ఈ పోలికలోని PII-TRACE సంభాషణల నుండి ఐదు సాంప్రదాయ సింగిల్-రికార్డ్ బెంచ్‌మార్క్‌లకు బదిలీ చేయబడుతుంది.

ముగింపు

హైబ్రిడ్ AI వినియోగదారు పరికరాన్ని ఇన్ఫరెన్స్ స్టాక్‌లో ఏకీకృతం చేస్తుంది, బలమైన గోప్యతను మరియు తక్కువ ఖర్చును అందిస్తుంది. క్లౌడ్‌లోని ఫ్రాంటియర్ మోడల్స్ పరిశోధన, తార్కికం మరియు ప్రణాళికను నిర్వహించగలవు, అయితే స్థానిక మోడల్స్ పరికరంలో ఉండవలసిన ఫైళ్లు మరియు వ్యక్తిగత డేటాతో పని చేస్తాయి. ఈ విభజన ఏవైనా సున్నితమైన డేటా క్లౌడ్‌కు వెళ్లే ముందు సున్నితమైన సమాచారాన్ని గుర్తించడంపై ఆధారపడి ఉంటుంది.

PII-Tracer అనేది బహుళ-టర్న్ సంభాషణలలో PIIని గుర్తించడానికి ఒక కాంపాక్ట్ మోడల్, అయితే PII-TRACE డిటెక్టర్లు సంభాషణ అంతటా పునరావృతమయ్యే PIIని స్థిరంగా గుర్తించగలవా అని మూల్యాంకనం చేస్తుంది.

కలిసి, PII-TRACE మరియు PII-Tracer బహుళ-టర్న్ సంభాషణలు మరియు ఇతర లాంగ్-కాంటెక్స్ట్ సెట్టింగ్‌లలో PII డిటెక్షన్‌ను ముందుకు తీసుకెళ్లడానికి ఒక బెంచ్‌మార్క్ మరియు రిఫరెన్స్ మోడల్‌ను అందిస్తాయి.

ఏజెంట్లు ఎక్కువ టాస్క్‌లను స్వీకరిస్తున్నాయి మరియు మరింత వ్యక్తిగత సందర్భంతో పని చేస్తున్నాయి. ఫలితంగా, గోప్యతా నియంత్రణలు ప్రారంభ ఇన్‌పుట్ మాత్రమే కాకుండా, మొత్తం సంభాషణ అంతటా ఉండాలి. సున్నితమైన సందర్భాన్ని పరికరంలో ఉంచడానికి హైబ్రిడ్ AI నమ్మదగిన స్థానిక డిటెక్షన్‌పై ఆధారపడి ఉంటుంది.

PII-TRACE బెంచ్‌మార్క్, PII-Tracer మోడల్ మరియు మా మూల్యాంకనం గురించిన వివరాల కోసం Read the arXiv paper చదవండి. మేము త్వరలో PII-TRACE మరియు PII-Tracer రెండింటినీ విడుదల చేయాలని திட்டமிட்டాము.

  1. మ్యాక్‌లో హైబ్రిడ్ కంప్యూట్‌ను పరిచయం చేస్తున్నామువార్తలు1, సెప్టెం 2026
  2. డేటా సెంటర్ మీ మెషీన్‌కి కదులుతుందివార్తలు2, జూన్ 2026