PII-TRACE: Upptäck personuppgifter innan de lämnar enheten

Ett riktmärke med 13 språk för konsekvent PII-detektering i utdragna konversationer, i kombination med en kompakt detektor på 0,6 miljarder parametrar som utformats för att köras lokalt.

FörfattarePerplexity Secure Intelligence Institute

Hybridberäkning på Mac delar upp Perplexity Computer-uppgifter mellan avancerade modeller i molnet och en lokal modell på Mac-datorn. Molnagenter hanterar forskning, resonemang och planering, medan den lokala modellen arbetar med privata filer och känslig information.

Denna gräns är beroende av att man detekterar personligt identifierbar information (PII) innan den lämnar enheten. En lokal integritetsspärr håller kvar känsligt innehåll på Mac-datorn, maskerar detekterad privat information eller begär godkännande innan den skickas till molnet.

Detektering blir svårare i långa, flerspråkiga konversationer. Samma identifierare kan dyka upp flera gånger i olika turer. En missad omnämning kan exponera den information som systemet är avsett att skydda.

Introduktion

Idag presenterar vi PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), ett nytt riktmärke för utvärdering av detektorer för personligt identifierbar information (PII), samt PII-Tracer, en kompakt modell på 0,6 miljarder parametrar för PII-detektering.

Molnfokuserade agenter tvingar användare att balansera kontext, intelligens och integritet. Mer personlig kontext kan hjälpa en agent att förstå användaren och producera bättre resultat. Men att tillhandahålla denna kontext innebär ofta att privat information skickas till en fjärrtjänst och kan läcka personlig information. Den information som gör en assistent användbar kan vara exakt det som en användare helst vill hålla privat.

Hybrid-AI underlättar denna avvägning genom att dela upp arbetet mellan användarens enhet och molnmodeller. Men den gränsen skyddar endast integriteten om enheten kan känna igen PII innan text skickas till en fjärrmodell. Användare ska inte behöva granska varje meddelande själva. Enheten behöver en lokal PII-detektor som sin integritetsspärr. I långa konversationer kan samma identifierare återkomma över turer, och en missad omnämning räcker för att personlig information ska läcka igenom.

Diagram som illustrerar ett arbetsflöde för integritetsspärr, som visar hur känsliga data stannar kvar på en lokal enhet medan godkända förfrågningar skickas till molnmodeller för bearbetning.
PII-Tracer som integritetsspärr i hybrid-AI

Perplexity introducerade en hybrid lokal/serverbaserad inferensorkestrerare som avgör vilket arbete som ska köras på enheten och vilket arbete som ska skickas till agenter i molnet. Modellen, agentmiljön, konversationerna och exekveringsspåren finns alla på användarens maskin. Uppgifter som krävs för att komma åt omvärlden anropas endast när det är nödvändigt och styrs av användarens behörighet. Därför stannar innehållet på enheten tills användaren godkänner det.

PII-Tracer tillhandahåller en lokal kontrollsignal för modellroutning genom att flagga spann som förutspås innehålla PII. Applikationen tillämpar sedan routningspolicyn. Den håller relevant indata lokal, maskerar detekterade spann eller begär ett uttryckligt godkännande innan den eskalerar till en molnmodell. Detta gör routningen mer selektiv. Detekterad PII stannar kvar på enheten medan godkänd kontext fortfarande drar nytta av avancerade molnmodeller.

Selektiv routning är beroende av konsekvent detektering i hela konversationen. Samma identifierare kan återkomma i olika turer, och en missad omnämning kan ändå överföras.

Av 12 detektorer noterar PII-Tracer det högsta teckenbaserade F1-värdet och den högsta konsekventa täckningen av återkommande identifierare. Riktmärket förklarar varför båda resultaten är viktiga: i en lång konversation är det inte samma sak att hitta det mesta av PII som att hitta varje kopia av den.

PII-detektering möter nya utmaningar inom hybrid-AI

PII-detektering är ett långvarigt säkerhetsproblem, och det finns redan flera riktmärken och detektorer. PII-detektering i hybrid-AI-miljöer introducerar dock nya utmaningar. i synnerhet måste detektorer identifiera PII i långa konversationer med flera turer, där konversationens kontext avgör om en sträng ska betraktas som PII. Till exempel kan ett namn identifiera användaren i en konversation, referera till en offentlig person i en annan eller helt enkelt vara en platshållare som genererats av en assistent. Ytformen ensam räcker inte för att avgöra om en sträng ska flaggas som PII.

Ett chattgränssnitt visar en assistent som behåller en användares namn, telefonnummer, mötesdetaljer och e-postadress över många turer.
Ett namn, telefonnummer och en e-postadress återkommer genom konversationen. PII-TRACE räknar en identifierare som konsekvent detekterad endast om varje omnämning hittas.

Befintliga PII-detektorer och riktmärken inriktar sig främst på enskilda poster. Vi ser att detektorer som är utformade för att bearbeta en post i taget presterar svagt på långa, komplexa konversationer. Dessutom utvärderar befintliga riktmärken i allmänhet inte konsekvens över turer. Därför leder inte stark prestanda på dessa riktmärken nödvändigtvis till effektiv PII-detektering i långa konversationer med flera turer.

PII-TRACE: Ett riktmärke för driftskritiska PII-detektering

Vi utformade PII-TRACE kring tre beteenden som är viktiga när en PII-detektor används i assistentkonversationer. Det första är konsekvent täckning: när en identifierare dyker upp flera gånger eller korsar användar- och assistentturer måste detektoren hitta varje omnämning. Det andra är robusthet mot lång kontext: konversationer sträcker sig från färre än 1 000 till mer än 100 000 tecken, vilket gör det möjligt att mäta vad som händer när historiken växer. Det tredje är att hantera flera språk och innehåll med blandat format: en konversation kan växla språk och kombinera löptext med kod, tabeller eller strukturerade poster. PII-TRACE bevarar dessa mönster genom att utvärdera varje fullständig dialog i stället för att dela upp den i isolerade poster.

Riktmärket mäter prestanda på två kompletterande nivåer. På identifierarnivå ställer konsekvent detektering den striktare frågan: täckte detektorn varje tecken i varje omnämning av samma identifierare? Vi redovisar detta resultat separat för identifierare med flera omnämnanden och för identifierare som upprepas över turer. På teckennivå mäter precision hur stor del av den text som markerats av en detektor som är märkt som PII, återsökning mäter hur stor del av den märkta PII som hittas, och F1 balanserar de två.

PII-TRACE innehåller 13 148 syntetiska användar- och assistentkonversationer på 13 språk och med 10 skrivsystem, med 37 431 identifieraromnämningar märkta på teckennivå över nio PII-typer. Totalt innehåller 41 % av konversationerna strukturerat innehåll. Av de 5 645 konversationerna med märkt PII innehåller 63,8 % en identifierare som förekommer mer än en gång, och 28,7 % innehåller en identifierare som förekommer över flera turer.

Bygga ett syntetiskt dataset från produktionskonversationer

PII-TRACE bevarar turstrukturen i källkonversationerna utan att publicera originalen. Pipelinen skriver om varje tur och ersätter varje märkt identifierare med ett syntetiskt värde.

Diagram som visar hur PII-TRACE omvandlar märkta produktionskonversationer till syntetiska dataset genom mallning, parafrasering, ersättning med konsekventa syntetiska värden och valideringskontroller.
IPII-TRACE omvandlar märkt källtext till en mall, skriver om varje tur, infogar konsekventa syntetiska värden och kör lanseringskontroller på resultatet.

För det första markerar flera språkmodeller nio typer av PII i produktionskonversationer mellan användare och assistenter. Ett regelbaserat steg grupperar upprepade identifierare av samma typ under ett entitets-ID. Varje märkt värde ersätts sedan med en typbestämd platshållare, vilket lämnar kvar en mall som behåller turordning, PII-typ och kopplingar mellan omnämnanden, men inget av de märkta originalvärdena.

Systemet parafraserar varje tur samtidigt som platshållarna hålls intakta, och infogar sedan syntetiska värden som matchar identifierarens typ och format. Upprepade omnämnanden får samma värde inom en konversation, medan olika konversationer använder oberoende genererade värden. Det slutliga justeringssteget beräknar om varje teckenoffset.

Tre automatiska kontrollsystem kontrollerar att ersättningar matchar de lagrade spannen, att upprepade omnämnanden använder samma värde och att märkta källvärden saknas vid en omscanning med Presidio och reguljära uttryck. Ett lagrat offset måste också kunna återskapa den exakta syntetiska delsträngen. Poster som misslyckas genereras på nytt eller tas bort. En andra språkmodell granskar ett urval, och människor granskar allt som den flaggar som PII.

PII-Tracer: En kompakt detektor för lokal användning

PII-Tracer är en dubbelriktad kodare på 0,6 miljarder parametrar som anpassats från en Qwen3-grundmodell. Integritetsfiltrering skiljer sig från textgenerering och kräver att man hittar relevanta PII-spann och returnerar deras gränser. Därför ersätter PII-Tracer Qwen3:s kausala mask med padding-medveten dubbelriktad uppmärksamhet (attention), så att varje token kan dra nytta av både tidigare och senare turer inom ett fönster på 4 096 tokens.

För varje token producerar kodaren en 1 024-dimensionell representation. Ett linjärt taggningshuvud genererar poäng för 37 möjliga etiketter: en speciell etikett (som vi använder O för att beteckna) för text utanför ett PII-spann, plus fyra spannpositionsetiketter för var och en av de nio PII-typerna. I BIOES-schemat för namngiven entitetsigenkänning markerar B (Beginning/Början), I (Inside/Inuti) och E (End/Slut) ett flertokenspann, medan S (Single/Enskild) markerar ett entokenspann. Ett extra huvud förutsäger också om konversationen innehåller känsligt material, såsom hälso- eller religionsrelaterad information.

Vi tränar PII-Tracer under tre epoker på cirka 714 000 träningsprov, som kombinerar flerspråkiga assistentkonversationer med exempel på enskilda poster. Den delade dubbelriktade kodaren har två träningshuvuden: ett 37-klassers BIOES-tokenhuvud som detekterar och typbestämmer PII-spann, och ett binärt konversationsnivåhuvud som förutsäger om konversationen innehåller känsligt material. Vi tränar båda huvudena gemensamt med L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}}. Här ger Ltag\mathcal{L}_{\mathrm{tag}} sällsynta PII-etiketter högre vikt så att den frekventa etiketten `O` inte dominerar, medan Lsens\mathcal{L}_{\mathrm{sens}} tillhandahåller träningssignalen på konversationsnivå; koefficienterna 1,5 och 0,3 håller span-detektering som huvuduppgift. Denna extra signal förstärker kontextmedveten detektering: modellen lär sig att bedöma ett kandidatspann inom konversationen snarare än som en isolerad sträng, vilket bidrar till att minska falska positiva resultat med endast en liten avvägning i återsökning.

Vid inferenstid söker en begränsad Viterbi-avkodare efter den giltiga BIOES-sekvensen med högst poäng i stället för att märka ut varje token oberoende. Till exempel kan B-private_person följas av I-private_person eller avslutas med E-private_person, men inte växla till I-private_email. Avkodaren mappar resultatet tillbaka till exakta teckenspann för maskering eller lokal routning.

PII-Tracer leder i teckenbaserat F1 och återkommande PII

Vi jämför detektorerna på både tecken- och spannivå. Teckenbaserat F1 utvärderar detektering tecken för tecken. Span-överlappande F1 mäter om detektorn identifierar någon del av ett PII-objekt, medan span-inneslutande F1 mäter om den fångar upp hela objektet.

PII-Tracer uppnådde det högsta teckenbaserade F1-värdet (0,629) bland de 12 utvärderade systemen, samt näst högsta spannöverlappande F1 och spanninneslutande F1. Avancerade modeller, nämligen GPT-5.6-sol och Claude Sonnet 5, uppnådde jämförbar övergripande prestanda. GPT-5.6-sol erhöll högre poäng på båda F1-måtten på spannnivå, men ett lägre teckenbaserat F1. Dessa avancerade modeller har dock hundratals miljarder eller till och med biljoner parametrar och är ställföreträdande källkodslystna molnhostade modeller. Därmed är de olämpliga för att skydda känsliga lokala data i hybrid-AI-miljöer där oscreenad text måste förbli lokal. Däremot levererar PII-Tracer detektering på spannnivå nära toppnivå med endast 0,6 miljarder parametrar och kan bearbeta oscreenad text helt lokalt. Andra PII-detektorer med öppen källkod presterar avsevärt sämre än PII-Tracer.

Tre stapeldiagram som jämför 12 PII-detekteringssystem. PII-Tracer 0,6B rankas etta i teckenbaserat F1 och tvåa i spannöverlappande och spanninneslutande F1, efter GPT-5.6-sol.
Teckenbaserat F1, spannöverlappande F1 och spanninneslutande F1 för alla tolv system.

Hitta varje återkommande omnämning

Konsekvensexperimentet tillämpar ett striktare test på samma förutsägelser. Testsetet innehåller 899 identifierare som förekommer en gång och 959 som förekommer mer än en gång; 790 av de återkommande identifierarna spänner över flera turer. Figuren redovisar fyra grupper baserat på antal omnämnanden (en, två, tre till fem, samt sex till tio) och räknar en identifierare endast när alla dess märkta tecken hittas. Den presenterar PII-Tracer tillsammans med tre utvalda baslinjer, medan samlingstabellen redovisar resultat för återkommande och flertursfördelning för alla tolv system.

Linjediagram som visar att PII-Tracer hittar varje omnämning av återkommande identifierare mer konsekvent än GPT-5.6-sol, GLiNER2-PII och Claude Opus 4.8 i alla grupper baserade på antal omnämnanden, och sjunker från 91,7 % för en omnämning till 69,1 % för 6–10 omnämnanden.
Andel identifierare vars varje omnämning hittas. PII-Tracer leder i alla fyra jämförelsegrupper.

PII-Tracer ligger i framkant när upprepningen ökar: dess poäng går från 0,917 för en omnämning till 0,873 för två, 0,796 för tre till fem, och 0,691 för sex till tio. I den sista gruppen når GPT-5.6-sol 0,464, medan GLiNER2-PII och Claude Opus 4.8 når 0,073 och 0,045. Genom hela utvärderingen hittar PII-Tracer varje omnämning av 79,4 % av återkommande identifierare och 77,6 % av identifierare som förekommer över flera turer; GPT-5.6-sol når 57,0 % och 55,1 % för samma två mått.

Täcker långa konversationer

Vi grupperar först alla 1 922 testkonversationer efter teckenlängd och avkodar PII-Tracer med fönstret på 4 096 tokens. Grupperna innehåller 167 konversationer under 1 000 tecken, 1 292 från 1 000 till 10 000 och 463 på 10 000 eller fler.

Grupperat stapeldiagram över PII-Tracers prestanda per konversationslängd. F1 når en topp på 67,0 % för konversationer på 1 000–10 000 tecken, medan atersökningen sjunker från 97,5 % för konversationer under 1 000 tecken till 68,7 % för de över 10 000.
Teckenbaserad precision, återsökning och F1 efter konversationslängd

Återsökningen för ett enskilt fönster är 0,975 under 1 000 tecken och 0,955 från 1 000 till 10 000, men sjunker till 0,687 för konversationer på eller över 10 000 tecken. Precisionen ligger kvar nära 0,51 i de två längre grupperna, vilket pekar på indatatäckning som det huvudsakliga problemet.

För att studera effekten av indatahantering utvärderar vi samma kontrollpunkt med glidande fönster-avkodning med 50 % överlappning. Detta höjer den totala teckenåtersökningen från 0,830 till 0,965 och konsekvent detektering av flera omnämnanden från 0,794 till 0,954, utan omträning.

Konsekvent över språk

PII-TRACE omfattar 13 språk; språkexperimentet rapporterar ett urval med sex språk som spänner över latinska, cyrilliska och koreanska skriftsystem (Hangul): engelska, tyska, franska, italienska, ryska och koreanska. Vi kör samma 12 detektorer på alla testkonversationer på respektive språk. Inom varje språk sammanslår vi förutsagda och gyllene tecken och beräknar teckenbaserat F1.

Värmekarta som jämför teckenbaserade F1-poäng för 12 PII-detekteringssystem på engelska, tyska, franska, italienska, ryska och koreanska. PII-Tracer leder på tyska, franska, italienska och ryska, med konsekvent starka resultat på alla sex språk.
Teckenbaserat F1 på sex språkundermängder som innehåller PII, inklusive latinska, cyrilliska och koreanska skriftsystem.

PII-Tracer leder teckenbaserat F1 på fyra av sex språk: tyska (0,735), franska (0,633), italienska (0,676) och ryska (0,651), och ligger inom 0,016 respektive 0,036 från de bästa resultaten på engelska och koreanska. I den tillhörande analysen leder den till konsekvent detektering i alla sex språkundermängder, med ett resultat på 0,80–0,93. Vyn per språk visar förbättringar utöver engelska.

Högre teckenbaserat F1 än integritetsfiltret på fem standardriktmärken

Det sista experimentet utförs utanför PII-TRACE. Vi kör PII-Tracer och OpenAI Privacy Filter på valideringsdelen av ai4privacy (47 728 dokument), testdelen av Nemotron-PII (100 000), ett fast SPY-seed-set (8 688), testdelen av Gretel PII (5 000) och testdelen av TAB ECHR (127).

Grupperat stapeldiagram som jämför PII-Tracers precision, återsökning och teckenbaserade F1 med OpenAI Privacy Filters F1 över fem externa riktmärken. PII-Tracer uppnår ett högre F1-värde på varje riktmärke.
Resultat på teckennivå på fem externa PII-riktmärken, poängsatta utan krav på att kategorinamn ska matcha. Grå staplar visar OpenAI Privacy Filter under samma utvärdering.

PII-Tracer har högre teckenbaserat F1 på varje dataset: 0,950 mot 0,907 på ai4privacy, 0,847 mot 0,709 på Nemotron-PII, 0,585 mot 0,543 på SPY, 0,952 mot 0,895 på Gretel PII och 0,594 mot 0,350 på TAB. TAB är det enda riktmärket i denna grupp som har byggts upp av riktig, humanmärkt text. Där når PII-Tracer 0,986 mot 0,982 i precision och 0,425 mot 0,213 i återsökning – dubbelt så hög återsökning vid i princip samma precision (detaljer finns i artikeln). Det högre F1-värdet förs därför över från PII-TRACE-konversationer till alla fem konventionella riktmärken för enskilda poster i denna jämförelse.

Slutsats

Hybrid-AI integrerar användarens enhet i inferensstacken, vilket ger högre integritet och lägre kostnad. Avancerade modeller i molnet kan hantera forskning, resonemang och planering, medan lokala modeller arbetar med filer och personuppgifter som bör finnas kvar på enheten. Denna uppdelning är beroende av att känslig information känns igen innan några känsliga data skickas till molnet.

PII-Tracer är en kompakt modell för att detektera PII i konversationer med flera turer, medan PII-TRACE utvärderar om detektorer konsekvent kan identifiera återkommande PII genom en konversation.

Tillsammans tillhandahåller PII-TRACE och PII-Tracer ett riktmärke och en referensmodell för att driva PII-detektering framåt i konversationer med flera turer och andra miljöer med lång kontext.

Agenter tar sig an längre uppgifter och arbetar med mer personlig kontext. Därför bör integritetskontroller gälla för hela konversationen, inte bara den ursprungliga indatan. Hybrid-AI är beroende av tillförlitlig lokal detektering för att hålla känslig kontext kvar på enheten.

Läs arXiv-artikeln för detaljer om PII-TRACE-riktmärket, PII-Tracer-modellen och vår utvärdering. Vi planerar att släppa både PII-TRACE och PII-Tracer inom kort.

  1. Vi introducerar Hybrid Compute på MacNyheter1 sep. 2026
  2. Datacentret flyttar till din enhetNyheter2 juni 2026