PII-TRACE: Isikuandmete tuvastamine enne seadmest lahkumist
13 keele võrdlusalus järjepidevaks PII tuvastamiseks pikaajalistes vestlustes koos kohapealseks käitamiseks mõeldud kompaktse 0,6B detektoriga.
Hübriidarvutus Macis jagab Perplexity Computer ülesanded pilves asuvate tipptasemel mudelite ja Macis asuva kohaliku mudeli vahel. Pilveagendid tegelevad uurimistöö, arutluskäikude ja planeerimisega, samas kui kohalik mudel töötab privaatsete failide ja tundliku teabega.
See piir sõltub isikut tuvastavate andmete (PII) tuvastamisest enne nende seadmest lahkumist. Kohalik privaatsuslüüs hoiab tundliku sisu Macis, redigeerib tuvastatud privaatse teabe või taotleb enne selle pilve saatmist heakskiitu.
Tuvastamine muutub pikkades mitmekeelsetes vestlustes keerulisemaks. Sama identifikaator võib erinevate voorude vältel mitu korda esineda. Üks vahele jäetud mainimine võib paljastada teabe, mida süsteem peab kaitsma.
Sissejuhatus
Täna tutvustame lahendust PII-TRACE (Tracing Recurring PII Across Conversational Exchanges – korduvate PII-de jälgimine vestlusvahetustes), mis on uus võrdlusalus isikut tuvastavate teabe (PII) detektorite hindamiseks, ja PII-Tracerit, kompaktset 0,6B mudelit PII tuvastamiseks.
Pilvekesksed agendid sunnivad kasutajaid tasakaalustama konteksti, intelligentsust ja privaatsust. Rohkem isiklikku konteksti aitab agendil kasutajat mõista ja paremaid tulemusi toota. Kuid selle konteksti pakkumine tähendab sageli eraisikulise teabe saatmist kaugteenusele ja võib lekitada isikuandmeid. Teave, mis teeb assistendist kasuliku tööriista, võib olla just see, mida kasutaja soovib kõige enam privaatsena hoida.
Hübriidne tehisintellekt leevendab seda kompromissi, jagades tööd kasutaja seadme ja pilvemudelite vahel. Kuid see piir kaitseb privaatsust ainult juhul, kui seade suudab PII ära tunda enne teksti saatmist kaugmudelile. Kasutajad ei peaks iga sõnumit ise kontrollima. Seade vajab oma privaatsuslüüsiks kohalikku PII detektorit. Pikkades vestlustes võib sama identifikaator voorude vahel korduda ning ühest vahele jäetud mainimisest piisab isikuandmete läbipääsemiseks.

Perplexity tutvustas hübriidset kohaliku serveri järelduste orkestraatorit, mis otsustab, milliseid töid tuleks käitada seadmes ja millised tuleks saata pilves olevatele agentidele. Mudel, agentide keskkond, vestlused ja täitmise trajektoorid asuvad kõik kasutaja masinas. Välismaailmale juurdepääsu nõudvaid ülesandeid kutsutakse esile ainult vajadusel ja need on kaitstud kasutaja loaga. Seetõttu püsib see sisu seadmes seni, kuni kasutaja selle heaks kiidab.
PII-Tracer pakub mudelite marsruutimiseks ühte kohalikku juhtsignaali, märgistades vahemikud, mis ennustuste kohaselt sisaldavad PII-d. Seejärel rakendab rakendus marsruutimiseeskirja. See hoiab asjakohase sisendi kohapeal, redigeerib tuvastatud vahemikud või taotleb enne pilvemudelile eskaleerimist selgesõnalist luba. See muudab marsruutimise valivamaks. Tuvastatud PII jääb seadmesse, samas kui heakskiidetud kontekst saab endiselt kasu tipptasemel pilvemudelitest.
Valikuline marsruutimine sõltub järjepidevast tuvastamisest kogu vestluse vältel. Sama identifikaator võib voorude vahel korduda ja vahele jäetud mainimine võidakse siiski edastada.
12 detektori seas registreerib PII-Tracer kõrgeima sümboli F1 ja korduvate identifikaatorite kõrgeima järjepideva katvuse. Võrdlusalus selgitab, miks mõlemad tulemused on olulised: pika vestluse puhul ei tähenda enamiku PII leidmine sama, mis selle iga koopia leidmine.
PII tuvastamine seisab hübriidses tehisintellektis silmitsi uute väljakutsetega
PII tuvastamine on kauaaegne turvaprobleem ja mitmed võrdlusalused ning detektorid on juba olemas. Siiski toob PII tuvastamine hübriidse tehisintellekti seadetes kaasa uusi väljakutseid. Eelkõige peavad detektorid tuvastama PII pikkades mitmevoorulistes vestlustes, kus vestluse kontekst määrab, kas stringi tuleks pidada PII-ks. Näiteks võib nimi ühes vestluses tuvastada kasutaja, teises viidata avaliku elu tegelasele või olla lihtsalt assistendi genereeritud kohatäide. Ainuüksi pealispindne vorm ei piisa selle määratlemiseks, kas string tuleks märgistada PII-na.

Olemasolevad PII detektorid ja võrdlusalused on suunatud peamiselt üksikutele kirjetele. Oleme seisukohal, et detektorid, mis on loodud ühe kirje töötlemiseks korraga, toimivad pikkades ja keerulistes vestlustes kehvasti. Samuti ei hinda olemasolevad võrdlusalused üldiselt järjepidevust voorude vahel. Seetõttu ei tähenda hea jõudlus nendel võrdlusalustel tingimata tõhusat PII tuvastamist pikkades mitmevoorulistes vestlustes.
PII-TRACE: juurutuskriitilise PII tuvastamise võrdlusalus
Kujundasime PII-TRACE-i ümber kolme käitumise, mis on PII detektori kasutamisel assistendi vestlustes olulised. Esimene on järjepidev katvus: kui identifikaator ilmub mitu korda või ületab kasutaja ja assistendi voorude piire, peab detektor leidma iga mainimise. Teine on töökindlus pika konteksti korral: vestlused ulatuvad vähemalt 1000-st kuni üle 100 000 sümbolini, võimaldades mõõta, mis juhtub ajaloo kasvades. Kolmas on mitme keele ja segavormingus sisu haldamine: vestlus võib keelt vahetada ning kombineerida proosat koodi, tabelite või struktureeritud kirjetega. PII-TRACE säilitab need mustrid, hinnates iga täielikku dialoogi selle eraldiseisvateks kirjeteks jagamise asemel.
Võrdlusalus mõõdab jõudlust kahel teineteist täiendaval tasemel. Identifikaatori tasemel esitab järjepidev tuvastamine rangema küsimuse: kas detektor kattis sama identifikaatori iga mainimise iga sümboli? Esitame selle skoori eraldi mitme mainimisega identifikaatorite ja voorude vahel korduvate identifikaatorite jaoks. Sümboli tasemel mõõdab täpsus, kui suur osa detektori märgistatud tekstist on märgistatud PII-na, tagasikutse mõõdab, kui suure osa märgistatud PII-st see leiab, ning F1 tasakaalustab neid kahte.
PII-TRACE sisaldab 13 148 sünteetilist kasutaja ja assistendi vestlust 13 keeles ja 10 kirjasüsteemis ning 37 431 sümboli tasemel märgistatud identifikaatori mainimist üheksa PII tüübi lõikes. Kokku 41% vestlustest sisaldab struktureeritud sisu. 5645 märgistatud PII-ga vestluse seas sisaldab 63,8% identifikaatorit, mis esineb mitu korda, ja 28,7% identifikaatorit, mis esineb mitmes voorus.
Sünteetilise andmekogumi loomine toodanguvestlustest
PII-TRACE säilitab lähtevestluste vooru struktuuri originaale avaldamata. Torujuhe kirjutab iga vooru ümber ja asendab iga märgistatud identifikaatori sünteetilise väärtusega.

Esiteks märgistavad mitu keelemudelit toodangu kasutaja ja assistendi vestlustes üheksa tüüpi PII-d. Reeglipõhine etapp rühmitab sama tüüpi korduvad identifikaatorid ühe olemia ID alla. Seejärel asendatakse iga märgistatud väärtus tüübipõhise kohatäitega, jättes alles malli, mis säilitab voorude järjekorra, PII tüübi ja mainimiste vahelised seosed, kuid mitte ühtegi märgistatud algset väärtust.
Süsteem parafraseerib iga vooru, jättes need kohatäited puutumatuks, ning lisab seejärel sünteetilised väärtused, mis vastavad identifikaatori tüübile ja vormingule. Korduvad mainimised saavad vestluse siseselt sama väärtuse, samas kui erinevad vestlused kasutavad iseseisvalt genereeritud väärtusi. Lõplik vastendusetapp arvutab uuesti iga sümboli nihke.
Kolm automatiseeritud lüüsi kontrollivad, kas asendused vastavad salvestatud vahemikele, korduvad mainimised kasutavad sama väärtust ja märgistatud lähtevedud puuduvad Presidio ja regulaaravaldiste uuesti skannimisel. Salvestatud nihe peab taastama ka täpse sünteetilise alamstringi. Kontrolli läbimata kirjed genereeritakse uuesti või eemaldatakse. Teine keelemudel teeb valimist auditi ja inimesed vaatavad üle kõik, mida see PII-na märgistab.
PII-Tracer: kompaktne detektor kohalikuks kasutamiseks
PII-Tracer on Qwen3 tuumalt kohandatud 0,6B kahesuunaline kodeerija. Privaatsuse sõelumine erineb teksti genereerimisest ja nõuab asjakohaste PII vahemike leidmist ning nende piiride tagastamist. Seetõttu asendab PII-Tracer Qwen3 põhjusliku maski polsterdust teadvustava kahesuunalise tähelepanuga, nii et iga token saab ammutada teavet nii varasematest kui ka hilsematest voorudest 4096 tokeni akna piires.
Kodeerija toodab iga tokeni jaoks 1024-mõõtmelise esituse. Lineaarne sildistuspea annab skoorid 37 võimaliku sildi jaoks: ühe spetsiaalse sildi (mille tähistamiseks kasutame märki O) PII vahemikust väljaspool oleva teksti jaoks ja neli vahemiku positsiooni silti kõigi üheksa PII tüübi jaoks. Nimega olemite tuvastamise (NER) BIOES-skeemis tähistavad mitme tokeniga vahemikku B (algus, Beginning), I (sees, Inside) ja E (lõpp, End), samas kui S (üksik, Single) tähistab ühest tokenist koosnevat vahemikku. Abipea ennustab lisaks, kas vestlus sisaldab tundlikku materjali, näiteks tervise- või religioosset teavet.
Treening PII-Traceri kolmeks epohhiks umbes 714 000 treeningnäidisel, kombineerides mitmekeelseid assistendi vestlusi ühiste kirjete näidetega. Jagatud kahesuunalisel kodeerijal on kaks treeningpead: 37 klassiga BIOES tokeni pea, mis tuvastab ja liigitab PII vahemikke, ning binaarne vestluse taseme pea, mis ennustab, kas vestlus sisaldab tundlikku materjali. Treenime mõlemat pead koos abil. Siin annab haruldastele PII siltidele suurema kaalu, et sagedane silt `O` ei domineeriks, samas kui varustab vestluse tasandi treeningtunnusega; kordajad 1,5 ja 0.3 hoiavad vahemike tuvastamist peamise ülesandena. See lisasignaal tugevdab kontekstiteadlikku tuvastamist: mudel õpib hindama kandidaatvahemikku vestluse siseselt, mitte eraldiseisva stringina, aidates vähendada valepositiivseid tulemusi tagasikutse vaid väikese vähenemise hinnaga.
Järelduse tegemise ajal otsib piiratud Viterbi dekooder kõrgeima skooriga kehtivat BIOES-järjestust selle asemel, et märgistada iga token eraldiseisvalt. Näiteks võib B-private_person jätkuda I-private_person-iga või lõppeda E-private_person-iga, kuid mitte lülituda ümber valikule I-private_email. Dekooder vastendab tulemuse redigeerimiseks või kohalikuks marsruutimiseks tagasi täpsetele sümbolivahemikele.
PII-Tracer on liider sümboli F1 ja korduva PII valdkonnas
Võrdleme detektoreid nii sümboli kui ka vahemiku tasemel. Sümboli F1 hindab tuvastust sümbolite kaupa. Vahemiku kattuvuse F1 mõõdab, kas detektor tuvastab PII-üksuse mõne osa, samas kui vahemiku sisalduvuse F1 mõõdab, kas see hõlmab kogu üksuse.
PII-Tracer saavutas hinnatud 12 süsteemi seas kõrgeima sümboli F1 (0,629) ning paremuselt teise vahemiku kattuvuse F1 ja vahemiku sisalduvuse F1. Tipptasemel mudelid, nimelt GPT-5.6-sol ja Claude Sonnet 5, saavutasid võrreldava üldise jõudluse. GPT-5.6-sol saavutas kõrgemad skoorid mõlemal vahemiku taseme F1 mõõdikul, kuid madalama sümboli F1. Nendel tipptasemel mudelitel on aga sadu miljardeid või isegi triljoneid parameetreid ning need on pilves hostitavad avatud lähtekoodita mudelid. Seetõttu ei sobi need tundlike kohalike andmete kaitsmiseks hübriidsetes tehisintellekti seadetes, kus skannimata tekst peab jääma kohapealaseks. Seevastu PII-Tracer pakub tipptasemele lähedast vahemiku taseme tuvastust vaid 0,6B parameetriga ja suudab skannimata teksti töödelda täielikult kohapeal. Teised avatud lähtekoodiga PII detektorid toimivad PII-Traceriga võrreldes märgatavalt halvemini.

Iga korduva mainimise leidmine
Järjepidevuse katse rakendab samadele ennustustele rangemat testi. Testikomplekt sisaldab 899 kord ilmuvat identifikaatorit ja 959 identifikaatorit, mis ilmuvad rohkem kui üks kord; 790 korduvatest identifikaatoritest hõlmavad mitut vooru. Joonisel on esitatud neli mainimiste arvude vahemikku (üks, kaks, kolm kuni viis ning kuus kuni kümne) ja identifikaator loetakse üles leituks ainult siis, kui kõik selle märgistatud sümbolid on leitud. See esitab PII-Traceri koos kolme valitud baasjoonelise mudeliga, samas kui koondtabel esitab korduvate ja voorudeüleste skooride andmed kõigi kaheteistkümne süsteemi kohta.

PII-Tracer püsib korduste arvu kasvades esirinnas: selle skoor liigub ühele mainimisele vastavalt 0,917-lt 0,873-le kahe puhul, 0,796-lt kolme kuni viie puhul ja 0,691-lt kuue kuni kümne puhul. Viimases vahemikus jõuab GPT-5.6-sol 0,464-ni, samas kui GLiNER2-PII ja Claude Opus 4.8 jõuavad vastavalt 0,073 ja 0,045-ni. Kogu hindamise jooksul leiab PII-Tracer 79,4% korduvate identifikaatorite ja 77,6% vestlusteüleste identifikaatorite igast mainimisest; GPT-5.6-sol saavutab samadel näitajatel vastavalt 57,0% ja 55,1%.
Pikkade vestluste katmine
Kõigepealt rühmitame kõik 1922 testi vestlust sümbolite pikkuse järgi ja dekodeerime PII-Traceri 4096 tokeni aknaga. Rühmad sisaldavad 167 vestlust alla 1000 sümboliga, 1292 vestlust 1000 kuni 10 000 sümboliga ja 463 vestlust, mille pikkus on 10 000 või rohkem.

Ühe akna tagasikutse on alla 1000 sümboli korral 0,975 ning 1000 kuni 10 000 sümboli puhul 0,955, kuid langeb 10 000 või enama sümboliga vestluste puhul 0,687-le. Täpsus püsib kahes pikemas rühmas ligikaudu 0,51 juures, osutades põhipbleemina sisendi katvusele.
Sisendi töötlemise mõju uurimiseks hindasime sama kontrollpunkti 50%-lise kattuvusega libiseva akna dekodeerimisega. See tõstab üldise sümbolite tagasikutse 0,830-lt 0,965-le ja mitme mainimisega järjepideva tuvastuse 0,794-lt 0,954-le ilma ümberõppimiseta.
Keeltes järjepidev
PII-TRACE katab 13 keelt; keeleeksperiment kajastab kuue keele lõiku, mis hõlmab ladina, kirillitsa ja hanguli kirjasüsteeme: inglise, saksa, prantsuse, itaalia, vene ja korea keelt. Käitame samu 12 detektorit kõigis testivestlustes igas keeles. Iga keele raames ühendame ennustatud ja kuldsed sümbolid ning arvutame sümboli F1.

PII-Tracer on sümboli F1 arvestuses liider kuuest keelest neljas: saksa (0,735), prantsuse (0,633), itaalia (0,676) ja vene (0,651) keeles ning jääb inglise ja korea keeles parimatest tulemustest vaid 0,016 ja 0,036 kaugusele. Kaasnevas analüüsis viib see ühtse tuvastamiseni kõigis kuues keele alamhulgas, saavutades skoori 0,80–0,93. Keelest sõltumatu vaade näitab kasvu ka väljaspool inglise keelt.
Kõrgem sümboli F1 kui privaatsusfiltril viiel standardsel võrdlusalusel
Lõplik eksperiment väljub PII-TRACE piiridest. Käitame PII-Tracerit ja OpenAI privaatsusfiltrit ai4privacy valideerimise alamhulgal (47 728 dokumenti), Nemotron-PII testi alamhulgal (100 000), fikseeritud seemnega SPY komplektil (8688), Gretel PII testi alamhulgal (5000) ja TAB ECHR testi alamhulgal (127).

PII-Traceril on kõigil andmekogumitel kõrgem sümboli F1: 0,950 versus 0,907 andmekogumil ai4privacy, 0,847 versus 0,709 andmekogumil Nemotron-PII, 0,585 versus 0,543 andmekogumil SPY, 0,952 versus 0,895 andmekogumil Gretel PII ja 0,594 versus 0,350 andmekogumil TAB. TAB on selle rühma ainus võrdlusalus, mis on ehitatud reaalsest, inimeste poolt märgistatud tekstist. Seal saavutab PII-Tracer 0,986 versus 0,982 täpsuse ja 0,425 versus 0,213 tagasikutse – kaks korda suurema tagasikutse sisuliselt sama täpsuse juures (üksikasjad on toodud artiklis). Seetõttu kandub kõrgem F1 PII-TRACE vestlustest üle kõigile viiele tavapärasele ühte kirjet sisaldavale võrdlusalusele selles võrdluses.
Kokkuvõte
Hübriidne tehisintellekt integreerib kasutaja seadme järelduste virna, pakkudes tugevamat privaatsust ja madalamaid kulusid. Pilves asuvad tipptasemel mudelid saavad hakkama uurimistöö, arutluskäikude ja planeerimisega, samas kui kohalikud mudelid töötlevad faile ja isikuandmeid, mis peaksid jääma seadmesse. See jaotus sõltub tundliku teabe äratundmisest enne, kui tundlikud andmed pilve lähevad.
PII-Tracer on kompaktne mudel PII tuvastamiseks mitmevoorulistes vestlustes, samas kui PII-TRACE hindab, kas detektorid suudavad korduvat PII-d järjepidevalt kogu vestluse vältel tuvastada.
Koos pakuvad PII-TRACE ja PII-Tracer võrdlusalust ja võrdlusmudelit PII tuvastamise edendamiseks mitmevoorulistes vestlustes ja muudes pika kontekstiga seadetes.
Agendid võtavad enda kanda pikemaid ülesandeid ja töötavad rohkema isikliku kontekstiga. Seetõttu peaksid privaatsuskontrollid kehtima kogu vestluse vältel, mitte ainult esialgse sisendi puhul. Hübriidne tehisintellekt sõltub usaldusväärsest kohalikust tuvastusest, et hoida tundlikku konteksti seadmes.
Lugege arXiv-i artiklit üksikasjade saamiseks PII-TRACE võrdlusaluse, PII-Traceri mudeli ja meie hindamise kohta. Plaanime peagi välja anda nii PII-TRACE kui ka PII-Traceri.