PII-TRACE: Asmens duomenų aptikimas prieš jiems paliekant įrenginį

13 kalbų bazinis vertinimas nuosekliam PII aptikimui ilguose pokalbiuose, suporuotas su kompaktišku 0,6B detektoriumi, skirtu veikti vietoje.

AutoriaiPerplexity Secure Intelligence Institute

Hibridinis skaičiavimas „Mac“ kompiuteryje padalija „Perplexity Computer“ užduotis tarp pažangiausių debesies modelių ir vietinio modelio „Mac“ kompiuteryje. Debesies agentai atlieka tyrimus, samprotavimą ir planavimą, o vietinis modelis dirba su privačiais failais ir neskelbtina informacija.

Ši riba priklauso nuo asmens tapatybės informacijos (PII) aptikimo prieš jai paliekant įrenginį. Vietinis privatumo filtras išsaugo neskelbtiną turinį „Mac“ kompiuteryje, redaguoja aptiktą privačią informaciją arba prašo patvirtinimo prieš siunčiant ją į debesį.

Aptikimas tampa sunkesnis ilguose, daugiakalbiuose pokalbiuose. Tas pats identifikatorius gali pasikartoti kelis kartus skirtingose eilutėse. Vienas praleistas paminėjimas gali atskleisti informaciją, kurią sistema skirta apsaugoti.

Įvadas

Šiandien pristatome PII-TRACE (Tracing Recurring PII Across Conversational Exchanges – pasikartojančio PII sekimas pokalbių apsikeitimuose) – naują bazinį vertinimą, skirtą asmens tapatybės informacijos (PII) detektoriams vertinti, ir „PII-Tracer“ – kompaktišką 0,6B modelį PII aptikimui.

Debesyje veikiantys agentai verčia naudotojus rasti pusiausvyrą tarp konteksto, intelekto ir privatumo. Daugiau asmeninio konteksto gali padėti agentui suprasti naudotoją ir pasiekti geresnių rezultatų. Tačiau šio konteksto suteikimas dažnai reiškia privačios informacijos siuntimą į nuotolinę paslaugą ir gali sukelti asmeninės informacijos nutekėjimą. Informacija, dėl kurios asistentas yra naudingas, gali būti būtent tai, ką naudotojas labiausiai nori išlaikyti privačiu.

Hibridinis dirbtinis intelektas sušvelnina šį kompromisą padalydamas darbą tarp naudotojo įrenginio ir debesies modelių. Tačiau ši riba apsaugo privatumą tik tuo atveju, jei įrenginys gali atpažinti PII prieš išsiunčiant tekstą į nuotolinį modelį. Naudotojai neturėtų patys tikrinti kiekvienos žinutės. Įrenginiui reikia vietinio PII detektoriaus kaip privatumo filtro. Ilguose pokalbiuose tas pats identifikatorius gali kartotis per kelis apsikeitimus, o vieno praleisto paminėjimo pakanka, kad asmeninė informacija prasiskverbtų pro šalį.

Diagrama, iliustruojanti privatumo filtro darbo eigą ir rodo, kaip neskelbtini duomenys lieka vietiniame įrenginyje, o patvirtintos užklausos siunčiamos į debesies modelius apdoroti.
„PII-Tracer“ kaip privatumo filtras hibridiniame dirbtiniame intelekte

„Perplexity“ pristatė hibridinį vietinio serverio inferencijos orkestratorių, kuris nusprendžia, kokį darbą vykdyti įrenginyje, o kokį – siųsti agentams debesyje. Modelis, agento sistema, pokalbiai ir vykdymo trajektorijos yra naudotojo kompiuteryje. Užduotys, kurioms reikia prieigos prie išorinio pasaulio, iškviečiamos tik prireikus ir yra ribojamos naudotojo leidimu. Dėl to, kol naudotojas nepatvirtina, šis turinys lieka įrenginyje.

„PII-Tracer“ suteikia vieną vietinio valdymo signalą modelio maršrutizavimui, pažymėdamas intervalus, kuriuose prognozuojama esant PII. Tada programa įgyvendina maršrutizavimo politiką. Ji palieka atitinkamą įvestį vietoje, redaguoja aptiktus intervalus arba prašo aiškaus patvirtinimo prieš perkeliant į debesies modelį. Tai padaro maršrutizavimą selektyvesniu. Aptiktas PII lieka įrenginyje, o patvirtintas kontekstas vis tiek naudoja pažangiausius debesies modelius.

Selektyvus maršrutizavimas priklauso nuo nuoseklaus aptikimo visame pokalbyje. Tas pats identifikatorius gali pasikartoti per kelis apsikeitimus, o praleistas paminėjimas vis tiek gali būti perduotas.

Tarp 12 detektorių „PII-Tracer“ fiksuoja didžiausią simbolių F1 ir didžiausią nuoseklią pasikartojančių identifikatorių aprėptį. Bazinis vertinimas paaiškina, kodėl abi šios išvados yra svarbios: ilgame pokalbyje rasti didžiąją dalį PII nėra tas pats, kas rasti kiekvieną jo kopiją.

PII aptikimas susiduria su naujais iššūkiais hibridiniame dirbtiniame intelekte

PII aptikimas yra ilgaamžė saugumo problema, ir jau egzistuoja keletas bazinių vertinimų bei detektorių. Tačiau PII aptikimas hibridinio dirbtinio intelekto aplinkoje sukelia naujų iššūkių. Visų pirma, detektoriai turi identifikuoti PII ilguose, daugiakrypčiuose pokalbiuose, kur pokalbio kontekstas lemia, ar eilutė turėtų būti laikoma PII. Pavyzdžiui, vardas gali identifikuoti naudotoją viename pokalbyje, nurodyti viešą asmenį kitame arba tiesiog būti asistento sugeneruotas vietos rezervženklas. Vien paviršinės formos nepakanka nustatyti, ar eilutė turi būti pažymėta kaip PII.

Pokalbio sąsaja rodo asistentą, išsaugantį naudotojo vardą, telefono numerį, susitikimo informaciją ir el. pašto adresą per daugelį apsikeitimų.
Vardas, telefono numeris ir el. pašto adresas kartojasi visame pokalbyje. PII-TRACE laiko identifikatorių nuosekliai aptiktu tik tuo atveju, jei rasti visi paminėjimai.

Esami PII detektoriai ir baziniai vertinimai daugiausia skirti individualiems įrašams. Nustatėme, kad detektoriai, sukurti apdoroti po vieną įrašą, prastai veikia ilguose, sudėtinguose pokalbiuose. Be to, esami baziniai vertinimai paprastai neįvertina nuoseklumo per pokalbių eigą. Dėl to stiprus našumas atliekant šiuos vertinimus nebūtinai reiškia veiksmingą PII aptikimą ilguose, daugiakrypčiuose pokalbiuose.

PII-TRACE: diegimui kritinio PII aptikimo bazinis vertinimas

Sukūrėme PII-TRACE aplink tris elgsenas, kurios yra svarbios, kai PII detektorius naudojamas asistento pokalbiams. Pirmoji yra nuosekli aprėptis: kai identifikatorius pasirodo kelis kartus arba kerta naudotojo ir asistento apsikeitimus, detektorius turi rasti kiekvieną paminėjimą. Antroji yra atsparumas ilgam kontekstui: pokalbiai svyruoja nuo mažiau nei 1 000 iki daugiau nei 100 000 simbolių, todėl galima išmatuoti, kas nutinka augant istorijai. Trečioji yra kelių kalbų ir mišraus formato turinio tvarkymas: pokalbis gali keisti kalbas ir derinti prozą su kodu, lentelėmis arba struktūrizuotais įrašais. PII-TRACE išsaugo šiuos šablonus įvertindama kiekvieną pilną dialogą, o ne padalydama jį į izoliuotus įrašus.

Bazinis vertinimas matuoja našumą dviem papildomais lygmenimis. Identifikatoriaus lygmeniu nuoseklus aptikimas kelia griežtesnį klausimą: ar detektorius apėmė kiekvieną simbolį kiekviename to paties identifikatoriaus paminėjime? Šį rezultatą atskirai pateikiame identifikatoriams su keliais paminėjimais ir identifikatoriams, kurie kartojasi per kelis apsikeitimus. Simbolių lygmeniu tikslumas matuoja, kiek detektoriaus pažymėto teksto yra pažymėta kaip PII, atšaukimasis matuoja, kiek pažymėto PII jis randa, o F1 subalansuoja abu šiuos rodiklius.

PII-TRACE sudaro 13 148 sintetiniai naudotojo ir asistento pokalbiai 13 kalbų ir 10 rašto sistemų, kuriuose 37 431 identifikatoriaus paminėjimas suženklintas simbolių lygmeniu pagal devynis PII tipus. Iš viso 41 % pokalbių yra su struktūrizuotu turiniu. Tarp 5 645 pokalbių su suženklintu PII, 63,8 % apima identifikatorių, kuris pasirodo daugiau nei vieną kartą, o 28,7 % apima identifikatorių, kuris pasirodo per kelis apsikeitimus.

Sintetinio duomenų rinkinio kūrimas iš gamybinių pokalbių

PII-TRACE išsaugo šaltinio pokalbių apsikeitimų struktūrą neviešindama originalų. Vamzdynas perrašo kiekvieną apsikeitimą ir pakeičia kiekvieną pažymėtą identifikatorių sintetine reikšme.

Diagrama, iliustruojanti, kaip PII-TRACE konvertuoja pažymėtus gamybinius pokalbius į sintetinius duomenų rinkinius per šablonų kūrimą, parafrazavimą, pakeitimą nuosekliomis sintetinėmis reikšmėmis ir patvirtinimo patikras.
PII-TRACE paverčia pažymėtą šaltinio tekstą šablonu, perrašo kiekvieną apsikeitimą, įterpia nuoseklias sintetines reikšmes ir atlieka išleidimo patikras gautam rezultatui.

Pirma, keli kalbos modeliai pažymi devynių tipų PII gamybiniuose naudotojo ir asistento pokalbiuose. Taisyklėmis pagrįstas etapas sugrupuoja pakartotinius to paties tipo identifikatorius po vienu esybės ID. Tada kiekvienas pažymėtas dydis pakeičiamas tipizuotu vietos rezervženklu, paliekant šabloną, kuriame išlaikyta apsikeitimų tvarka, PII tipas ir ryšiai tarp paminėjimų, bet nelieka jokių pažymėtų originalių reikšmių.

Sistema parafrazuoja kiekvieną apsikeitimą, išlaikydama tuos vietos rezervženklus nepakeistus, o tada įterpia sintetines reikšmes, atitinkančias identifikatoriaus tipą ir formatą. Pasikartojantys paminėjimai gauna tą pačią reikšmę pokalbio viduje, o skirtinguose pokalbiuose naudojamos savarankiškai sugeneruotos reikšmės. Galutinis sulyginimo etapas perskaičiuoja kiekvieną simbolio poslinkį.

Trys automatiniai filtrai patikrina, ar pakeitimai atitinka saugomus intervalus, ar pakartotiniuose paminėjimuose naudojama ta pati reikšmė ir ar pažymėtų šaltinio reikšmių nėra atlikus nuskaitymimą naudojant „Presidio“ ir reguliariuosius reiškinius. Saugomas poslinkis taip pat turi atkurti tikslią sintetinę poeilutę. Įrašai, kurių patikra nepavyksta, yra generuojami iš naujo arba pašalinami. Antras kalbos modelis atlieka pavyzdžio auditą, o žmonės peržiūri viską, ką jis pažymi kaip PII.

„PII-Tracer“: kompaktiškas detektorius vietiniam naudojimui

„PII-Tracer“ yra 0,6B dvikryptis koduotuvas, pritaikytas „Qwen3“ pagrindu. Privatumo patikra skiriasi nuo teksto generavimo ir reikalauja rasti susijusius PII intervalus bei grąžinti jų ribas. Dėl to „PII-Tracer“ pakeičia „Qwen3“ kauzališkumo kaukę į užpildą atpažįstančiu dvikrypčiu dėmesiu, todėl kiekvienas žetonas gali remtis tiek ankstesniais, tiek vėlesniais apsikeitimais 4 096 žetonų lange.

Kiekvienam žetonui koduotuvas sukuria 1 024 matavimų reprezentaciją. Linijinė žymėjimo galvutė sukuria 37 galimų žymių balus: vieną specialią žymę (kuriai žymėti naudojame O) tekstui už PII intervalo ribų ir keturias intervalo padėties žymes kiekvienam iš devynių PII tipų. BIOES schemoje, skirtoje vardinių esybių atpažinimui, B (pradžia), I (viduje) ir E (pabaiga) žymi kelių žetonų intervalą, o S (atskiras) žymi vieno žetono intervalą. Pagalbinė galvutė taip pat prognozuoja, ar pokalbyje yra neskelbtinos medžiagos, pavyzdžiui, sveikatos ar religinės informacijos.

Mokome „PII-Tracer“ tris epochas su maždaug 714 000 mokymo pavyzdžių, sujungiant daugiakalbius asistento pokalbius su vieno įrašo pavyzdžiais. Bendras dvikryptis koduotuvas turi dvi mokymo galvutes: 37 klasių BIOES žetonų galvutę, kuri aptinka ir nustato PII intervalus, ir dvejetainę pokalbio lygmens galvutę, kuri prognozuoja, ar pokalbyje yra neskelbtinos medžiagos. Abi galvutes mokome kartu naudodami L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}}. Čia Ltag\mathcal{L}_{\mathrm{tag}} suteikia retoms PII žymėms daugiau svorio, kad dažna žymė „O“ nedominuotų, o Lsens\mathcal{L}_{\mathrm{sens}} pateikia pokalbio lygmens mokymo signalą; 1,5 ir 0,3 koeficientai išlaiko intervalo aptikimą kaip pagrindinę užduotį. Šis papildomas signalas sustiprina kontekstu pagrįstą aptikimą: modelis išmoksta įvertinti kandidato intervalą pokalbio kontekste, o ne kaip atskirą eilutę, taip padėdamas sumažinti klaidingai teigiamus rezultatus tik su nedideliu atšaukimų nuostoliu.

Inferencijos metu suvaržytas Viterbi dekoderis ieško didžiausią įvertinimą turinčios galiojančios BIOES sekos, o ne žymi kiekvieną žetoną atskirai. Pavyzdžiui, B-private_person gali tęstis su I-private_person arba užsidaryti su E-private_person, bet negali persijungti į I-private_email. Dekoderis susieja rezultatą su tiksliais simbolių intervalais, kad juos būtų galima redaguoti arba nukreipti vietoje.

„PII-Tracer“ pirmauja pagal simbolių F1 ir pasikartojantį PII

Detektorius lyginame tiek simbolių, tiek intervalų lygmeniu. Simbolių F1 įvertina aptikimą simbolis po simbolio. Intervalų persidengimo F1 matuoja, ar detektorius aptinka bet kurią PII elemento dalį, o intervalų apimties F1 matuoja, ar jis apima visą elementą.

„PII-Tracer“ pasiekė didžiausią simbolių F1 (0,629) tarp 12 įvertintų sistemų ir antrą pagal dydį intervalų persidengimo F1 bei intervalų apimties F1. Pažangiausi modeliai, būtent „GPT-5.6-sol“ ir „Claude Sonnet 5“, pasiekė panašų bendrą našumą. „GPT-5.6-sol“ gavo geresnius rezultatus pagal abu intervalų lygmens F1 metrikas, bet mažesnį simbolių F1. Tačiau šie pažangiausi modeliai turi šimtus milijardų ar net trilijonu parametrų ir yra uždaro kodo modeliai, priglobti debesyje. Dėl to jie netinkami apsaugoti neskelbtinus vietinius duomenis hibridinio dirbtinio intelekto aplinkoje, kur nepatikrintas tekstas turi likti vietoje. Priešingai, „PII-Tracer“ užtikrina beveik pažangiausių modelių lygio intervalų aptikimą turėdamas tik 0,6B parametrų ir gali apdoroti nepatikrintą tekstą visiškai vietoje. Kiti atvirojo kodo PII detektoriai veikia gerokai prasčiau nei „PII-Tracer“.

Trys stulpelinės diagramos, lyginančios 12 PII aptikimo sistemų. „PII-Tracer 0.6B“ užima pirmąją vietą pagal simbolių F1 ir antrąją vietą pagal intervalų persidengimo ir intervalų apimties F1, atsilikdamas nuo „GPT-5.6-sol“.
Simbolių F1, intervalų persidengimo F1 ir intervalų apimties F1 visose dvylikoje sistemų.

Kiekvieno pasikartojančio paminėjimo radimas

Nuoseklumo eksperimentas taiko griežtesnį testą toms pačioms prognozėms. Testavimo rinkinį sudaro 899 identifikatoriai, kurie pasirodo vieną kartą, ir 959, kurie pasirodo daugiau nei vieną kartą; 790 pasikartojančių identifikatorių apima kelis apsikeitimus. Figūroje pateikiami keturi paminėjimų skaičiaus intervalai (vienas, du, nuo trijų iki penkių ir nuo šešių iki dešimties), o identifikatorius skaičiuojamas tik tada, kad rasti visi jo pažymėti simboliai. Joje pavaizduotas „PII-Tracer“ su trimis pasirinktais atskaitos taškais, o suvestinėje lentelėje pateikiami pasikartojančių ir kelių apsikeitimų rezultatai visoms dvylikai sistemų.

Linijinė diagrama, rodoanti, kad „PII-Tracer“ randa kiekvieną pasikartojančių identifikatorių paminėjimą nuosekliau nei „GPT-5.6-sol“, „GLiNER2-PII“ ir „Claude Opus 4.8“ visose paminėjimų skaičiaus grupėse, o rezultatas sumažėja nuo 91,7 % vienam paminėjimui iki 69,1 % 6–10 paminėjimų.
Identifikatorių, kurių kiekvienas paminėjimas yra rastas, dalis. „PII-Tracer“ pirmauja visose keturiose palyginimo grupėse.

Augant pasikartojimams, „PII-Tracer“ išsiveržia į priekį: jo rezultatas pasikeičia nuo 0,917 esant vienam paminėjimui iki 0,873 esant dviem, 0,796 esant nuo trijų iki penkių ir 0,691 esant nuo šešių iki dešimties. Paskutinėje grupėje „GPT-5.6-sol“ pasiekia 0,464, o „GLiNER2-PII“ ir „Claude Opus 4.8“ pasiekia atitinkamai 0,73 ir 0,045. Atliekant visą vertinimą, „PII-Tracer“ randa kiekvieną 79,4 % pasikartojančių identifikatorių ir 77,6 % tarp eilučių pasikartojančių identifikatorių paminėjimą; „GPT-5.6-sol“ pasiekia 57,0 % ir 55,1 % pagal tuos pačius du matavimus.

Ilgų pokalbių apėmimas

Pirmiausia visus 1 922 bandomuosius pokalbius sugrupuojame pagal simbolių ilgį ir dekoduojame „PII-Tracer“ su 4 096 žetonų langu. Grupėse yra 167 pokalbiai, kuriuose yra mažiau nei 1 000 simbolių, 1 292 – nuo 1 000 iki 10 000, o 463 – 10 000 ar ilgesni.

Grupinė stulpelinė „PII-Tracer“ našumo diagrama pagal pokalbio ilgį. F1 pasiekia aukščiausią 67,0 % tašką 1 000–10 000 simbolių pokalbiams, o atšaukimasis sumažėja nuo 97,5 % pokalbiams iki 1 000 simbolių iki 68,7 % pokalbiams, ilgesniems nei 10 000 simbolių.
Simbolių tikslumas, atšaukimasis ir F1 pagal pokalbio ilgį

Vieno lango atšaukimasis yra 0,975 esant mažiau nei 1 000 simbolių ir 0,955 esant nuo 1 000 iki 10 000, tačiau nukrenta iki 0,687 pokalbiams, kuriuose yra 10 000 ar daugiau simbolių. Tikslumas išlieka artimas 0,51 dviejose ilgesnėse grupėse, o tai rodo, kad pagrindinė problema yra įvesties aprėptis.

Siekiant ištirti įvesties tvarkymo poveikį, tą patį kontrolinį tašką įvertiname taikant slankiojo lango dekodavimą su 50 % persidengimu. Tai padidina bendrą simbolių atšaukimą nuo 0,830 iki 0,965, o kelių paminėjimų nuoseklų aptikimą – nuo 0,794 iki 0,954, be pakartotinio mokymo.

Nuoseklumas kalbose

PII-TRACE apima 13 kalbų; kalbos eksperimente aprašoma šešių kalbų dalis, apimanti lotynų, kirilicos ir hangul rašto sistemas: anglų, vokiečių, prancūzų, italų, rusų ir korėjiečių. Tuos pačius 12 detektorių paleidžiame visuose bandomuosiuose pokalbiuose kiekviena kalba. Kiekvienoje kalboje sujungiame numatomus ir aukso simbolius bei apskaičiuojame simbolių F1.

Šilumos žemėlapis, lyginantis 12 PII aptikimo sistemų simbolių F1 rezultatus anglų, vokiečių, prancūzų, italų, rusų ir korėjiečių kalbomis. „PII-Tracer“ pirmauja vokiečių, prancūzų, italų ir rusų kalbomis, o visose šešiose kalbose rodo nuosekliai gerus rezultatus.
Simbolių F1 šešiose kalbų posistemėse, kuriose yra PII, apimančiose lotynų, kirilicos ir hangul rašto sistemas.

„PII-Tracer“ pirmauja pagal simbolių F1 keturiose iš šešių kalbų: vokiečių (0,735), prancūzų (0,633), italų (0,676) ir rusų (0,651), o anglų bei korėjiečių kalbomis atsilieka nuo geriausių rezultatų 0,016 ir 0,036. Papildomoje analizėje jis užtikrina nuoseklų aptikimą visose šešiose kalbų posistemėse, surinkdamas 0,80–0,93 balus. Rodinys pagal kalbas rodo geresnius rezultatus nei vien anglų kalba.

Aukštesnis simbolių F1 nei privatumo filtro penkiuose standartiniuose baziniuose vertinimuose

Paskutinis eksperimentas perkeliamas už PII-TRACE ribų. Paleidžiame „PII-Tracer“ ir „OpenAI“ privatumo filtrą „ai4privacy“ tikrinimo imtyje (47 728 dokumentai), „Nemotron-PII“ testavimo imtyje (100 000), fiksuoto šaltinio „SPY“ rinkinyje (8 688), „Gretel PII“ testavimo imtyje (5 000) ir „TAB ECHR“ testavimo imtyje (127).

Grupinė stulpelinė diagrama, lyginanti „PII-Tracer“ tikslumą, atšaukimą ir simbolių F1 su „OpenAI“ privatumo filtro F1 penkiuose išoriniuose bazuotuose vertinimuose. „PII-Tracer“ pasiekia aukštesnį F1 rezultatą kiekviename baziniame vertinime.
Simbolių lygmens rezultatai penkiuose išoriniuose PII baziniuose vertinimuose, įvertinti nereikalaujant, kad kategorijų pavadinimai sutaptų. Pilki stulpeliai rodo „OpenAI“ privatumo filtrą atliekant tą patį vertinimą.

„PII-Tracer“ pasiekia aukštesnį simbolių F1 kiekviename duomenų rinkinyje: 0,950 palyginti su 0,907 „ai4privacy“, 0,847 palyginti su 0,709 „Nemotron-PII“, 0,585 palyginti su 0,543 „SPY“, 0,952 palyginti su 0,895 „Gretel PII“ ir 0,594 palyginti su 0,350 „TAB“. „TAB“ yra vienintelis bazinis vertinimas šioje grupėje, sudarytas iš realaus, žmonių pažymėto teksto. Čia „PII-Tracer“ pasiekia 0,986, palyginti su 0,982 tikslumu, ir 0,425, palyginti su 0,213 atšaukimu – tai dvigubai didesnis atšaukimas esant iš esmės tam pačiam tikslumui (išsamiau aprašyta straipsnyje). Todėl didesnis F1 perkeliamas iš PII-TRACE pokalbių į visus penkis įprastus vieno įrašo bazinius vertinimus šiame palyginime.

Išvada

Hibridinis dirbtinis intelektas integruoja naudotojo įrenginį į inferencijos dėklą, siūlydamas geresnį privatumą ir mažesnę kainą. Pažangiausi debesies modeliai gali valdyti tyrimus, samprotavimą ir planavimą, o vietiniai modeliai dirba su failais ir asmens duomenimis, kurie turėtų likti įrenginyje. Šis padalijimas priklauso nuo neskelbtinos informacijos atpažinimo prieš bet kokiems neskelbtiniems duomenims patenkant į debesį.

„PII-Tracer“ yra kompaktiškas modelis, skirtas PII aptikti daugiakrypčiuose pokalbiuose, o PII-TRACE įvertina, ar detektoriai gali nuosekliai nustatyti pasikartojantį PII viso pokalbio metu.

Kartu PII-TRACE ir „PII-Tracer“ suteikia bazinį vertinimą ir pavyzdinį modelį, skirtą skatinti PII aptikimą daugiakrypčiuose pokalbiuose ir kitoje ilgo konteksto aplinkoje.

Agentai imasi ilgesnių užduočių ir dirba su daugiau asmeninio konteksto. Dėl to privatumo valdikliai turėtų galioti visame pokalbyje, o ne tik pradinėje įvestyje. Hibridinis dirbtinis intelektas priklauso nuo patikimo vietinio aptikimo, kad neskelbtinas kontekstas liktų įrenginyje.

Perskaitykite „arXiv“ straipsnį, kuriame pateikiama išsami informacija apie PII-TRACE bazinį vertinimą, „PII-Tracer“ modelį ir mūsų vertinimą. Netrukus planuojame išleisti ir PII-TRACE, ir „PII-Tracer“.

  1. Pristatome hibridinį skaičiavimą „Mac“ kompiuteryjeNaujienos2026-09-01
  2. Duomenų centras persikelia į jūsų įrenginįNaujienos2026-06-02