PII-TRACE: Wykrywanie danych osobowych przed ich opuszczeniem urządzenia

Benchmark w 13 językach do spójnego wykrywania PII w długich konwersacjach, połączony z kompaktowym detektorem 0,6B zaprojektowanym do działania lokalnego.

AutorzyPerplexity Secure Intelligence Institute

Obliczenia hybrydowe na komputerze Mac dzielą zadania Perplexity Computer pomiędzy wiodące modele w chmurze a lokalny model na komputerze Mac. Agenci chmurowi obsługują badania, wnioskowanie i planowanie, podczas gdy model lokalny pracuje z prywatnymi plikami i poufnymi informacjami.

Granica ta zależy od wykrycia danych osobowych (PII) przed ich opuszczeniem urządzenia. Lokalna bramka prywatności zatrzymuje poufną zawartość na komputerze Mac, redaguje wykryte informacje prywatne lub żąda zatwierdzenia przed wysłaniem ich do chmury.

Wykrywanie staje się trudniejsze w długich, wielojęzycznych konwersacjach. Ten sam identyfikator może pojawić się kilka razy w różnych turach. Jedna pominięta wzmianka może ujawnić informacje, które system ma za zadanie chronić.

Wprowadzenie

Dzisiaj przedstawiamy PII-TRACE (Tracing Recurring PII Across Conversational Exchanges – śledzenie powtarzających się PII w wymianach konwersacyjnych), nowy benchmark do oceny detektorów danych osobowych (PII) oraz PII-Tracer, kompaktowy model o rozmiarze 0,6B przeznaczony do wykrywania PII.

Agenci opierający się w pierwszej kolejności na chmurze zmuszają użytkowników do balansowania między kontekstem, inteligencją a prywatnością. Więcej osobistego kontekstu może pomóc agentowi zrozumieć użytkownika i przynieść lepsze wyniki. Jednakże dostarczenie tego kontekstu często oznacza wysyłanie prywatnych informacji do zdalnej usługi i może prowadzić do wycieku danych osobowych. Informacje, dzięki którym asystent jest użyteczny, mogą być dokładnie tym, co użytkownik najbardziej chce zachować w tajemnicy.

Sztuczna inteligencja hybrydowa ułatwia ten kompromis, dzieląc pracę pomiędzy urządzenie użytkownika a modele w chmurze. Jednak ta granica chroni prywatność tylko wtedy, gdy urządzenie potrafi rozpoznać PII, zanim tekst zostanie wysłany do zdalnego modelu. Użytkownicy nie powinni musieć samodzielnie sprawdzać każdej wiadomości. Urządzenie potrzebuje lokalnego detektora PII jako swojej bramki prywatności. W długich konwersacjach ten sam identyfikator może powtarzać się w różnych turach, a jedna pominięta wzmianka wystarczy, aby informacje osobiste przedostały się dalej.

Diagram ilustrujący przepływ pracy bramki prywatności (Privacy Gate), pokazujący, jak poufne dane pozostają na urządzeniu lokalnym, podczas gdy zatwierdzone żądania są wysyłane do modeli w chmurze w celu przetworzenia.
PII-Tracer jako bramka prywatności w sztucznej inteligencji hybrydowej

Perplexity wprowadził hybrydowy orkiestrator wnioskowania lokalno-serwerowego, który decyduje, jakie zadania powinny być wykonywane na urządzeniu, a jakie powinny trafiać do agentów w chmurze. Model, zestaw narzędzi agenta (agent harness), konwersacje i trajektorie wykonania znajdują się na maszynie użytkownika. Zadania wymagające dostępu do świata zewnętrznego są wywoływane tylko wtedy, gdy jest to konieczne, i są ograniczone uprawnieniami użytkownika. W rezultacie, dopóki użytkownik ich nie zatwierdzi, zawartość ta pozostaje na urządzeniu.

PII-Tracer zapewnia jeden lokalny sygnał sterujący do routingu modeli poprzez oznaczanie zakresów, co do których przewiduje się, że zawierają PII. Aplikacja egzekwuje następnie politykę routingu. Utrzymuje istotne dane wejściowe lokalnie, redaguje wykryte zakresy lub żąda wyraźnego zatwierdzenia przed przekazaniem do modelu w chmurze. Sprawia to, że routing staje się bardziej selektywny. Wykryte PII pozostają na urządzeniu, podczas gdy zatwierdzony kontekst nadal korzysta z wiodących modeli w chmurze.

Selektywny routing zależy od spójnego wykrywania w całej konwersacji. Ten sam identyfikator może powtarzać się w różnych turach, a pominięta wzmianka nadal może zostać przesłana.

Spośród 12 detektorów PII-Tracer odnotowuje najwyższy wskaźnik Character F1 oraz najwyższe spójne pokrycie powtarzających się identyfikatorów. Benchmark wyjaśnia, dlaczego oba wyniki mają znaczenie: w przypadku długiej konwersacji znalezienie większości PII to nie to samo, co znalezienie każdej jej kopii.

Wykrywanie PII napotyka nowe wyzwania w sztucznej inteligencji hybrydowej

Wykrywanie PII to wieloletni problem związany z bezpieczeństwem, dla którego istnieje już kilka benchmarków i detektorów. Jednak wykrywanie PII w środowiskach hybrydowej AI wprowadza nowe wyzwania. W szczególności detektory muszą identyfikować PII w długich konwersacjach wieloturowych, w których kontekst konwersacyjny decyduje o tym, czy dany ciąg znaków powinien być uznany za PII. Na przykład imię może identyfikować użytkownika w jednej konwersacji, odnosić się do osoby publicznej w innej lub być po prostu symbolem zastępczym wygenerowanym przez asystenta. Sama postać tekstowa (surface form) nie wystarcza do określenia, czy ciąg znaków powinien zostać oznaczony jako PII.

Interfejs czatu przedstawia asystenta zachowującego imię i nazwisko użytkownika, numer telefonu, szczegóły spotkania oraz adres e-mail w wielu turach.
Imię i nazwisko, numer telefonu oraz adres e-mail powtarzają się w konwersacji. PII-TRACE uznaje identyfikator za spójnie wykryty tylko wtedy, gdy zostanie znaleziona każda wzmianka.

Istniejące detektory i benchmarki PII koncentrują się przede wszystkim na pojedynczych rekordach. Odkrywamy, że detektory zaprojektowane do przetwarzania jednego rekordu naraz radzą sobie słabo z długimi, złożonymi konwersacjami. Co więcej, istniejące benchmarki zazwyczaj nie oceniają spójności między turami. W rezultacie wysoka wydajność w tych benchmarkach niekoniecznie przekłada się na skuteczne wykrywanie PII w długich konwersacjach wielobocznych (multi-turn).

PII-TRACE: Benchmark do wykrywania PII o krytycznym znaczeniu dla wdrożeń

Zaprojektowaliśmy PII-TRACE wokół trzech zachowań, które mają znaczenie, gdy detektor PII jest używany w konwersacjach z asystentem. Pierwszym z nich jest spójne pokrycie: gdy identyfikator pojawia się kilka razy lub przekracza tury użytkownika i asystenta, detektor musi odnaleźć każdą wzmiankę. Drugim jest odporność na długi kontekst: konwersacje liczą od mniej niż 1000 do ponad 100 000 znaków, co umożliwia zmierzenie, co dzieje się w miarę wzrostu historii. Trzecim jest obsługa wielu języków i treści o mieszanym formacie: konwersacja może zmieniać język i łączyć prozę z kodem, tabelami lub strukturami danych. PII-TRACE zachowuje te wzorce, oceniając każdy pełny dialog zamiast dzielić go na odizolowane rekordy.

Benchmark mierzy wydajność na dwóch uzupełniających się poziomach. Na poziomie identyfikatorów spójne wykrywanie stawia trudniejsze pytanie: czy detektor objął każdy znak w każdej wzmiance tego samego identyfikatora? Wynik ten podajemy osobno dla identyfikatorów z wieloma wzmiankami oraz dla identyfikatorów powtarzających się w różnych turach. Na poziomie znaków precyzja mierzy, jaka część tekstu oznaczonego przez detektor jest oznaczona jako PII, czułość mierzy, jaką część oznaczonych PII wykrywa, a F1 równoważy oba te wskaźniki.

PII-TRACE zawiera 13 148 syntetycznych konwersacji użytkownika z asystentem w 13 językach i 10 systemach pisma, z 37 431 wzmiankami identyfikatorów oznaczonymi na poziomie znaków w dziewięciu typach PII. Łącznie 41% konwersacji zawiera strukturę danych. Spośród 5 645 konwersacji z oznaczonymi PII, 63,8% zawiera identyfikator pojawiający się więcej niż raz, a 28,7% zawiera identyfikator pojawiający się w wielu turach.

Budowanie syntetycznego zestawu danych z konwersacji produkcyjnych

PII-TRACE zachowuje strukturę tur konwersacji źródłowych bez publikowania oryginałów. Potok (pipeline) przepisuje każdą turę i zastępuje każdy oznaczony identyfikator wartością syntetyczną.

Diagram ilustrujący, w jaki sposób PII-TRACE przekształca oznaczone konwersacje produkcyjne w syntetyczne zestawy danych za pomocą tworzenia szablonów, parafrazowania, zastępowania spójnymi wartościami syntetycznymi oraz kontroli walidacyjnych.
IPII-TRACE przekształca oznaczony tekst źródłowy w szablon, przepisuje każdą turę, wstawia spójne wartości syntetyczne i przeprowadza kontrole wydania.

Po pierwsze, wiele modeli językowych oznacz pięć (tu: dziewięć) typów PII w produkcyjnych konwersacjach użytkownika z asystentem. Przebieg oparty na regułach grupuje powtórzone identyfikatory tego samego typu pod jednym identyfikatorem jednostki. Każda oznaczona wartość jest następnie zastępowana wpisem z typem (typed placeholder), pozostawiając szablon, który zachowuje kolejność tur, typ PII i powiązania między wzmiankami, ale nie zawiera żadnych oznaczonych wartości oryginalnych.

System parafrazuje każdą turę, zachowując nienaruszone symbole zastępcze, a następnie wstawia syntetyczne wartości pasujące do typu i formatu identyfikatora. Powtarzające się wzmianki otrzymują tę samą wartość w obrębie konwersacji, podczas gdy różne konwersacje używają niezależnie wygenerowanych wartości. Ostatni przebieg wyrównywania przelicza każde przesunięcie znaków.

Trzy zautomatyzowane bramki sprawdzają, czy zamienniki odpowiadają zapisanym zakresom, czy powtórzone wzmianki używają tej samej wartości oraz czy oznaczone wartości źródłowe są nieobecne podczas ponownego skanowania za pomocą Presidio i wyrażeń regularnych. Zapisane przesunięcie musi również odtworzyć dokładny syntetyczny podciąg. Rekordy, które nie przeszły testu, są generowane ponownie lub odrzucane. Drugi model językowy audytuje próbkę, a ludzie weryfikują wszystko, co zostanie przez niego oznaczone jako PII.

PII-Tracer: Kompaktowy detektor do użytku lokalnego

PII-Tracer to dwukierunkowy koder o rozmiarze 0,6B zaadaptowany z bocznej struktury Qwen3. Filtrowanie prywatności różni się od generowania tekstu i wymaga odnajdywania istotnych zakresów PII oraz zwracania ich granic. W rezultacie PII-Tracer zastępuje maskę przyczynową (causal mask) Qwen3 dwukierunkową uwagą z uwzględnieniem dopełnienia (padding-aware bidirectional attention), dzięki czemu każdy token może korzystać zarówno z wcześniejszych, jak i późniejszych tur w oknie o długości 4096 tokenów.

Dla każdego tokena koder generuje reprezentację o wymiarze 1024. Liniowa głowica tagowania generuje wyniki dla 37 możliwych etykiet: jednej etykiety specjalnej (którą oznaczamy jako O) dla tekstu poza zakresem PII oraz czterech etykiet pozycji w zakresie dla każdego z dziewięciu typów PII. W schemacie BIOES dla rozpoznawania nazwanych jednostek (Named Entity Recognition) B (Początek), I (Środek) i E (Koniec) oznaczają zakres wielotokenowy, podczas gdy S (Pojedynczy) oznacza zakres jedno tokenowy. Głowica pomocnicza przewiduje również, czy konwersacja zawiera materiały poufne, takie jak informacje o stanie zdrowia lub poglądach religijnych.

Trenujemy PII-Tracer przez trzy epoki na około 714 000 próbek treningowych, łącząc wielojęzyczne konwersacje z asystentem z przykładami pojedynczych rekordów. Współdzielony koder dwukierunkowy posiada dwie głowice treningowe: 37-klasową głowicę tokenów BIOES, która wykrywa i klasyfikuje zakresy PII, oraz binarną głowicę na poziomie konwersacji, która przewiduje, czy konwersacja zawiera materiały poufne. Trenujemy obie głowice wspólnie przy użyciu L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}}. Tutaj Ltag\mathcal{L}_{\mathrm{tag}} nadaje rzadszym etykietom PII większą wagę, dzięki czemu częsta etykieta „O” nie dominuje, podczas gdy Lsens\mathcal{L}_{\mathrm{sens}} dostarcza sygnał treningowy na poziomie konwersacji; współczynniki 1,5 i 0.3 utrzymują wykrywanie zakresów jako główne zadanie. Ten sygnał pomocniczy wzmacnia wykrywanie uwzględniające kontekst (context-aware): model u się oceniać kandydata na zakres w ramach konwersacji, a nie jako odizolowany ciąg znaków, co pomaga ograniczyć liczbę fałszywych alarmów przy niewielkim kompromisie w zakresie czułości.

W czasie wnioskowania ograniczony dekoder Viterbija wyszukuje prawidłową sekwencję BIOES o najwyższym wyniku zamiast etykietować każdy token niezależnie. Na przykład B-private_person może być kontynuowany przez I-private_person lub zakończony przez E-private_person, ale nie może przełączyć się na I-private_email. Dekoder mapuje wynik z powrotem na dokładne zakresy znaków w celu zamaskowania (redaction) lub lokalnego routingu.

PII-Tracer liderem w zakresie Character F1 oraz powtarzających się PII

Porównujemy detektory na poziomie zarówno znaków, jak i zakresów (span). Wskaźnik Character F1 ocenia wykrywanie znak po znaku. Span-overlap F1 mierzy, czy detektor identyfikuje jakąkolwiek część elementu PII, podczas gdy span-containment F1 mierzy, czy przechwytuje on cały element.

PII-Tracer osiągnął najwyższy wskaźnik Character F1 (0,629) spośród 12 ocenianych systemów oraz drugi najwyższy wynik span-overlap F1 i span-containment F1. Modele czołowe, a mianowicie GPT-5.6-sol i Claude Sonnet 5, osiągnęły porównywalną ogólną wydajność. GPT-5.6-sol uzyskał wyższe wyniki w obu metrykach F1 na poziomie zakresów, ale niższy wskaźnik Character F1. Modele te mają jednak setki miliardów lub nawet biliony parametrów i są modelami o zamkniętym kodzie źródłowym hostowanymi w chmurze. W rezultacie nie nadają się do ochrony wrażliwych danych lokalnych w środowiskach AI hybrydowej, gdzie niesprawdzony tekst musi pozostać lokalny. Z kolei PII-Tracer zapewnia wykrywanie na poziomie zakresów zbliżonym do modeli czołowych przy zaledwie 0,6B parametrów i może przetwarzać niesprawdzony tekst w całości lokalnie. Inne otwarte detektory PII radzą sobie znacznie gorzej niż PII-Tracer.

Trzy wykresy słupkowe porównujące 12 systemów wykrywania PII. PII-Tracer 0.6B zajmuje pierwsze miejsce pod względem wskaźnika Character F1 oraz drugie pod względem span-overlap i span-containment F1, ustępując jedynie GPT-5.6-sol.
Character F1, Span-overlap F1 i Span-containment F1 we wszystkich dwunastu systemach.

Wyszukiwanie każdej powtarzającej się wzmianki

Eksperyment dotyczący spójności stosuje surowszy test do tych samych predykcji. Zestaw testowy zawiera 899 identyfikatorów, które pojawiają się raz, oraz 959, które pojawiają się więcej niż raz; 790 powtarzających się identyfikatorów obejmuje wiele tur. Rysunek przedstawia cztery przedziały liczby wzmianek (jedna, dwie, od trzech do pięciu oraz od sześciu do dziesięciu) i uwzględnia identyfikator tylko wtedy, gdy znaleziono wszystkie jego oznaczone znaki. Wykres przedstawia PII-Tracer z trzema wybranymi modelami bazowymi, podczas gdy tabela agregująca podaje wyniki dla powtarzających się i wieloturowych identyfikatorów dla wszystkich dwunastu systemów.

Wykres liniowy pokazujący, że PII-Tracer znajduje każdą wzmiankę powtarzających się identyfikatorów bardziej konsekwentnie niż GPT-5.6-sol, GLiNER2-PII i Claude Opus 4.8 we wszystkich grupach liczby wzmianek, ze spadkiem z 91,7% dla jednej wzmianki do 69,1% dla 6–10 wzmianek.
Udział identyfikatorów, których każda wzmianka została znaleziona. PII-Tracer prowadzi we wszystkich czterech przedziałach porównawczych.

PII-Tracer zachowuje przewagę w miarę wzrostu liczby powtórzeń: jego wynik zmienia się z 0,917 dla jednej wzmianki do 0,873 dla dwóch, 0,796 dla trzech do pięciu oraz 0,691 dla sześciu do dziesięciu. W ostatnim przedziale GPT-5.6-sol osiąga 0,464, podczas gdy GLiNER2-PII i Claude Opus 4.8 osiągają odpowiednio 0,073 i 0,045. W całej ewaluacji PII-Tracer znajduje każdą wzmiankę 79,4% powtarzających się identyfikatorów oraz 77,6% identyfikatorów występujących w wielu turach; GPT-5.6-sol osiąga 57,0% i 55,1% w tych samych dwóch miarach.

Obejmowanie długich konwersacji

Najpierw grupuziemy wszystkie 1 922 konwersacje testowe według długości znaków i dekodujemy PII-Tracer przy użyciu okna o długości 4096 tokenów. Grupy zawierają 167 konwersacji poniżej 1000 znaków, 1 292 konwersacje o długości od 1000 do 10 000 oraz 463 konwersacje o długości 10 000 lub większej.

Grupowany wykres słupkowy przedstawiający wydajność PII-Tracer według długości konwersacji. Wskaźnik F1 osiąga szczyt na poziomie 67,0% dla konwersacji liczących 1000–10 000 znaków, podczas gdy czułość (recall) spada z 97,5% dla konwersacji poniżej 1000 znaków do 68,7% dla tych powyżej 10 000.
Precyzja znakowa, czułość i F1 w zależności od długości konwersacji

Czułość dla pojedynczego okna wynosi 0,975 poniżej 1000 znaków i 0,955 w zakresie od 1000 do 10 000, ale spada do 0,687 w przypadku konwersacji mających 10 000 znaków lub więcej. Precyzja utrzymuje się na poziomie bliskim 0,51 w dwóch dłuższych grupach, co wskazuje na pokrycie danych wejściowych jako główny problem.

Aby zbadać wpływ przetwarzania danych wejściowych, oceniamy ten sam punkt kontrolny (checkpoint) przy użyciu dekodowania z oknem przesuwnym z nakładaniem się w 50% (50%-overlap sliding-window). Zwiększa to ogólną czułość znakową z 0,830 do 0,965 oraz spójne wykrywanie wielu wzmianek z 0,794 do 0,954 bez ponownego trenowania.

Spójność w różnych językach

PII-TRACE obejmuje 13 języków; eksperyment językowy przedstawia wycinek składający się z sześciu języków obejmujących pisma łacińskie, cyrylicę i hangul: angielski, niemiecki, francuski, włoski, rosyjski i koreański. Uruchamiamy te same 12 detektorów dla wszystkich konwersacji testowych w każdym języku. W ramach każdego języka łączymy przewidziane i złote znaki oraz obliczamy wskaźnik Character F1.

Mapa cieplna porównująca wyniki Character F1 dla 12 systemów wykrywania PII w językach angielskim, niemieckim, francuskim, włoskim, rosyjskim i koreańskim. PII-Tracer przoduje w języku niemieckim, francuskim, włoskim i rosyjskim, osiągając niezmiennie dobre wyniki we wszystkich sześciu językach.
Character F1 dla sześciu podzbiorów językowych zawierających PII, obejmujących pismo łacińskie, cyrylicę i hangul.

PII-Tracer prowadzi w zakresie Character F1 w czterech z sześciu języków: niemieckim (0,735), francuskim (0,633), włoskim (0,676) i rosyjskim (0,651), a w języku angielskim i koreańskim ustępuje najlepszym wynikom o zaledwie 0,016 i 0,036. W analizie towarzyszącej prowadzi do spójnego wykrywania we wszystkich sześciu podzbiorach językowych, osiągając wynik 0,80–0,93. Widok w podziale na języki pokazuje zyski wykraczające poza język angielski.

Wyższy wskaźnik Character F1 niż Privacy Filter w pięciu standardowych benchmarkach

Ostatni eksperyment wykracza poza PII-TRACE. Uruchamiamy PII-Tracer i OpenAI Privacy Filter na zbiorze walidacyjnym ai4privacy (47 728 dokumentów), zbiorze testowym Nemotron-PII (100 000), stałym zbiorze testowym SPY (8 688), zbiorze testowym Gretel PII (5 000) oraz zbiorze testowym TAB ECHR (127).

Grupowany wykres słupkowy porównujący precyzję, czułość i wskaźnik Character F1 modelu PII-Tracer ze wskaźnikiem F1 OpenAI Privacy Filter w pięciu zewnętrznych benchmarkach. PII-Tracer osiąga wyższy wynik F1 w każdym benchmarku.
Wyniki na poziomie znaków w pięciu zewnętrznych benchmarkach PII, oceniane bez wymagania dopasowania nazw kategorii. Szare słupki przedstawiają OpenAI Privacy Filter w ramach tej samej ewaluacji.

PII-Tracer uzyskuje wyższy wskaźnik Character F1 na każdym zbiorze danych: 0,950 wobec 0,907 na ai4privacy, 0,847 wobec 0,709 na Nemotron-PII, 0,585 wobec 0,543 na SPY, 0,952 wobec 0,895 na Gretel PII oraz 0,594 wobec 0,350 na TAB. TAB to jedyny benchmark w tej grupie zbudowany z rzeczywistego tekstu opatrzonego etykietami przez ludzi. W tym przypadku PII-Tracer osiąga precyzję 0,986 wobec 0,982 oraz czułość 0,425 wobec 0,213 – dwukrotnie wyższą czułość przy zasadniczo tej samej precyzji (szczegóły w dokumencie). Wyższy wynik F1 przenosi się zatem z konwersacji PII-TRACE na wszystkie pięć konwencjonalnych benchmarków pojedynczych rekordów w tym porównaniu.

Wniosek

Sztuczna inteligencja hybrydowa integruje urządzenie użytkownika ze stosem wnioskowania, oferując wyższy poziom prywatności i niższy koszt. Wiodące modele w chmurze mogą obsługiwać badania, wnioskowanie i planowanie, podczas gdy modele lokalne pracują z plikami i danymi osobowymi, które powinny pozostać na urządzeniu. Ten podział zależy od rozpoznania poufnych informacji, zanim jakiekolwiek wrażliwe dane trafią do chmury.

PII-Tracer to kompaktowy model do wykrywania PII w konwersacjach wieloturowych, podczas gdy PII-TRACE ocenia, czy detektory potrafią spójnie identyfikować powtarzające się PII w trakcie całej konwersacji.

Razem PII-TRACE i PII-Tracer stanowią benchmark oraz model referencyjny służący do rozwoju wykrywania PII w konwersacjach wieloturowych i innych scenariuszach z długim kontekstem.

Agenci podejmują się dłuższych zadań i pracują z większym kontekstem osobistym. W rezultacie mechanizmy kontroli prywatności powinny utrzymywać się w trakcie całej konwersacji, a nie tylko na etapie początkowego wprowadzania danych. Sztuczna inteligencja hybrydowa opiera się na niezawodnym lokalnym wykrywaniu, aby zachować poufny kontekst na urządzeniu.

Przeczytaj artykuł z arXiv, aby poznać szczegóły dotyczące benchmarku PII-TRACE, modelu PII-Tracer oraz naszej ewaluacji. Planujemy wkrótce udostępnić zarówno PII-TRACE, jak i PII-Tracer.

  1. Wprowadzenie obliczeń hybrydowych na MacaAktualności1 wrz 2026
  2. Centrum danych przenosi się na Twoje urządzenieAktualności2 cze 2026