PII-TRACE: Detectando dados pessoais antes que saiam do dispositivo

Um benchmark de 13 idiomas para detecção consistente de PII em conversas longas, emparelhado com um detector compacto de 0,6B projetado para rodar localmente.

AutoresPerplexity Secure Intelligence Institute

O recurso computacional híbrido no Mac divide as tarefas do Perplexity Computer entre modelos de ponta na nuvem e um modelo local no Mac. Agentes na nuvem lidam com pesquisas, raciocínio e planejamento, enquanto o modelo local trabalha com arquivos privados e informações sensíveis.

Esse limite depende da detecção de informações pessoalmente identificáveis (PII) antes que elas deixem o dispositivo. Um portal de privacidade local mantém o conteúdo sensível no Mac, oculta as informações privadas detectadas ou solicita aprovação antes de enviá-las para a nuvem.

A detecção torna-se mais difícil em conversas longas e multilíngues. O mesmo identificador pode aparecer várias vezes em diferentes turnos. Uma única menção omitida pode expor as informações que o sistema deve proteger.

Introdução

Hoje, estamos apresentando o PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), um novo benchmark para avaliar detectores de informações pessoalmente identificáveis (PII) e o PII-Tracer, um modelo compacto de 0,6B para detecção de PII.

Agentes focados na nuvem forçam os usuários a equilibrar contexto, inteligência e privacidade. Mais contexto pessoal pode ajudar um agente a entender o usuário e produzir melhores resultados. Mas fornecer esse contexto geralmente significa enviar informações privadas para um serviço remoto e pode vazar informações pessoais. A informação que torna um assistente útil pode ser exatamente o que um usuário mais deseja manter privado.

A IA híbrida suaviza esse compromisso dividindo o trabalho entre o dispositivo do usuário e modelos em nuvem. Mas esse limite só protege a privacidade se o dispositivo puder reconhecer PII antes que o texto seja enviado para um modelo remoto. Os usuários não deveriam ter que inspecionar cada mensagem por si mesmos. O dispositivo precisa de um detector de PII local como seu portal de privacidade. Em conversas longas, o mesmo identificador pode recorrer entre turnos, e uma menção omitida é suficiente para que informações pessoais passem.

Diagrama ilustrando o fluxo de trabalho de um portal de privacidade, mostrando como os dados sensíveis permanecem em um dispositivo local enquanto solicitações aprovadas são enviadas para modelos em nuvem para processamento.
O PII-Tracer como o portal de privacidade em IA híbrida

A Perplexity introduziu um orquestrador híbrido de inferência local e em servidor que decide qual trabalho deve ser executado no dispositivo e qual trabalho deve ir para os agentes na nuvem. O modelo, o harness do agente, as conversas e as trajetórias de execução residem na máquina do usuário. Tarefas que exigem acesso ao mundo externo são invocadas apenas quando necessário e são controladas por permissão do usuário. Como resultado, até que o usuário aprove, esse conteúdo permanece no dispositivo.

O PII-Tracer fornece um sinal de controle local para o roteamento de modelos, sinalizando spans previstos para conter PII. O aplicativo então aplica a política de roteamento. Ele mantém a entrada relevante no dispositivo, oculta os spans detectados ou solicita aprovação explícita antes de escalar para um modelo na nuvem. Isso torna o roteamento mais seletivo. A PII detectada permanece no dispositivo, enquanto o contexto aprovado ainda se beneficia de modelos de ponta em nuvem.

O roteamento seletivo depende de detecção consistente em toda a conversa. O mesmo identificador pode recorrer entre turnos, e uma menção omitida ainda pode ser transmitida.

Entre 12 detectores, o PII-Tracer registra o maior F1 de caracteres e a maior cobertura consistente de identificadores recorrentes. O benchmark explica por que ambos os resultados importam: em uma conversa longa, encontrar a maioria da PII não é o mesmo que encontrar cada cópia dela.

A detecção de PII enfrenta novos desafios na IA híbrida

A detecção de PII é um problema de segurança de longa data, e vários benchmarks e detectores já existem. No entanto, a detecção de PII em configurações de IA híbrida introduz novos desafios. Em particular, os detectores devem identificar PII em conversas longas e de múltiplos turnos, onde o contexto conversacional determina se uma string deve ser considerada PII. Por exemplo, um nome pode identificar o usuário em uma conversa, referir-se a uma figura pública em outra ou simplesmente ser um espaço reservado gerado por um assistente. A forma de superfície isolada é insuficiente para determinar se uma string deve ser sinalizada como PII.

Uma interface de chat mostra um assistente retendo o nome, o número de telefone, os detalhes de compromissos e o endereço de e-mail de um usuário em vários turnos.
Um nome, número de telefone e endereço de e-mail recorrem ao longo da conversa. O PII-TRACE conta um identificador como detectado consistentemente apenas se cada menção for encontrada.

Os detectores e benchmarks de PII existentes visam principalmente registros individuais. Descobrimos que os detectores projetados para processar um registro por vez têm desempenho ruim em conversas longas e complexas. Além disso, os benchmarks existentes geralmente não avaliam a consistência entre turnos. Como resultado, um forte desempenho nesses benchmarks não se traduz necessariamente em uma detecção de PII eficaz em conversas longas e de múltiplos turnos.

PII-TRACE: Um benchmark para detecção de PII crítica para implantação

Projetamos o PII-TRACE em torno de três comportamentos que importam quando um detector de PII é usado em conversas de assistentes. O primeiro é a cobertura consistente: quando um identificador aparece várias vezes ou cruza turnos de usuário e assistente, o detector precisa encontrar todas as menções. O segundo é a robustez a contextos longos: as conversas variam de menos de 1.000 a mais de 100.000 caracteres, tornando possível medir o que acontece conforme o histórico cresce. O terceiro é o tratamento de múltiplos idiomas e conteúdo de formatos mistos: uma conversa pode mudar de idioma e combinar prosa com código, tabelas ou registros estruturados. O PII-TRACE preserva esses padrões avaliando cada diálogo completo em vez de dividi-lo em registros isolados.

O benchmark mede o desempenho em dois níveis complementares. No nível do identificador, a detecção consistente faz a pergunta mais rigorosa: o detector cobriu cada caractere em cada menção do mesmo identificador? Relatamos essa pontuação separadamente para identificadores com múltiplas menções e para identificadores que se repetem entre turnos. No nível do caractere, a precisão mede quanto do texto marcado por um detector é rotulado como PII, o recall mede quanta PII rotulada ele encontra, e o F1 equilibra ambos.

O PII-TRACE contém 13.148 conversas sintéticas entre usuário e assistente em 13 idiomas e 10 sistemas de escrita, com 37.431 menções de identificadores rotuladas no nível de caractere em nove tipos de PII. Um total de 41% das conversas contém conteúdo estruturado. Entre as 5.645 conversas com PII rotulada, 63,8% incluem um identificador que aparece mais de uma vez, e 28,7% incluem um identificador que aparece em múltiplos turnos.

Construindo um conjunto de dados sintético a partir de conversas de produção

O PII-TRACE preserva a estrutura de turnos das conversas de origem sem publicar os originais. O pipeline reescreve cada turno e substitui cada identificador rotulado por um valor sintético.

Diagrama mostrando como o PII-TRACE converte conversas de produção rotuladas em conjuntos de dados sintéticos por meio de modelagem, paráfrase, substituição por valores sintéticos consistentes e verificações de validação.
O PII-TRACE transforma texto de origem rotulado em um modelo, reescreve cada turno, insere valores sintéticos consistentes e executa verificações de lançamento no resultado.

Primeiro, vários modelos de linguagem marcam nove tipos de PII em conversas de produção entre usuário e assistente. Uma passagem baseada em regras agrupa identificadores repetidos do mesmo tipo sob um ID de entidade. Cada valor marcado é então substituído por um espaço reservado tipado, deixando um modelo que retém a ordem dos turnos, o tipo de PII e os links entre as menções, mas nenhum dos valores originais marcados.

O sistema parafraseia cada turno mantendo esses espaços reservados intactos, insere valores sintéticos que correspondem ao tipo e formato do identificador. Menções repetidas recebem o mesmo valor dentro de uma conversa, enquanto conversas diferentes usam valores gerados de forma independente. A passagem de alinhamento final recalcula cada deslocamento de caractere.

Três portões automatizados verificam se as substituições correspondem aos spans armazenados, se menções repetidas usam o mesmo valor e se os valores de origem marcados estão ausentes sob uma nova varredura com Presidio e expressão regular. Um deslocamento armazenado também deve recuperar a substring sintética exata. Os registros que falham são regenerados ou descartados. Um segundo modelo de linguagem audita uma amostra, e humanos revisam qualquer coisa que ele sinalize como PII.

PII-Tracer: Um detector compacto para uso local

O PII-Tracer é um codificador bidirecional de 0,6B adaptado de uma base Qwen3. A triagem de privacidade é diferente da geração de texto e requer encontrar spans de PII relevantes e retornar seus limites. Como resultado, o PII-Tracer substitui a máscara causal do Qwen3 por atenção bidirecional ciente de preenchimento, de modo que cada token possa aproveitar turnos anteriores e posteriores dentro de uma janela de 4.096 tokens.

Para cada token, o codificador produz uma representação de 1.024 dimensões. Uma cabeça de rotulagem linear produz pontuações para 37 rótulos possíveis: um rótulo especial (que usamos O para denotar) para texto fora de um span de PII, mais quatro rótulos de posição de span para cada um dos nove tipos de PII. No esquema BIOES para Reconhecimento de Entidade Nomeada, B (Início), I (Dentro) e E (Fim) marcam um span de múltiplos tokens, enquanto S (Único) marca um span de um único token. Uma cabeça auxiliar também prevê se a conversa contém material sensível, como informações de saúde ou religiosas.

Treinamos o PII-Tracer por três épocas em aproximadamente 714.000 amostras de treinamento, combinando conversas multilíngues de assistentes com exemplos de registro único. O codificador bidirecional compartilhado tem duas cabeças de treinamento: uma cabeça de token BIOES de 37 classes que detecta e classifica spans de PII, e uma cabeça binária em nível de conversa que prevê se a conversa contém material sensível. Treinamos ambas as cabeças conjuntamente usando L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}}. Aqui, Ltag\mathcal{L}_{\mathrm{tag}} dá mais peso a rótulos de PII raros para que o rótulo frequente `O` não domine, enquanto Lsens\mathcal{L}_{\mathrm{sens}} fornece o sinal de treinamento em nível de conversa; os coeficientes 1,5 e 0,3 mantêm a detecção de span como a tarefa principal. Este sinal auxiliar reforça a detecção ciente de contexto: o modelo aprende a julgar um span candidato dentro da conversa, em vez de como uma string isolada, ajudando a reduzir falsos positivos com apenas uma pequena compensação no recall.

No momento da inferência, um decodificador de Viterbi restrito busca pela sequência BIOES válida de maior pontuação, em vez de rotular cada token de forma independente. Por exemplo, B-private_person pode continuar com I-private_person ou fechar com E-private_person, mas não mudar para I-private_email. O decodificador mapeia o resultado de volta para spans de caracteres exatos para anonimização ou roteamento local.

O PII-Tracer lidera em F1 de caracteres e PII recorrente

Comparamos os detectores nos níveis de caractere e span. O F1 de caracteres avalia a detecção caractere por caractere. O F1 de sobreposição de spans mede se o detector identifica qualquer parte de um item de PII, enquanto o F1 de contenção de spans mede se ele captura o item inteiro.

O PII-Tracer alcançou o maior F1 de caracteres (0,629) entre os 12 sistemas avaliados, e o segundo maior F1 de sobreposição de spans e F1 de contenção de spans. Modelos de ponta, a saber, GPT-5.6-sol e Claude Sonnet 5, alcançaram desempenho geral comparável. O GPT-5.6-sol obteve pontuações mais altas em ambas as métricas de F1 em nível de span, mas um F1 de caracteres menor. No entanto, esses modelos de ponta têm centenas de bilhões ou até trilhões de parâmetros e são modelos de código fechado hospedados na nuvem. Como resultado, eles são inadequados para proteger dados locais sensíveis em configurações de IA híbrida onde o texto não rastreado deve permanecer local. Em contraste, o PII-Tracer oferece detecção em nível de span próxima à de ponta com apenas 0,6B de parâmetros e pode processar texto não rastreado inteiramente no dispositivo. Outros detectores de PII de código aberto têm desempenho substancialmente pior do que o PII-Tracer.

Três gráficos de barras comparando 12 sistemas de detecção de PII. O PII-Tracer 0,6B ocupa o primeiro lugar em F1 de caracteres e o segundo em F1 de sobreposição e contenção de spans, atrás do GPT-5.6-sol.
F1 de caracteres, F1 de sobreposição de spans e F1 de contenção de spans em todos os doze sistemas.

Encontrando todas as menções recorrentes

O experimento de consistência aplica um teste mais rigoroso às mesmas previsões. O conjunto de teste contém 899 identificadores que aparecem uma vez e 959 que aparecem mais de uma vez; 790 dos identificadores recorrentes abrangem múltiplos turnos. A figura relata quatro faixas de contagem de menções (uma, duas, três a cinco e seis a dez) e conta um identificador apenas quando todos os seus caracteres rotulados são encontrados. Ela plota o PII-Tracer com três baselines selecionados, enquanto a tabela agregada relata pontuações recorrentes e entre turnos para todos os doze sistemas.

Gráfico de linhas mostrando que o PII-Tracer encontra todas as menções de identificadores recorrentes de forma mais consistente do que o GPT-5.6-sol, o GLiNER2-PII e o Claude Opus 4.8 em todos os grupos de contagem de menções, caindo de 91,7% para uma menção para 69,1% para 6 a 10 menções.
Participação de identificadores cuja cada menção é encontrada. O PII-Tracer lidera todas as quatro faixas de comparação.

O PII-Tracer mantém-se à frente conforme a repetição aumenta: sua pontuação vai de 0,917 para uma menção a 0,873 para duas, 0,796 para três a cinco e 0,691 para seis a dez. Na última faixa, o GPT-5.6-sol alcança 0,464, enquanto o GLiNER2-PII e o Claude Opus 4.8 alcançam 0,073 e 0,045. Em toda a avaliação, o PII-Tracer encontra todas as menções de 79,4% dos identificadores recorrentes e 77,6% dos identificadores entre turnos; o GPT-5.6-sol atinge 57,0% e 55,1% nas mesmas duas medidas.

Cobrindo Conversas Longas

Primeiro, agrupamos todas as 1.922 conversas de teste por comprimento de caractere e decodificamos o PII-Tracer com a janela de 4.096 tokens. Os grupos contêm 167 conversas abaixo de 1.000 caracteres, 1.292 de 1.000 a 10.000 e 463 com 10.000 ou mais.

Gráfico de barras agrupadas do desempenho do PII-Tracer por comprimento da conversa. O F1 atinge o pico de 67,0% para conversas de 1.000 a 10.000 caracteres, enquanto o recall diminui de 97,5% para conversas com menos de 1.000 caracteres para 68,7% para aquelas com mais de 10.000.
Precisão, recall e F1 de caracteres por comprimento da conversa

O recall de janela única é de 0,975 abaixo de 1.000 caracteres e 0,955 de 1.000 a 10.000, mas cai para 0,687 para conversas com 10.000 caracteres ou mais. A precisão permanece próxima de 0,51 nos dois grupos mais longos, apontando a cobertura de entrada como o principal problema.

Para estudar o efeito do tratamento de entradas, avaliamos o mesmo checkpoint com decodificação de janela deslizante com 50% de sobreposição. Isso eleva o recall geral de caracteres de 0,830 para 0,965 e a detecção consistente de múltiplas menções de 0,794 para 0,954, sem retreinamento.

Consistente entre idiomas

O PII-TRACE abrange 13 idiomas; o experimento de idioma relata uma fatia de seis idiomas abrangendo os scripts latino, cirílico e hangul: inglês, alemão, francês, italiano, russo e coreano. Executamos os mesmos 12 detectores em todas as conversas de teste em cada idioma. Dentro de cada idioma, agrupamos os caracteres previstos e originais e calculamos o F1 de caracteres.

Mapa de calor comparando as pontuações de F1 de caracteres para 12 sistemas de detecção de PII em inglês, alemão, francês, italiano, russo e coreano. O PII-Tracer lidera em alemão, francês, italiano e russo, com resultados consistentemente fortes em todos os seis idiomas.
F1 de caracteres em seis subconjuntos de idiomas que contêm PII, abrangendo os scripts latino, cirílico e hangul.

O PII-Tracer lidera o F1 de caracteres em quatro dos seis idiomas: alemão (0,735), francês (0,633), italiano (0,676) e russo (0,651), e fica a 0,016 e 0,036 dos melhores resultados em inglês e coreano. Na análise complementar, ele leva a uma detecção consistente em todos os seis subconjuntos de idiomas, pontuando entre 0,80 e 0,93. A visão por idioma mostra ganhos além do inglês.

F1 de caracteres mais alto que o Privacy Filter em cinco benchmarks padrão

O experimento final move-se para fora do PII-TRACE. Executamos o PII-Tracer e o OpenAI Privacy Filter na divisão de validação do ai4privacy (47.728 documentos), na divisão de teste do Nemotron-PII (100.000), em um conjunto SPY de seed fixa (8.688), na divisão de teste do Gretel PII (5.000) e na divisão de teste do TAB ECHR (127).

Gráfico de barras agrupadas comparando a precisão, o recall e o F1 de caracteres do PII-Tracer com o F1 do OpenAI Privacy Filter em cinco benchmarks externos. O PII-Tracer obtém uma pontuação F1 mais alta em cada benchmark.
Resultados em nível de caractere em cinco benchmarks de PII externos, pontuados sem exigir a correspondência dos nomes das categorias. As barras cinzentas mostram o OpenAI Privacy Filter sob a mesma avaliação.

O PII-Tracer apresenta um F1 de caracteres mais alto em todos os conjuntos de dados: 0,950 versus 0,907 no ai4privacy, 0,847 versus 0,709 no Nemotron-PII, 0,585 versus 0,543 no SPY, 0,952 versus 0,895 no Gretel PII e 0,594 versus 0,350 no TAB. O TAB é o único benchmark deste grupo construído a partir de texto real rotulado por humanos. Nele, o PII-Tracer atinge 0,986 versus 0,982 de precisão e 0,425 versus 0,213 de recall — o dobro do recall com essencialmente a mesma precisão (detalhes no artigo). Portanto, o F1 mais alto é transferido das conversas do PII-TRACE para todos os cinco benchmarks convencionais de registro único nesta comparação.

Conclusão

A IA híbrida integra o dispositivo do usuário à pilha de inferência, oferecendo privacidade mais forte e menor custo. Modelos de ponta na nuvem podem lidar com pesquisas, raciocínio e planejamento, enquanto modelos locais trabalham com arquivos e dados pessoais que devem permanecer no dispositivo. Essa divisão depende do reconhecimento de informações sensíveis antes que qualquer dado sensível vá para a nuvem.

O PII-Tracer é um modelo compacto para detectar PII em conversas de múltiplos turnos, enquanto o PII-TRACE avalia se os detectores conseguem identificar consistentemente PII recorrente ao longo de uma conversa.

Juntos, o PII-TRACE e o PII-Tracer fornecem um benchmark e um modelo de referência para avançar na detecção de PII em conversas de múltiplos turnos e outros cenários de contexto longo.

Os agentes estão assumindo tarefas mais longas e trabalhando com mais contexto pessoal. Como resultado, os controles de privacidade devem se manter em toda a conversa, e não apenas na entrada inicial. A IA híbrida depende de uma detecção local confiável para manter o contexto sensível no dispositivo.

Leia o artigo no arXiv para obter detalhes sobre o benchmark PII-TRACE, o modelo PII-Tracer e nossa avaliação. Planejamos lançar o PII-TRACE e o PII-Tracer em breve.

  1. Conheça a Computação Híbrida no MacNotícias1 de set. de 2026
  2. O data center vai para a sua máquinaNotícias2 de jun. de 2026