PII-TRACE: обнаружение персональных данных до того, как они покинут устройство

Бенчмарк для 13 языков, предназначенный для согласованного обнаружения PII в долгосрочных диалогах, в паре с компактным детектором на 0,6B, созданным для локального запуска.

АвторыPerplexity Secure Intelligence Institute

Гибридные вычисления на Mac распределяют задачи Perplexity Computer между пограничными моделями в облаке и локальной моделью на Mac. Облачные агенты занимаются исследованиями, рассуждениями и планированием, в то время как локальная модель работает с личными файлами и конфиденциальной информацией.

Эта граница зависит от обнаружения персональных данных (PII) до того, как они покинут устройство. Локальный шлюз конфиденциальности оставляет конфиденциальный контент на Mac, маскирует обнаруженную конфиденциальную информацию или запрашивает подтверждение перед отправкой в облако.

Обнаружение становится сложнее в длинных многоязычных диалогах. Один и тот же идентификатор может появляться несколько раз в разных репликах. Одно пропущенное упоминание может раскрыть информацию, которую система призвана защищать.

Введение

Сегодня мы представляем PII-TRACE (Tracing Recurring PII Across Conversational Exchanges — отслеживание повторяющихся PII в диалоговых обменах), новый бенчмарк для оценки детекторов персональных данных (PII) и PII-Tracer, компактную модель на 0,6B для обнаружения PII.

Облачные агенты заставляют пользователей искать баланс между контекстом, интеллектуальными возможностями и конфиденциальностью. Больший персональный контекст может помочь агенту понять пользователя и выдать лучшие результаты. Но предоставление этого контекста часто означает отправку личной информации удаленному сервису и может привести к утечке персональных данных. Информация, которая делает ассистента полезным, может быть именно тем, что пользователь больше всего хочет сохранить в тайне.

Гибридный ИИ упрощает этот компромисс, разделяя работу между устройством пользователя и облачными моделями. Но эта граница защищает конфиденциальность только в том случае, если устройство может распознать PII до того, как текст будет отправлен удаленной модели. Пользователям не нужно самостоятельно проверять каждое сообщение. Устройству необходим локальный детектор PII в качестве шлюза конфиденциальности. В длинных диалогах один и тот же идентификатор может повторяться в разных репликах, и одного пропущенного упоминания достаточно, чтобы персональная информация прошла дальше.

Диаграмма, иллюстрирующая рабочий процесс шлюза конфиденциальности и показывающая, как конфиденциальные данные остаются на локальном устройстве, в то время как одобренные запросы отправляются на обработку облачным моделям.
PII-Tracer как шлюз конфиденциальности в гибридном ИИ

Perplexity представила гибридный оркестратор локально-серверного инференса, который определяет, какие задачи должны выполняться на устройстве, а какие — отправляться агентам в облаке. Модель, среда агента, диалоги и траектории выполнения — все это хранится на машине пользователя. Задачи, требующие доступа к внешнему миру, вызываются только при необходимости и контролируются разрешениями пользователя. В результате, пока пользователь не одобрит это, контент остается на устройстве.

PII-Tracer предоставляет один локальный управляющий сигнал для маршрутизации моделей, помечая фрагменты, в которых прогнозируется наличие PII. Затем приложение применяет политику маршрутизации. Оно оставляет соответствующие входные данные локально, маскирует обнаруженные фрагменты или запрашивает явное подтверждение перед эскалацией до облачной модели. Это делает маршрутизацию более избирательной. Обнаруженные PII остаются на устройстве, в то время как одобренный контекст по-прежнему использует преимущества облачных пограничных моделей.

Избирательная маршрутизация зависит от стабильного обнаружения во всем диалоге. Один и тот же идентификатор может повторяться в разных репликах, и пропущенное упоминание все равно может быть передано.

Среди 12 детекторов PII-Tracer регистрирует самый высокий F1 по символам и самое высокое согласованное покрытие повторяющихся идентификаторов. Бенчмарк объясняет, почему оба результата важны: в длинном диалоге обнаружение большинства PII — это не то же самое, что обнаружение каждой его копии.

Обнаружение PII сталкивается с новыми проблемами в гибридном ИИ

Обнаружение PII — это давняя проблема безопасности, и уже существует несколько бенчмарков и детекторов. Тем не менее, обнаружение PII в условиях гибридного ИИ создает новые проблемы. В частности, детекторы должны идентифицировать PII в длинных диалогах с несколькими репликами, где контекст диалога определяет, следует ли считать строку PII. Например, имя может идентифицировать пользователя в одном диалоге, ссылаться на публичную личность в другом или просто быть заполнителем, созданным ассистентом. Обычной поверхностной формы недостаточно, чтобы определить, следует ли помечать строку как PII.

Интерфейс чата показывает ассистента, сохраняющего имя пользователя, номер телефона, детали встречи и адрес электронной почты на протяжении множества реплик.
Имя, номер телефона и адрес электронной почты повторяются на протяжении всего диалога. PII-TRACE считает идентификатор последовательно обнаруженным только в том случае, если найдено каждое упоминание.

Существующие детекторы и бенчмарки PII в первую очередь ориентированы на отдельные записи. Мы обнаружили, что детекторы, предназначенные для обработки по одной записи за раз, демонстрируют низкую эффективность на длинных и сложных диалогах. Кроме того, существующие бенчмарки, как правило, не оценивают согласованность между репликами. В результате высокие показатели на этих бенчмарках не обязательно означают эффективное обнаружение PII в длинных диалогах с несколькими репликами.

PII-TRACE: бенчмарк для критически важного для развертывания обнаружения PII

Мы разработали PII-TRACE с учетом трех особенностей, которые имеют значение при использовании детектора PII в диалогах с ассистентом. Первая — это согласованное покрытие: когда идентификатор появляется несколько раз или пересекает реплики пользователя и ассистента, детектор должен найти каждое упоминание. Вторая — устойчивость к длинному контексту: длина диалогов варьируется от менее чем 1 000 до более чем 100 000 символов, что позволяет оценить, что происходит по мере роста истории. Третья — работа с несколькими языками и контентом смешанного формата: диалог может переключаться между языками и объединять прозу с кодом, таблицами или структурированными записями. PII-TRACE сохраняет эти паттерны, оценивая каждый диалог целиком вместо разбиения его на изолированные записи.

Бенчмарк измеряет производительность на двух взаимодополняющих уровнях. На уровне идентификаторов согласованное обнаружение задает более строгий вопрос: покрыл ли детектор каждый символ в каждом упоминании одного и того же идентификатора? Мы публикуем этот показатель отдельно для идентификаторов с несколькими упоминаниями и для идентификаторов, повторяющихся в разных репликах. На уровне символов точность измеряет, какая часть текста, отмеченного детектором, размечена как PII, полнота измеряет, сколько размеченных PII он находит, а F1 балансирует эти два показателя.

PII-TRACE содержит 13 148 синтетических диалогов между пользователем и ассистентом на 13 языках и с 10 системами письма, причем 37 431 упоминание идентификаторов размечено на уровне символов по девяти типам PII. В общей сложности 41% диалогов содержат структурированный контент. Среди 5 645 диалогов с размеченными PII 63,8% включают идентификатор, который встречается более одного раза, а 28,7% включают идентификатор, появляющийся в нескольких репликах.

Создание синтетического набора данных на основе рабочих диалогов

PII-TRACE сохраняет структуру реплик исходных диалогов без публикации оригиналов. Конвейер переписывает каждую реплику и заменяет каждый размеченный идентификатор синтетическим значением.

Диаграмма, иллюстрирующая, как PII-TRACE преобразует размеченные рабочие диалоги в синтетические наборы данных с помощью шаблонизации, перефразирования, замены на согласованные синтетические значения и проверок валидации.
PII-TRACE превращает размеченный исходный текст в шаблон, переписывает каждую реплику, вставляет согласованные синтетические значения и выполняет проверки перед релизом.

Во-первых, несколько языковых моделей размечают девять типов PII в рабочих диалогах пользователей и ассистента. Проход на основе правил группирует повторяющиеся идентификаторы одного типа под одним идентификатором сущности. Затем каждое помеченное значение заменяется типизированным заполнителем, оставляя шаблон, который сохраняет порядок реплик, тип PII и связи между упоминаниями, но не содержит помеченных исходных значений.

Система перефразирует каждую реплику, сохраняя эти заполнители неизменными, а затем вставляет синтетические значения, соответствующие типу и формату идентификатора. Повторяющиеся упоминания получают одно и то же значение в рамках диалога, в то время как в разных диалогах используются независимо сгенерированные значения. Финальный проход выравнивания пересчитывает смещение каждого символа.

Три автоматизированные проверки подтверждают, что замены соответствуют сохраненным фрагментам, повторяющиеся упоминания используют одно и то же значение, а помеченные исходные значения отсутствуют при повторном сканировании с помощью Presidio и регулярных выражений. Сохраненное смещение также должно позволять восстановить точную синтетическую подстроку. Записи, не прошедшие проверку, генерируются заново или отбрасываются. Вторая языковая модель проверяет выборку, а люди проверяют все, что она помечает как PII.

PII-Tracer: компактный детектор для локального использования

PII-Tracer — это двунаправленная модель-энкодер на 0,6B параметров, адаптированная на базе Qwen3. Проверка конфиденциальности отличается от генерации текста и требует поиска релевантных фрагментов PII и возврата их границ. В результате PII-Tracer заменяет причинную маску Qwen3 на двунаправленное внимание с учетом заполнения (padding-aware), поэтому каждый токен может задействовать как предыдущие, так и последующие реплики в пределах окна из 4 096 токенов.

Для каждого токена энкодер создает 1 024-мерное представление. Линейная головка теггирования выдает оценки для 37 возможных меток: одной специальной метки (для обозначения которой мы используем O) для текста за пределами фрагмента PII, а также четырех меток позиций фрагмента для каждого из девяти типов PII. В схеме BIOES для распознавания именованных сущностей B (начало), I (середина) и E (конец) отмечают многотокеновый фрагмент, в то время как S (одиночный) отмечает однотокеновый фрагмент. Вспомогательная головка также прогнозирует, содержит ли диалог конфиденциальный материал, такой как информация о здоровье или религии.

Мы обучаем PII-Tracer в течение трех эпох примерно на 714 000 обучающих примерах, объединяя многоязычные диалоги ассистента с примерами из отдельных записей. Общий двунаправленный энкодер имеет две обучающие головки: 37-классовую токеновую головку BIOES, которая обнаруживает и классифицирует фрагменты PII, и бинарную головку уровня диалога, которая прогнозирует, содержит ли диалог конфиденциальный материал. Мы обучаем обе головки совместно с использованием L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}}. Здесь Ltag\mathcal{L}_{\mathrm{tag}} придает редким меткам PII больший вес, чтобы частая метка `O` не доминировала, в то время как Lsens\mathcal{L}_{\mathrm{sens}} предоставляет сигнал обучения на уровне диалога; коэффициенты 1,5 и 0,3 сохраняют обнаружение фрагментов в качестве основной задачи. Этот вспомогательный сигнал подкрепляет контекстно-зависимое обнаружение: модель учится оценивать кандидатный фрагмент в контексте диалога, а не как изолированную строку, что помогает сократить количество ложноположительных срабатываний лишь при небольшом снижении полноты.

На этапе инференса ограниченный декодер Витерби ищет допустимую последовательность BIOES с наибольшим баллом вместо независимой маркировки каждого токена. Например, B-private_person может продолжиться как I-private_person или завершиться как E-private_person, но не переключиться на I-private_email. Декодер соотносит результат с точными текстовыми фрагментами для маскирования или локальной маршрутизации.

PII-Tracer лидирует по F1 на уровне символов и повторяющимся PII

Мы сравниваем детекторы на уровне символов и фрагментов (span). F1 по символам оценивает обнаружение символ за символом. F1 с пересечением фрагментов измеряет, определяет ли детектор какую-либо часть элемента PII, в то время как F1 с охватом фрагментов измеряет, захватывает ли он весь элемент целиком.

PII-Tracer достиг самого высокого значения F1 по символам (0,629) среди 12 оцененных систем, а также второго по величине значения F1 с пересечением и охватом фрагментов. Пограничные модели, а именно GPT-5.6-sol и Claude Sonnet 5, достигли сопоставимой общей производительности. GPT-5.6-sol показала более высокие результаты по обеим метрикам F1 на уровне фрагментов, но более низкий F1 по символам. Однако эти пограничные модели имеют сотни миллиардов или даже триллионы параметров и являются моделями с закрытым исходным кодом, размещенными в облаке. В результате они непригодны для защиты конфиденциальных локальных данных в условиях гибридного ИИ, где не прошедший проверку текст должен оставаться локальным. Напротив, PII-Tracer обеспечивает обнаружение на уровне фрагментов, близкое по качеству к пограничным моделям, имея всего 0,6B параметров и возможность обрабатывать непроверенный текст полностью локально. Другие детекторы PII с открытым исходным кодом работают значительно хуже, чем PII-Tracer.

Три гистограммы, сравнивающие 12 систем обнаружения PII. PII-Tracer 0.6B занимает первое место по F1 на уровне символов и второе по F1 с пересечением и охватом фрагментов, уступая GPT-5.6-sol.
F1 по символам, F1 с пересечением фрагментов и F1 с охватом фрагментов по всем двенадцати системам.

Обнаружение каждого повторяющегося упоминания

Эксперимент на согласованность применяет более строгий тест к тем же прогнозам. Тестовый набор содержит 899 идентификаторов, которые появляются один раз, и 959, которые появляются более одного раза; 790 повторяющихся идентификаторов охватывают несколько реплик. На рисунке представлены четыре категории по количеству упоминаний (одно, два, от трех до пяти и от шести до десяти), причем идентификатор учитывается только тогда, когда обнаружены все его размеченные символы. На графике отображен PII-Tracer с тремя выбранными базовыми моделями, в то время как в сводной таблице приведены оценки повторяющихся и кросс-репликовых данных для всех двенадцати систем.

Линейный график, показывающий, что PII-Tracer находит каждое упоминание повторяющихся идентификаторов более стабильно, чем GPT-5.6-sol, GLiNER2-PII и Claude Opus 4.8 во всех группах по количеству упоминаний, снижаясь с 91,7% для одного упоминания до 69,1% для 6–10 упоминаний.
Доля идентификаторов, каждое упоминание которых было найдено. PII-Tracer лидирует во всех четырех категориях сравнения.

PII-Tracer сохраняет лидерство по мере роста числа повторений: его показатель меняется с 0,917 для одного упоминания до 0,873 для двух, от 0,796 для трех-пяти и до 0,691 для шести-десяти. В последней категории GPT-5.6-sol достигает 0,464, в то время как GLiNER2-PII и Claude Opus 4.8 достигают 0,073 и 0,045. В рамках полной оценки PII-Tracer находит каждое упоминание для 79,4% повторяющихся идентификаторов и 77,6% идентификаторов, охватывающих несколько реплик; GPT-5.6-sol достигает 57,0% и 55,1% по тем же двум метрикам.

Охват длинных диалогов

Сначала мы сгруппируем все 1 922 тестовых диалога по длине символов и выполним декодирование PII-Tracer с окном в 4 096 токенов. Группы содержат 167 диалогов длиной менее 1 000 символов, 1 292 — от 1 000 до 10 000 и 463 — от 10 000 и более.

Групповая гистограмма производительности PII-Tracer в зависимости от длины диалога. F1 достигает пика в 67,0% для диалогов длиной от 1 000 до 10 000 символов, в то время как полнота (recall) снижается с 97,5% для диалогов короче 1 000 символов до 68,7% для диалогов длиннее 10 000.
Точность, полнота и F1 на уровне символов в зависимости от длины диалога

Полнота для одного окна составляет 0,975 при длине менее 1 000 символов и 0,955 при длине от 1 000 до 10 000, но падает до 0,687 для диалогов длиной 10 000 символов и более. Точность остается на уровне около 0,51 в двух более длинных группах, что указывает на охват входных данных как на основную проблему.

Чтобы изучить влияние обработки входных данных, мы оцениваем ту же контрольную точку с декодированием скользящим окном с 50%-м перекрытием. Это повышает общую полноту символов с 0,830 до 0,965, а согласованное обнаружение с несколькими упоминаниями — с 0,794 до 0,954 без повторного обучения.

Согласованность на разных языках

PII-TRACE охватывает 13 языков; языковой эксперимент охватывает срез из шести языков, включающий латиницу, кириллицу и хангыль: английский, немецкий, французский, итальянский, русский и корейский. Мы запускаем те же 12 детекторов на всех тестовых диалогах на каждом языке. Внутри каждого языка мы объединяем прогнозируемые и эталонные символы и вычисляем F1 по символам.

Тепловая карта, сравнивающая оценки F1 по символам для 12 систем обнаружения PII на английском, немецком, французском, итальянском, русском и корейском языках. PII-Tracer лидирует в немецком, французском, итальянском и русском языках с неизменно высокими результатами по всем шести языкам.
F1 по символам для шести языковых подмножеств, содержащих PII, охватывающих латиницу, кириллицу и хангыль.

PII-Tracer лидирует по F1 на уровне символов в четырех из шести языков: немецком (0,735), французском (0,633), итальянском (0,676) и русском (0,651), а в английском и корейском уступает лучшим результатам всего 0,016 и 0,036. В сопутствующем анализе он обеспечивает стабильное обнаружение во всех шести языковых подмножествах с оценкой 0,80–0.93. Представление в разрезе языков демонстрирует прирост показателей за пределами английского языка.

Более высокий F1 по символам, чем у фильтра конфиденциальности, на пяти стандартных бенчмарках

Заключительный эксперимент выходит за рамки PII-TRACE. Мы запускаем PII-Tracer и фильтр конфиденциальности OpenAI на валидационной выборке ai4privacy (47 728 документов), тестовой выборке Nemotron-PII (100 000), фиксированном наборе seed SPY (8 688), тестовой выборке Gretel PII (5 000) и тестовой выборке TAB ECHR (127).

Групповая гистограмма, сравнивающая точность, полноту и F1 по символам PII-Tracer с F1 фильтра конфиденциальности OpenAI на пяти внешних бенчмарках. PII-Tracer достигает более высокого балла F1 на каждом бенчмарке.
Результаты на уровне символов на пяти внешних бенчмарках PII, оцененные без требования совпадения названий категорий. Серые полосы показывают фильтр конфиденциальности OpenAI при той же оценке.

PII-Tracer показывает более высокий F1 на уровне символов на каждом наборе данных: 0,950 против 0,907 на ai4privacy, 0,847 против 0,709 на Nemotron-PII, 0,585 против 0,543 на SPY, 0,952 против 0,895 на Gretel PII и 0,594 против 0,350 на TAB. TAB — единственный бенчмарк в этой группе, построенный на основе реального текста с разметкой человеком. В нем PII-Tracer достигает точности 0,986 против 0,982 и полноты 0,425 против 0,213 — что означает удвоенную полноту при практически той же точности (подробности в статье). Таким образом, более высокий F1 переносится с диалогов PII-TRACE на все пять традиционных бенчмарков с одной записью в данном сравнении.

Заключение

Гибридный ИИ интегрирует устройство пользователя в стек инференса, предлагая более высокую конфиденциальность и более низкую стоимость. Пограничные модели в облаке могут выполнять задачи исследования, рассуждения и планирования, в то время как локальные модели работают с файлами и персональными данными, которые должны оставаться на устройстве. Это разделение зависит от распознавания конфиденциальной информации до того, как любые конфиденциальные данные попадут в облако.

PII-Tracer — это компактная модель для обнаружения PII в диалогах с несколькими репликами, в то время как PII-TRACE оценивает способность детекторов последовательно выявлять повторяющиеся PII на протяжении всего диалога.

В совокупности PII-TRACE и PII-Tracer предоставляют бенчмарк и эталонную модель для продвижения обнаружения PII в диалогах с несколькими репликами и других сценариях с длинным контекстом.

Агенты берут на себя более длительные задачи и работают с большим персональным контекстом. В результате элементы управления конфиденциальностью должны работать на протяжении всего диалога, а не только на этапе первоначального ввода. Гибридный ИИ зависит от надежного локального обнаружения, чтобы удерживать конфиденциальный контекст на устройстве.

Прочтите статью на arXiv для получения подробной информации о бенчмарке PII-TRACE, модели PII-Tracer и нашей оценке. Мы планируем выпустить как PII-TRACE, так и PII-Tracer в ближайшее время.

  1. Представляем гибридные вычисления на MacНовости1 сент. 2026 г.
  2. Дата-центр перемещается на ваше устройствоНовости2 июн. 2026 г.