PII-TRACE:在个人数据离开设备之前对其进行检测

一个用于跨长对话进行一致 PII 检测的 13 语言基准测试,搭配旨在本地运行的紧凑型 0.6B 检测器。

作者Perplexity Secure Intelligence Institute

Mac 上的混合计算将 Perplexity Computer 任务分配给云端的前沿模型和 Mac 上的本地模型。云端智能体处理研究、推理和规划,而本地模型则处理私密文件和敏感信息。

这一边界取决于在个人身份信息(PII)离开设备之前对其进行检测。本地隐私网关将敏感内容保留在 Mac 上、修订检测到的私密信息,或者在将其发送到云端之前请求批准。

在漫长的多语言对话中,检测变得更加困难。同一个标识符可能会在不同的轮次中出现多次。漏掉一次提及就可能暴露系统旨在保护的信息。

引言

今天,我们推出 PII-TRACE Tracing Recurring PII Across Conversational Exchanges,跨对话交流追踪重复 PII),这是一个用于评估个人身份信息(PII)检测器的新基准测试,以及用于 PII 检测的紧凑型 0.6B 模型 PII-Tracer

以云端为主的智能体迫使用户在上下文、智能和隐私之间做出平衡。更多的个人上下文可以帮助智能体了解用户并产生更好的结果。但提供此上下文通常意味着将私密信息发送到远程服务,并可能泄漏个人信息。使助手变得有用的信息可能正是用户最想保持私密的信息。

混合 AI 通过在用户的设备和云模型之间分配工作,缓解了这种权衡。但只有当设备能够在文本发送到远程模型之前识别 PII 时,该边界才能保护隐私。用户不应该必须亲自检查每条消息。设备需要一个本地 PII 检测器作为其隐私网关。在长对话中,同一个标识符可能会在多轮中反复出现,而漏掉的一次提及就足以让个人信息穿透防线。

图表阐释了隐私网关(Privacy Gate)工作流,展示了敏感数据如何保留在本地设备上,同时将批准的请求发送到云模型进行处理。
作为混合 AI 中隐私网关的 PII-Tracer

Perplexity 引入了一个混合本地-服务器推理编排器,用于决定哪些工作应在设备上运行,哪些工作应发送到云端的智能体(agent)。模型、智能体驱动程序(agent harness)、对话和执行轨迹都驻留在用户的机器上。需要访问外部世界的任务仅在必要时调用,并受用户权限控制。因此,在用户批准之前,该内容一直保留在设备上。

PII-Tracer 通过标记预测包含 PII 的跨度,为模型路由提供了一个本地控制信号。然后,应用程序强制执行路由政策。它将相关的输入保留在本地、对检测到的跨度进行修订(redact),或者在升级到云模型之前请求明确批准。这使得路由更具选择性。检测到的 PII 保留在设备上,而已批准的上下文仍然受益于前沿云模型。

选择性路由取决于整个对话中的一致检测。同一个标识符可能会在多轮中反复出现,而漏掉的一次提及可能仍会被传输。

在 12 个检测器中,PII-Tracer 记录了最高的字符 F1 和对重复标识符的最高一致覆盖率。该基准测试解释了为什么这两个结果都很重要:在长对话中,找到大部分 PII 并不等于找到它的每一份复制品。

混合 AI 中的 PII 检测面临新挑战

PII 检测是一个长期存在的安全问题,并且已经存在几个基准测试和检测器。然而,混合 AI 设置中的 PII 检测引入了新的挑战。特别是,检测器必须在漫长的多轮对话中识别 PII,在这些对话中,对话上下文决定了字符串是否应被视为 PII. 例如,一个名字可能在一个对话中标识用户,在另一个对话中指代公众人物,或者干脆是助手生成的占位符。仅靠表层形式不足以确定字符串是否应被标记为 PII。

聊天界面显示助手在多轮对话中保留了用户的姓名、电话号码、预约详情和电子邮件地址。
姓名、电话号码和电子邮件地址在整个对话中反复出现。PII-TRACE 仅在找到每一次相同时,才将标识符算作一致检测到。

现有的 PII 检测器和基准测试主要针对单个记录。我们发现,设计为一次处理一条记录的检测器在处理漫长、复杂的对话时表现不佳。此外,现有的基准测试通常不评估跨轮次的一致性。因此,在这些基准测试中的出色表现并不一定能转化为在漫长的多轮对话中的有效 PII 检测。

PII-TRACE:针对部署关键型 PII 检测的基准测试

我们围绕在助手对话上使用 PII 检测器时非常重要的三种行为设计了 PII-TRACE。第一种是一致覆盖:当标识符出现多次或跨越用户和助手轮次时,检测器需要找到每一次提及。第二种是对长上下文的鲁棒性:对话长度从少于 1,000 个字符到超过 100,000 个字符不等,从而可以衡量历史记录增长时会发生什么。第三种是处理多种语言和混合格式内容:对话可能会切换语言并将散文与代码、表格或结构化记录结合起来。PII-TRACE 通过评估每个完整的对话而不是将其拆分为孤立的记录来保留这些模式。

该基准测试在两个互补的层面上衡量性能。在标识符级别,一致检测提出了一个更严格的问题:检测器是否覆盖了同一标识符的每一次提及中的每个字符?我们分别报告了具有多个提及的标识符以及跨轮次重复的标识符的此得分。在字符级别,精确率衡量检测器标记的文本中有多少被标记为 PII,召回率衡量它找到了多少标记的 PII,而 F1 则平衡了两者。

PII-TRACE 包含跨 13 种语言和 10 种书写系统的 13,148 个合成用户-助手对话,其中包含在 9 种 PII 类型下按字符级别标记的 37,431 个标识符提及。总计 41% 的对话包含结构化内容。在带有标记 PII 的 5,645 个对话中,63.8% 包含出现不止一次的标识符,28.7% 包含跨多个轮次出现的标识符。

从生产对话构建合成数据集

PII-TRACE 保留了源对话的轮次结构,而不发布原始内容。该流水线重写每个轮次,并用合成值替换每个标记的标识符。

图表说明了 PII-TRACE 如何通过模板化、释义、替换为一致的合成值以及验证检查,将标记的生产对话转换为合成数据集。
IPII-TRACE 将标记的源文本转化为模板,重写每一轮,插入一致的合成值,并对结果运行发布检查。

首先,多个语言模型在生产用户-助手对话中标记了九种类型的 PII。基于规则的通道将同一类型的重复标识符组合在一个实体 ID 下。然后,每个标记的值都被替换为一个有类型的占位符,留下一个保留了轮次顺序、PII 类型和提及之间链接但不包含任何标记的原始值的模板。

系统在保持这些占位符不变的同时对每一轮进行释义(paraphrase),然后插入与标识符类型和格式相匹配的合成值。在对话中,重复提及会收到相同的值,而不同的对话使用独立生成的值。最终的对齐通道会重新计算每个字符偏移量。

三个自动化检查门检查替换项是否与存储的跨度匹配、重复提及是否使用相同值、以及在 Presidio 和正则表达式重新扫描下标记的源值是否不存在。存储的偏移量还必须恢复精确的合成子字符串。失败的记录将被重新生成或丢弃。第二个语言模型对样本进行审计,人类则对它标记为 PII 的任何内容进行复查。

PII-Tracer:用于本地使用的紧凑型检测器

PII-Tracer 是一个从 Qwen3 主干网改编而来的 0.6B 双向编码器。隐私筛选不同于文本生成,它需要找到相关的 PII 跨度并返回其边界。因此,PII-Tracer 用感知填充的双向注意力替换了 Qwen3 的因果掩码(causal mask),因此每个 token 都可以利用 4,096-token 窗口内的早期和晚期轮次。

对于每个 token,编码器生成一个 1,024 维的表示。线性标记头生成 37 个可能标签的得分:一个用于 PII 跨度之外的文本的特殊标签(我们用 O 表示),以及九种 PII 类型中每种类型的四个跨度位置标签。在命名实体识别的 BIOES 方案中,B(开始,Beginning)、I(内部,Inside)和 E(结束,End)标记多 token 跨度,而 S(单个,Single)标记单 token 跨度。辅助头还预测对话是否包含敏感材料,例如健康或宗教信息。

我们在大约 714,000 个训练样本上对 PII-Tracer 进行了三个周期的训练,结合了多语言助手对话与单记录示例。共享的双向编码器有两个训练头:一个检测并对 PII 跨度进行分类的 37 类 BIOES token 头,以及一个预测对话是否包含敏感材料的二元对话级头。我们使用 L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}} 联合训练这两个头。这里,Ltag\mathcal{L}_{\mathrm{tag}} 给稀有的 PII 标签赋予更多权重,以便频繁出现的 `O` 标签不会占主导地位,而 Lsens\mathcal{L}_{\mathrm{sens}} 提供对话级训练信号;1.5 和 0.3 的系数将跨度检测保持为主要任务。这种辅助信号强化了上下文感知检测:模型学习在对话中判断候选跨度,而不是作为孤立的字符串,这有助于在召回率只有很小权衡的情况下减少误报。

在推理时,受约束的 Viterbi 解码器会搜索得分最高的有效 BIOES 序列,而不是独立标记每个 token。例如,B-private_person 可以接 I-private_person 或以 E-private_person 结束,但不能切换到 I-private_email。解码器将结果映射回精确的字符跨度,以便进行修订(redaction)或本地路由。

PII-Tracer 在字符 F1 和重复 PII 方面领先

我们在字符和跨度(span)两个层面上对检测器进行了比较。字符 F1 逐个字符地评估检测效果。跨度重叠 F1 用于衡量检测器是否识别出了 PII 项的任何部分,而跨度包含 F1 则用于衡量它是否捕获了整个项目。

在评估的 12 个系统中,PII-Tracer 实现了最高的字符 F1(0.629),以及第二高的跨度重叠 F1 和跨度包含 F1。前沿模型(即 GPT-5.6-sol 和 Claude Sonnet 5)取得了可比的整体性能。GPT-5.6-sol 在两个跨度级 F1 指标上获得了更高的得分,但字符 F1 较低。然而,这些前沿模型具有数千亿甚至数万亿个参数,并且是托管在云端的闭源模型。因此,它们不适合在混合 AI 设置中保护敏感的本地数据,因为在这些设置中,未筛选的文本必须保留在本地。相比之下,PII-Tracer 仅凭 0.6B 参数即可提供接近前沿的跨度级检测,并且可以在完全本地处理未筛选的文本。其他开源 PII 检测器的性能明显比 PII-Tracer 差。

对比 12 个 PII 检测系统的三个柱状图。PII-Tracer 0.6B 在字符 F1 中排名第一,在落后于 GPT-5.6-sol 的跨度重叠和跨度包含 F1 中排名第二。
所有十二个系统的字符 F1、跨度重叠 F1 和跨度包含 F1。

寻找每一个重复的提及

一致性实验对相同的预测应用了更严格的测试。测试集包含出现一次的 899 个标识符和出现多次的 959 个标识符;其中 790 个循环标识符跨越多个轮次。该图报告了四个提及次数桶(一次、两次、三到五次以及六到十次),并且仅在找到其所有标记字符时才计算一个标识符。它绘制了 PII-Tracer 与三个选定基准的对比,而汇总表则报告了所有十二个系统的循环和跨轮次得分。

折线图显示,在所有提及次数分组中,PII-Tracer 查找循环标识符的每一次提及都比 GPT-5.6-sol、GLiNER2-PII 和 Claude Opus 4.8 更具一致性,从提及一次的 91.7% 下降到 6–10 次提及的 69.1%。
找到每一次提及的标识符份额。PII-Tracer 在所有四个比较桶中均处于领先地位。

随着重复次数增加,PII-Tracer 保持领先:在提及一次时其得分为 0.917,两次为 0.873,三到五次为 0.796,六到十次为 0.691。在最后一组中,GPT-5.6-sol 达到 0.464,而 GLiNER2-PII 和 Claude Opus 4.8 分别达到 0.073 和 0.045。在完整的评估中,PII-Tracer 找出了 79.4% 的循环标识符和 77.6% 的跨轮次标识符的每一次提及;在这两项指标上,GPT-5.6-sol 分别达到 57.0% 和 55.1%。

覆盖长对话

我们首先按字符长度对所有 1,922 个测试对话进行分组,并使用 4,096-token 窗口对 PII-Tracer 进行解码。这些组包含 1,000 个字符以下的对话 167 个,1,000 到 10,000 个字符的对话 1,292 个,以及 10,000 或以上的对话 463 个。

按对话长度划分的 PII-Tracer 性能分组柱状图。对于 1,000–10,000 个字符的对话,F1 在 67.0% 达到峰值,而召回率则从 1,000 个字符以下对话的 97.5% 下降到 10,000 个字符以上对话的 68.7%。
按对话长度划分的字符精确率、召回率和 F1

在 1,000 个字符以下时,单窗口召回率为 0.975,在 1,000 到 10,000 之间为 0.955,但对于 10,000 个字符及以上的对话,则下降到 0.687。两个较长组中的精确率保持在 0.51 附近,这表明输入覆盖范围是主要问题。

为了研究输入处理的影响,我们评估了具有 50% 重叠滑动窗口解码的相同检查点。这在无需重新训练的情况下,将整体字符召回率从 0.830 提高到 0.965,并将多提及一致检测从 0.794 提高到 0.954。

跨语言保持一致

PII-TRACE 涵盖 13 种语言;语言实验报告了一个跨越拉丁字母、西里尔字母和韩文字母的六语言切片:英语、德语、法语、意大利语、俄语和韩语。我们在每种语言的所有测试对话上运行相同的 12 个检测器。在每种语言中,我们汇集预测的和黄金标准(gold)字符并计算字符 F1。

对比英语、德语、法语、意大利语、俄语和韩语这 12 个 PII 检测系统字符 F1 得分的折线图/热力图。PII-Tracer 在德语、法语、意大利语和俄语中处于领先地位,在所有六种语言中都表现出持续强劲的结果。
包含 PII 的六个语言子集上的字符 F1,涵盖拉丁字母、西里尔字母和韩文字母。

PII-Tracer 在六种语言中的四种——德语(0.735)、法语(0.633)、意大利语(0.676)和俄语(0.651)的字符 F1 中领先,并且在英语和韩语中与最佳结果相差 0.016 和 0.036。在配套分析中,它在所有六个语言子集中都带来了稳定的检测效果,得分为 0.80–0.93。分语言视图显示了超越英语的收益。

在五个标准基准测试中表现出高于隐私过滤器的字符 F1

最后的实验超出了 PII-TRACE 的范围。我们在 ai4privacy 验证拆分(47,728 个文档)、Nemotron-PII 测试拆分(100,000)、固定种子 SPY 集(8,688)、Gretel PII 测试拆分(5,000)和 TAB ECHR 测试拆分(127)上运行了 PII-Tracer 和 OpenAI 隐私过滤器。

对比 PII-Tracer 与五个外部基准测试中 OpenAI 隐私过滤器(Privacy Filter)F1 的精确率、召回率和字符 F1 的分组柱状图。PII-Tracer 在每个基准测试上都实现了更高的 F1 得分。
五个外部 PII 基准测试上的字符级结果,评分时不需要类别名称匹配。灰色条显示了相同评估下的 OpenAI 隐私过滤器。

PII-Tracer 在每个数据集上都具有更高的字符 F1:在 ai4privacy 上为 0.950 对比 0.907,在 Nemotron-PII 上为 0.847 对比 0.709,在 SPY 上为 0.585 对比 0.543,在 Gretel PII 上为 0.952 对比 0.895,在 TAB 上为 0.594 对比 0.350。TAB 是该组中唯一由真实人工标注文本构建的基准测试。在该测试中,PII-Tracer 达到了 0.986 对比 0.982 的精确率和 0.425 对比 0.213 的召回率——在基本上相同的精确率下,召回率翻倍(详情见论文)。因此,更高的 F1 从 PII-TRACE 对话延续到了此比较中的所有五个常规单记录基准测试中。

结论

混合 AI 将用户的设备集成到推理堆栈中,提供更高的隐私性和更低的成本。云端的前沿模型可以处理研究、推理和规划,而本地模型则处理应保留在设备上的文件和个人数据。这种分工取决于在任何敏感数据发送到云端之前识别出敏感信息。

PII-Tracer 是一种用于在多轮对话中检测 PII 的紧凑型模型,而 PII-TRACE 则评估检测器是否能够在整个对话中持续识别重复出现的 PII。

总而言之,PII-TRACE 和 PII-Tracer 为推进多轮对话和其他长上下文设置中的 PII 检测提供了基准测试和参考模型。

智能体正在承担更长时间的任务并处理更多的个人上下文。因此,隐私控制应贯穿整个对话,而不仅仅是初始输入。混合 AI 依靠可靠的本地检测将敏感上下文保留在设备上。

阅读 arXiv 论文以了解有关 PII-TRACE 基准测试、PII-Tracer 模型和我们评估的详细信息。我们计划很快发布 PII-TRACE 和 PII-Tracer。

  1. 推出 Mac 混合计算新闻2026年9月1日
  2. 数据中心转移至您的设备新闻2026年6月2日