PII-TRACE:在個人資料離開裝置之前進行檢測

一個用於在長對話中進行一致 PII 檢測的 13 語言基準測試,搭配一個旨在於本機執行的精簡 0.6B 檢測器。

作者Perplexity Secure Intelligence Institute

Mac 上的混合式運算將 Perplexity Computer 任務分配給雲端中的先進模型和 Mac 上的本機模型。雲端代理程式處理研究、推理和規劃,而本機模型則處理私密檔案和敏感資訊。

此邊界取決於在個人識別資訊 (PII) 離開裝置之前对其進行檢測。本機隱私閘門將敏感內容保留在 Mac 上、修訂檢測到的私密資訊,或者在將其傳送至雲端之前請求批准。

在漫長的多語言對話中,檢測難度會增加。同一個識別碼可能會在不同的輪次中出現多次。遺漏一次提及就可能暴露本應由系統保護的資訊。

簡介

今天,我們推出 PII-TRACE Tracing Recurring PII Across Conversational Exchanges,跨對話交流追蹤重複 PII),這是一項用於評估個人識別資訊 (PII) 檢測器的新基準測試,以及用於 PII 檢測的精簡 0.6B 模型 PII-Tracer

以雲端為先的代理程式迫使使用者在上下文、智慧和隱私之間做出平衡。更多的個人上下文可以幫助代理程式理解使用者並產生更好的結果。但提供這些上下文通常意味著將私密資訊傳送到遠端服務,並且可能會洩漏個人資訊。使助理變得有用的資訊可能正是使用者最想保持私密的資訊。

混合式 AI 透過在使用者裝置和雲端模型之間分配工作來緩解這種權衡。但只有在裝置能夠在文字傳送到遠端模型之前識別 PII 的情況下,該邊界才能保護隱私。使用者不應該親自檢查每條訊息。裝置需要一個本機 PII 檢測器作為其隱私閘門。在長對話中,同一個識別碼可能會在不同輪次中重複出現,而遺漏一次提及就足以讓個人資訊穿透防線。

圖表說明隱私閘門工作流程,展示敏感資料如何保留在本機裝置上,同時將批准的請求傳送到雲端模型進行處理。
作為混合式 AI 中隱私閘門的 PII-Tracer

Perplexity 引入了混合式本機-伺服器推論協調器,用於決定哪些工作應該在裝置上執行,哪些工作應該傳送至雲端的代理程式。模型、代理程式執行環境、對話和執行軌跡全都保留在使用者的機器上。需要存取外部世界的任務僅在必要時呼叫,並透過使用者權限進行控管。因此,在使用者批准之前,該內容會一直留在裝置上。

PII-Tracer 透過標記預測包含 PII 的區間,為模型路由提供一個本機控制訊號。接著,應用程式會強制執行路由政策。它會將相關的輸入保留在本機、修訂檢測到的區間,或在升級至雲端模型之前請求明確批准。這使得路由更具選擇性。檢測到的 PII 會留在裝置上,而已批准的上下文仍可受益於先進的雲端模型。

選擇性路由取決於整個對話中的一致檢測。同一個識別碼可能會在不同輪次中重複出現,而遺漏的提及可能仍會被傳輸。

在 12 個檢測器中,PII-Tracer 記錄了最高的字元 F1 和對重複識別碼最高的一致覆蓋率。該基準測試解釋了這兩個結果都很重要的原因:在長對話中,找到大部分 PII 與找到它的每一個副本並不相同。

PII 檢測在混合式 AI 中面臨新挑戰

PII 檢測是一個長久以來的安全問題,並且已經存在幾個基準測試和檢測器。然而,混合式 AI 設定中的 PII 檢測帶來了新的挑戰。特別是,檢測器必須在漫長的多輪對話中識別 PII,在這些對話中,對話上下文決定了一個字串是否應被視為 PII。例如,一個名稱在一個對話中可能識別使用者,在另一個對話中可能指代公眾人物,或者只是助理生成的佔位符。僅憑表面形式不足以判斷字串是否應被標記為 PII。

聊天介面顯示助理在多個輪次中保留了使用者的姓名、電話號碼、約會詳情和電子郵件地址。
姓名、電話號碼和電子郵件地址在整個對話中重複出現。PII-TRACE 僅在找到每一個提及的情況下,才將識別碼計為一致檢測。

現有的 PII 檢測器和基準測試主要針對單一記錄。我們發現,設計用於每次處理一條記錄的檢測器在處理長篇、複雜的對話時表現不佳。此外,現有基準測試通常不會評估跨輪次的一致性。因此,在這些基準測試上的強勁表現並不一定能轉化為長篇多輪對話中有效的 PII 檢測。

PII-TRACE:針對部署關鍵型 PII 檢測的基準測試

我們圍繞在助理對話上使用 PII 檢測器時至關重要的三個行為設計了 PII-TRACE。首先是一致覆蓋:當識別碼出現多次或跨越使用者和助理輪次時,檢測器需要找到每一個提及。其次是對長上下文的強健性:對話長度從少於 1,000 到超過 100,000 字元不等,這使得衡量歷史記錄增長時發生的情況成為可能。第三是處理多語言和混合格式內容:對話可能會切換語言並將散文與程式碼、表格或結構化記錄結合。PII-TRACE 透過評估每個完整對話而不是將其分割成孤立的記錄來保留這些模式。

該基準測試在兩個互補的層級上衡量效能。在識別碼層級上,一致檢測提出了更嚴格的問題:檢測器是否涵蓋了同一個識別碼每次提及中的每一個字元?我們針對具有多個提及的識別碼以及跨輪次重複的識別碼分別報告此分數。在字元層級上,精確度衡量檢測器標記的文字中有多少被標記為 PII,召回率衡量它找到了多少標記的 PII,而 F1 則平衡這兩者。

PII-TRACE 包含 13,148 個橫跨 13 種語言和 10 種書寫系統的合成使用者-助理對話,其中包含 37,431 個在字元層級標記的識別碼提及,涵蓋九種 PII 類型。所有對話中有 41% 包含結構化內容。在 5,645 個帶有標記 PII 的對話中,63.8% 包含出現超過一次的識別碼,28.7% 包含跨多個輪次出現的識別碼。

從生產對話構建合成資料集

PII-TRACE 在不發布原始對話的情況下保留了原始對話的輪次結構。此管道會重寫每個輪次,並將每個標記的識別碼替換為合成值。

圖表說明 PII-TRACE 如何透過範本化、釋義、替換為一致的合成值以及驗證檢查,將標記的生產對話轉換為合成資料集。
IPII-TRACE 將標記的原始文字轉化為範本、重寫每個輪次、插入一致的合成值,並對結果執行發布檢查。

首先,多個語言模型在生產環境的使用者-助理對話中標記九種 PII。基於規則的階段將同一類型的重複識別碼歸入一個實體 ID 下。然後,每個標記的值都被替換為帶有類型的佔位符,留下一個保留了輪次順序、PII 類型以及提及之間連結但沒有任何標記原始值的範本。

該系統在保持這些佔位符完整的情況下釋義每個輪次,然後插入與識別碼類型和格式相符的合成值。在同一個對話中,重複的提及會接收相同的值,而不同的對話則使用獨立生成的值。最後的對齊階段會重新計算每個字元位移。

三個自動化閘門會檢查替代項目是否與儲存的區間相符、重複提及是否使用相同值,以及標記的原始值在 Presidio 和正規表示式重新掃描下是否不存在。儲存的位移也必須能夠還原出確切的合成子字串。未通過的記錄將被重新生成或捨棄。第二個語言模型會審核樣本,而人工則會審核它標記為 PII 的任何內容。

PII-Tracer:用於本機使用的精簡檢測器

PII-Tracer 是一個改編自 Qwen3 骨幹網路的 0.6B 雙向編碼器。隱私篩檢與文字生成不同,它需要尋找相關的 PII 區間並返回其邊界。因此,PII-Tracer 將 Qwen3 的因果遮罩替換為感知填充的雙向注意力機制,以便每個 Token 都能在 4,096-token 視窗內利用先前和後續的輪次。

對於每個 Token,編碼器會生成一個 1,024 維的表示。線性標記頭會為 37 個可能的標籤生成分數:一個用於 PII 區間外文字的特殊標籤(我們使用 O 來表示),以及九種 PII 類型中每種類型的四個區間位置標籤。在命名實體識別的 BIOES 方案中,B(開始)、I(內部)和 E(結束)標記多 Token 區間,而 S(單一)標記單 Token 區間。輔助頭還會預測對話是否包含敏感素材,例如健康或宗教資訊。

我們對 PII-Tracer 進行了三個 Epoch 的訓練,資料約為 714,000 個訓練樣本,結合了多語言助理對話與單一記錄範例。共用的雙向編碼器有兩個訓練頭:一個 類別的 BIOES Token 頭,用於檢測和標記 PII 區間類型;以及一個二元對話層級頭,用於預測對話是否包含敏感素材。我們使用 L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}} 聯合訓練這兩個頭。在此,Ltag\mathcal{L}_{\mathrm{tag}} 給予稀有 PII 標籤更高的權重,使頻繁出現的 `O` 標籤不至於佔主導地位,而 Lsens\mathcal{L}_{\mathrm{sens}} 則提供對話層級的訓練訊號;1.5 和 0.3 的係數使區間檢測保持為主要任務。此輔助訊號強化了上下文感知檢測:模型學會在對話中判斷候選區間,而不是將其視為孤立的字串,這有助於減少誤報,同時僅付出少許召回率的權衡。

在推論時,受約束的 Viterbi 解碼器會搜尋評分最高且有效的 BIOES 序列,而不是獨立標記每個 Token。例如,B-private_person 可以接著出現 I-private_person 或以 E-private_person 結束,但不能切換為 I-private_email。解碼器將結果對應回確切的字元區間,以便進行修訂(redaction)或本機路由。

PII-Tracer 在字元 F1 和重複 PII 檢測上領先

我們在字元和區間層級上對比了這些檢測器。字元 F1 逐字元評估檢測效果;區間重疊 F1 衡量檢測器是否識別出 PII 項目的任何部分,而區間包含 F1 則衡量其是否捕獲了整個項目。

在評估的 12 個系統中,PII-Tracer 獲得了最高的字元 F1(0.629),以及第二高的區間重疊 F1 和區間包含 F1。先進模型(即 GPT-5.6-sol 和 Claude Sonnet 5)獲得了可比擬的整體效能。GPT-5.6-sol 在兩個區間層級 F1 指標上獲得了更高的分數,但字元 F1 較低。然而,這些先進模型擁有數千億甚至數兆個參數,是託管在雲端中的閉源模型。因此,它們不適合在未篩檢文字必須留在本機的混合式 AI 設定中保護敏感的本機資料。相比之下,PII-Tracer 僅憑 0.6B 參數即可提供接近先進水準的區間層級檢測,並且能夠完全在本機處理未篩檢的文字。其他開源 PII 檢測器的效能明顯比 PII-Tracer 差。

三個長條圖,對比了 12 個 PII 檢測系統。PII-Tracer 0.6B 在字元 F1 中排名第一,在區間重疊和區間包含 F1 中排名第二,僅次於 GPT-5.6-sol。
所有十二個系統的字元 F1、區間重疊 F1 和區間包含 F1。

尋找每一個重複的提及

一致性實驗對相同的預測應用了更嚴格的測試。測試集包含 899 個出現一次的識別碼和 959 個出現超過一次的識別碼;其中 790 個重複出現的識別碼跨越了多個輪次。該圖表報告了四個提及次數分組(一次、兩次、三到五次以及六到十次),並且僅在找到識別碼的所有標記字元時計算一次。它繪製了 PII-Tracer 與三個選定基準的對比,而彙總表格則報告了所有十二個系統的重複和跨輪次分數。

折線圖顯示,在所有提及次數分組中,PII-Tracer 檢測重複識別碼的每個提及都比 GPT-5.6-sol、GLiNER2-PII 和 Claude Opus 4.8 更為一致,從一次提及的 91.7% 下降到 6–10 次提及的 69.1%。
找到每個提及的識別碼佔比。PII-Tracer 在所有四個對比分組中均處於領先地位。

隨著重複次數增加,PII-Tracer 依然保持領先:其分數從提及一次時的 0.917 降至兩次時的 0.873、三到五次時的 0.796,以及六到十次時的 0.691。在最後一個分組中,GPT-5.6-sol 達到 0.464,而 GLiNER2-PII 和 Claude Opus 4.8 則分別達到 0.073 和 0.045。在完整評估中,PII-Tracer 對 79.4% 的重複識別碼和 77.6% 的跨輪次識別碼實現了全數檢測;在相同的兩項指標上,GPT-5.6-sol 分別達到 57.0% 和 55.1%。

涵蓋長對話

我們首先按字元長度將所有 1,922 個測試對話分組,並使用 4,096-token 視窗對 PII-Tracer 進行解碼。這些分組包含 1,000 字元以下的對話 167 個、1,000 至 10,000 字元的對話 1,292 個,以及 10,000 字元或以上的對話 463 個。

按對話長度劃分的 PII-Tracer 效能分組長條圖。F1 在 1,000 至 10,000 字元的對話中達到 67.0% 的峰值,而召回率則從 1,000 字元以下對話的 97.5% 下降到 10,000 字元以上對話的 68.7%。
按對話長度劃分的字元精確度、召回率和 F1

單一視窗召回率在 1,000 字元以下時為 0.975,在 1,000 到 10,000 字元之間時為 0.955,但在 10,000 字元及以上的對話中降至 0.687。精確度在兩個較長的分組中保持在 0.51 左右,這表明輸入覆蓋率是主要問題。

為了研究輸入處理的影響,我們使用 50% 重疊的滑動視窗解碼來評估相同的檢查點。在不重新訓練的情況下,這將整體字元召回率從 0.830 提高到 0.965,並將多提及一致檢測從 0.794 提高到 0.954。

跨語言保持一致

PII-TRACE 涵蓋 13 種語言;語言實驗報告了涵蓋拉丁字母、斯拉夫字母和諺文字母的六種語言片段:英語、德語、法語、義大利語、俄語和韓語。我們對每種語言的所有測試對話運行相同的 12 個檢測器。在每種語言中,我們將預測的和黃金標準的字元合併並計算字元 F1。

熱力圖,對比了 12 個 PII 檢測系統在英語、德語、法語、義大利語、俄語和韓語中的字元 F1 分數。PII-Tracer 在德語、法語、義大利語和俄語中領先,在所有六種語言中均展現出持續強勁的結果。
六個包含 PII 的語言子集上的字元 F1,涵蓋拉丁字母、斯拉夫字母和諺文字母。

PII-Tracer 在六種語言中的四種(德語 [0.735]、法語 [0.633]、義大利語 [0.676] 和俄語 [0.651])的字元 F1 處於領先地位,並且在英語和韓語方面與最佳結果相差僅 0.016 和 0.036。在配套分析中,它在所有六個語言子集中均實現了一致的檢測,評分為 0.80–0.93。各語言視圖顯示了英語以外的增長。

在五個標準基準測試中超越隱私篩檢程式的字元 F1

最後一個實驗移到了 PII-TRACE 之外。我們在 ai4privacy 驗證分割集(47,728 個文件)、Nemotron-PII 測試分割集(100,000 個)、固定種子 SPY 集(8,688 個)、Gretel PII 測試分割集(5,000 個)和 TAB ECHR 測試分割集(127 個)上運行了 PII-Tracer 和 OpenAI 隱私篩檢程式。

對比 PII-Tracer 的精確度、召回率和字元 F1 與五個外部基準測試中 OpenAI 隱私篩檢程式 F1 的分組長條圖。PII-Tracer 在每個基準測試中都實現了更高的 F1 分數。
五個外部 PII 基準測試上的字元層級結果,評分時不要求類別名稱相符。灰色長條圖顯示了相同評估下的 OpenAI 隱私篩檢程式。

PII-Tracer 在每個資料集上都具有更高的字元 F1:在 ai4privacy 上為 0.950 對 0.907,在 Nemotron-PII 上為 0.847 對 0.709,在 SPY 上為 0.585 對 0.543,在 Gretel PII 上為 0.952 對 0.895,在 TAB 上為 0.594 對 0.350。TAB 是此群組中唯一由真實人工標記文本構建的基準測試。在此基準中,PII-Tracer 的精確度達到 0.986 對 0.982,召回率達到 0.425 對 0.213——在精確度基本相同的情況下,召回率達到兩倍(詳細資訊請參閱論文)。因此,更高的 F1 從 PII-TRACE 對話延續到了此次對比中的全部五個傳統單一記錄基準測試中。

結論

混合式 AI 將使用者的裝置整合到推論堆疊中,提供更強大的隱私和更低的成本。雲端中的先進模型可以處理研究、推理和規劃,而本機模型則處理應留在裝置上的檔案和個人資料。這種分工取決於在任何敏感資料傳送到雲端之前識別出敏感資訊。

PII-Tracer 是一個用於在多輪對話中檢測 PII 的精簡模型,而 PII-TRACE 則用於評估檢測器是否能在整個對話中持續識別重複出現的 PII。

PII-TRACE 與 PII-Tracer 共同提供了一個基準測試和參考模型,用於推動多輪對話和其他長上下文設定中的 PII 檢測。

代理程式正在承擔更長的任務並處理更多的個人上下文。因此,隱私控制應貫穿整個對話,而不僅僅是初始輸入。混合式 AI 依賴可靠的本機檢測將敏感上下文保留在裝置上。

閱讀 arXiv 論文以了解有關 PII-TRACE 基準測試、PII-Tracer 模型和我們評估的詳細資訊。我們計劃很快發布 PII-TRACE 和 PII-Tracer。

  1. 介紹 Mac 上的混合運算新聞2026年9月1日
  2. 資料中心轉移至您的設備新聞2026年6月2日