PII-TRACE: ಸಾಧನವನ್ನು ತೊರೆಯುವ ಮೊದಲು ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು
ಸ್ಥಳೀಯವಾಗಿ ರನ್ ಮಾಡಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ಕಾಂಪ್ಯಾಕ್ಟ್ 0.6B ಡಿಟೆಕ್ಟರ್ನೊಂದಿಗೆ ಜೋಡಿಸಲ್ಪಟ್ಟ, ದೀರ್ಘಕಾಲದ ಸಂಭಾಷಣೆಗಳಾದ್ಯಂತ ಸ್ಥಿರವಾದ PII ಪತ್ತೆಗಾಗಿ 13-ಭಾಷೆಯ ಬೆಂಚ್ಮಾರ್ಕ್.
Mac ನಲ್ಲಿ ಹೈಬ್ರಿಡ್ ಕಂಪ್ಯೂಟ್ Perplexity Computer ಕಾರ್ಯಗಳನ್ನು ಕ್ಲೌಡ್ನಲ್ಲಿರುವ ಫ್ರಾಂಟಿಯರ್ ಮಾದರಿಗಳು ಮತ್ತು Mac ನಲ್ಲಿರುವ ಸ್ಥಳೀಯ ಮಾದರಿಯ ನಡುವೆ ವಿಭಜಿಸುತ್ತದೆ. ಕ್ಲೌಡ್ ಏಜೆಂಟ್ಗಳು ಸಂಶೋಧನೆ, ತಾರ್ಕಿಕತೆ ಮತ್ತು ಯೋಜನೆಯನ್ನು ನಿರ್ವಹಿಸುತ್ತವೆ, ಆದರೆ ಸ್ಥಳೀಯ ಮಾದರಿಯು ಖಾಸಗಿ ಕಡತಗಳು ಮತ್ತು ಸಂವೇದನಾಶೀಲ ಮಾಹಿತಿಯೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತದೆ.
ಈ ಗಡಿಯು ಸಾಧನವನ್ನು ತೊರೆಯುವ ಮೊದಲು ವೈಯಕ್ತಿಕವಾಗಿ ಗುರುತಿಸಬಹುದಾದ ಮಾಹಿತಿಯನ್ನು (PII) ಪತ್ತೆಹಚ್ಚುವುದರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ. ಸ್ಥಳೀಯ ಗೌಪ್ಯತೆ ಗೇಟ್ ಸಂವೇದನಾಶೀಲ ವಿಷಯವನ್ನು Mac ನಲ್ಲಿ ಇರಿಸುತ್ತದೆ, ಪತ್ತೆಯಾದ ಖಾಸಗಿ ಮಾಹಿತಿಯನ್ನು ಮರೆಮಾಚುತ್ತದೆ ಅಥವಾ ಕ್ಲೌಡ್ಗೆ ಕಳುಹಿಸುವ ಮೊದಲು ಅನುಮೋದನೆಯನ್ನು ವಿನಂತಿಸುತ್ತದೆ.
ಉದ್ದವಾದ, ಬಹುಭಾಷಾ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಪತ್ತೆಹಚ್ಚುವಿಕೆ ಕಷ್ಟವಾಗುತ್ತದೆ. ಅದೇ ಗುರುತಿಸುವಿಕೆಯು ವಿಭಿನ್ನ ತಿರುವುಗಳಲ್ಲಿ ಹಲವಾರು ಬಾರಿ ಕಾಣಿಸಿಕೊಳ್ಳಬಹುದು. ತಪ್ಪಿದ ಒಂದು ಉಲ್ಲೇಖವು ಸಿಸ್ಟಮ್ ರಕ್ಷಿಸಲು ಉದ್ದೇಶಿಸಿರುವ ಮಾಹಿತಿಯನ್ನು ಬಹಿರಂಗಪಡಿಸಬಹುದು.
ಪರಿಚಯ
ಇಂದು, ನಾವು PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), ವೈಯಕ್ತಿಕವಾಗಿ ಗುರುತಿಸಬಹುದಾದ ಮಾಹಿತಿ (PII) ಡಿಟೆಕ್ಟರ್ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ಹೊಸ ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಪರಿಚಯಿಸುತ್ತಿದ್ದೇವೆ, ಮತ್ತು PII-Tracer, PII ಪತ್ತೆಗಾಗಿ ಕಾಂಪ್ಯಾಕ್ಟ್ 0.6B ಮಾದರಿಯಾಗಿದೆ.
ಕ್ಲೌಡ್-ಮೊದಲ ಏಜೆಂಟ್ಗಳು ಬಳಕೆದಾರರಿಗೆ ಸಂದರ್ಭ, ಬುದ್ಧಿವಂತಿಕೆ ಮತ್ತು ಗೌಪ್ಯತೆಯನ್ನು ಸಮತೋಲನಗೊಳಿಸಲು ಒತ್ತಾಯಿಸುತ್ತವೆ. ಹೆಚ್ಚು ವೈಯಕ್ತಿಕ ಸಂದರ್ಭವು ಏಜೆಂಟ್ಗೆ ಬಳಕೆದಾರರನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಮತ್ತು ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಆದರೆ ಈ ಸಂದರ್ಭವನ್ನು ಒದಗಿಸುವುದು ಎಂದರೆ ಖಾಸಗಿ ಮಾಹಿತಿಯನ್ನು ರಿಮೋಟ್ ಸೇವೆಗೆ ಕಳುಹಿಸುವುದು ಎಂದರ್ಥ ಮತ್ತು ವೈಯಕ್ತಿಕ ಮಾಹಿತಿಯನ್ನು ಸೋರಿಕೆ ಮಾಡಬಹುದು. ಸಹಾಯಕನನ್ನು ಉಪಯುಕ್ತವಾಗಿಸುವ ಮಾಹಿತಿಯು ಬಳಕೆದಾರರು ಖಾಸgವಾಗಿಡಲು ಹೆಚ್ಚು ಬಯಸುವ ನಿಖರವಾದ ವಿಷಯವಾಗಿರಬಹುದು.
ಹೈಬ್ರಿಡ್ AI ಬಳಕೆದಾರರ ಸಾಧನ ಮತ್ತು ಕ್ಲೌಡ್ ಮಾದರಿಗಳ ನಡುವೆ ಕೆಲಸವನ್ನು ವಿಭಜಿಸುವ ಮೂಲಕ ಈ ರಾಜಿ ಮಾಡಿಕೊಳ್ಳುವುದನ್ನು ಸುಲಭಗೊಳಿಸುತ್ತದೆ. ಆದರೆ ಪಠ್ಯವನ್ನು ರಿಮೋಟ್ ಮಾದರಿಗೆ ಕಳುಹಿಸುವ ಮೊದಲು ಸಾಧನವು PII ಅನ್ನು ಗುರುತಿಸಲು ಸಾಧ್ಯವಾದರೆ ಮಾತ್ರ ಆ ಗಡಿಯು ಗೌಪ್ಯತೆಯನ್ನು ರಕ್ಷಿಸುತ್ತದೆ. ಬಳಕೆದಾರರು ಪ್ರತಿ ಸಂದೇಶವನ್ನು ತಮ್ಮಷ್ಟಕ್ಕೆ ತಾವೇ ಪರಿಶೀಲಿಸಬೇಕಾಗಿಲ್ಲ. ಸಾಧನಕ್ಕೆ ಅದರ ಗೌಪ್ಯತೆ ಗೇಟ್ ಆಗಿ ಸ್ಥಳೀಯ PII ಡಿಟೆಕ್ಟರ್ ಅಗತ್ಯವಿದೆ. ದೀರ್ಘ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ, ಅದೇ ಗುರುತಿಸುವಿಕೆಯು ತಿರುವುಗಳಾದ್ಯಂತ ಮರುಕಳಿಸಬಹುದು, ಮತ್ತು ವೈಯಕ್ತಿಕ ಮಾಹಿತಿಯು ಹಾದುಹೋಗಲು ತಪ್ಪಿದ ಒಂದು ಉಲ್ಲೇಖವೇ ಸಾಕು.

Perplexity ಹೈಬ್ರಿಡ್ ಸ್ಥಳೀಯ-ಸರ್ವರ್ ಅನುಮಾನ ಆರ್ಕೆಸ್ಟ್ರೇಟರ್ ಅನ್ನು ಪರಿಚಯಿಸಿತು ಇದು ಯಾವ ಕೆಲಸವು ಸಾಧನದಲ್ಲಿ चलाना ಮತ್ತು ಯಾವ ಕೆಲಸವು ಕ್ಲೌಡ್ನಲ್ಲಿರುವ ಏಜೆಂಟ್ಗಳಿಗೆ ಹೋಗಬೇಕು ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಮಾದರಿ, ಏಜೆಂಟ್ ಹಾರ್ನೆಸ್, ಸಂಭಾಷಣೆಗಳು ಮತ್ತು ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯ ಪಥಗಳು ಎಲ್ಲವೂ ಬಳಕೆದಾರರ ಯಂತ್ರದಲ್ಲಿ ಇರುತ್ತವೆ. ಹೊರಗಿನ ಜಗತ್ತಿಗೆ ಪ್ರವೇಶದ ಅಗತ್ಯವಿರುವ ಕಾರ್ಯಗಳನ್ನು ಅಗತ್ಯವಿದ್ದಾಗ ಮಾತ್ರ ಕರೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ಬಳಕೆದಾರರ ಅನುಮತಿಯಿಂದ ಗೇಟ್ ಮಾಡಲಾಗುತ್ತದೆ. ಪರಿಣಾಮವಾಗಿ, ಬಳಕೆದಾರರು ಅನುಮೋದಿಸುವವರೆಗೆ, ಆ ವಿಷಯವು ಸಾಧನದಲ್ಲೇ ಇರುತ್ತದೆ.
PII ಅನ್ನು ಹೊಂದಿರುವಂತೆ ಊಹಿಸಲಾದ ಸ್ಪಾನ್ಗಳನ್ನು ಫ್ಲ್ಯಾಗ್ ಮಾಡುವ ಮೂಲಕ ಮಾದರಿ ರೂಟಿಂಗ್ಗಾಗಿ PII-Tracer ಒಂದು ಸ್ಥಳೀಯ ನಿಯಂತ್ರಣ 신호ವನ್ನು ಒದಗಿಸುತ್ತದೆ. ಅಪ್ಲಿಕೇಶನ್ ನಂತರ ರೂಟಿಂಗ್ ನೀತಿಯನ್ನು ಜಾರಿಗೆ ತರುತ್ತದೆ. ಇದು ಸಂಬಂಧಿತ ಇನ್ಪುಟ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ ಇರಿಸುತ್ತದೆ, ಪತ್ತೆಯಾದ ಸ್ಪಾನ್ಗಳನ್ನು ಮರೆಮಾಚುತ್ತದೆ ಅಥವಾ ಕ್ಲೌಡ್ ಮಾದರಿಗೆ ಏರಿಸುವ ಮೊದಲು ಸ್ಪಷ್ಟ ಅನುಮೋದನೆಯನ್ನು ವಿನಂತಿಸುತ್ತದೆ. ಇದು ರೂಟಿಂಗ್ ಅನ್ನು ಹೆಚ್ಚು ಆಯ್ಕೆ ಮಾಡುವಂತೆ ಮಾಡುತ್ತದೆ. ಪತ್ತೆಯಾದ PII ಸಾಧನದಲ್ಲಿ ಉಳಿಯುತ್ತದೆ ಆದರೆ ಅನುಮೋದಿತ ಸಂದರ್ಭವು ಇನ್ನೂ ಫ್ರಾಂಟಿಯರ್ ಕ್ಲೌಡ್ ಮಾದರಿಗಳಿಂದ ಪ್ರಯೋಜನ ಪಡೆಯುತ್ತದೆ.
ಆಯ್ಕೆಮಾಡಿದ ರೂಟಿಂಗ್ ಸಂಪೂರ್ಣ ಸಂಭಾಷಣೆಯಾದ್ಯಂತ ಸ್ಥಿರವಾದ ಪತ್ತೆಯನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. ಅದೇ ಗುರುತಿಸುವಿಕೆಯು ತಿರುವುಗಳಾದ್ಯಂತ ಮರುಕಳಿಸಬಹುದು, ಮತ್ತು ತಪ್ಪಿದ ಉಲ್ಲೇಖವು ಇನ್ನೂ ರವಾನಿಸಲ್ಪಡಬಹುದು.
12 ಡಿಟೆಕ್ಟರ್ಗಳಲ್ಲಿ, PII-Tracer ಅತ್ಯಧಿಕ ಅಕ್ಷರ F1 ಮತ್ತು ಮರುಕಳಿಸುವ ಗುರುತಿಸುವಿಕೆಗಳ ಅತ್ಯಧಿಕ ಸ್ಥಿರ ಕವರೇಜ್ ಅನ್ನು ದಾಖಲಿಸುತ್ತದೆ. ಎರಡೂ ಫಲಿತಾಂಶಗಳು ಏಕೆ ಮುಖ್ಯ ಎಂಬುದನ್ನು ಬೆಂಚ್ಮಾರ್ಕ್ ವಿವರಿಸುತ್ತದೆ: ದೀರ್ಘ ಸಂಭಾಷಣೆಯಲ್ಲಿ, ಹೆಚ್ಚಿನ PII ಅನ್ನು ಕಂಡುಹಿಡಿಯುವುದು ಅದರ ಪ್ರತಿಯೊಂದು ನಕಲನ್ನು ಕಂಡುಹಿಡಿಯುವುದಕ್ಕೆ ಸಮಾನವಲ್ಲ.
ಹೈಬ್ರಿಡ್ AI ನಲ್ಲಿ PII ಪತ್ತೆಯು ಹೊಸ ಸವಾಲುಗಳನ್ನು ಎದುರಿಸುತ್ತದೆ
PII ಪತ್ತೆಯು ದೀರ್ಘಕಾಲದ ಭದ್ರತಾ ಸಮಸ್ಯೆಯಾಗಿದೆ, ಮತ್ತು ಹಲವಾರು ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಮತ್ತು ಡಿಟೆಕ್ಟರ್ಗಳು ಈಗಾಗಲೇ ಅಸ್ತಿತ್ವದಲ್ಲಿವೆ. ಆದಾಗ್ಯೂ, ಹೈಬ್ರಿಡ್ AI ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ PII ಪತ್ತೆಯು ಹೊಸ ಸವಾಲುಗಳನ್ನು ಪರಿಚಯಿಸುತ್ತದೆ. ನಿರ್ದಿಷ್ಟವಾಗಿ ಹೇಳುವುದಾದರೆ, ಡಿಟೆಕ್ಟರ್ಗಳು ದೀರ್ಘವಾದ, ಬಹು-ಟರ್ನ್ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ PII ಅನ್ನು ಗುರುತಿಸಬೇಕು, ಅಲ್ಲಿ ಸಂಭಾಷಣೆಯ ಸಂದರ್ಭವು ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು PII ಎಂದು ಪರಿಗಣಿಸಬೇಕೆFಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಒಂದು ಸಂಭಾಷಣೆಯಲ್ಲಿ ಹೆಸರು ಬಳಕೆದಾರರನ್ನು ಗುರುತಿಸಬಹುದು, ಮತ್ತೊಂದರಲ್ಲಿ ಸಾರ್ವಜನಿಕ ವ್ಯಕ್ತಿಯನ್ನು ಉಲ್ಲೇಖಿಸಬಹುದು ಅಥವಾ ಸಹಾಯಕನಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ಸ್ಥಳದಾರ ಆಗಿರಬಹುದು. ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು PII ಎಂದು ಫ್ಲ್ಯಾಗ್ ಮಾಡಬೇಕೆ ಎಂದು ನಿರ್ಧರಿಸಲು ಮೇಲ್ಮೈ ರೂಪ ಮಾತ್ರ ಸಾಕಾಗುವುದಿಲ್ಲ.

ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ PII ಡಿಟೆಕ್ಟರ್ಗಳು ಮತ್ತು ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಪ್ರಾಥಮಿಕವಾಗಿ ವೈಯಕ್ತಿಕ ದಾಖಲೆಗಳನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿವೆ. ಏಕಕಾಲದಲ್ಲಿ ಒಂದು ದಾಖಲೆಯನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ಡಿಟೆಕ್ಟರ್ಗಳು ಉದ್ದವಾದ, ಸಂಕೀರ್ಣ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಕಳಪೆಯಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಎಂದು ನಾವು ಕಂಡುಕೊಳ್ಳುತ್ತೇವೆ. ಅಲ್ಲದೆ, ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಸಾಮಾನ್ಯವಾಗಿ ತಿರುವುಗಳಾದ್ಯಂತ ಸ್ಥಿರತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದಿಲ್ಲ. ಪರಿಣಾಮವಾಗಿ, ಈ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿನ ಬಲವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯು ದೀರ್ಘವಾದ, ಬಹು-ಟರ್ನ್ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಪರಿಣಾಮಕಾರಿ PII ಪತ್ತೆಗೆ ಅಗತ್ಯವಾಗಿ ಅನುವಾದಿಸುವುದಿಲ್ಲ.
PII-TRACE: ನಿಯೋಜನೆ-ನಿರ್ಣಾಯಕ PII ಪತ್ತೆಗಾಗಿ ಒಂದು ಬೆಂಚ್ಮಾರ್ಕ್
ಸಹಾಯಕ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ PII ಡಿಟೆಕ್ಟರ್ ಅನ್ನು ಬಳಸಿದಾಗ ಮುಖ್ಯವಾದ ಮೂರು ನಡವಳಿಕೆಗಳ ಸುತ್ತ ನಾವು PII-TRACE ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿದ್ದೇವೆ. ಮೊದಲನೆಯದು ಸ್ಥಿರ ಕವರೇಜ್: ಗುರುತಿಸುವಿಕೆಯು ಹಲವಾರು ಬಾರಿ ಕಾಣಿಸಿಕೊಂಡಾಗ ಅಥವಾ ಬಳಕೆದಾರ ಮತ್ತು ಸಹಾಯಕ ತಿರುವುಗಳನ್ನು ದಾಟಿದಾಗ, ಡಿಟೆಕ್ಟರ್ ಪ್ರತಿ ಉಲ್ಲೇಖವನ್ನು ಕಂಡುಹಿಡಿಯಬೇಕು. ಎರಡನೆಯದು ಉದ್ದವಾದ ಸಂದರ್ಭಕ್ಕೆ ದೃಢತೆ: ಸಂಭಾಷಣೆಗಳು 1,000 ಕ್ಕಿಂತ ಕಡಿಮೆ ಅಕ್ಷರಗಳಿಂದ 100,000 ಕ್ಕಿಂತ ಹೆಚ್ಚು ಅಕ್ಷರಗಳವರೆಗೆ ಇರುತ್ತವೆ, ಇತಿಹಾಸ ಬೆಳೆದಂತೆ ಏನಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಅಳೆಯಲು ಇದು ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ. ಮೂರನೆಯದು ಬಹು ಭಾಷೆಗಳು ಮತ್ತು ಮಿಶ್ರ-ರೂಪದ ವಿಷಯವನ್ನು ನಿರ್ವಹಿಸುವುದು: ಸಂಭಾಷಣೆಯು ಭಾಷೆಗಳನ್ನು ಬದಲಾಯಿಸಬಹುದು ಮತ್ತು ಪ್ರೋಸ್ ಅನ್ನು ಕೋಡ್, ಟೇಬಲ್ಗಳು ಅಥವಾ ರಚನಾತ್ಮಕ ದಾಖಲೆಗಳೊಂದಿಗೆ ಸಂಯೋಜಿಸಬಹುದು. PII-TRACE ಪ್ರತ್ಯೇಕ ದಾಖಲೆಗಳಾಗಿ ವಿಭಜಿಸುವ ಬದಲು ಪ್ರತಿ ಸಂಪೂರ್ಣ ಸಂಭಾಷಣೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ ಈ ಮಾದರಿಗಳನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ.
ಬೆಂಚ್ಮಾರ್ಕ್ ಎರಡು ಪೂರಕ ಮಟ್ಟದಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅಳೆಯುತ್ತದೆ. ಗುರುತಿಸುವಿಕೆ ಮಟ್ಟದಲ್ಲಿ, ಸ್ಥಿರ ಪತ್ತೆ ಹೆಚ್ಚು ಕಟ್ಟುನಿಟ್ಟಾದ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳುತ್ತದೆ: ಡಿಟೆಕ್ಟರ್ ಅದೇ ಗುರುತಿಸುವಿಕೆಯ ಪ್ರತಿ ಉಲ್ಲೇಖದಲ್ಲಿ ಪ್ರತಿಯೊಂದು ಅಕ್ಷರವನ್ನು ಒಳಗೊಂಡಿದೆಯೇ? ಬಹು ಉಲ್ಲೇಖಗಳನ್ನು ಹೊಂದಿರುವ ಗುರುತಿಸುವಿಕೆಗಳಿಗೆ ಮತ್ತು ತಿರುವುಗಳಾದ್ಯಂತ ಪುನರಾವರ್ತಿಸುವ ಗುರುತಿಸುವಿಕೆಗಳಿಗೆ ನಾವು ಈ ಸ್ಕೋರ್ ಅನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ವರದಿ ಮಾಡುತ್ತೇವೆ. ಅಕ್ಷರ ಮಟ್ಟದಲ್ಲಿ, ನಿಖರತೆಯು ಡಿಟೆಕ್ಟರ್ನಿಂದ ಗುರುತಿಸಲಾದ ಪಠ್ಯದ ಎಷ್ಟು ಭಾಗವು PII ಎಂದು ಲೇಬಲ್ ಮಾಡಲಾಗಿದೆ ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತದೆ, ರೀಕಾಲ್ ಅದು ಎಷ್ಟು ಲೇಬಲ್ ಮಾಡಲಾದ PII ಅನ್ನು ಕಂಡುಕೊಳ್ಳುತ್ತದೆ ಎಂಬುದನ್ನು ಅಳೆಯುತ್ತದೆ ಮತ್ತು F1 ಎರಡನ್ನೂ ಸಮತೋಲನಗೊಳಿಸುತ್ತದೆ.
PII-TRACE 13 ಭಾಷೆಗಳು ಮತ್ತು 13,148 ಬರವಣಿಗೆಯ ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ 13,148 ಸಿಂಥೆಟಿಕ್ ಬಳಕೆದಾರ-ಸಹಾಯಕ ಸಂಭಾಷಣೆಗಳನ್ನು ಒಳಗೊಂಡಿದೆ, ಒಂಬತ್ತು PII ಪ್ರಕಾರಗಳಲ್ಲಿ ಅಕ್ಷರ ಮಟ್ಟದಲ್ಲಿ ಲೇಬಲ್ ಮಾಡಲಾದ 37,431 ಗುರುತಿಸುವಿಕೆ ಉಲ್ಲೇಖಗಳನ್ನು ಹೊಂದಿದೆ. ಸಂಭಾಷಣೆಗಳ ಒಟ್ಟು 41% ರಚನಾತ್ಮಕ ವಿಷಯವನ್ನು ಹೊಂದಿವೆ. ಲೇಬಲ್ ಮಾಡಲಾದ PII ನೊಂದಿಗೆ 5,645 ಸಂಭಾಷಣೆಗಳಲ್ಲಿ, 63.8% ಕ್ಕಿಂತ ಹೆಚ್ಚು ಬಾರಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ ಗುರುತಿಸುವಿಕೆಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ ಮತ್ತು 28.7% ಬಹು ತಿರುವುಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ ಗುರುತಿಸುವಿಕೆಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ.
ಉತ್ಪಾದನಾ ಸಂಭಾಷಣೆಗಳಿಂದ ಸಿಂಥೆಟಿಕ್ ಡೇಟಾಸೆಟ್ ಅನ್ನು ನಿರ್ಮಿಸುವುದು
PII-TRACE ಮೂಲ ಸಂಭಾಷಣೆಗಳ ತಿರುವು ರಚನೆಯನ್ನು ಮೂಲಗಳನ್ನು ಪ್ರಕಟಿಸದೆ ಸಂರಕ್ಷಿಸುತ್ತದೆ. ಪೈಪ್ಲೈನ್ ಪ್ರತಿ ತಿರುವನ್ನು ಪುನಃ ಬರೆಯುತ್ತದೆ ಮತ್ತು ಲೇಬಲ್ ಮಾಡಲಾದ ಪ್ರತಿಯೊಂದು ಗುರುತಿಸುವಿಕೆಯನ್ನು ಸಿಂಥೆಟಿಕ್ ಮೌಲ್ಯದೊಂದಿಗೆ ಬದಲಾಯಿಸುತ್ತದೆ.

ಮೊದಲನೆಯದಾಗಿ, ಬಹು ಭಾಷಾ ಮಾದರಿಗಳು ಉತ್ಪಾದನಾ ಬಳಕೆದಾರ-ಸಹಾಯಕ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಒಂಬತ್ತು ವಿಧದ PII ಅನ್ನು ಗುರುತಿಸುತ್ತವೆ. ನಿಯಮ-ಆಧಾರಿತ ಪಾಸ್ ಒಂದು ಘಟಕ ID ಅಡಿಯಲ್ಲಿ ಒಂದೇ ಪ್ರಕಾರದ ಪುನರಾವರ್ತಿತ ಗುರುತಿಸುವಿಕೆಗಳನ್ನು ಗುಂಪು ಮಾಡುತ್ತದೆ. ಪ್ರತಿ ಗುರುತಿಸಲಾದ ಮೌಲ್ಯವನ್ನು ಟೈಪ್ ಮಾಡಿದ ಸ್ಥಳದಾರರೊಂದಿಗೆ ಬದಲಾಯಿಸಲಾಗುತ್ತದೆ, ಇದು ತಿರುವಿನ ಕ್ರಮ, PII ಪ್ರಕಾರ ಮತ್ತು ಉಲ್ಲೇಖಗಳ ನಡುವಿನ ಲಿಂಕ್ಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವ ಟೆಂಪ್ಲೇಟ್ ಅನ್ನು ಬಿಡುತ್ತದೆ ಆದರೆ ಗುರುತಿಸಲಾದ ಮೂಲ ಮೌಲ್ಯಗಳಲ್ಲಿ ಯಾವುದನ್ನೂ ಉಳಿಸುವುದಿಲ್ಲ.
ಸಿಸ್ಟಮ್ ಆ ಸ್ಥಳದಾರರನ್ನು ಹಾಗೇ ಇರಿಸಿಕೊಳ್ಳುವಾಗ ಪ್ರತಿ ತಿರುವನ್ನು ಪ್ಯಾರಾಫ್ರೇಸ್ ಮಾಡುತ್ತದೆ, ನಂತರ ಗುರುತಿಸುವಿಕೆಯ ಪ್ರಕಾರ ಮತ್ತು ಸ್ವರೂಪಕ್ಕೆ ಹೊಂದಿಕೆಯಾಗುವ ಸಿಂಥೆಟಿಕ್ ಮೌಲ್ಯಗಳನ್ನು ಸೇರಿಸುತ್ತದೆ. ಪುನರಾವರ್ತಿತ ಉಲ್ಲೇಖಗಳು ಸಂಭಾಷಣೆಯೊಳಗೆ ಒಂದೇ ಮೌಲ್ಯವನ್ನು ಸ್ವೀಕರಿಸುತ್ತವೆ, ಆದರೆ ವಿಭಿನ್ನ ಸಂಭಾಷಣೆಗಳು ಸ್ವತಂತ್ರವಾಗಿ ಉತ್ಪತ್ತಿಯಾಗುವ ಮೌಲ್ಯಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಅಂತಿಮ ಜೋಡಣೆ ಪಾಸ್ ಪ್ರತಿಯೊಂದು ಅಕ್ಷರ ಆಫ್ಸೆಟ್ ಅನ್ನು ಮರುಲೆಕ್ಕಾಚಾರ ಮಾಡುತ್ತದೆ.
ಬದಲಿಗಳು ಸಂಗ್ರಹಗೊಂಡ ಸ್ಪಾನ್ಗಳಿಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತವೆ, ಪುನರಾವರ್ತಿತ ಉಲ್ಲೇಖಗಳು ಒಂದೇ ಮೌಲ್ಯವನ್ನು ಬಳಸುತ್ತವೆ ಮತ್ತು ಗುರುತಿಸಲಾದ ಮೂಲ ಮೌಲ್ಯಗಳು Presidio ಮತ್ತು ರೆಗ್ಯುಲರ್-ಎಕ್ಸ್ಪ್ರೆಷನ್ ಮರುಸ್ಕ್ಯಾನ್ ಅಡಿಯಲ್ಲಿ ಗೈರುಹಾಜರಾಗಿವೆ ಎಂದು ಮೂರು ಸ್ವಯಂಚಾಲಿತ ಗೇಟ್ಗಳು ಪರಿಶೀಲಿಸುತ್ತವೆ. ಸಂಗ್ರಹಿಸಿದ ಆಫ್ಸೆಟ್ ನಿಖರವಾದ ಸಿಂಥೆಟಿಕ್ ಸಬ್ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು ಸಹ ಮರುಪಡೆಯಬೇಕು. ವಿಫಲವಾದ ದಾಖಲೆಗಳನ್ನು ಮರುಸೃಷ್ಟಿಸಲಾಗುತ್ತದೆ ಅಥವಾ ಕೈಬಿಡಲಾಗುತ್ತದೆ. ಎರಡನೇ ಭಾಷಾ ಮಾದರಿಯು ಒಂದು ಮಾದರಿಯನ್ನು ಲೆಕ್ಕಪರಿಶೋಧಿಸುತ್ತದೆ ಮತ್ತು ಅದು PII ಎಂದು ಫ್ಲ್ಯಾಗ್ ಮಾಡುವ ಯಾವುದನ್ನಾದರೂ ಮಾನವರು ಪರಿಶೀಲಿಸುತ್ತಾರೆ.
PII-Tracer: ಸ್ಥಳೀಯ ಬಳಕೆಗಾಗಿ ಒಂದು ಕಾಂಪ್ಯಾಕ್ಟ್ ಡಿಟೆಕ್ಟರ್
PII-Tracer ಎನ್ನುವುದು Qwen3 ಬ್ಯಾಕ್ಬೋನ್ನಿಂದ ರೂಪುಗೊಂಡ 0.6B ದ್ವಿಮುಖ ಎನ್ಕೋಡರ್ ಆಗಿದೆ. ಗೌಪ್ಯತೆ ಸ್ಕ್ರೀನಿಂಗ್ ಪಠ್ಯ ಉತ್ಪಾದನೆಗಿಂತ ಭಿನ್ನವಾಗಿದೆ ಮತ್ತು ಸಂಬಂಧಿತ PII ಸ್ಪಾನ್ಗಳನ್ನು ಹುಡುಕುವ ಮತ್ತು ಅವುಗಳ ಗಡಿಗಳನ್ನು ಹಿಂದಿರುಗಿಸುವ ಅಗತ್ಯವಿದೆ. ಪರಿಣಾಮವಾಗಿ, PII-Tracer Qwen3 ನ ಕಾರ್ಟರಲ್ ಮಾಸ್ಕ್ ಅನ್ನು ಪ್ಯಾಡಿಂಗ್-ಅವೇರ್ ದ್ವಿಮುಖ ಗಮನದೊಂದಿಗೆ ಬದಲಾಯಿಸುತ್ತದೆ, ಆದ್ದರಿಂದ ಪ್ರತಿ ಟೋಕನ್ 4,096-ಟೋಕನ್ ವಿಂಡೋದೊಳಗೆ ಹಿಂದಿನ ಮತ್ತು ನಂತರದ ತಿರುವುಗಳಿಂದ ಸೆಳೆಯಬಹುದು.
ಪ್ರತಿ ಟೋಕನ್ಗಾಗಿ, ಎನ್ಕೋಡರ್ 1,024-ಆಯಾಮದ ಪ್ರಾತಿನಿಧ್ಯವನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ರೇಖೀಯ ಟ್ಯಾಗಿಂಗ್ ಹೆಡ್ 37 ಸಂಭಾವ್ಯ ಲೇಬಲ್ಗಳಿಗೆ ಸ್ಕೋರ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ: PII ಸ್ಪಾನ್ನ ಹೊರಗಿನ ಪಠ್ಯಕ್ಕಾಗಿ ಒಂದು ವಿಶೇಷ ಲೇಬಲ್ (ಯದಕ್ಕಾಗಿ ನಾವು O ಅನ್ನು ಬಳಸುತ್ತೇವೆ), ಜೊತೆಗೆ ಒಂಬತ್ತು PII ಪ್ರಕಾರಗಳಲ್ಲಿ ಪ್ರತಿಯೊಂದಕ್ಕೂ ನಾಲ್ಕು ಸ್ಪಾನ್-ಸ್ಥಳ ಲೇಬಲ್ಗಳು. ನೇಮ್ಡ್ ಎಂಟಿಟಿ ರಿಕಗ್ನಿಷನ್ಗಾಗಿ BIOES ಯೋಜನೆಯಲ್ಲಿ, B (Beginning), I (Inside), ಮತ್ತು E (End) ಬಹು-ಟೋಕನ್ ಸ್ಪಾನ್ ಅನ್ನು ಗುರುತಿಸುತ್ತವೆ, ಆದರೆ S (Single) ಒಂದು-ಟೋಕನ್ ಸ್ಪಾನ್ ಅನ್ನು ಗುರುತಿಸುತ್ತದೆ. ಆರೋಗ್ಯ ಅಥವಾ ಧಾರ್ಮಿಕ ಮಾಹಿತಿಯಂತಹ ಸಂವೇದನಾಶೀಲ ವಿಷಯವನ್ನು ಸಂಭಾಷಣೆಯು ಹೊಂದಿದೆಯೇ ಎಂದು ಸಹಾಯಕ ಮುಖ್ಯಸ್ಥರು ಸಹ ಊಹಿಸುತ್ತಾರೆ.
ಬಹುಭಾಷಾ ಸಹಾಯಕ ಸಂಭಾಷಣೆಗಳನ್ನು ಏಕ-ದಾಖಲೆ ಉದಾಹರಣೆಗಳೊಂದಿಗೆ ಸಂಯೋಜಿಸಿ, ಸರಿಸುಮಾರು 714,000 ತರಬೇತಿ ಮಾದರಿಗಳಲ್ಲಿ ನಾವು ಮೂರು ಯುಗಗಳಿಗೆ PII-Tracer ಅನ್ನು ತರಬೇತಿಗೊಳಿಸುತ್ತೇವೆ. ಹಂಚಿಕೊಳ್ಳಲಾದ ದ್ವಿಮುಖ ಎನ್ಕೋಡರ್ ಎರಡು ತರಬೇತಿ ಮುಖ್ಯಸ್ಥರನ್ನು ಹೊಂದಿದೆ: PII ಸ್ಪಾನ್ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವ ಮತ್ತು ಟೈಪ್ ಮಾಡುವ 37-ವರ್ಗದ BIOES ಟೋಕನ್ ಹೆಡ್, ಮತ್ತು ಸಂಭಾಷಣೆಯು ಸಂವೇದನಾಶೀಲ ವಸ್ತುವನ್ನು ಹೊಂದಿದೆಯೇ ಎಂದು ಊಹಿಸುವ ಬೈನರಿ ಸಂಭಾಷಣೆ-ಮಟ್ಟದ ಹೆಡ್. ಬಳಸಿ ನಾವು ಎರಡೂ ಮುಖ್ಯಸ್ಥರಿಗೆ ಜಂಟಿಯಾಗಿ ತರಬೇತಿ ನೀಡುತ್ತೇವೆ. ಇಲ್ಲಿ, ಅಪರೂಪದ PII ಲೇಬಲ್ಗಳಿಗೆ ಹೆಚ್ಚಿನ ತೂಕವನ್ನು ನೀಡುತ್ತದೆ ಇದರಿಂದ ಆಗಾಗ್ಗೆ ಬರುವ `O` ಲೇಬಲ್ ಪ್ರಾಬಲ್ಯ ಸಾಧಿಸುವುದಿಲ್ಲ, ಆದರೆ ಸಂಭಾಷಣೆ-ಮಟ್ಟದ ತರಬೇತಿ ಸಂಕೇತವನ್ನು ಪೂರೈಸುತ್ತದೆ; 1.5 ಮತ್ತು 0.3 ಗುಣಾಂಕಗಳು ಸ್ಪಾನ್ ಪತ್ತೆಯನ್ನು ಮುಖ್ಯ ಕಾರ್ಯವಾಗಿ ಇರಿಸುತ್ತವೆ. ಈ ಸಹಾಯಕ ಸಂಕೇತವು ಸಂದರ್ಭ-ಅರಿವು ಪತ್ತೆಯನ್ನು ಬಲಪಡಿಸುತ್ತದೆ: ಮಾದರಿಯು ಪ್ರತ್ಯೇಕವಾದ ಸ್ಟ್ರಿಂಗ್ಗಿಂತ ಸಂಭಾಷಣೆಯೊಳಗೆ ಅಭ್ಯರ್ಥಿ ಸ್ಪಾನ್ ಅನ್ನು ನಿರ್ಣಯಿಸಲು ಕಲಿಯುತ್ತದೆ, ಇದು ರೀಕಾಲ್ನಲ್ಲಿ ಕೇವಲ ಸಣ್ಣ ರಾಜಿ ಮಾಡಿಕೊಳ್ಳುವ ಮೂಲಕ ತಪ್ಪು ಧನಾತ್ಮಕಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಅನುಮಾನದ ಸಮಯದಲ್ಲಿ, ನಿರ್ಬಂಧಿತ Viterbi ಡಿಕೋಡರ್ ಪ್ರತಿ ಟೋಕನ್ ಅನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಲೇಬಲ್ ಮಾಡುವ ಬದಲು ಅತ್ಯಧಿಕ ಸ್ಕೋರ್ ಗಳಿಸುವ ಮಾನ್ಯ BIOES ಅನುಕ್ರಮಕ್ಕಾಗಿ ಹುಡುಕುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, B-private_person I-private_person ನೊಂದಿಗೆ ಮುಂದುವರಿಯಬಹುದು ಅಥವಾ E-private_person ನೊಂದಿಗೆ ಮುಚ್ಚಬಹುದು, ಆದರೆ I-private_email ಗೆ ಬದಲಾಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಡಿಕೋಡರ್ ಫಲಿತಾಂಶವನ್ನು ಮರುರೂಪಿಸಲು ಅಥವಾ ಸ್ಥಳೀಯ ರೂಟಿಂಗ್ಗಾಗಿ ನಿಖರವಾದ ಅಕ್ಷರ ಸ್ಪಾನ್ಗಳಿಗೆ ಮ್ಯಾಪ್ ಮಾಡುತ್ತದೆ.
ಅಕ್ಷರ F1 ಮತ್ತು ಮರುಕಳಿಸುವ PII ನಲ್ಲಿ PII-Tracer ಮುಂಚೂಣಿಯಲ್ಲಿದೆ
ನಾವು ಅಕ್ಷರ ಮತ್ತು ಸ್ಪಾನ್ ಮಟ್ಟಗಳಲ್ಲಿ ಡಿಟೆಕ್ಟರ್ಗಳನ್ನು ಹೋಲಿಸುತ್ತೇವೆ. ಅಕ್ಷರ F1 ಪ್ರತಿ ಅಕ್ಷರಕ್ಕೂ ಪತ್ತೆಹಚ್ಚುವಿಕೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ. ಸ್ಪಾನ್-ಅತಿಕ್ರಮಣ F1 ಡಿಟೆಕ್ಟರ್ PII ಅಂಶದ ಯಾವುದೇ ಭಾಗವನ್ನು ಗುರುತಿಸುತ್ತದೆಯೇ ಎಂದು ಅಳೆಯುತ್ತದೆ, ಆದರೆ ಸ್ಪಾನ್-ಹೊಂದಿರುವಿಕೆ F1 ಇದು ಸಂಪೂರ್ಣ ಅಂಶವನ್ನು ಸೆರೆಹಿಡಿಯುತ್ತದೆಯೇ ಎಂದು ಅಳೆಯುತ್ತದೆ.
ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾದ 12 ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ PII-Tracer ಅತ್ಯಧಿಕ ಅಕ್ಷರ F1 (0.629) ಅನ್ನು ಸಾಧಿಸಿದೆ, ಮತ್ತು ಎರಡನೇ ಅತಿ ಹೆಚ್ಚು ಸ್ಪಾನ್-ಅತಿಕ್ರಮಣ F1 ಮತ್ತು ಸ್ಪಾನ್-ಹೊಂದಿರುವಿಕೆ F1 ಅನ್ನು ಸಾಧಿಸಿದೆ. ಫ್ರಾಂಟಿಯರ್ ಮಾದರಿಗಳು, ಅಂದರೆ GPT-5.6-sol ಮತ್ತು Claude Sonnet 5, ಹೋಲಿಸಬಹುದಾದ ಒಟ್ಟಾರೆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸಾಧಿಸಿವೆ. GPT-5.6-sol ಎರಡೂ ಸ್ಪಾನ್-ಮಟ್ಟದ F1 ಮೆಟ್ರಿಕ್ಗಳಲ್ಲಿ ಹೆಚ್ಚಿನ ಸ್ಕೋರ್ಗಳನ್ನು ಪಡೆದುಕೊಂಡಿದೆ, ಆದರೆ ಕಡಿಮೆ ಅಕ್ಷರ F1 ಪಡೆದಿದೆ. ಆದಾಗ್ಯೂ, ಈ ಫ್ರಾಂಟಿಯರ್ ಮಾದರಿಗಳು ನೂರಾರು ಶತಕೋಟಿ ಅಥವಾ ಟ್ರಿಲಿಯನ್ಗಳಷ್ಟು ನಿಯರಾಮಿತಿಗಳನ್ನು ಹೊಂದಿವೆ ಮತ್ತು ಕ್ಲೌಡ್ನಲ್ಲಿ ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಕ್ಲೋಸ್ಡ್-ಸೋರ್ಸ್ ಮಾದರಿಗಳಾಗಿವೆ. ಪರಿಣಾಮವಾಗಿ, ಸ್ಕ್ರೀನ್ ಮಾಡದ ಪಠ್ಯವು ಸ್ಥಳೀಯವಾಗಿರಬೇಕಾದ ಹೈಬ್ರಿಡ್ AI ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ ಸಂವೇದನಾಶೀಲ ಸ್ಥಳೀಯ ಡೇಟಾವನ್ನು ರಕ್ಷಿಸಲು ಅವು ಸೂಕ್ತವಲ್ಲ. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, PII-Tracer ಕೇವಲ 0.6B ನಿಯರಾಮಿತಿಗಳೊಂದಿಗೆ ಫ್ರಾಂಟಿಯರ್-ಸಮೀಪದ ಸ್ಪಾನ್-ಮಟ್ಟದ ಪತ್ತೆಯನ್ನು ತಲುಪಿಸುತ್ತದೆ ಮತ್ತು ಸ್ಕ್ರೀನ್ ಮಾಡದ ಪಠ್ಯವನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಸ್ಥಳೀಯವಾಗಿ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬಹುದು. ಇತರ ಓಪನ್-ಸೋರ್ಸ್ PII ಡಿಟೆಕ್ಟರ್ಗಳು PII-Tracer ಗಿಂತ ಗಣನೀಯವಾಗಿ ಕಳಪೆಯಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ.

ಪ್ರತಿ ಮರುಕಳಿಸುವ ಉಲ್ಲೇಖವನ್ನು ಕಂಡುಹಿಡಿಯುವುದು
ಸ್ಥಿರತೆಯ ಪ್ರಯೋಗವು ಅದೇ ಮುನ್ಸೂಚನೆಗಳಿಗೆ ಕಟ್ಟುನಿಟ್ಟಾದ ಪರೀಕ್ಷೆಯನ್ನು ಅನ್ವಯಿಸುತ್ತದೆ. ಪರೀಕ್ಷಾ ಸೆಟ್ ಒಮ್ಮೆ ಕಾಣಿಸಿಕೊಳ್ಳುವ 899 ಗುರುತಿಸುವಿಕೆಗಳನ್ನು ಮತ್ತು ಒಂದಕ್ಕಿಂತ ಹೆಚ್ಚು ಬಾರಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ 959 ಅನ್ನು ಒಳಗೊಂಡಿದೆ; ಮರುಕಳಿಸುವ ಗುರುತಿಸುವಿಕೆಗಳಲ್ಲಿ 790 ಬಹು ತಿರುವುಗಳನ್ನು ವ್ಯಾಪಿಸುತ್ತವೆ. ಅಂಕಿಅಂಶವು ನಾಲ್ಕು ಉಲ್ಲೇಖ-ಎಣಿಕೆ ಬಕೆಟ್ಗಳನ್ನು (ಒಂದು, ಎರಡು, ಮೂರರಿಂದ ಐದು, ಮತ್ತು ಆರು ರಿಂದ ಹತ್ತು) ವರದಿ ಮಾಡುತ್ತದೆ ಮತ್ತು ಅದರ ಎಲ್ಲಾ ಲೇಬಲ್ ಮಾಡಲಾದ ಅಕ್ಷರಗಳು ಕಂಡುಬಂದಾಗ ಮಾತ್ರ ಗುರುತಿಸುವಿಕೆಯನ್ನು ಎಣಿಕೆ ಮಾಡುತ್ತದೆ. ಇದು ಮೂರು ಆಯ್ಕೆಮಾಡಿದ ಬೇಸ್ಲೈನ್ಗಳೊಂದಿಗೆ PII-Tracer ಅನ್ನು ಪ್ಲಾಟ್ ಮಾಡುತ್ತದೆ, ಆದರೆ ಒಟ್ಟುಗೂಡಿದ ಕೋಷ್ಟಕವು ಎಲ್ಲಾ ಹನ್ನೆರಡು ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಮರುಕಳಿಸುವ ಮತ್ತು ಕ್ರಾಸ್-ಟರ್ನ್ ಸ್ಕೋರ್ಗಳನ್ನು ವರದಿ ಮಾಡುತ್ತದೆ.

ಪುನರಾವರ್ತನೆಯು ಹೆಚ್ಚಾದಂತೆ PII-Tracer ಮುಂದಿರುತ್ತದೆ: ಇದರ ಸ್ಕೋರ್ ಒಂದು ಉಲ್ಲೇಖಕ್ಕೆ 0.917 ರಿಂದ ಎರಡಕ್ಕೆ 0.873 ಕ್ಕೆ, ಮೂರರಿಂದ ಐದಕ್ಕೆ 0.796 ಕ್ಕೆ ಮತ್ತು ಆರರಿಂದ ಹತ್ತಕ್ಕೆ 0.691 ಕ್ಕೆ ಚಲಿಸುತ್ತದೆ. ಕೊನೆಯ ಬಕೆಟ್ನಲ್ಲಿ, GPT-5.6-sol 0.464 ತಲುಪುತ್ತದೆ, ಆದರೆ GLiNER2-PII ಮತ್ತು Claude Opus 4.8 ಕ್ರಮವಾಗಿ 0.073 ಮತ್ತು 0.045 ತಲುಪುತ್ತವೆ. ಸಂಪೂರ್ಣ ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ, PII-Tracer ಮರುಕಳಿಸುವ ಗುರುತಿಸುವಿಕೆಗಳ 79.4% ಮತ್ತು ಕ್ರಾಸ್-ಟರ್ನ್ ಗುರುತಿಸುವಿಕೆಗಳ 77.6% ಪ್ರತಿ ಉಲ್ಲೇಖವನ್ನು ಕಂಡುಕೊಳ್ಳುತ್ತದೆ; GPT-5.6-sol ಅದೇ ಎರಡು ಅಳತೆಗಳಲ್ಲಿ 57.0% ಮತ್ತು 55.1% ತಲುಪುತ್ತದೆ.
ಉದ್ದವಾದ ಸಂಭಾಷಣೆಗಳನ್ನು ಒಳಗೊಳ್ಳುವುದು
ನಾವು ಮೊದಲು ಎಲ್ಲಾ 1,922 ಪರೀಕ್ಷಾ ಸಂಭಾಷಣೆಗಳನ್ನು ಅಕ್ಷರದ ಉದ್ದದಿಂದ ಗುಂಪು ಮಾಡುತ್ತೇವೆ ಮತ್ತು 4,096-ಟೋಕನ್ ವಿಂಡೋದೊಂದಿಗೆ PII-Tracer ಅನ್ನು ಡಿಕೋಡ್ ಮಾಡುತ್ತೇವೆ. ಗುಂಪುಗಳು 1,000 ಅಕ್ಷರಗಳಿಗಿಂತ ಕೆಳಗಿರುವ 167 ಸಂಭಾಷಣೆಗಳನ್ನು, 1,000 ರಿಂದ 10,000 ವರೆಗೆ 1,292, ಮತ್ತು 10,000 ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚಿನದರಲ್ಲಿ 463 ಅನ್ನು ಒಳಗೊಂಡಿರುತ್ತವೆ.

ಏಕ-ವಿಂಡೋ ರೀಕಾಲ್ 1,000 ಅಕ್ಷರಗಳ ಕೆಳಗೆ 0.975 ಮತ್ತು 1,000 ರಿಂದ 10,000 ವರೆಗೆ 0.955 ಆಗಿದೆ, ಆದರೆ 10,000 ಅಕ್ಷರಗಳು ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಸಂಭಾಷಣೆಗಳಿಗೆ 0.687 ಕ್ಕೆ ಇಳಿಯುತ್ತದೆ. ಎರಡು ಉದ್ದವಾದ ಗುಂಪುಗಳಲ್ಲಿ ನಿಖರತೆಯು ಸುಮಾರು 0.51 ಕ್ಕೆ ಇರುತ್ತದೆ, ಇದು ಮುಖ್ಯ ಸಮಸ್ಯೆಯಾಗಿ ಇನ್ಪುಟ್ ಕವರೇಜನ್ನು ಸೂಚಿಸುತ್ತದೆ.
ಇನ್ಪುಟ್ ನಿರ್ವಹಣೆಯ ಪರಿಣಾಮವನ್ನು ಅಧ್ಯಯನ ಮಾಡಲು, ನಾವು 50%-ಅತ್ರಿಕ್ರಮಣ ಸ್ಲೈಡಿಂಗ್-ವಿಂಡೋ ಡಿಕೋಡಿಂಗ್ನೊಂದಿಗೆ ಅದೇ ಚೆಕ್ಪಾಯಿಂಟ್ ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. ಇದು ಮರುತರಬೇತಿ ಇಲ್ಲದೆ, ಒಟ್ಟಾರೆ ಅಕ್ಷರ ರೀಕಾಲ್ ಅನ್ನು 0.830 ರಿಂದ 0.965 ಕ್ಕೆ ಮತ್ತು ಬಹು-ಉಲ್ಲೇಖ ಸ್ಥಿರ ಪತ್ತೆಯನ್ನು 0.794 ರಿಂದ 0.954 ಕ್ಕೆ ಹೆಚ್ಚಿಸುತ್ತದೆ.
ಭಾಷೆಗಳಾದ್ಯಂತ ಸ್ಥಿರವಾಗಿದೆ
PII-TRACE 13 ಭಾಷೆಗಳನ್ನು ಒಳಗೊಂಡಿದೆ; ಭಾಷಾ ಪ್ರಯೋಗವು ಲ್ಯಾಟಿನ್, ಸಿರಿಲಿಕ್ ಮತ್ತು ಹಂಗುಲ್ ಲಿಪಿಗಳನ್ನು ವ್ಯಾಪಿಸಿರುವ ಆರು-ಭಾಷೆಯ ಸ್ಲೈಸ್ ಅನ್ನು ವರದಿ ಮಾಡುತ್ತದೆ: ಇಂಗ್ಲಿಷ್, ಜರ್ಮನ್, ಫ್ರೆಂಚ್, ಇಟಾಲಿಯನ್, ರಷ್ಯನ್ ಮತ್ತು ಕೊರಿಯನ್. ನಾವು ಪ್ರತಿ ಭಾಷೆಯಲ್ಲಿ ಎಲ್ಲಾ ಪರೀಕ್ಷಾ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ ಅದೇ 12 ಡಿಟೆಕ್ಟರ್ಗಳನ್ನು ರನ್ ಮಾಡುತ್ತೇವೆ. ಪ್ರತಿ ಭಾಷೆಯೊಳಗೆ, ನಾವು ಊಹಿಸಿದ ಮತ್ತು ಚಿನ್ನದ ಅಕ್ಷರಗಳನ್ನು ಪೂಲ್ ಮಾಡುತ್ತೇವೆ ಮತ್ತು ಅಕ್ಷರ F1 ಅನ್ನು ಲೆಕ್ಕ ಹಾಕುತ್ತೇವೆ.

PII-Tracer ಆರು ಭಾಷೆಗಳಲ್ಲಿ ನಾಲ್ಕರಲ್ಲಿ ಅಕ್ಷರ F1 ಅನ್ನು ಮುಂಚೂಣಿಯಲ್ಲಿದೆ: ಜರ್ಮನ್ (0.735), ಫ್ರೆಂಚ್ (0.633), ಇಟಾಲಿಯನ್ (0.676), ಮತ್ತು ರಷ್ಯನ್ (0.651), ಮತ್ತು ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಕೊರಿಯನ್ನಲ್ಲಿ ಅತ್ಯುತ್ತಮ ಫಲಿತಾಂಶಗಳ 0.016 ಮತ್ತು 0.036 ರ ಒಳಗೆ ಇದೆ. ಒಡನಾಡಿ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ, ಇದು ಎಲ್ಲಾ ಆರು ಭಾಷಾ ಉಪವಿಭಾಗಗಳಲ್ಲಿ ಸ್ಥಿರವಾದ ಪತ್ತೆಗೆ ಕಾರಣವಾಗುತ್ತದೆ, 0.80–0.93 ಸ್ಕೋರ್ ಮಾಡುತ್ತದೆ. ಪ್ರತಿ-ಭಾಷೆಯ ವೀಕ್ಷಣೆ ಇಂಗ್ಲಿಷ್ಗಿಂತ ಹೆಚ್ಚಿನ ಲಾಭಗಳನ್ನು ತೋರಿಸುತ್ತದೆ.
ಐದು ಪ್ರಮಾಣಿತ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ ಗೌಪ್ಯತೆ ಫಿಲ್ಟರ್ಗಿಂತ ಹೆಚ್ಚಿನ ಅಕ್ಷರ F1
ಅಂತಿಮ ಪ್ರಯೋಗವು PII-TRACE ನ ಹೊರಗೆ ಚಲಿಸುತ್ತದೆ. ನಾವು ai4privacy ಮೌಲ್ಯಮಾಪನ ವಿಭಜನೆ (47,728 ಡಾಕ್ಯುಮೆಂಟ್ಗಳು), Nemotron-PII ಪರೀಕ್ಷಾ ವಿಭಜನೆ (100,000), ಸ್ಥಿರ ಸೀಡ್ SPY ಸೆಟ್ (8,688), Gretel PII ಪರೀಕ್ಷಾ ವಿಭಜನೆ (5,000), ಮತ್ತು TAB ECHR ಪರೀಕ್ಷಾ ವಿಭಜನೆ (127) ನಲ್ಲಿ PII-Tracer ಮತ್ತು OpenAI ಗೌಪ್ಯತೆ ಫಿಲ್ಟರ್ ಅನ್ನು ರನ್ ಮಾಡುತ್ತೇವೆ.

PII-Tracer ಪ್ರತಿ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಅಕ್ಷರ F1 ಅನ್ನು ಹೊಂದಿದೆ: ai4privacy ನಲ್ಲಿ 0.907 ರ ವಿರುದ್ಧ 0.950, Nemotron-PII ನಲ್ಲಿ 0.709 ರ ವಿರುದ್ಧ 0.847, SPY ನಲ್ಲಿ 0.543 ರ ವಿರುದ್ಧ 0.585, Gretel PII ನಲ್ಲಿ 0.895 ರ ವಿರುದ್ಧ 0.952, ಮತ್ತು TAB ನಲ್ಲಿ 0.350 ರ ವಿರುದ್ಧ 0.594. TAB ಈ ಗುಂಪಿನಲ್ಲಿ ನೈಜ, ಮಾನವ-ಲೇಬಲ್ ಮಾಡಲಾದ ಪಠ್ಯದಿಂದ ನಿರ್ಮಿಸಲಾದ ಏಕೈಕ ಬೆಂಚ್ಮಾರ್ಕ್ ಆಗಿದೆ. ಅಲ್ಲಿ, PII-Tracer 0.982 ನಿಖರತೆಯ ವಿರುದ್ಧ 0.986 ಮತ್ತು 0.213 ರೀಕಾಲ್ ವಿರುದ್ಧ 0.425 ತಲುಪುತ್ತದೆ - ಮೂಲಭೂತವಾಗಿ ಅದೇ ನಿಖರತೆಯಲ್ಲಿ ಎರಡು ಪಟ್ಟು ರೀಕಾಲ್ (ವಿವರಗಳು ಕಾಗದದಲ್ಲಿವೆ). ಹೆಚ್ಚಿನ F1 ಆದ್ದರಿಂದ PII-TRACE ಸಂಭಾಷಣೆಗಳಿಂದ ಈ ಹೋಲಿಕೆಯಲ್ಲಿ ಎಲ್ಲಾ ಐದು ಸಾಂಪ್ರದಾಯಿಕ ಏಕ-ದಾಖಲೆ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಿಗೆ ಸಾಗಿಸುತ್ತದೆ.
ತೀರ್ಮಾನ
ಹೈಬ್ರಿಡ್ AI ಬಳಕೆದಾರರ ಸಾಧನವನ್ನು ಅನುಮಾನ ಸ್ಟ್ಯಾಕ್ಗೆ ಸಂಯೋಜಿಸುತ್ತದೆ, ಇದು ಬಲವಾದ ಗೌಪ್ಯತೆ ಮತ್ತು ಕಡಿಮೆ ವೆಚ್ಚವನ್ನು ನೀಡುತ್ತದೆ. ಕ್ಲೌಡ್ನಲ್ಲಿರುವ ಫ್ರಾಂಟಿಯರ್ ಮಾದರಿಗಳು ಸಂಶೋಧನೆ, ತಾರ್ಕಿಕತೆ ಮತ್ತು ಯೋಜನೆಯನ್ನು ನಿರ್ವಹಿಸగలವು, ಆದರೆ ಸ್ಥಳೀಯ ಮಾದರಿಗಳು ಸಾಧನದಲ್ಲಿಯೇ ಇರಬೇಕಾದ ಕಡತಗಳು ಮತ್ತು ವೈಯಕ್ತಿಕ ಡೇಟಾದೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತವೆ. ಈ ವಿಭಾಗವು ಯಾವುದೇ ಸಂವೇದನಾಶೀಲ ಡೇಟಾ ಕ್ಲೌಡ್ಗೆ ಹೋಗುವ ಮೊದಲು ಸಂವೇದನಾಶೀಲ ಮಾಹಿತಿಯನ್ನು ಗುರುತಿಸುವುದರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.
PII-Tracer ಬಹು-ಟರ್ನ್ ಸಂಭಾಷಣೆಗಳಲ್ಲಿ PII ಅನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಒಂದು ಕಾಂಪ್ಯಾಕ್ಟ್ ಮಾದರಿಯಾಗಿದೆ, ಆದರೆ PII-TRACE ಡಿಟೆಕ್ಟರ್ಗಳು ಸಂಭಾಷಣೆಯಾದ್ಯಂತ ಮರುಕಳಿಸುವ PII ಅನ್ನು ಸ್ಥಿರವಾಗಿ ಗುರುತಿಸಬಹುದೇ ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ.
ಒಟ್ಟಾಗಿ, PII-TRACE ಮತ್ತು PII-Tracer ಬಹು-ಟರ್ನ್ ಸಂಭಾಷಣೆಗಳು ಮತ್ತು ಇತರ ದೀರ್ಘ-ಸಂದರ್ಭ ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ PII ಪತ್ತೆಯನ್ನು ಮುನ್ನಡೆಸಲು ಬೆಂಚ್ಮಾರ್ಕ್ ಮತ್ತು ಉಲ್ಲೇಖ ಮಾದರಿಯನ್ನು ಒದಗಿಸುತ್ತಾರೆ.
ಏಜೆಂಟ್ಗಳು ದೀರ್ಘವಾದ ಕಾರ್ಯಗಳನ್ನು ഏറ്റെടുಕೊಳ್ಳುತ್ತಿದ್ದಾರೆ ಮತ್ತು ಹೆಚ್ಚಿನ ವೈಯಕ್ತಿಕ ಸಂದರ್ಭದೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದಾರೆ. ಪರಿಣಾಮವಾಗಿ, ಆರಂಭಿಕ ಇನ್ಪುಟ್ ಮಾತ್ರವಲ್ಲದೆ ಸಂಪೂರ್ಣ ಸಂಭಾಷಣೆಯಾದ್ಯಂತ ಗೌಪ್ಯತೆ ನಿಯಂತ್ರಣಗಳು ಹಿಡಿದಿಟ್ಟುಕೊಳ್ಳಬೇಕು. ಸಂವೇದನಾಶೀಲ ಸಂದರ್ಭವನ್ನು ಸಾಧನದಲ್ಲಿಯೇ ಇರಿಸಲು ಹೈಬ್ರಿಡ್ AI ವಿಶ್ವಾಸಾರ್ಹ ಸ್ಥಳೀಯ ಪತ್ತೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ.
PII-TRACE ಬೆಂಚ್ಮಾರ್ಕ್, PII-Tracer ಮಾದರಿ ಮತ್ತು ನಮ್ಮ ಮೌಲ್ಯಮಾಪನದ ವಿವರಗಳಿಗಾಗಿ arXiv ಪೇಪರ್ ಅನ್ನು ಓದಿ. ನಾವು ಶೀಘ್ರದಲ್ಲೇ PII-TRACE ಮತ್ತು PII-Tracer ಎರಡನ್ನೂ ಬಿಡುಗಡೆ ಮಾಡಲು ಯೋಜಿಸುತ್ತೇವೆ.