PII-TRACE: ডিভাইস ছেড়ে যাওয়ার আগে ব্যক্তিগত ডেটা সনাক্ত করা

দীর্ঘস্থায়ী কথোপকথন জুড়ে ধারাবাহিক PII সনাক্তকরণের জন্য একটি 13-ভাষার বেঞ্চমার্ক, স্থানীয়ভাবে চালানোর জন্য ডিজাইন করা একটি কমপ্যাক্ট 0.6B ডিটেক্টরের সাথে যুক্ত।

লেখকগণPerplexity Secure Intelligence Institute

ম্যাকে হাইব্রিড কম্পিউট ক্লাউডের ফ্রন্টিয়ার মডেল এবং ম্যাকের একটি স্থানীয় মডেলের মধ্যে Perplexity Computer কাজগুলিকে ভাগ করে। ক্লাউড এজেন্টরা গবেষণা, যুক্তি এবং পরিকল্পনা পরিচালনা করে, যখন স্থানীয় মডেল ব্যক্তিগত ফাইল এবং সংবেদনশীল তথ্য নিয়ে কাজ করে।

এই সীমানাটি ডিভাইস ছেড়ে যাওয়ার আগে ব্যক্তিগতভাবে সনাক্তযোগ্য তথ্য (PII) সনাক্ত করার উপর নির্ভর করে। একটি স্থানীয় গোপনীয়তা গেট সংবেদনশীল বিষয়বস্তু ম্যাকে রাখে, সনাক্ত করা ব্যক্তিগত তথ্য রিড্যাক্ট করে, অথবা ক্লাউডে পাঠানোর আগে অনুমোদনের অনুরোধ করে।

দীর্ঘ, বহুভাষিক কথোপকথন জুড়ে সনাক্তকরণ আরও কঠিন হয়ে ওঠে। একই শনাক্তকারী বিভিন্ন টার্ন জুড়ে বেশ কয়েকবার উপস্থিত হতে পারে। একটি বাদপড়া উল্লেখ সিস্টেম যে তথ্য সুরক্ষা করার উদ্দেশ্যে তৈরি তা প্রকাশ করতে পারে।

ভূমিকা

আজ, আমরা পরিচয় করিয়ে দিচ্ছি PII-TRACE (Tracing Recurring PII Across Conversational Exchanges), ব্যক্তিগতভাবে সনাক্তযোগ্য তথ্য (PII) ডিটেক্টর মূল্যায়নের জন্য একটি নতুন বেঞ্চমার্ক, এবং PII সনাক্তকরণের জন্য একটি কমপ্যাক্ট 0.6B মডেল PII-Tracer

ক্লাউড-প্রথম এজেন্টরা ব্যবহারকারীদের প্রসঙ্গ, বুদ্ধিমত্তা এবং গোপনীয়তার মধ্যে ভারসাম্য বজায় রাখতে বাধ্য করে। আরও ব্যক্তিগত প্রসঙ্গ একজন এজেন্টকে ব্যবহারকারীকে বুঝতে এবং আরও ভাল ফলাফল তৈরি করতে সাহায্য করতে পারে। তবে এই প্রসঙ্গ প্রদানের অর্থ প্রায়শই দূরবর্তী পরিষেবাতে ব্যক্তিগত তথ্য পাঠানো এবং ব্যক্তিগত তথ্য ফাঁস করতে পারে। যে তথ্য একজন সহকারীকে দরকারী করে তোলে তা ঠিক সেটাই হতে পারে যা একজন ব্যবহারকারী সবচেয়ে বেশি ব্যক্তিগত রাখতে চান।

হাইব্রিড এআই ব্যবহারকারীর ডিভাইস এবং ক্লাউড মডেলের মধ্যে কাজ ভাগ করে এই সমঝোতাকে সহজ করে। কিন্তু সেই সীমানা শুধুমাত্র তখনই গোপনীয়তা রক্ষা করে যদি ডিভাইসটি দূরবর্তী মডেলে পাঠ্য পাঠানোর আগে PII চিনতে পারে। ব্যবহারকারীদের নিজেদের প্রতিটি বার্তা পরিদর্শন করতে হবে না। ডিভাইসের গোপনীয়তা গেট হিসাবে একটি স্থানীয় PII ডিটেক্টর প্রয়োজন। দীর্ঘ কথোপকথনে, একই শনাক্তকারী টার্ন জুড়ে পুনরাবৃত্তি হতে পারে, এবং ব্যক্তিগত তথ্যের পাস করার জন্য একটি বাদপড়া উল্লেখই যথেষ্ট।

একটি প্রাইভেসি গেট ওয়ার্কফ্লো চিত্রিত করে চিত্র, যা দেখায় যে কীভাবে সংবেদনশীল ডেটা স্থানীয় ডিভাইসে থাকে যখন অনুমোদিত অনুরোধগুলি প্রক্রিয়াকরণের জন্য ক্লাউড মডেলে পাঠানো হয়।
হাইব্রিড এআই-তে প্রাইভেসি গেট হিসাবে PII-Tracer

Perplexity একটি হাইব্রিড লোকাল-সার্ভার ইনফারেন্স অর্কেস্ট্রেটর প্রবর্তন করেছে যা সিদ্ধান্ত নেয় কোন কাজ ডিভাইসে চালানো উচিত এবং কোন কাজ ক্লাউডে এজেন্টদের কাছে যাওয়া উচিত। মডেল, এজেন্ট হারনেস, কথোপকথন এবং এক্সিকিউশন ট্র্যাজেক্টরি সবই ব্যবহারকারীর মেশিনে থাকে। বাইরের জগতের অ্যাক্সেসের প্রয়োজন এমন কাজগুলি শুধুমাত্র তখনই আহ্বান করা হয় যখন প্রয়োজন হয় এবং ব্যবহারকারীর অনুমতি দ্বারা গেট করা হয়। ফলস্বরূপ, ব্যবহারকারী অনুমোদন না করা পর্যন্ত, সেই সামগ্রীটি ডিভাইসে থাকে।

PII ধারণ করতে পূর্বাভাসিত স্প্যানগুলিকে ফ্ল্যাগ করে মডেল রাউটিংয়ের জন্য PII-Tracer একটি স্থানীয় নিয়ন্ত্রণ সংকেত প্রদান করে। অ্যাপ্লিকেশনটি তখন রাউটিং নীতি প্রয়োগ করে। এটি প্রাসঙ্গিক ইনপুট স্থানীয় রাখে, সনাক্ত করা স্প্যানগুলি রিড্যাক্ট করে, অথবা ক্লাউড মডেলে যাওয়ার আগে স্পষ্ট অনুমোদনের অনুরোধ করে। এটি রাউটিংকে আরও নির্বাচনী করে তোলে। সনাক্ত করা PII ডিভাইসে থাকে যখন অনুমোদিত প্রসঙ্গ এখনও ফ্রন্টিয়ার ক্লাউড মডেলগুলি থেকে উপকৃত হয়।

নির্বাচনী রাউটিং সম্পূর্ণ কথোপকথন জুড়ে ধারাবাহিক সনাক্তকরণের উপর নির্ভর করে। একই শনাক্তকারী টার্ন জুড়ে পুনরাবৃত্তি হতে পারে, এবং একটি বাদপড়া উল্লেখ এখনও প্রেরিত হতে পারে।

12টি ডিটেক্টরের মধ্যে, PII-Tracer সর্বোচ্চ চরিত্র F1 এবং পুনরাবৃত্ত শনাক্তকারীগুলির সর্বোচ্চ ধারাবাহিক কভারেজ রেকর্ড করে। বেঞ্চমার্কটি ব্যাখ্যা করে কেন উভয় ফলাফলই গুরুত্বপূর্ণ: একটি দীর্ঘ কথোপকথনে, বেশিরভাগ PII খোঁজা মানে এর প্রতিটি কপি খোঁজা নয়।

হাইব্রিড এআই-তে PII সনাক্তকরণের নতুন চ্যালেঞ্জের মুখোমুখি

PII সনাক্তকরণ একটি দীর্ঘস্থায়ী নিরাপত্তা সমস্যা, এবং বেশ কয়েকটি বেঞ্চমার্ক এবং ডিটেক্টর ইতিমধ্যেই বিদ্যমান। যাইহোক, হাইব্রিড এআই সেটিংসে PII সনাক্তকরণ নতুন চ্যালেঞ্জ নিয়ে আসে। বিশেষ করে, ডিটেক্টরগুলিকে অবশ্যই দীর্ঘ, বহু-টার্ন কথোপকথনে PII সনাক্ত করতে হবে, যেখানে কথোপকথনের প্রসঙ্গ নির্ধারণ করে যে কোনো স্ট্রিংকে PII হিসাবে বিবেচনা করা উচিত কিনা। উদাহরণস্বরূপ, একটি নাম একটি কথোপকথনে ব্যবহারকারীকে সনাক্ত করতে পারে, অন্যটিতে একজন বিশিষ্ট ব্যক্তিকে উল্লেখ করতে পারে, বা কেবল একজন সহকারী দ্বারা উত্পাদিত একটি প্লেসহোল্ডার হতে পারে। শুধুমাত্র পৃষ্ঠের ফর্মটি নির্ধারণ করার জন্য অপর্যাপ্ত যে একটি স্ট্রিংকে PII হিসাবে পতাকাঙ্কিত করা উচিত কিনা।

একটি চ্যাট ইন্টারফেস একজন সহকারীকে দেখায় যে ব্যবহারকারীর নাম, ফোন নম্বর, অ্যাপয়েন্টমেন্টের বিবরণ এবং ইমেল ঠিকানা বহু টার্ন ধরে ধরে রেখেছে।
কথোপকথন জুড়ে একটি নাম, ফোন নম্বর এবং ইমেল ঠিকানা বারবার আসে। PII-TRACE তখনই একটি শনাক্তকারীকে ধারাবাহিকভাবে শনাক্ত হিসেবে গণনা করে যদি প্রতিটি উল্লেখ পাওয়া যায়।

বিদ্যমান PII ডিটেক্টর এবং বেঞ্চমার্কগুলি প্রাথমিকভাবে পৃথক রেকর্ডগুলিকে লক্ষ্য করে। আমরা দেখতে পাই যে একবারের বেশি রেকর্ড প্রক্রিয়া করার জন্য ডিজাইন করা ডিটেক্টরগুলি দীর্ঘ, জটিল কথোপকথনে খারাপ পারফর্ম করে। এছাড়াও, বিদ্যমান বেঞ্চমার্কগুলি সাধারণত টার্ন জুড়ে ধারাবাহিকতা মূল্যায়ন করে না। ফলস্বরূপ, এই বেঞ্চমার্কগুলিতে শক্তিশালী পারফরম্যান্স অগত্যা দীর্ঘ, বহু-টার্ন কথোপকথনে কার্যকর PII সনাক্তকরণে রূপান্তরিত হয় না।

PII-TRACE: ডিপ্লয়মেন্ট-সমালোচনামূলক PII সনাক্তকরণের জন্য একটি বেঞ্চমার্ক

সহকারী কথোপকথনে যখন একটি PII ডিটেক্টর ব্যবহার করা হয় তখন আমরা তিনটি আচরণের চারপাশে PII-TRACE ডিজাইন করেছি। প্রথমটি হল ধারাবাহিক কভারেজ: যখন কোনো শনাক্তকারী কয়েকবার উপস্থিত হয় বা ব্যবহারকারী এবং সহকারী টার্ন অতিক্রম করে, তখন ডিটেক্টরের প্রতিটি উল্লেখ খুঁজে বের করতে হবে। দ্বিতীয়টি হল দীর্ঘ প্রসঙ্গের প্রতি দৃঢ়তা: কথোপকথনগুলি 1,000-এর কম থেকে 100,000-এর বেশি অক্ষর পর্যন্ত বিস্তৃত, ইতিহাস বাড়ার সাথে সাথে কী ঘটে তা পরিমাপ করা সম্ভব করে তোলে। তৃতীয়টি হল একাধিক ভাষা এবং মিশ্র-বিন্যাস বিষয়বস্তু পরিচালনা করা: একটি কথোপকথন ভাষা পরিবর্তন করতে পারে এবং কোড, টেবিল বা কাঠামোগত রেকর্ডের সাথে গদ্য একত্রিত করতে পারে। PII-TRACE বিচ্ছিন্ন রেকর্ডে বিভক্ত না করে প্রতিটি সম্পূর্ণ সংলাপ মূল্যায়ন করে এই প্যাটার্নগুলি সংরক্ষণ করে।

বেঞ্চমার্ক দুটি পরিপূরক স্তরে কর্মক্ষমতা পরিমাপ করে। শনাক্তকারী স্তরে, ধারাবাহিক সনাক্তকরণ কঠোর প্রশ্নটি জিজ্ঞাসা করে: ডিটেক্টর কি একই শনাক্তকারীর প্রতিটি উল্লেখের প্রতিটি অক্ষর কভার করেছে? আমরা একাধিক উল্লেখ সহ শনাক্তকারী এবং টার্ন জুড়ে পুনরাবৃত্তি হওয়া শনাক্তকারীগুলির জন্য আলাদাভাবে এই স্কোর রিপোর্ট করি। চরিত্র স্তরে, নির্ভুলতা পরিমাপ করে যে ডিটেক্টর দ্বারা চিহ্নিত পাঠ্যের কত অংশ PII লেবেলযুক্ত, স্মরণ পরিমাপ করে যে এটি কত লেবেলযুক্ত PII খুঁজে পায় এবং F1 দুটির মধ্যে ভারসাম্য বজায় রাখে।

PII-TRACE-এ 13টি ভাষা এবং 10টি লেখার সিস্টেমে 13,148টি সিন্থেটিক ব্যবহারকারী-সহকারী কথোপকথন রয়েছে, যেখানে নয়টি PII প্রকারে চরিত্র স্তরে 37,431টি শনাক্তকারী উল্লেখ লেবেল করা হয়েছে। কথোপকথনের মোট 41% কাঠামোগত বিষয়বস্তু রয়েছে। লেবেলযুক্ত PII সহ 5,645টি কথোপকথনের মধ্যে, 63.8% এমন একটি শনাক্তকারী অন্তর্ভুক্ত করে যা একাধিকবার উপস্থিত হয় এবং 28.7% এমন একটি শনাক্তকারী অন্তর্ভুক্ত করে যা একাধিক টার্ন জুড়ে উপস্থিত হয়।

উৎপাদন কথোপকথন থেকে একটি সিন্থেটিক ডেটাসেট তৈরি করা

PII-TRACE মূল প্রকাশ না করেই উৎস কথোপকথনের টার্ন স্ট্রাকচার সংরক্ষণ করে। পাইপলাইন প্রতিটি টার্ন পুনরায় লেখে এবং প্রতিটি লেবেলযুক্ত শনাক্তকারীকে একটি সিন্থেটিক মান দিয়ে প্রতিস্থাপন করে।

টেমপ্লেটিং, প্যারাফ্রেজিং, সামঞ্জস্যপূর্ণ সিন্থেটিক মানগুলির সাথে প্রতিস্থাপন এবং বৈধতা পরীক্ষার মাধ্যমে PII-TRACE কীভাবে লেবেলযুক্ত উৎপাদন কথোপকথনকে সিন্থেটিক ডেটাসেটে রূপান্তর করে তা চিত্রিত করার চিত্র।
IPII-TRACE লেবেলযুক্ত সোর্স টেক্সটকে একটি টেমপ্লেটে পরিণত করে, প্রতিটি টার্ন পুনর্লিখন করে, সামঞ্জস্যপূর্ণ সিন্থেটিক মান সন্নিবেশ করে এবং ফলাফলের উপর রিলিজ চেক চালায়।

প্রথমে, একাধিক ভাষা মডেল উৎপাদন ব্যবহারকারী-সহকারী কথোপকথনে নয়টি ধরণের PII চিহ্নিত করে। একটি নিয়ম-ভিত্তিক পাস একই ধরণের পুনরাবৃত্ত শনাক্তকারীকে একটি সত্তা আইডির অধীনে দলবদ্ধ করে। প্রতিটি চিহ্নিত মান তখন একটি টাইপ করা প্লেসহোল্ডার দ্বারা প্রতিস্থাপিত হয়, একটি টেমপ্লেট রেখে যা টার্নের ক্রম, PII প্রকার এবং উল্লেখগুলির মধ্যে লিঙ্কগুলি ধরে রাখে কিন্তু চিহ্নিত মূল মানগুলির কোনটিই রাখে না।

সিস্টেম প্লেসহোল্ডারগুলিকে অক্ষুণ্ণ রেখে প্রতিটি টার্ন প্যারাফ্রেজ করে, তারপর সিন্থেটিক মান সন্নিবেশ করায় যা শনাক্তকারীর প্রকার এবং বিন্যাসের সাথে মেলে। বারবার উল্লেখগুলি একটি কথোপকথনের মধ্যে একই মান পায়, অন্যদিকে বিভিন্ন কথোপকথন স্বাধীনভাবে তৈরি মান ব্যবহার করে। চূড়ান্ত সারিবদ্ধকরণ পাস প্রতিটি অক্ষর অফসেট পুনर्गণনা করে।

তিনটি স্বয়ংক্রিয় গেট পরীক্ষা করে যে প্রতিস্থাপনগুলি সংরক্ষিত স্প্যানের সাথে মেলে, পুনরাবৃত্ত উল্লেখগুলি একই মান ব্যবহার করে, এবং চিহ্নিত উৎসের মানগুলি Presidio এবং রেগুলার-এক্সপ্রেশন পুনরায় স্ক্যানের অধীনে অনুপস্থিত। একটি সংরক্ষিত অফসেটকেও অবশ্যই সঠিক সিন্থেটিক সাবস্ট্রিং পুনরুদ্ধার করতে হবে। যে রেকর্ডগুলি ব্যর্থ হয় সেগুলি পুনরুত্পাদন বা ড্রপ করা হয়। দ্বিতীয় ভাষা মডেল একটি নমুনা নিরীক্ষণ করে, এবং এটি PII হিসাবে পতাকাঙ্কিত যেকোনো কিছু মানব পর্যালোচনা করে।

PII-Tracer: স্থানীয় ব্যবহারের জন্য একটি কমপ্যাক্ট ডিটেক্টর

PII-Tracer হল একটি 0.6B দ্বিমুখী এনকোডার যা একটি Qwen3 ব্যাকবোন থেকে অভিযোজিত। গোপনীয়তা স্ক্রীনিং পাঠ্য সৃষ্টি থেকে আলাদা এবং এর জন্য প্রাসঙ্গিক PII স্প্যান খোঁজার এবং তাদের সীমানা ফেরানোর প্রয়োজন হয়। ফলস্বরূপ, PII-Tracer Qwen3-এর কার্যকারণ মুখোশকে প্যাডিং-সচেতন দ্বিমুখী মনোযোগ দিয়ে প্রতিস্থাপন করে, যাতে প্রতিটি টোকেন 4,096-টোকেন উইন্ডোর মধ্যে আগের এবং পরের উভয় টার্ন থেকে আঁকতে পারে।

প্রতিটি টোকেনের জন্য, এনকোডার একটি 1,024-মাত্রিক উপস্থাপনা তৈরি করে। একটি রৈখিক ট্যাঙ্গিং হেড 37টি সম্ভাব্য লেবেলের জন্য স্কোর তৈরি করে: একটি বিশেষ লেবেল (যা আমরা PII স্প্যানের বাইরের পাঠ্যের জন্য O বোঝাতে ব্যবহার করি), এবং নয়টি PII প্রকারের প্রতিটির জন্য চারটি স্প্যান-পজিশন লেবেল। নেমডgetEntity রিকগনিশনের জন্য BIOES স্কিমে, B (Beginning), I (Inside), এবং E (End) একটি বহু-টোকেন স্প্যান চিহ্নিত করে, যখন S (Single) একটি এক-টোকেন স্প্যান চিহ্নিত করে। একটি সহায়ক হেড আরও ভবিষ্যদ্বাণী করে যে কথোপকথনে সংবেদনশীল উপাদান রয়েছে কিনা, যেমন স্বাস্থ্য বা ধর্মীয় তথ্য।

আমরা বহুভাষিক সহকারী কথোপকথনকে একক-রেকর্ড উদাহরণের সাথে একত্রিত করে প্রায় 714,000 প্রশিক্ষণের নমুনায় তিন যুগের জন্য PII-Tracer প্রশিক্ষণ দিই। শেয়ার করা দ্বিমুখী এনকোডারে দুটি ট্রেনিং হেড রয়েছে: একটি 37-শ্রেণীর BIOES টোকেন হেড যা PII স্প্যান সনাক্ত করে এবং টাইপ করে, এবং একটি বাইনারি কথোপকথন-স্তরের হেড যা ভবিষ্যদ্বাণী করে যে কথোপকথনে সংবেদনশীল উপাদান রয়েছে কিনা। আমরা L=1.5Ltag+0.3Lsens\mathcal{L}=1.5\mathcal{L}_{\mathrm{tag}}+0.3\mathcal{L}_{\mathrm{sens}} ব্যবহার করে যৌথভাবে উভয় হেড প্রশিক্ষণ দিই। এখানে, Ltag\mathcal{L}_{\mathrm{tag}} বিরল PII লেবেলগুলিকে আরও ওজন দেয় যাতে ঘন ঘন `O` লেবেলটি আধিপত্য বিস্তার না করে, যখন Lsens\mathcal{L}_{\mathrm{sens}} কথোপকথন-স্তরের প্রশিক্ষণের সংকেত সরবরাহ করে; 1.5 এবং 0.3 সহগগুলি স্প্যান সনাক্তকরণকে প্রধান কাজ হিসাবে রাখে। এই সহায়ক সংকেতটি প্রসঙ্গ-সচেতন সনাক্তকরণকে শক্তিশালী করে: মডেলটি একটি বিচ্ছিন্ন স্ট্রিং হিসাবে নয় বরং কথোপকথনের মধ্যে একটি প্রার্থী স্প্যান বিচার করতে শেখে, যা স্মরণে শুধুমাত্র একটি ছোট ট্রেডঅফ সহ মিথ্যা ইতিবাচক কমাতে সাহায্য করে।

অনুমানের সময়, একটি সীমাবদ্ধ Viterbi decoder প্রতিটি টোকেনকে স্বাধীনভাবে লেবেল করার পরিবর্তে সর্বোচ্চ স্কোরিং বৈধ BIOES ক্রম অনুসন্ধান করে। উদাহরণস্বরূপ, B-private_person I-private_person দিয়ে চালিয়ে যেতে পারে বা E-private_person দিয়ে বন্ধ করতে পারে, কিন্তু I-private_email-এ স্যুইচ করতে পারে না। ডিকোডার ফলাফলটিকে রিডাকশন বা স্থানীয় রাউটিংয়ের জন্য সঠিক চরিত্র স্প্যানে ম্যাপ করে।

ক্যারেক্টার F1 এবং পুনরাবৃত্ত PII-তে PII-Tracer এগিয়ে রয়েছে

আমরা চরিত্র এবং স্প্যান উভয় স্তরে ডিটেক্টরগুলির তুলনা করি। ক্যারেক্টার F1 চরিত্র ধরে ধরে সনাক্তকরণ মূল্যায়ন করে। স্প্যান-ওভারল্যাপ F1 পরিমাপ করে যে ডিটেক্টর কোনো PII আইটেমের কোনো অংশ সনাক্ত করে কিনা, অন্যদিকে স্প্যান-কনটেইনমেন্ট F1 পরিমাপ করে যে এটি পুরো আইটেমটি ক্যাপচার করে কিনা।

মূল্যায়িত 12টি সিস্টেমের মধ্যে PII-Tracer সর্বোচ্চ চরিত্র F1 (0.629) অর্জন করেছে এবং দ্বিতীয় সর্বোচ্চ স্প্যান-ওভারল্যাপ F1 এবং স্প্যান-কনটেইনমেন্ট F1 অর্জন করেছে। ফ্রন্টিয়ার মডেল, যথা GPT-5.6-sol এবং Claude Sonnet 5, তুলনামূলক সামগ্রিক কর্মক্ষমতা অর্জন করেছে। GPT-5.6-sol উভয় স্প্যান-স্তরের F1 মেট্রিক্সে উচ্চতর স্কোর অর্জন করেছে, কিন্তু একটি নিম্ন চরিত্র F1। যাইহোক, এই ফ্রন্টিয়ার মডেলগুলির শত শত বিলিয়ন বা এমনকি ট্রিলিয়ন প্যারামিটার রয়েছে এবং এগুলি ক্লাউডে হোস্ট করা ক্লোজড-সোর্স মডেল। ফলস্বরূপ, হাইব্রিড এআই সেটিংসে সংবেদনশীল স্থানীয় ডেটা সুরক্ষিত করার জন্য এগুলি অনুপযুক্ত যেখানে স্ক্রীন না করা পাঠ্য স্থানীয় রাখতে হবে। বিপরীতে, PII-Tracer মাত্র 0.6B প্যারামিটারের সাথে প্রায়-ফ্রন্টিয়ার স্প্যান-স্তরের সনাক্তকরণ প্রদান করে এবং সম্পূর্ণ স্থানীয়ভাবে স্ক্রীন না করা পাঠ্য প্রক্রিয়া করতে পারে। অন্যান্য ওপেন-সোর্স PII ডিটেক্টরগুলি PII-Tracer-এর চেয়ে যথেষ্ট খারাপ পারফর্ম করে।

12টি PII-সনাক্তকরণ সিস্টেমের তুলনা করে তিনটি বার চার্ট। PII-Tracer 0.6B চরিত্র F1-এ প্রথম এবং স্প্যান-ওভারল্যাপ এবং স্প্যান-কনটেইনমেন্ট F1-এ দ্বিতীয় স্থানে রয়েছে, GPT-5.6-sol-এর পরে।
সমস্ত বারোটি সিস্টেমে ক্যারেক্টার F1, স্প্যান-ওভারল্যাপ F1 এবং স্প্যান-কনটেইনমেন্ট F1।

প্রতিটি পুনরাবৃত্ত উল্লেখ খোঁজা

ধারাবাহিকতা পরীক্ষা একই ভবিষ্যদ্বাণীগুলিতে একটি কঠোর পরীক্ষা প্রয়োগ করে। টেস্ট সেটে 899টি শনাক্তকারী রয়েছে যা একবার প্রদর্শিত হয় এবং 959টি যা একাধিকবার প্রদর্শিত হয়; পুনরাবৃত্তি হওয়া শনাক্তকারীগুলির মধ্যে 790টি একাধিক টার্ন জুড়ে রয়েছে। চিত্রটি চারটি মেনশন-কাউন্ট বালতি (এক, দুই, তিন থেকে পাঁচ, এবং ছয় থেকে দশ) রিপোর্ট করে এবং একটি শনাক্তকারীকে তখনই গণনা করে যখন এর সমস্ত লেবেলযুক্ত অক্ষর পাওয়া যায়। এটি তিনটি নির্বাচিত বেসলাইনের সাথে PII-Tracer প্লট করে, যখন সমষ্টিগত সারণী সমস্ত বারোটি সিস্টেমের জন্য পুনরাবৃত্ত এবং ক্রস-টার্ন স্কোর রিপোর্ট করে।

লাইন চার্ট দেখায় যে PII-Tracer সমস্ত মেনশন-কাউন্ট গ্রুপ জুড়ে GPT-5.6-sol, GLiNER2-PII, এবং Claude Opus 4.8-এর চেয়ে বেশি ধারাবাহিকভাবে পুনরাবৃত্ত শনাক্তকারীগুলির প্রতিটি উল্লেখ খুঁজে পায়, যা একটি উল্লেখের জন্য 91.7% থেকে কমে 6-10টি উল্লেখের জন্য 69.1% হয়েছে।
যে শনাক্তকারীগুলির প্রতিটি উল্লেখ পাওয়া গেছে তাদের অংশ। PII-Tracer সমস্ত চারটি তুলনার বালটিতে নেতৃত্ব দেয়।

রিপিটিশন বাড়ার সাথে সাথে PII-Tracer এগিয়ে থাকে: এর স্কোর একটি উল্লেখে 0.917 থেকে কমে দুটিতে 0.873, তিন থেকে পাঁচে 0.796 এবং ছয় থেকে দশে 0.691 হয়। শেষ বালতিতে, GPT-5.6-sol পৌঁছেছে 0.464-এ, যেখানে GLiNER2-PII এবং Claude Opus 4.8 পৌঁছেছে 0.073 এবং 0.045-এ। সম্পূর্ণ মূল্যায়ন জুড়ে, PII-Tracer বারবার আসা শনাক্তকারীগুলির 79.4% এবং ক্রস-টার্ন শনাক্তকারীগুলির 77.6% প্রতিটির প্রতিটি উল্লেখ খুঁজে পায়; GPT-5.6-sol একই দুটি পরিমাপে 57.0% এবং 55.1% এ পৌঁছেছে।

দীর্ঘ কথোপকথন কভার করা

আমরা প্রথমে চরিত্র দৈর্ঘ্য দ্বারা সমস্ত 1,922টি পরীক্ষা কথোপকথনকে গ্রুপ করি এবং 4,096-টোকেন উইন্ডো দিয়ে PII-Tracer ডিকোড করি। গ্রুপগুলিতে 1,000 অক্ষরের নিচে 167টি কথোপকথন, 1,000 থেকে 10,000 পর্যন্ত 1,292টি এবং 10,000 বা তার বেশি দীর্ঘ 463টি কথোপকথন রয়েছে।

কথোপকথনের দৈর্ঘ্য দ্বারা PII-Tracer পারফরম্যান্সের গ্রুফড বার চার্ট। 1,000–10,000-অক্ষরের কথোপকথনের জন্য F1 67.0% এ পৌঁছেছে, যেখানে 1,000 অক্ষরের কম কথোপকথনের জন্য রিকল 97.5% থেকে কমে 10,000 এর বেশির জন্য 68.7% হয়েছে।
কথোপকথনের দৈর্ঘ্য দ্বারা অক্ষরের নির্ভুলতা, স্মরণ এবং F1

একক-উইন্ডো রিকল 1,000 অক্ষরের নিচে 0.975 এবং 1,000 থেকে 10,000 পর্যন্ত 0.955, কিন্তু 10,000 বা তার বেশি অক্ষরের কথোপকথনের জন্য 0.687-এ নেমে আসে। দুটি দীর্ঘ গ্রুপে নির্ভুলতা প্রায় 0.51 এ থাকে, যা প্রধান সমস্যা হিসাবে ইনপুট কভারেজ নির্দেশ করে।

ইনপুট হ্যান্ডলিং এর প্রভাব অধ্যয়ন করতে, আমরা 50%-ওভারল্যাপ স্লাইডিং-উইন্ডো ডিকোডিং সহ একই চেকপয়েন্ট মূল্যায়ন করি। এটি পুনরশিক্ষণ ছাড়াই সামগ্রিক চরিত্র স্মরণকে 0.830 থেকে 0.965 এবং বহু-উল্লেখ ধারাবাহিক সনাক্তকরণকে 0.794 থেকে 0.954 এ উন্নীত করে।

ভাষা জুড়ে ধারাবাহিক

PII-TRACE 13টি ভাষা কভার করে; ভাষা পরীক্ষাটি ল্যাটিন, সিরিলিক এবং হাঙ্গুল লিপি বিস্তৃত একটি ছয়-ভাষা স্লাইস রিপোর্ট করে: ইংরেজি, জার্মান, ফরাসি, ইতালীয়, রাশিয়ান এবং কোরিয়ান। আমরা প্রতিটি ভাষার সমস্ত পরীক্ষা কথোপকথনে একই 12টি ডিটেক্টর চালাই। প্রতিটি ভাষার মধ্যে, আমরা পূর্বাভাসিত এবং সোনার অক্ষরগুলিকে পুঞ্জীভূত করি এবং চরিত্র F1 গণনা করি।

ইংরেজি, জার্মান, ফরাসি, ইতালীয়, রাশিয়ান এবং কোরিয়ান জুড়ে 12টি PII-সনাক্তকরণ সিস্টেমের জন্য চরিত্র F1 স্কোরের তুলনা করে হিটম্যাপ। PII-Tracer জার্মান, ফরাসি, ইতালীয় এবং রাশিয়ানে নেতৃত্ব দেয়, সমস্ত ছয়টি ভাষা জুড়ে ধারাবাহিকভাবে শক্তিশালী ফলাফল সহ।
ল্যাটিন, সিরিলিক এবং হাঙ্গুল লিপি কভার করে PII ধারণকারী ছয়টি ভাষা উপসেটে চরিত্র F1।

PII-Tracer ছয়টি ভাষার মধ্যে চারটিতে চরিত্র F1-এ নেতৃত্ব দেয়: জার্মান (0.735), ফরাসি (0.633), ইতালীয় (0.676), এবং রাশিয়ান (0.651), এবং ইংরেজি এবং কোরিয়ান ভাষায় সেরা ফলাফলের 0.016 এবং 0.036 এর মধ্যে রয়েছে। সহচর বিশ্লেষণে, এটি সমস্ত ছয়টি ভাষা উপসেটে ধারাবাহিক সনাক্তকরণের দিকে নিয়ে যায়, যা 0.80–0.93 স্কোর করে। প্রতি-ভাষা দৃশ্য ইংরেজি ছাড়িয়ে লাভ দেখায়।

পাঁচটি স্ট্যান্ডার্ড বেঞ্চমার্কে প্রাইভেসি ফিল্টারের চেয়ে উচ্চতর চরিত্র F1

চূড়ান্ত পরীক্ষাটি PII-TRACE-এর বাইরে চলে যায়। আমরা ai4privacy বৈধতা স্প্লিট (47,728 নথি), Nemotron-PII টেস্ট স্প্লিট (100,000), একটি নির্দিষ্ট বীজ SPY সেট (8,688), Gretel PII টেস্ট স্প্লিট (5,000), এবং TAB ECHR টেস্ট স্প্লিট (127)-এ PII-Tracer এবং OpenAI Privacy Filter চালাই।

পাঁচটি বাহ্যিক বেঞ্চমার্ক জুড়ে OpenAI Privacy Filter F1-এর সাথে PII-Tracer-এর নির্ভুলতা, স্মরণ এবং চরিত্র F1-এর তুলনা করে গ্রুপ করা বার চার্ট। PII-Tracer প্রতিটি বেঞ্চমার্কে উচ্চতর F1 স্কোর অর্জন করে।
পাঁচটি বাহ্যিক PII বেঞ্চমার্কে ক্যারেক্টার-স্তরের ফলাফল, ক্যাটাগরির নামের মিল না রেখেই স্কোর করা হয়েছে। ধূসর বারগুলি একই মূল্যায়নের অধীনে OpenAI Privacy Filter দেখায়।

প্রতিটি ডেটাসেটে PII-Tracer-এর উচ্চতর চরিত্র F1 রয়েছে: ai4privacy-এ 0.950 বনাম 0.907, Nemotron-PII-তে 0.847 বনাম 0.709, SPY-তে 0.585 বনাম 0.543, Gretel PII-তে 0.952 বনাম 0.895, এবং TAB-এ 0.594 বনাম 0.350। TAB হল এই গ্রুপের একমাত্র বেঞ্চমার্ক যা বাস্তব, মানব-লেবেলযুক্ত পাঠ্য থেকে তৈরি। সেখানে, PII-Tracer 0.986 বনাম 0.982 নির্ভুলতা এবং 0.425 বনাম 0.213 রিকলে পৌঁছেছে—মূলত একই নির্ভুলতায় দ্বিগুণ রিকল (বিবরণ কাগজে)। উচ্চতর F1 তাই PII-TRACE কথোপকথন থেকে এই তুলনার সমস্ত পাঁচটি প্রচলিত একক-রেকর্ড বেঞ্চমার্কে বহন করে।

উপসংহার

হাইব্রিড এআই ইনফারেন্স স্ট্যাকে ব্যবহারকারীর ডিভাইসকে একীভূত করে, শক্তিশালী গোপনীয়তা এবং কম খরচ অফার করে। ক্লাউডের ফ্রন্টিয়ার মডেলগুলি গবেষণা, যুক্তি এবং পরিকল্পনা পরিচালনা করতে পারে, যখন স্থানীয় মডেলগুলি ফাইল এবং ব্যক্তিগত ডেটা নিয়ে কাজ করে যা ডিভাইসে থাকা উচিত। এই বিভাজনটি ক্লাউডে কোনো সংবেদনশীল ডেটা যাওয়ার আগে সংবেদনশীল তথ্য চেনার উপর নির্ভর করে।

PII-Tracer হল বহু-টার্ন কথোপকথনে PII সনাক্ত করার জন্য একটি কমপ্যাক্ট মডেল, যেখানে PII-TRACE মূল্যায়ন করে যে ডিটেক্টরগুলি পুরো কথোপকথন জুড়ে ধারাবাহিকভাবে পুনরাবৃত্তি হওয়া PII সনাক্ত করতে পারে কিনা।

একত্রে, PII-TRACE এবং PII-Tracer বহু-টার্ন কথোপকথন এবং অন্যান্য দীর্ঘ-প্রসঙ্গের সেটিংসে PII সনাক্তকরণ অগ্রসর করার জন্য একটি বেঞ্চমার্ক এবং রেফারেন্স মডেল প্রদান করে।

এজেন্টরা দীর্ঘ কাজ গ্রহণ করছে এবং আরও ব্যক্তিগত প্রসঙ্গ নিয়ে কাজ করছে। ফলস্বরূপ, গোপনীয়তা নিয়ন্ত্রণগুলি শুধুমাত্র প্রাথমিক ইনপুট নয়, পুরো কথোপকথন জুড়ে রাখা উচিত। সংবেদনশীল প্রসঙ্গ ডিভাইসে রাখতে হাইব্রিড এআই নির্ভরযোগ্য স্থানীয় সনাক্তকরণের উপর নির্ভর করে।

PII-TRACE বেঞ্চমার্ক, PII-Tracer মডেল এবং আমাদের মূল্যায়ন সম্পর্কে বিশদ বিবরণের জন্য arXiv পেপারটি পড়ুন। আমরা শীঘ্রই PII-TRACE এবং PII-Tracer উভয়ই রিলিজ করার পরিকল্পনা করছি।

  1. ম্যাকে হাইব্রিড কম্পিউটের সাথে পরিচিত হোনসংবাদ১ সেপ, ২০২৬
  2. ডেটা সেন্টার আপনার মেশিনে স্থানান্তরিত হচ্ছেসংবাদ২ জুন, ২০২৬