ব্যক্তিগত এবং সাশ্রয়ী জ্ঞান-কাজের জন্য একটি লোকাল-ফার্স্ট এজেন্ট

একটি হার্নেস এবং মডেল যা স্থানীয় জ্ঞান-কাজের জন্য কো-ডিজাইন করা হয়েছে, ডিভাইসে চলছে এবং চাহিদামতো রিমোট ক্ষমতা অ্যাক্সেস করছে।

লেখকগণPerplexity Research

Perplexity Portable Computer হলো একটি লোকাল-ফার্স্ট এজেন্ট।

পুরো স্ট্যাকটি ডিফল্টভাবে স্থানীয়ভাবে চলে। মডেল, হার্নেস, কথোপকথন এবং ট্র্যাজেক্টরি সবই ব্যবহারকারীর মেশিনে থাকে। যে কাজের জন্য বাইরের জগতের প্রয়োজন হয়, যেমন ওয়েব সার্চ, কানেক্টর, বা ক্লাউডে আরও শক্তিশালী অ্যাডভাইজার মডেলে এসকালিউশন, তা শুধুমাত্র যখন প্রয়োজন তখনই আহ্বান করা হয় এবং সর্বদা ব্যবহারকারী দ্বারা নিয়ন্ত্রিত হয়। তাই সংবেদনশীল ডেটা অনুমতি ছাড়া কখনই ডিভাইস ছেড়ে যায় না, এবং স্থানীয় মডেলগুলির কোনো ইনফারেন্স ফি লাগে না: সিস্টেমটি ডিজাইনগতভাবেই ব্যক্তিগত এবং সাশ্রয়ী।

একটি কার্যকর লোকাল-ফার্স্ট এজেন্টের জন্য মডেল এবং হার্নেসকে একত্রে ডিজাইন করা প্রয়োজন। সাধারণ-উদ্দেশ্যের হার্নেসগুলি এমন একটি ফ্রন্টিয়ার মডেল ধরে নেয় যা দীর্ঘ কনটেক্সট শোষণ করতে পারে, একটি বিস্তৃত টুল পৃষ্ঠ নেভিগেট করতে পারে এবং দীর্ঘ দিগন্ত জুড়ে পরিকল্পনা করতে পারে। স্থানীয় মডেলগুলি সেই চাহিদার অধীনে কম নির্ভরযোগ্য হয়। ছোট মডেলকে বড় মডেলের জন্য তৈরি হার্নেস পরিচালনা করতে বলার পরিবর্তে, আমরা দু'টিকে একে অপরের চারপাশে রূপ দিয়েছি: মডেলের সক্ষমতা প্রোফাইলের সাথে মানানসই একটি হার্নেস, এবং সেই হার্নেস কার্যকরভাবে ব্যবহার করার জন্য পোস্ট-ট্রেন করা একটি মডেল।

ভূমিকা

সাম্প্রতিক মাসগুলিতে জ্ঞান-কাজের কাজের বিস্তৃত পরিসরে এজেন্টিক ক্ষমতা দ্রুত উন্নত হয়েছে। যদিও এই অগ্রগতিগুলি উৎপাদনশীলতা এবং দক্ষতার ক্ষেত্রে বড় ধরনের লাভ বয়ে আনে, তবে সেগুলি দুটি চ্যালেঞ্জও তৈরি করে।

টোকেনের ব্যবহার দ্রুত বৃদ্ধি পাচ্ছে, এবং এর সাথে সামগ্রিক খরচও বাড়ছে। যখন রিমোট ক্লাস্টারে চলমান ক্লোজড-সোর্স মডেলগুলির এপিআই-এর মাধ্যমে বুদ্ধিমত্তার অ্যাক্সেস নেওয়া হয়, তখন প্রতিটি অনুরোধের সাথে ব্যক্তিগত তথ্য এবং বুদ্ধিবৃত্তিক সম্পত্তি ব্যবহারকারীর ডিভাইস ছেড়ে চলে যায়। এজেন্টরা যখন পৃথক ওয়ার্কফ্লো এবং পুরো সংস্থা জুড়ে প্রসারিত হয়, তখন টোকেনের ব্যয় এবং ডেটা মুভমেন্ট নিয়ন্ত্রণ করা ক্রমবর্ধমান কঠিন হয়ে পড়ে।

একই সময়ে, ওপেন-সোর্স মডেলগুলি আরও দ্রুত হারে উন্নত হয়েছে। NVIDIA Nemotron 3.5 Lightning (মোট ৩০বি প্যারামিটার), Qwen 3.6 (৩৫বি), এবং Qwen 3.8 (২৭বি)-এর মতো অত্যন্ত ছোট এবং দক্ষ মডেলগুলিতে অগ্রগতি সবচেয়ে বেশি দৃশ্যমান। এই ছোট মডেলগুলি তাদের ওজনের চেয়ে অনেক বেশি শক্তিশালী এবং এখন জটিল এজেন্টিক ওয়ার্কফ্লো পরিচালনা করতে সক্ষম। স্থানীয়-ইনফারেন্স হার্ডওয়্যার সমান্তরালভাবে উন্নত হচ্ছে: NVIDIA DGX Spark-এর মতো সিস্টেমগুলি এখন এই মডেলগুলিকে স্থানীয়ভাবে চালাতে পারে। একসাথে, এই ট্রেন্ডগুলি সম্পূর্ণ অন-ডিভাইস অপারেশনকে বাস্তবসম্মত করে তোলে এবং ব্যবহারকারীদের প্রয়োজন অনুযায়ী বাহ্যিক ক্ষমতা বেছে নেওয়ার অনুমতি দেয়, যেমন ওয়েব সার্চ, কানেক্টর, বা ক্লাউড-মডেল এসকালেশন।

এই লোকাল-ফার্স্ট পদ্ধতি উল্লেখযোগ্য খরচ সাশ্রয় করতে সক্ষম করে, কারণ স্থানীয় ইনফারেন্স প্রতি-টোকেন এপিআই ফি এড়িয়ে চলে। এটি স্বাভাবিকভাবেই গোপনীয়তা এবং বুদ্ধিবৃত্তিক সম্পত্তির উদ্বেগগুলিও সমাধান করে: ব্যক্তিগত টোকেনগুলি কখনই রিমোট ক্লাস্টারে প্রেরণ করার প্রয়োজন হয় না এবং স্থানীয় ডিভাইসের সীমানার মধ্যেই নিরাপদে থাকে।

জুন মাসে, আমরা প্রথম হাইব্রিড লোকাল-সার্ভার ইনফারেন্স অর্কেস্ট্রেটর প্রবর্তন করেছি যা নির্ধারণ করে যে কোন কাজটি অন-ডিভাইসে চালানো উচিত এবং কোন কাজটি ক্লাউডের এজেন্টদের কাছে যাওয়া উচিত। এখানে আমরা ব্যাখ্যা করছি যে কীভাবে আমরা এমন একটি লোকাল-ফার্স্ট এজেন্ট তৈরি করেছি, যার মধ্যে রয়েছে হার্নেস এবং একে অপরের জন্য কো-অপ্টিমাইজ করা মডেলগুলি।

আমরা মূল ডিজাইনের পছন্দগুলির একটি ওভারভিউ দিই, তিনটি পাবলিক বেঞ্চমার্ক এবং আমাদের অভ্যন্তরীণ লোকাল নলেজ ওয়ার্ক বেঞ্চ জুড়ে জনপ্রিয় ওপেন-সোর্স জেনারেল-পারপাস হার্নেস (Hermes এবং Pi)-এর বিপরীতে Computer-এর মূল্যায়ন করি। আমাদের বেঞ্চমার্কে, NVIDIA DGX Spark-এ চলমান Qwen 3.8 27B মডেলের সাথে, Computer সর্বোচ্চ স্কোর অর্জন করেছে, Pi-এর জন্য ৭৬.৬% এবং Hermes-এর জন্য ৭৪.০% এর তুলনায় ৮২.৬%। PPLX 27B, Qwen 3.8 27B-এর উপরে আমাদের পোস্ট-ট্রেন করা মডেল, স্কোরটিকে আরও বাড়িয়ে ৮৫.৪%-এ উন্নীত করেছে।

লোকাল নলেজ ওয়ার্ক বেঞ্চ স্কোরের বার চার্ট: Qwen 3.8 27B সহ Computer, Pi এবং Hermes হার্নেস, এবং PPLX 27B সহ Computer, যা ৮৫.৪% এ সর্বোচ্চ স্কোর করেছে।
লোকাল নলেজ ওয়ার্ক বেঞ্চে স্কোর, দৈনন্দিন জ্ঞান-কাজের ৫৩টি প্রতিনিধি কাজের আমাদের বেঞ্চমার্ক। প্রতিটি বার হলো NVIDIA DGX Spark-এ চলমান একটি হার্নেস এবং মডেল কম্বিনেশন; PPLX 27B হলো আমাদের পোস্ট-ট্রেন করা মডেল। প্রতি টাস্কে তিনটি ট্রায়াল; হুইস্কারগুলি হলো ৯৫% কনফিডেন্স ইন্টারভাল।

স্থানীয় মডেলের চারপাশে হার্নেস ডিজাইন করুন

যদিও কমপ্যাক্ট অন-ডিভাইস মডেলগুলি ইতিমধ্যেই বেশ সক্ষম, তবুও তারা কার্যক্ষমতায় বড় ফ্রন্টিয়ার মডেলগুলির চেয়ে পিছিয়ে রয়েছে। এই মডেলগুলিকে কার্যকরভাবে চালিত করতে এবং তাদের সীমাবদ্ধতাগুলি সমাধান করার জন্য একটি সতর্কতার সাথে ডিজাইন করা হার্নেস প্রয়োজন।

Pi এবং Hermes-এর মতো জনপ্রিয় ওপেন-সোর্স হার্নেসগুলি সাধারণ প্রমাণিত হয়েছে: এগুলি বিভিন্ন আকার এবং ক্লাসের বিস্তৃত মডেলগুলির সাথে ভালোভাবে কাজ করে। কিন্তু এগুলি অন-ডিভাইস মডেলগুলির সক্ষমতার জন্য অপ্টিমাইজ করা হয়নি। আমরা এই সেটিংয়ের জন্য বিশেষভাবে স্থানীয় হার্নেসটি ডিজাইন করেছি, কিছু মূল নীতির চারপাশে।

কনটেক্সট দক্ষতা

আমাদের হার্নেস ডিজাইনের মূল ফোকাস ছিল মডেলের কনটেক্সটের সেরা ব্যবহার করা।

যদিও Qwen 3.8 27B-এর মতো অন-ডিভাইস মডেলগুলি ২৬০K টোকেনের কনটেক্সট উইন্ডো অফার করে, আমরা অভিজ্ঞতা থেকে দেখেছি যে তারা ১০০K টোকেনের বাইরে লড়াই করতে শুরু করে। তাই আমরা মূল হার্নেসটিকে সংক্ষিপ্ত রাখি: একটি ন্যূনতম সিস্টেম প্রম্পট এবং মূল টুলের একটি ছোট সেট।

অন্যান্য সমস্ত ক্ষমতা অন-ডিমান্ড দক্ষতায় মডুলারাইজ করা হয় যা ট্র্যাজেক্টরি জুড়ে লোড এবং আনলোড হয়। আমরা সাধারণ জ্ঞান-কাজের কাজগুলির জন্য এই দক্ষতাগুলি ডিজাইন করেছি: গবেষণা, ডেটা সায়েন্স, ডেটা ভিজ্যুয়ালাইজেশন, ডকুমেন্ট তৈরি, সফটওয়্যার ইঞ্জিনিয়ারিং এবং আরও অনেক কিছু।

হার্নেস কনটেক্সট কম্প্যাকশনকেও সমর্থন করে, ট্র্যাজেক্টরি দীর্ঘ হলে পুরোনো কনটেক্সট সংক্ষেপণ করে যাতে মডেলটি তার কার্যকর উইন্ডোর মধ্যে থাকে।

কমান্ড-লাইন টুল হিসেবে কানেক্টর

দৈনন্দিন জ্ঞান-কাজের জন্য প্রায়ই জিমেইল, গিটহাব, আউটলুক এবং গুগল ক্যালেন্ডারের মতো কানেক্টরের প্রয়োজন হয়। এগুলি সাধারণত একটি হার্নেসের কাছে MCP সার্ভার হিসাবে প্রকাশিত হয়, যার বড় টুল সংজ্ঞাগুলি কনটেক্সটের একটি উল্লেখযোগ্য অংশ ব্যবহার করে। পরিবর্তে, আমরা সর্বাধিক ব্যবহৃত MCP গুলিকে কমপ্যাক্ট, সহজে ব্যবহারযোগ্য কমান্ড-লাইন টুলে রূপান্তর করেছি, যা কাস্টম দক্ষতার সাথে সম্পূরক যা সীমিত কার্যকর কনটেক্সটের অনেক ভালো ব্যবহার করে।

স্বয়ং-যাচাইকরণ

এজেন্ট যখন নিজের কাজ যাচাই করে তখন কর্মক্ষমতাও উন্নত হয়। যাচাইকরণ অতিরিক্ত পদক্ষেপ যোগ করে, তবে এটি চূড়ান্ত ফলাফলকে অনেক উন্নত করে এবং ফ্রন্টিয়ার মডেলগুলির সাথে ব্যবধান উল্লেখযোগ্যভাবে সংকুচিত করে। এটি মডেল নিজেই বা হুকের একটি সেট দ্বারা ট্রিগার করা যেতে পারে যা ট্র্যাজেক্টরির স্বাস্থ্য নিরীক্ষণ করে এবং যখন কিছু ভুল হয়ে যায় তখন স্বয়ং-যাচাইকরণের অনুরোধ করে।

স্যান্ডবক্সড এক্সিকিউশন

হার্নেস ব্যবহারকারীর ডিভাইসে একটি OS-স্তরের স্যান্ডবক্সে টুলগুলি চালায়। নীতি অনুযায়ী সীমানা প্রক্রিয়া, ফাইলসিস্টেম পাথ এবং নেটওয়ার্ক অ্যাক্সেস সীমিত করে। এটি একটি ভুল কমান্ডের প্রভাবের ব্যাসার্ধ সীমিত করে। যদি স্যান্ডবক্স অনুপলব্ধ হয়, তবে হার্নেস আনস্যান্ডবক্সড এক্সিকিউশনে অবনমিত না হয়ে যেকোনো টুল কলের আগেই নিজেকে নিষ্ক্রিয় করে দেয়।

এটি Pi এবং Hermes-এর মতো ওপেন-সোর্স হার্নেস থেকে আলাদা, যা ডিফল্টভাবে ব্যবহারকারীর অনুমতি নিয়ে সরাসরি কমান্ড চালায়। Computer-এ, আইসোলেশন সর্বদা চালু থাকে, কোনো কনফিগারেশনের প্রয়োজন হয় না এবং এটি ছাড়া টুল চলতে পারে না।

নীচের ডায়াগ্রামটি দেখায় যে এই নীতিগুলি এক্সিকিউশন লুপে কীভাবে একসাথে খাপ খায়। অর্কেস্ট্রেটর হলো ডিটারমিনিস্টিক হার্নেস কোড, কোনো এলএলএম নয়: এটি লুপ বজায় রাখে, কনটেক্সট একত্রিত করে এবং নীতি প্রয়োগ করে। স্থানীয় মডেল পরবর্তী অ্যাকশনের প্রস্তাব দেয়; অর্কেস্ট্রেটর স্যান্ডবক্সে অনুমোদিত টুল কলগুলি কার্যকর করে এবং মডেলটিতে তাদের ফলাফল ফিরিয়ে দেয়। ওয়েব সার্চ, কানেক্টর এবং অ্যাডভাইজার কলগুলি কেবল তখনই এবং যখন অনুমোদিত হয় তখনই ডিভাইস সীমানা অতিক্রম করে।

স্থানীয় হার্নেস এক্সিকিউশন লুপের ডায়াগ্রাম: ডিটারমিনিস্টিক অর্কেস্ট্রেটর কোড কনটেক্সট একত্রিত করে এবং স্যান্ডবক্সড টুল চালায়, স্থানীয় মডেল অ্যাকশনের প্রস্তাব দেয় এবং অফ-ডিভাইস পরিষেবাগুলি ঐচ্ছিক এবং ব্যবহারকারী-নিয়ন্ত্রিত।
স্থানীয় হার্নেস কীভাবে একটি টাস্ক চালায়। ডিটারমিনিস্টিক হার্নেস কোড লুপ এবং স্যান্ডবক্সড টুল নিয়ন্ত্রণ করে; স্থানীয় মডেল অ্যাকশনের প্রস্তাব দেয়। অফ-ডিভাইস পরিষেবাগুলি ঐচ্ছিক এবং ব্যবহারকারী-নিয়ন্ত্রিত।

একটি স্থানীয় হার্নেস একই মডেলের আরও বেশি সদ্ব্যবহার করে

একই অন-ডিভাইস বেস মডেল ব্যবহার করে, আমরা ওয়েব গবেষণা এবং মাল্টিমোডাল ডকুমেন্ট বোঝার ক্ষেত্রে সাধারণ-উদ্দেশ্যের বিকল্পগুলির সাথে আমাদের স্থানীয় হার্নেসের তুলনা করি। সমস্ত হার্নেস NVIDIA DGX Spark-এ মাঝারি রিজনিং সহ Qwen 3.8 27B মডেল ব্যবহার করে। এই তুলনাটি কোনো মডেল পোস্ট-ট্রেনিংয়ের আগে, শুধুমাত্র হার্নেস দ্বারা অবদান রাখা ক্ষমতাগুলিকে আলাদা করে।

আমরা এই দুটি ক্ষমতার উপর ফোকাস করি কারণ জ্ঞান-কাজে প্রায়ই ব্যবহারকারীর ডিভাইসের প্রাইভেট ডকুমেন্টসকে ওয়েবের পাবলিক তথ্যের সাথে একত্রিত করে একটি গ্রাউন্ডেড আর্টিফ্যাক্ট তৈরি করা হয়। ওয়েব অনুসন্ধানের জন্য সংযোগের প্রয়োজন হয়, তবে মডেল ইনফারেন্স এবং প্রাইভেট-ডকুমেন্ট প্রসেসিং স্থানীয় থাকে। স্থানীয় ফাইলগুলি প্রামাণিক উত্স হিসাবে কাজ করে, পাবলিক উত্সগুলি কনটেক্সট যোগ করে এবং ব্যবহারকারীরা সম্পূর্ণ অফলাইন কাজের জন্য ওয়েব অনুসন্ধান সম্পূর্ণভাবে নিষ্ক্রিয় করতে পারে।

ওয়েব গবেষণা

আমরা Perplexity-এর সার্চ ইঞ্জিনের পাশাপাশি আমাদের স্থানীয় হার্নেস তৈরি করি, যা স্বাধীন মূল্যায়নে শীর্ষ স্থান অর্জন করেছে। হার্নেসটি Search as Code ইন্টারফেসের মাধ্যমে এটি অ্যাক্সেস করে।

আমরা ১,২৬৬টি BrowseComp টাস্কে গবেষণার গুণমান মূল্যায়ন করি। Computer আমাদের স্থানীয় হার্নেসের পাশাপাশি Perplexity-এর সার্চ অবকাঠামো ব্যবহার করে, অন্যদিকে Pi এবং Hermes তাদের প্রস্তাবিত সার্চ প্রদানকারী Brave-এর উপর নির্ভর করে। Pi-এর জন্য ৫০.২% এবং Hermes-এর জন্য ৪৩.৯%-এর তুলনায় Computer ৬৬.৭% নির্ভুলতা অর্জন করে।

Computer-এর গড় রেকর্ড করা ওয়াল টাইম এবং টোকেন ব্যবহারও সবচেয়ে কম: প্রতি টাস্কে ৪০২.১ সেকেন্ড এবং ৮৫২k টোকেন, যেখানে Hermes-এর জন্য ১,০২০.৯ সেকেন্ড এবং ১.০১ মিলিয়ন টোকেন এবং Pi-এর জন্য ৮২৬.০ সেকেন্ড এবং ২.৮২ মিলিয়ন টোকেন লাগে। তাই Computer, Hermes-এর তুলনায় ৬১% কম ওয়াল টাইম এবং ১৬% কম টোকেন এবং Pi-এর তুলনায় ৫১% কম ওয়াল টাইম এবং ৭০% কম টোকেন ব্যবহার করে।

Qwen 3.8 27B সহ Computer, Hermes এবং Pi-এর জন্য প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে BrowseComp স্কোরের স্ক্যাটার প্লট; Computer সবচেয়ে কম সময় এবং সবচেয়ে কম টোকেনে সর্বোচ্চ স্কোর অর্জন করে।
অন-ডিভাইস Qwen 3.8 27B মডেল সহ BrowseComp ফলাফল: Computer, Hermes এবং Pi হার্নেসের জন্য প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে স্কোর; পয়েন্ট লেবেল প্রতি টাস্কে গড় টোকেন দেখায়। অসম্পূর্ণ ফলাফল শূন্য স্কোর পায়, এবং সময় এবং টোকেন গড়ে রেকর্ড করা পরিমাপ ছাড়া রোলআউটগুলি বাদ দেওয়া হয়। হুইস্কারগুলি হলো স্কোরের জন্য ৯৫% উইলসন কনফিডেন্স ইন্টারভাল।

অন-ডিভাইস মাল্টিমোডাল ডকুমেন্ট আন্ডারস্ট্যান্ডিং

অনেক নথিপত্র দৃশ্যমানভাবে তথ্য বহন করে এবং প্লেইন টেক্সট হিসেবে পার্স করা কঠিন: PDF, স্ক্যান করা পৃষ্ঠা, স্ক্রিনশট, চার্ট এবং প্রেজেন্টেশন। এই ওয়ার্কফ্লোগুলি OCR এবং ইমেজ আন্ডারস্ট্যান্ডিংয়ের উপর নির্ভর করে এবং একটি নেটিভভাবে মাল্টিমোডাল মডেল থেকে সবচেয়ে বেশি উপকৃত হয়।

হার্নেস ডকুমেন্ট পেজ এবং ছবি সরাসরি মডেলে পাঠায়, যা সেগুলি বুঝতে পারে এবং নিষ্কাশিত পাঠ্যের সাথে ভিজ্যুয়াল প্রমাণ একত্রিত করে। ডিভাইসে এই ফাইলগুলি প্রসেস করা সংবেদনশীল নথি এবং তাদের নিষ্কাশিত বিষয়বস্তুকে ব্যক্তিগত রাখে।

আমরা ParseBench-100-এ মাল্টিমোডাল ডকুমেন্ট বোঝার মূল্যায়ন করি, যা ParseBench বেঞ্চমার্কের ১০০-টাস্ক সাবসেট, যেখানে চার্ট, লেআউট, টেবিল, টেক্সট কন্টেন্ট এবং ফরম্যাটিংয়ের জন্য প্রতিটি ২০টি করে টাস্ক রয়েছে।

Computer ৬৪.১% এর গড় স্কোর অর্জন করে, যেখানে Hermes-এর জন্য ৩৪.৬% এবং Pi-এর জন্য ১৩.৯%। এটি সবচেয়ে কম সময়ে এবং সবচেয়ে কম টোকেনে কাজ সম্পন্ন করে: প্রতি টাস্কে গড়ে ৬০.৬ সেকেন্ড এবং ২০.১k টোকেন, যেখানে Hermes-এর জন্য ১০৮.৩ সেকেন্ড এবং ৩২.১k টোকেন এবং Pi-এর জন্য ৪১০.৫ সেকেন্ড এবং ৮২৯.১k টোকেন লাগে। Computer সমস্ত পাঁচটি ডকুমেন্ট বিভাগে এগিয়ে রয়েছে, যার মধ্যে চার্টে এর সুবিধা সবচেয়ে বেশি। তিনটি হার্নেসের জন্যই লেআউট কঠিন রয়ে গেছে।

Qwen 3.8 27B সহ Computer, Hermes এবং Pi-এর জন্য প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে ParseBench-100 OCR স্কোরের স্ক্যাটার প্লট; Computer সবচেয়ে কম সময় এবং সবচেয়ে কম টোকেনে সর্বোচ্চ স্কোর অর্জন করে।
অন-ডিভাইস Qwen 3.8 27B মডেল সহ ParseBench-100 OCR ফলাফল: Computer, Hermes এবং Pi হার্নেসের জন্য প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে স্কোর; পয়েন্ট লেবেল প্রতি টাস্কে গড় টোকেন দেখায়। টোকেন গড় রেকর্ড করা পরিমাপ সহ রোলআউট ব্যবহার করে। হুইস্কারগুলি হলো ৯৫% কনফিডেন্স ইন্টারভাল।

টেবিল ১. অন-ডিভাইস Qwen 3.8 27B মডেল সহ Computer, Hermes, এবং Pi হার্নেসের জন্য ডকুমেন্ট বিভাগ অনুযায়ী ParseBench-100 গড় স্কোর। Computer সমস্ত পাঁচটি বিভাগে এগিয়ে রয়েছে।

হার্নেস

চার্ট

লেআউট

টেবিল

টেক্সট কন্টেন্ট

ফরম্যাটিং

Computer

৭৬.৫%

১৬.২%

৭২.৭%

৮৭.৯%

৭২.৪%

Hermes

২৯.৩%

২.৯%

৪৪.১%

৬১.৫%

৩৫.২%

Pi

২.৫%

০.১%

১১.০%

২৯.৭%

২৬.১%

অ্যাডভাইজার এসকালেশনের মাধ্যমে ফ্রন্টিয়ারের ব্যবধান কমানো

সতর্কতার সাথে ডিজাইন করা হার্নেস থাকা সত্ত্বেও, কঠিনতম কাজগুলি এখনও একটি কমপ্যাক্ট অন-ডিভাইস মডেলের ক্ষমতার বাইরে। এই ধরনের কাজের জন্য, হার্নেস একটি অ্যাডভাইজার টুল প্রকাশ করে: স্থানীয় মডেল যখন পরিকল্পনা, দ্ব্যর্থতা দূরীকরণ, বারবার ব্যর্থতা থেকে পুনরুদ্ধার বা চূড়ান্ত ফলাফল যাচাই করার জন্য সাহায্যের প্রয়োজন হয় তখন একটি শক্তিশালী ফ্রন্টিয়ার মডেলের সাথে পরামর্শ করতে পারে।

স্থানীয় মডেল কখন পরামর্শের অনুরোধ করতে হবে তা নির্ধারণ করে, অন্যদিকে হার্নেস অর্কেস্ট্রেটর টুল অথরিটি ধরে রাখে এবং কোন কনটেক্সট পাঠানো হবে তা নিয়ন্ত্রণ করে। এসকালেশন ঐচ্ছিক। ব্যবহারকারী এটি সক্ষম করতে হবে কিনা এবং প্রতিটি অ্যাডভাইজার কল ম্যানুয়ালি বা স্বয়ংক্রিয়ভাবে অনুমোদন করতে হবে কিনা তা সিদ্ধান্ত নেন।

অ্যাডভাইজার কলের আগে, হার্নেস প্রাসঙ্গিক কনটেক্সট নির্বাচন করে, সংবেদনশীল তথ্য চিহ্নিত করতে একটি PII ক্লাসিফায়ার প্রয়োগ করে এবং ব্যবহারকারীকে দেখায় যে কী ডিভাইস ছেড়ে চলে যাবে। অ্যাডভাইজার শুধুমাত্র অনুমোদিত কনটেক্সট পায় এবং টেক্সট গাইডেন্স ফেরত দেয়; ডিভাইসের ফাইল, টুল বা কথোপকথনে এর কোনো সরাসরি অ্যাক্সেস নেই। এটি খরচ এবং গোপনীয়তা উভয়ই উন্নত করে, এবং আমরা ভবিষ্যতের কাজে এই দিকটি আরও অন্বেষণ করার পরিকল্পনা করছি।

অ্যাডভাইজার এসকালেশনের ডায়াগ্রাম: হার্নেস অর্কেস্ট্রেটর টুল অথরিটি ধরে রাখে এবং শুধুমাত্র অনুমোদিত কনটেক্সট অ্যাডভাইজার মডেলে পাঠায়, যা টুল বা ফাইলে সরাসরি অ্যাক্সেস ছাড়াই টেক্সট গাইডেন্স ফেরত দেয়।
দূরবর্তী নির্দেশিকা, স্থানীয় নিয়ন্ত্রণ। হার্নেস অর্কেস্ট্রেটর টুল অথরিটি ধরে রাখে এবং শুধুমাত্র এসকালেশনের জন্য অনুমোদিত কনটেক্সট পাঠায়। অ্যাডভাইজারের টুল, ফাইল বা রেসপন্স চ্যানেলে কোনো সরাসরি অ্যাক্সেস নেই; এটি টেক্সট গাইডেন্স ফেরত দেয় যা স্থানীয় মডেল ব্যবহার করতে পারে।

আমরা চ্যালেঞ্জিং সফটওয়্যার ইঞ্জিনিয়ারিং টাস্কে এই পদ্ধতিটি পরীক্ষা করি, যার জন্য শক্তিশালী যুক্তি প্রয়োজন এবং যেখানে একটি স্থানীয় মডেল সবচেয়ে বেশি পিছিয়ে পড়ে। এর জন্য আমরা কোডিং এজেন্টের জন্য একটি জনপ্রিয় ৮৯-টাস্ক বেঞ্চমার্ক Terminal Bench 2.1 ব্যবহার করি।

আমরা দুটি প্রশ্নের উত্তর দিতে চাই: ফ্রন্টিয়ার মডেলের সাথে ব্যবধান কতখানি অ্যাডভাইজার এসকালেশন দূর করতে পারে, এবং কী খরচে। সম্পূর্ণরূপে স্থানীয় মডেল চালাতে প্রায় কোনো খরচই হয় না, কারণ ইনফারেন্স ব্যবহারকারীর হার্ডওয়্যারে ঘটে। তবে একবার মডেলটি অ্যাডভাইজারকে কল করা শুরু করলে, এটি এপিআই খরচ বহন করতে শুরু করে।

ফ্রন্টিয়ার পারফরম্যান্সের বেসলাইন হিসেবে, আমরা স্থানীয় হার্নেসে পরিচালিত Claude Opus 5 ব্যবহার করি; স্থানীয় মডেলটি হলো Qwen 3.8 27B। অবশেষে, আমরা দু'টিকে জোড়া দিই: Qwen 3.8 27B কাজটি চালায় এবং সাহায্যের প্রয়োজন হলে Claude Opus 5 অ্যাডভাইজারের কাছে এসকালেট করে। আমরা Pi বা Hermes-এর সাথে অ্যাডভাইজার এসকালেশন মূল্যায়ন করি না কারণ কেউ সমতুল্য অ্যাডভাইজার টুল প্রদান করে না; একটি যোগ করার জন্য এর টুল সারফেস এবং অর্কেস্ট্রেশন লজিক পরিবর্তন করতে হবে, তাই ফলাফলটি আর অফ-দ্য-শেলফ হার্নেসকে প্রতিনিধিত্ব করবে না।

অ্যাডভাইজার এসকালেশন Computer-এর স্কোর ৫৯.৬% থেকে বাড়িয়ে ৭৩.০% করে, যা ১৩.৫ শতাংশ পয়েন্টের বৃদ্ধি, প্রতি রোলআউটে আনুমানিক $০.৪১৫ এপিআই খরচে। একা Claude Opus 5 চালালে প্রতি রোলআউটে $০.৬৫ এ ৮২.৪% পৌঁছায়। এসকালেশন এইভাবে ফ্রন্টিয়ারের খরচের প্রায় দুই-তৃতীয়াংশে ফ্রন্টিয়ারের ব্যবধানের প্রায় তিন-পঞ্চমাংশ পুনরুদ্ধার করে, এবং ব্যবহারকারী সিদ্ধান্ত নেন যে সেই বাণিজ্যটি কখন করা মূল্যবান।

প্রতি রোলআউটে এপিআই খরচের বিপরীতে Terminal Bench 2.1 স্কোরের স্ক্যাটার প্লট: সম্পূর্ণ স্থানীয় Qwen 3.8 27B, Claude Opus 5 অ্যাডভাইজারের সাথে Qwen 3.8 27B, এবং একা Claude Opus 5, সবগুলিই Computer হার্নেসে।
৮৯টি কাজে Terminal Bench 2.1 খরচ-পারফরম্যান্স: প্রতি রোলআউটে এপিআই খরচের বিপরীতে স্কোর। সমস্ত পয়েন্ট Computer হার্নেস ব্যবহার করে: সম্পূর্ণ স্থানীয় Qwen 3.8 27B, Claude Opus 5 অ্যাডভাইজারের কাছে এসকালেট করা Qwen 3.8 27B, এবং একা Claude Opus 5। ড্যাশযুক্ত লাইনগুলি শূন্য এপিআই খরচে একই স্থানীয় মডেল চালানো Pi এবং Hermes দেখায়। হুইস্কারগুলি হলো টাস্ক-বুটস্ট্রাপ ৯৫% কনফিডেন্স ইন্টারভাল; অসম্পূর্ণ রোলআউট শূন্য স্কোর পায়।

হার্নেস এবং জ্ঞান-কাজের জন্য পোস্ট-ট্রেনিং

এখন পর্যন্ত, হার্নেস কী অবদান রাখে তা আলাদা করার জন্য আমরা স্থানীয় মডেলটিকে অপরিবর্তিত রেখেছি। হার্নেস ডিজাইন প্রস্তুত থাকার সাথে সাথে, সবচেয়ে বড় অবশিষ্ট লাভগুলি আসে মডেলটিকে নিজে মানিয়ে নেওয়া থেকে। Perplexity Computer ব্যবহারের ডেটা আমাদের দেখায় যে লোকেরা জ্ঞান-কাজের জন্য আসলে কী করে, যা আমরা প্রশিক্ষণ ডেটা সংশ্লেষণ করতে ব্যবহার করি। ব্যবহারকারীরা যে কাজগুলি সম্পাদন করে তাদের প্রকৃত বিতরণের দ্বারা পরিচালিত হয়ে আমরা Computer হার্নেসের ভিতরে স্থানীয় মডেলটিকে পোস্ট-ট্রেন করি।

সুনির্দিষ্টভাবে বলতে গেলে, আমরা বিভিন্ন ব্যবহারের কেস চিহ্নিত করি যা বিভিন্ন মডেলের ক্ষমতা, টুল এবং কানেক্টর প্রয়োগ করে। এই ব্যবহারের কেসগুলি থেকে আমরা বাস্তবসম্মত রেইনফোর্সমেন্ট লার্নিং পরিবেশ সংশ্লেষণ করি এবং চ্যালেঞ্জিং কিন্তু যাচাইযোগ্য কাজগুলি সংজ্ঞায়িত করি: প্রতিটি কাজ একটি নির্দেশ, একটি পরিবেশ এবং একটি যাচাইকারী নিয়ে গঠিত যা চূড়ান্ত ফলাফল স্কোর করে, যেখানে পরিবেশ হলো একটি ডকার কন্টেইনার যেখানে হার্নেস কাজ করে। গুরুত্বপূর্ণভাবে, কাজগুলি কৃত্রিম হওয়ায়, সেগুলিতে কোনো বাস্তব নথি বা ব্যবহারকারীর তথ্য থাকে না।

আমরা দুই-পর্যায়ের প্রশিক্ষণের জন্য এই পরিবেশগুলি ব্যবহার করি: রিজেকশন ফাইন-টিউনিং এবং তারপরে রেইনফোর্সমেন্ট লার্নিং। প্রথম পর্যায়ে, আমরা প্রতিটি টাস্কের বিপরীতে একাধিকবার মডেলটি রোল আউট করি, ভেরিফায়ার স্কোর দ্বারা সেরা ট্র্যাজেক্টরিগুলি নির্বাচন করি এবং সুপারভাইজড লার্নিংয়ের মাধ্যমে সেগুলির উপর প্রশিক্ষণ দিই। এই পর্যায়টি নির্দিষ্ট হার্নেস এবং টাস্ক বিতরণের জন্য মডেলটিকে শুরু করে। দ্বিতীয় পর্যায়ে, রেইনফোর্সমেন্ট লার্নিং মডেলটিকে আরও ফাইন-টিউন করে, এটিকে আরও শক্তিশালী করে তোলে।

কাজের একটি সাবসেট প্রশিক্ষণ থেকে বাদ রাখা হয় এবং চূড়ান্ত মূল্যায়নের জন্য ব্যবহার করা হয়; আমরা এই বাদ রাখা সেটটিকে লোকাল নলেজ ওয়ার্ক বেঞ্চ বলি: গভীর গবেষণা থেকে শুরু করে ডকুমেন্ট তৈরি পর্যন্ত দৈনন্দিন জ্ঞান-কাজের সাতটি বিভাগ জুড়ে ৫৩টি কাজ। আমরা শীঘ্রই মডেল প্রশিক্ষণ বিস্তারিত বর্ণনা করে একটি প্রযুক্তিগত প্রতিবেদন প্রকাশ করব, এবং আমরা এই মূল্যায়ন বেঞ্চমার্ক ওপেন-সোর্স করার পরিকল্পনা করছি।

আমরা এই পদ্ধতির সাথে Qwen 3.8 27B পোস্ট-ট্রেন করেছি, PPLX 27B নামক একটি মডেল তৈরি করেছি এবং লোকাল নলেজ ওয়ার্ক বেঞ্চে এর মূল্যায়ন করেছি। বেস Qwen 3.8 27B মডেলের সাথে, Computer সর্বোচ্চ স্কোর অর্জন করেছে (৮২.৬%, Pi-এর জন্য ৭৭.৬% এবং Hermes-এর জন্য ৭৪.০% এর তুলনায়) এবং সবচেয়ে কম টোকেন ব্যবহার করেছে (৫২০k, যেখানে Pi-এর জন্য ৬৮১k এবং Hermes-এর জন্য ৬৩৪k)। প্রতি টাস্কে ১৭৬ সেকেন্ডে Pi দ্রুততম কাজগুলি সম্পন্ন করে, যেখানে Computer-এর জন্য ২১৮ সেকেন্ড এবং Hermes-এর জন্য ২৯২ সেকেন্ড লাগে। PPLX 27B Computer-এর স্কোর ৮৫.৪% এ উন্নীত করে, অধিক টোকেনের খরচে (৬৭৮k বনাম ৫২০k)। এর আনুমানিক ওয়াল টাইম ২৫০ সেকেন্ড।

প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে লোকাল নলেজ ওয়ার্ক বেঞ্চ স্কোরের স্ক্যাটার প্লট; Computer-এ চলমান PPLX 27B ৮৫.৪% এ সর্বোচ্চ স্কোর অর্জন করে।
লোকাল নলেজ ওয়ার্ক বেঞ্চে পোস্ট-ট্রেনিং ফলাফল: প্রতি টাস্কে গড় ওয়াল টাইমের বিপরীতে স্কোর; পয়েন্ট লেবেল হার্নেস, মডেল এবং প্রতি টাস্কে গড় টোকেন দেখায়। PPLX 27B হলো আমাদের পোস্ট-ট্রেন করা মডেল, যা Computer-এ চলছে। হুইস্কারগুলি হলো প্রতিটি তিনটি ট্রায়াল সহ ৫৩টি কাজ জুড়ে ৯৫% কনফিডেন্স ইন্টারভাল।

টেবিল ২. লোকাল নলেজ ওয়ার্ক বেঞ্চ টাস্ক বিভাগ।

বিভাগ

কাজ

শেয়ার

বিবরণ

গভীর গবেষণা

২০

৩৭.৭%

মাল্টি-হপ ওয়েব গবেষণা, পাবলিক ডেটাসেট, পরিসংখ্যান এবং উৎস যাচাইকরণের প্রয়োজন এমন জটিল প্রশ্নের উত্তর দিন।

ডেটা, ফাইন্যান্স এবং প্রকিউরমেন্ট

১৭.০%

ডেটাসেট পরিষ্কার করুন, রেকর্ড পুনর্মিলন করুন, খরচ অডিট করুন, বিনিয়োগ বিশ্লেষণ করুন, সরবরাহকারী মূল্যায়ন করুন এবং আর্থিক মেট্রিক গণনা করুন।

ডকুমেন্ট, প্রেজেন্টেশন এবং ডিজাইন

১৩.২%

পলিশ করা PDF, চালান, অনবোর্ডিং উপকরণ, ইভেন্ট কোলাটেরাল এবং ব্যবসায়িক প্রেজেন্টেশন তৈরি করুন।

ইঞ্জিনিয়ারিং, আইটি এবং ইনসিডেন্ট

৯.৪%

ইনসিডেন্ট তদন্ত করুন, লগ বিশ্লেষণ করুন, পুনরুদ্ধারের পরিকল্পনা লিখুন, রিলিজ প্রস্তুতি মূল্যায়ন করুন এবং প্রযুক্তিগত ডকুমেন্টেশন সংশ্লেষণ করুন।

চুক্তি, প্রমাণ এবং কমপ্লায়েন্স

৯.৪%

চুক্তি পর্যালোচনা করুন, প্রমাণ স্ক্রিন করুন, রিকল তদন্ত করুন, সংবেদনশীল নথি রিড্যাক্ট করুন এবং কমপ্লায়েন্স প্রয়োজনীয়তা যাচাই করুন।

ড্যাশবোর্ড, সফটওয়্যার এবং ভিজ্যুয়ালাইজেশন

৭.৫%

ইন্টারেক্টিভ ড্যাশবোর্ড, শিক্ষামূলক মাইক্রোসাইট, চার্ট এবং প্রজেক্ট ভিজ্যুয়ালাইজেশন তৈরি করুন।

ব্যক্তি, প্রকল্প এবং মিটিং

৫.৭%

রিজিউমে স্ক্রিন করুন, মিটিংয়ের সিদ্ধান্ত একত্রিত করুন এবং প্রজেক্ট অ্যাকশন ট্র্যাকার বজায় রাখুন।

মোট

৫৩

১০০%

উপসংহার

আমাদের গবেষণা দেখায় যে একটি শক্তিশালী ওপেন-সোর্স মডেল, সক্ষম স্থানীয় হার্ডওয়্যার এবং সেগুলির জন্য তৈরি একটি হার্নেস সংবেদনশীল ডেটা ডিভাইস ছেড়ে যাওয়ার প্রয়োজন ছাড়াই প্রায় শূন্য ইনফারেন্স খরচে বাস্তব জ্ঞান-কাজ পরিচালনা করতে পারে।

বিভিন্ন বেঞ্চমার্ক জুড়ে, NVIDIA DGX Spark-এ Qwen 3.8 27B চালানোর সময় Computer নির্ভুলতার ক্ষেত্রে Hermes এবং Pi-কে ছাড়িয়ে গেছে বা সমান হয়েছে। যে তিনটি বেঞ্চমার্ক লেটেন্সি এবং টোকেন ব্যবহার রিপোর্ট করে, তার মধ্যে Computer BrowseComp এবং ParseBench-100-এ দ্রুততম ছিল এবং তিনটিতেই সবচেয়ে কম টোকেন ব্যবহার করেছে; লোকাল নলেজ ওয়ার্ক বেঞ্চে Pi দ্রুততম ছিল।

লাভ এসেছে আমাদের করা পছন্দগুলি থেকে। আমরা অন-ডিমান্ড লোড হওয়া দক্ষতার সাথে একটি সংক্ষিপ্ত স্থানীয় হার্নেস তৈরি করেছি। আমরা MCP সার্ভারের পরিবর্তে কানেক্টরগুলিকে কমপ্যাক্ট CLI টুলে রূপান্তর করেছি। সুরক্ষার জন্য এক্সিকিউশন স্যান্ডবক্স করা হয়েছিল।

ফলাফলগুলি এও দেখায় যে কমপ্যাক্ট মডেলগুলির কোথায় উন্নতির সুযোগ রয়েছে। উদাহরণস্বরূপ, Terminal Bench 2.1-এর চ্যালেঞ্জিং কোডিং কাজগুলিতে, তিনটি হার্নেস জুড়েই স্থানীয় মডেলটি ফ্রন্টিয়ার মডেলের চেয়ে পিছিয়ে রয়েছে। অ্যাডভাইজার এসকালেশন ব্যবধান সংকুচিত করে কিন্তু সম্পূর্ণরূপে দূর করে না; পারফরম্যান্সকে আরও এগিয়ে নেওয়ার জন্য মডেলের ক্ষমতা এবং স্থানীয় হার্ডওয়্যারে ধারাবাহিক উন্নতি এখনও প্রয়োজন।

স্থানীয় সীমাবদ্ধতার জন্য হার্নেস এবং মডেল তৈরি করার উদ্দেশ্য হলো ব্যবহারকারীদের তাদের মেশিন থেকে কোন তথ্য চলে যায় তার উপর স্পষ্ট নিয়ন্ত্রণ দেওয়া। ব্যবহারকারীর জন্য খরচগত সুবিধাও রয়েছে। আমরা এগুলিকে একটি বৃহত্তর পরিবর্তনের অংশ হিসেবে দেখি যেখানে ক্রমবর্ধমান সক্ষম এজেন্টরা রিমোট অবকাঠামো থেকে পৃথক এবং স্থানীয় ডিভাইসে চলে যায়। আমরা আশা করি যে চিপ, মডেল এবং ডিভাইসের অগ্রগতি ক্রমাগত জ্ঞান-কাজের পরিসর এবং গুণমান প্রসারিত করবে যা Portable Computer স্থানীয়ভাবে পরিচালনা করে।