निजी और लागत प्रभावी ज्ञान कार्य के लिए एक लोकल-फ़र्स्ट एजेंट
स्थानीय ज्ञान कार्य के लिए सह-डिज़ाइन किया गया एक हार्नेस और मॉडल, डिवाइस पर चल रहा है और मांग पर रिमोट क्षमताओं तक पहुँच रहा है।
Perplexity Portable Computer एक लोकल-फ़र्स्ट एजेंट है।
पूरा स्टैक डिफ़ॉल्ट रूप से स्थानीय स्तर पर चलता है। मॉडल, हार्नेस, बातचीत और ट्रेजेक्ट्री सभी उपयोगकर्ता की मशीन पर रहते हैं। जिन कार्यों के लिए बाहरी दुनिया की आवश्यकता होती है, जैसे कि वेब सर्च, कनेक्टर, या क्लाउड पर किसी मजबूत एडवाइज़र मॉडल तक एस्केलेशन, उन्हें केवल तभी और जब आवश्यक हो तब调用 किया जाता है और हमेशा उपयोगकर्ता द्वारा नियंत्रित किया जाता है। इसलिए संवेदनशील डेटा बिना अनुमति के कभी भी डिवाइस से बाहर नहीं जाता है, और स्थानीय मॉडल पर कोई इन्फेंस शुल्क नहीं लगता है: यह सिस्टम अपनी संरचना से ही निजी और लागत प्रभावी है।
एक प्रभावी लोकल-फ़र्स्ट एजेंट के लिए मॉडल और हार्नेस को एक साथ डिज़ाइन करने की आवश्यकता होती है। सामान्य-उद्देश्य वाले हार्नेस एक ऐसे फ़्रंटियर मॉडल मानते हैं जो लंबे संदर्भों को अवशोषित कर सके, एक व्यापक टूल सतह को नेविगेट कर सके, और लंबी क्षितिज पर योजना बना सके। स्थानीय मॉडल उन माँगों के तहत कम विश्वसनीय होते हैं। एक छोटे मॉडल को बड़े मॉडल के लिए बने हार्नेस को प्रबंधित करने के लिए कहने के बजाय, हमने दोनों को एक-दूसरे के इर्द-गिर्द आकार दिया: मॉडल की क्षमता प्रोफ़ाइल के अनुरूप एक हार्नेस, और उस हार्नेस का प्रभावी ढंग से उपयोग करने के लिए पोस्ट-ट्रेन किया गया एक मॉडल।
परिचय
हाल के महीनों में ज्ञान-कार्य कार्यों की एक विस्तृत श्रृंखला में एजेंट क्षमताएं तेजी से उन्नत हुई हैं। हालांकि इन अग्रिमों से उत्पादकता और दक्षता में बड़े लाभ मिलते हैं, लेकिन वे दो चुनौतियाँ भी पैदा करते हैं।
टोकन की खपत तेज़ी से बढ़ रही है, और इसके साथ कुल खर्च भी। जब रिमोट क्लस्टर पर चलने वाले क्लोज्ड-सोर्स मॉडल के API के माध्यम से इंटेलिजेंस तक पहुँचा जाता है, तो हर अनुरोध के साथ निजी जानकारी और बौद्धिक संपदा उपयोगकर्ता के डिवाइस से बाहर चली जाती है। जैसे-जैसे एजेंट व्यक्तिगत वर्कफ़्लो और पूरे संगठनों में स्केल करते हैं, टोकन का खर्च और डेटा का मूवमेंट को नियंत्रित करना तेजी से कठिन होता जाता है।
साथ ही, ओपन-सोर्स मॉडल और भी तेज़ी से सुधरे हैं। प्रगति बहुत छोटे और कुशल मॉडल जैसे कि NVIDIA Nemotron 3.5 Lightning (कुल 30B पैरामीटर), Qwen 3.6 (35B), और Qwen 3.8 (27B) में सबसे अधिक दिखाई देती है। ये छोटे मॉडल अपने वजन से अधिक प्रदर्शन करते हैं और अब जटिल एजेंट वर्कफ़्लो सक्षम हैं। लोकल-इन्फेंस हार्डवेयर समानांतर रूप से आगे बढ़ रहा है: NVIDIA DGX Spark जैसे सिस्टम अब इन मॉडल को स्थानीय रूप से चला सकते हैं। साथ में, ये रुझान पूरी तरह से ऑन-डिफ़्वाइस ऑपरेशन को व्यावहारिक बनाते हैं जबकि उपयोगकर्ताओं को आवश्यकता पड़ने पर बाहरी क्षमताओं, जैसे कि वेब सर्च, कनेक्टर, या क्लाउड-मॉडल एस्केलेशन का विकल्प चुनने की अनुमति देते हैं।
यह लोकल-फ़र्स्ट दृष्टिकोण महत्वपूर्ण लागत बचत सक्षम करता है, क्योंकि स्थानीय इन्फेंस प्रति-टोकन API शुल्क से बचाता है। यह स्वाभाविक रूप से गोपनीयता और बौद्धिक संपदा चिंताओं को भी हल करता है: निजी टोकन को कभी भी रिमोट क्लस्टर में प्रसारित करने की आवश्यकता नहीं होती है और वे स्थानीय डिवाइस की सीमा के भीतर सुरक्षित रूप से रहते हैं।
जून में, हमने पहला हाइब्रिड लोकल-सर्वर इन्फेंस ऑर्केस्ट्रेटर पेश किया जो यह तय करता है कि कौन सा काम डिवाइस पर चलना चाहिए और कौन सा काम क्लाउड में एजेंटों के पास जाना चाहिए। यहाँ हम बताते हैं कि हमने ऐसा लोकल-फ़र्स्ट एजेंट कैसे बनाया, जिसमें हार्नेस और एक-दूसरे के लिए सह-अनुकूलित मॉडल शामिल हैं।
हम मुख्य डिज़ाइन विकल्पों का अवलोकन देते हैं, तीन सार्वजनिक बेंचमार्क और हमारे आंतरिक लोकल नॉलेज वर्क बेंच में लोकप्रिय ओपन-सोर्स सामान्य-उद्देश्य वाले हार्नेस (Hermes और Pi) के मुकाबले Computer का मूल्यांकन करते हैं। हमारे बेंचमार्क पर, NVIDIA DGX Spark पर चलने वाले Qwen 3.8 27B मॉडल के साथ, Computer उच्चतम स्कोर प्राप्त करता है, Pi के लिए 77.6% और Hermes के लिए 74.0% की तुलना में 82.6%। PPLX 27B, Qwen 3.8 27B के शीर्ष पर हमारा पोस्ट-ट्रेन किया गया मॉडल, स्कोर को और बढ़ाकर 85.4% कर देता है।
स्थानीय मॉडल के चारों ओर हार्नेस डिज़ाइन करें
हालांकि कॉम्पैक्ट ऑन-डिफ़्वाइस मॉडल पहले से ही काफी सक्षम हैं, फिर भी वे प्रदर्शन में बड़े फ़्रंटियर मॉडल से पीछे हैं। इन मॉडलों को प्रभावी ढंग से मार्गदर्शन करने और उनकी सीमाओं को दूर करने के लिए एक सावधानीपूर्वक डिज़ाइन किए गए हार्नेस की आवश्यकता होती है।
Pi और Hermes जैसे लोकप्रिय ओपन-सोर्स हार्नेस सामान्य साबित हुए हैं: वे आकार और वर्गों की एक विस्तृत विविधता वाले मॉडल के साथ अच्छी तरह से काम करते हैं। लेकिन वे ऑन-डिफ़्वाइस मॉडल की क्षमताओं के लिए अनुकूलित नहीं हैं। हमने इस सेटिंग के लिए विशेष रूप से स्थानीय हार्नेस को कुछ मुख्य सिद्धांतों के इर्द-गिर्द डिज़ाइन किया है।
संदर्भ दक्षता
हमारे हार्नेस को डिज़ाइन करने में मुख्य ध्यान मॉडल के संदर्भ का सर्वोत्तम उपयोग करना था।
यद्यपि Qwen 3.8 27B जैसे ऑन-डिफ़्वाइस मॉडल 260K टोकन की संदर्भ विंडो प्रदान करते हैं, हमने अनुभवजन्य रूप से पाया कि वे 100K टोकन से परे संघर्ष करने लगते हैं। इसलिए हम कोर हार्नेस को संक्षिप्त रखते हैं: एक न्यूनतम सिस्टम प्रॉम्प्ट और कोर टूल का एक छोटा सेट।
अन्य सभी क्षमताओं को ऑन-डिमांड कौशल में मॉड्यूलर किया जाता है जो पूरे ट्रेजेक्ट्री के दौरान लोड और अनलोड होते हैं। हमने सामान्य ज्ञान-कार्य कार्यों के लिए इन कौशलों को डिज़ाइन किया है: अनुसंधान, डेटा विज्ञान, डेटा विज़ुअलाइज़ेशन, दस्तावेज़ निर्माण, सॉफ़्टवेयर इंजीनियरिंग, और बहुत कुछ।
हार्नेस संदर्भ कॉम्पैक्शन का भी समर्थन करता है, जब कोई ट्रेजेक्ट्री लंबी हो जाती है तो बासी संदर्भ का सारांश देता है ताकि मॉडल अपनी प्रभावी विंडो के भीतर रहे।
कमांड-लाइन टूल के रूप में कनेक्टर
दिन-प्रतिदिन के ज्ञान कार्य के लिए अक्सर Gmail, GitHub, Outlook और Google Calendar जैसे कनेक्टर की आवश्यकता होती है। इन्हें आमतौर पर MCP सर्वर के रूप में हार्नेस के सामने उजागर किया जाता है, जिनकी बड़ी टूल परिभाषाएँ संदर्भ का एक बड़ा हिस्सा उपभोग करती हैं। इसके बजाय, हमने सबसे अधिक उपयोग किए जाने वाले MCPs को कॉम्पैक्ट, उपयोग में आसान कमांड-लाइन टूल में परिवर्तित कर दिया, जिन्हें कस्टम कौशल के साथ पूरक किया गया जो सीमित प्रभावी संदर्भ का बहुत बेहतर उपयोग करते हैं।
स्व-सत्यापन
जब एजेंट अपने स्वयं के कार्य को सत्यापित करता है तो प्रदर्शन में भी सुधार होता है। सत्यापन अतिरिक्त कदम जोड़ता है, लेकिन यह अंतिम परिणामों में काफी सुधार करता है और फ़्रंटियर मॉडल के अंतर को काफी हद तक कम करता है। इसे मॉडल द्वारा स्वयं या हुक के एक सेट द्वारा ट्रिगर किया जा सकता है जो ट्रेजेक्ट्री के स्वास्थ्य की निगरानी करते हैं और कुछ गलत होने पर स्व-सत्यापन का अनुरोध करते हैं।
सैंडबॉक्स्ड निष्पादन
हार्नेस उपयोगकर्ता के डिवाइस पर OS-स्तरीय सैंडबॉक्स में टूल निष्पादित करता है। सीमा नीति के अनुसार प्रक्रियाओं, फ़ाइल सिस्टम पथ और नेटवर्क एक्सेस को प्रतिबंधित करती है। यह एक त्रुटिपूर्ण कमांड के विस्फोट त्रिज्या को सीमित करता है। यदि सैंडबॉक्स अनुपलब्ध है, तो हार्नेस अनसैंडबॉक्स्ड निष्पादन के लिए कम होने के बजाय किसी भी टूल कॉल से पहले खुद को अक्षम कर देता है।
यह Pi और Hermes जैसे ओपन-सोर्स हार्नेस से अलग है, जो डिफ़ॉल्ट रूप से उपयोगकर्ता की अनुमति के साथ सीधे कमांड चलाते हैं। Computer में, आइसोलेशन हमेशा चालू रहता है, इसके लिए किसी कॉन्फ़िगरेशन की आवश्यकता नहीं होती है, और इसके बिना टूल नहीं चल सकते हैं।
नीचे दिया गया आरेख दिखाता है कि ये सिद्धांत निष्पादन लूप में कैसे फिट बैठते हैं। ऑर्केस्ट्रेटर नियतात्मक हार्नेस कोड है, LLM नहीं: यह लूप को बनाए रखता है, संदर्भ को इकट्ठा करता है, और नीति को लागू करता है। स्थानीय मॉडल अगली कार्रवाई का प्रस्ताव करता है; ऑर्केस्ट्रेटर सैंडबॉक्स में स्वीकृत टूल कॉल निष्पादित करता है और उनके परिणाम मॉडल को लौटाता है। वेब सर्च, कनेक्टर और एडवाइज़र कॉल केवल तभी और जब सक्षम और स्वीकृत हों, डिवाइस की सीमा को पार करते हैं।
एक स्थानीय हार्नेस उसी मॉडल का अधिक लाभ उठाता है
समान ऑन-डिफ़्वाइस बेस मॉडल का उपयोग करके, हम वेब रिसर्च और मल्टीमॉडल दस्तावेज़ समझ पर सामान्य-उद्देश्य वाले विकल्पों के साथ हमारे स्थानीय हार्नेस की तुलना करते हैं। सभी हार्नेस NVIDIA DGX Spark पर चलने वाले मध्यम तर्क के साथ Qwen 3.8 27B मॉडल का उपयोग करते हैं। यह तुलना किसी भी मॉडल पोस्ट-ट्रेंडिंग से पहले, हार्नेस द्वारा ही योगदान की गई क्षमताओं को अलग करती है।
हम इन दो क्षमताओं पर ध्यान केंद्रित करते हैं क्योंकि ज्ञान कार्य अक्सर ग्राउंडेड आर्टिफ़ैक्ट का उत्पादन करने के लिए उपयोगकर्ता के डिवाइस पर निजी दस्तावेजों को वेब से सार्वजनिक जानकारी के साथ जोड़ता है। वेब सर्च के लिए कनेक्टिविटी की आवश्यकता होती है, लेकिन मॉडल इन्फेंस और निजी-दस्तावेज़ प्रसंस्करण स्थानीय बने रहते हैं। स्थानीय फ़ाइलें आधिकारिक स्रोत के रूप में काम करती हैं, सार्वजनिक स्रोत संदर्भ जोड़ते हैं, और उपयोगकर्ता पूरी तरह से ऑफ़लाइन कार्य के लिए वेब सर्च को पूरी तरह से अक्षम कर सकते हैं।
वेब रिसर्च
हम Perplexity के सर्च इंजन के साथ अपना स्थानीय हार्नेस बनाते हैं, जिसने स्वतंत्र मूल्यांकन में शीर्ष रैंकिंग हासिल की है। हार्नेस Search as Code इंटरफ़ेस के माध्यम से इस तक पहुँचता है।
हम 1,266 BrowseComp कार्यों पर शोध गुणवत्ता का मूल्यांकन करते हैं। Computer हमारे स्थानीय हार्नेस के साथ Perplexity के सर्च इन्फ्रास्ट्रक्चर का उपयोग करता है, जबकि Pi और Hermes अपने अनुशंसित सर्च प्रदाता Brave पर भरोसा करते हैं। Computer 66.7% सटीकता तक पहुँचता है, जिसकी तुलना में Pi के लिए 50.2% और Hermes के लिए 43.9% है।
Computer में सबसे कम औसत रिकॉर्ड किया गया वॉल समय और टोकन उपयोग भी है: प्रति कार्य 402.1 सेकंड और 852k टोकन, जबकि Hermes के लिए 1,020.9 सेकंड और 1.01 मिलियन टोकन, और Pi के लिए 826.0 सेकंड और 2.82 मिलियन टोकन हैं। इसलिए Computer Hermes की तुलना में 61% कम वॉल समय और 16% कम टोकन का उपयोग करता है, और Pi की तुलना में 51% कम वॉल समय और 70% कम टोकन का उपयोग करता है।
ऑन-डिफ़्वाइस मल्टीमॉडल दस्तावेज़ समझ
कई दस्तावेज़ दृश्य रूप से जानकारी ले जाते हैं और सादे पाठ के रूप में पार्स करना मुश्किल होता है: PDF, स्कैन किए गए पृष्ठ, स्क्रीनशॉट, चार्ट और प्रस्तुतियाँ। ये वर्कफ़्लो OCR और छवि समझ पर निर्भर करते हैं, और स्वाभाविक रूप से मल्टीमॉडल मॉडल से सबसे अधिक लाभ उठाते हैं।
हार्नेस दस्तावेज़ पृष्ठों और छवियों को सीधे मॉडल को पास करता है, जो उन्हें समझता है और निकाले गए पाठ के साथ दृश्य साक्ष्य को जोड़ता है। डिवाइस पर इन फ़ाइलों को संसाधित करने से संवेदनशील दस्तावेज़ और उनकी निकाली गई सामग्री निजी रहती है।
हम ParseBench-100 पर मल्टीmodal दस्तावेज़ समझ का मूल्यांकन करते हैं, जो ParseBench बेंचमार्क का 100-कार्य सबसेट है, जिसमें चार्ट, लेआउट, टेबल, टेक्स्ट सामग्री और फ़ॉर्मेटिंग में से प्रत्येक के लिए 20 कार्य शामिल हैं।
Computer 65.1% का औसत स्कोर प्राप्त करता है, जबकि Hermes के लिए 34.6% और Pi के लिए 13.9% है। यह सबसे कम समय और सबसे कम टोकन के साथ कार्य भी पूरा करता है: प्रति कार्य औसतन 60.6 सेकंड और 20.1k टोकन, जबकि Hermes के लिए 108.3 सेकंड और 32.1k टोकन, और Pi के लिए 410.5 सेकंड और 829.1k टोकन हैं। Computer सभी पाँच दस्तावेज़ श्रेणियों में अग्रणी है, जिसमें चार्ट पर इसका सबसे बड़ा लाभ है। लेआउट सभी तीन हार्नेस के लिए कठिन बना हुआ है।
सारणी 1. ऑन-डिवाइस Qwen 3.8 27B मॉडल के साथ Computer, Hermes और Pi हार्नेस के लिए दस्तावेज़ श्रेणी द्वारा ParseBench-100 औसत स्कोर। Computer सभी पाँच श्रेणियों में अग्रणी है।
हार्नेस | चार्ट | लेआउट | टेबल | पाठ सामग्री | फ़ॉर्मेटिंग |
Computer | 76.5% | 16.2% | 72.7% | 87.9% | 72.4% |
Hermes | 29.3% | 2.9% | 44.1% | 61.5% | 35.2% |
Pi | 2.5% | 0.1% | 11.0% | 29.7% | 26.1% |
सलाहकार एस्केलेशन के साथ फ़्रंटियर अंतर को कम करना
सावधानीपूर्वक डिज़ाइन किए गए हार्नेस के साथ भी, सबसे कठिन कार्य अभी भी कॉम्पैक्ट ऑन-डिफ़्वाइस मॉडल की क्षमताओं से अधिक हैं। ऐसे कार्यों के लिए, हार्नेस एक एडवाइज़र टूल उजागर करता है: जब इसे योजना बनाने, अस्पष्टता को हल करने, बार-बार विफलताओं से उबरने, या अंतिम परिणाम को सत्यापित करने में मदद की आवश्यकता होती है, तो स्थानीय मॉडल एक मजबूत फ़्रंटियर मॉडल से परामर्श कर सकता है।
स्थानीय मॉडल तय करता है कि सलाह का अनुरोध कब करना है, जबकि हार्नेस ऑर्केस्ट्रेटर टूल अधिकार बनाए रखता है और नियंत्रित करता है कि कौन सा संदर्भ भेजा जाता है। एस्केलेशन वैकल्पिक है। उपयोगकर्ता तय करता है कि इसे सक्षम करना है या नहीं और प्रत्येक एडवाइज़र कॉल को मैन्युअल रूप से या स्वचालित रूप से स्वीकृत करना है या नहीं।
एडवाइज़र कॉल से पहले, हार्नेस प्रासंगिक संदर्भ का चयन करता है, संवेदनशील जानकारी को चिह्नित करने के लिए PII क्लासिफायर लागू करता है, और उपयोगकर्ता को दिखाता है कि डिवाइस से क्या बाहर जाएगा। एडवाइज़र को केवल स्वीकृत संदर्भ प्राप्त होता है और यह पाठ मार्गदर्शन लौटाता है; इसकी डिवाइस की फ़ाइलों, टूल या बातचीत तक कोई प्रत्यक्ष पहुँच नहीं है। यह लागत और गोपनीयता दोनों में सुधार करता है, और हम भविष्य के कार्य में इस दिशा का और अधिक पता लगाने की योजना बना रहे हैं।
हम चुनौतीपूर्ण सॉफ्टवेयर इंजीनियरिंग कार्यों पर इस दृष्टिकोण का परीक्षण करते हैं, जिनकी मजबूत तर्क की आवश्यकता होती है और जहाँ एक स्थानीय मॉडल सबसे अधिक बार कम पड़ता है। इसके लिए हम कोडिंग एजेंटों के लिए एक लोकप्रिय 89-कार्य बेंचमार्क Terminal Bench 2.1 का उपयोग करते हैं।
हम दो सवालों के जवाब देना चाहते हैं: फ़्रंटियर मॉडल के अंतर का कितना हिस्सा एडवाइज़र एस्केलेशन बंद कर सकता है, और किस कीमत पर। पूरी तरह से स्थानीय मॉडल चलाने के लिए लगभग कुछ भी खर्च नहीं होता है, क्योंकि इन्फेंस उपयोगकर्ता के हार्डवेयर पर होता है। हालांकि, एक बार जब मॉडल एडवाइज़र को कॉल करना शुरू कर देता है, तो यह API लागत उठाना शुरू कर देता है।
फ़्रंटियर प्रदर्शन के लिए बेसलाइन के रूप में, हम स्थानीय हार्नेस में काम करने वाले Claude Opus 5 का उपयोग करते हैं; स्थानीय मॉडल Qwen 3.8 27B है। अंत में, हम दोनों को जोड़ते हैं: Qwen 3.8 27B कार्य को निष्पादित करता है और मदद की आवश्यकता होने पर Claude Opus 5 एडवाइज़र तक एस्केलेट करता है। हम Pi या Hermes के साथ एडवाइज़र एस्केलेशन का मूल्यांकन नहीं करते हैं क्योंकि दोनों में से कोई भी समकक्ष एडवाइज़र टूल प्रदान नहीं करता है; एक को जोड़ने के लिए इसकी टूल सतह और ऑर्केस्ट्रम लॉजिक को संशोधित करने की आवश्यकता होगी, इसलिए परिणाम अब शेल्फ से बाहर का हार्नेस नहीं रहेगा।
एडवाइज़र एस्केलेशन Computer के स्कोर को 59.6% से बढ़ाकर 73.0% कर देता है, जो प्रति रोलआउट $0.415 की अनुमानित API लागत पर 13.5 प्रतिशत अंकों की वृद्धि है। अकेले Claude Opus 5 को चलाना प्रति रोलआउट $0.65 पर 82.4% तक पहुँच जाता है। इस प्रकार एस्केलेशन फ़्रंटियर की लागत के लगभग दो-तिहाई हिस्से पर फ़्रंटियर के अंतर के लगभग तीन-पाँचवें हिस्से को पुनर्प्राप्त करता है, और उपयोगकर्ता तय करता है कि वह व्यापार कब करने लायक है।
हार्नेस और ज्ञान कार्य के लिए पोस्ट-ट्रेनिंग
अब तक, हमने हार्नेस के योगदान को अलग करने के लिए स्थानीय मॉडल को अपरिवर्तित रखा है। हार्नेस डिज़ाइन के स्थान पर होने के बाद, सबसे बड़े शेष लाभ मॉडल को ही अनुकूलित करने से आते हैं। Perplexity Computer उपयोग डेटा हमें दिखाता है कि लोग वास्तव में ज्ञान कार्य के लिए क्या करते हैं, जिसका उपयोग हम प्रशिक्षण डेटा को संश्लेषित करने के लिए करते हैं। हम उपयोगकर्ताओं द्वारा किए जाने वाले कार्यों के वास्तविक वितरण द्वारा निर्देशित Computer हार्नेस के भीतर स्थानीय मॉडल को पोस्ट-ट्रेन करते हैं।
विशेष रूप से, हम उपयोग के मामलों के एक विविध सेट की पहचान करते हैं जो विभिन्न मॉडल क्षमताओं, टूल और कनेक्टर का अभ्यास करते हैं। इन उपयोग के मामलों से हम यथार्थवादी सुदृढीकरण शिक्षण वातावरण को संश्लेषित करते हैं और चुनौतीपूर्ण लेकिन सत्यापन योग्य कार्यों को परिभाषित करते हैं: प्रत्येक कार्य में एक निर्देश, एक वातावरण, और एक वेरिफ़ायर शामिल होता है जो अंतिम परिणाम को स्कोर करता है, जहाँ वातावरण एक Docker कंटेनर है जिसमें हार्नेस संचालित होता है। महत्वपूर्ण रूप से, क्योंकि कार्य सिंथेटिक हैं, उनमें कोई वास्तविक दस्तावेज़ या उपयोगकर्ता जानकारी नहीं होती है।
हम दो-चरण के प्रशिक्षण के लिए इन वातावरणों का उपयोग करते हैं: रिजेक्शन फ़ाइन-ट्यूनिंग जिसके बाद सुदृढीकरण शिक्षण होता है। पहले चरण में, हम प्रत्येक कार्य के खिलाफ मॉडल को कई बार रोल आउट करते हैं, वेरिफ़ायर स्कोर द्वारा सर्वश्रेष्ठ ट्रेजेक्ट्री का चयन करते हैं, और सुपरवाइज़्ड लर्निंग के साथ उन पर प्रशिक्षण देते हैं। यह चरण विशिष्ट हार्नेस और कार्य वितरण के लिए मॉडल को प्रारंभ करता है। दूसरे चरण में, सुदृढीकरण शिक्षण मॉडल को और अधिक फ़ाइन-ट्यून करता है, जिससे यह अधिक मजबूत हो जाता है।
कार्यों का एक सबसेट प्रशिक्षण से बाहर रखा जाता है और अंतिम मूल्यांकन के लिए उपयोग किया जाता है; हम इस होल्ड-आउट सेट को लोकल नॉलेज वर्क बेंच कहते हैं: दिन-प्रतिदिन के ज्ञान कार्य की सात श्रेणियों में फैले 53 कार्य, गहरे शोध से लेकर दस्तावेज़ निर्माण तक। हम जल्द ही एक तकनीकी रिपोर्ट प्रकाशित करेंगे जो मॉडल प्रशिक्षण का विस्तार से वर्णन करती है, और हम इस मूल्यांकन बेंचमार्क को ओपन-सोर्स करने की योजना बना रहे हैं।
हमने इस दृष्टिकोण के साथ Qwen 3.8 27B को पोस्ट-ट्रेन किया, जिससे एक मॉडल तैयार हुआ जिसे हम PPLX 27B कहते हैं, और लोकल नॉलेज वर्क बेंच पर इसका मूल्यांकन किया। बेस Qwen 3.8 27B मॉडल के साथ, Computer उच्चतम स्कोर (82.6%, Pi के लिए 77.6% और Hermes के लिए 74.0% की तुलना में) प्राप्त करता है और सबसे कम टोकन (520k, Pi के लिए 681k और Hermes के लिए 634k की तुलना में) का उपयोग करता है। Pi प्रति कार्य 176 सेकंड पर सबसे तेज़ी से कार्य पूरा करता है, जबकि Computer के लिए 218 सेकंड और Hermes के लिए 292 सेकंड हैं। PPLX 27B Computer के स्कोर को 85.4% तक बढ़ाता है, अधिक टोकन (520k बनाम 678k) की लागत पर। इसका अनुमानित वॉल समय 250 सेकंड है।
सारणी 2. लोकल नॉलेज वर्क बेंच कार्य श्रेणियाँ।
श्रेणी | कार्य | शेयर | विवरण |
गहन शोध | 20 | 37.7% | जटिल प्रश्नों के उत्तर दें जिनके लिए मल्टी-हॉप वेब रिसर्च, सार्वजनिक डेटासेट, सांख्यिकी और स्रोत सत्यापन की आवश्यकता होती है। |
डेटा, वित्त और प्रोक्योरमेंट | 9 | 17.0% | डेटासेट को साफ़ करें, रिकॉर्ड का मिलान करें, खर्चों का ऑडिट करें, निवेश का विश्लेषण करें, आपूर्तिकर्ताओं का मूल्यांकन करें, और वित्तीय मेट्रिक्स की गणना करें। |
दस्तावेज़, प्रस्तुतियाँ और डिज़ाइन | 7 | 13.2% | पॉलिश्ड PDF, चालान, ऑनबोर्डिंग सामग्री, इवेंट संपार्श्विक और व्यावसायिक प्रस्तुतियाँ तैयार करें। |
इंजीनियरिंग, IT और घटनाएँ | 5 | 9.4% | घटनाओं की जाँच करें, लॉग का विश्लेषण करें, पुनर्प्राप्ति योजनाएँ लिखें, रिलीज़ की तैयारी का आकलन करें, और तकनीकी दस्तावेज़ीकरण को संश्लेषित करें। |
अनुबंध, साक्ष्य और अनुपालन | 5 | 9.4% | अनुबंधों की समीक्षा करें, साक्ष्यों की जाँच करें, रीकॉल की जाँच करें, संवेदनशील दस्तावेजों को रेडीक्ट करें, और अनुपालन आवश्यकताओं को सत्यापित करें। |
डैशबोर्ड, सॉफ्टवेयर और विज़ुअलाइज़ेशन | 4 | 7.5% | इंटरैक्टिव डैशबोर्ड, शैक्षिक माइक्रोसाइट्स, चार्ट और प्रोजेक्ट विज़ुअलाइज़ेशन बनाएँ। |
लोग, परियोजनाएं और बैठकें | 3 | 5.7% | बायोडाटा की जाँच करें, बैठक के निर्णयों को समेकित करें, और प्रोजेक्ट एक्शन ट्रैकर बनाए रखें। |
कुल | 53 | 100% |
निष्कर्ष
हमारा शोध से पता चलता है कि एक मजबूत ओपन-सोर्स मॉडल, सक्षम स्थानीय हार्डवेयर और उनके लिए निर्मित हार्नेस संवेदनशील डेटा को डिवाइस से बाहर छोड़ने की आवश्यकता के बिना लगभग-शून्य इन्फेंस लागत पर वास्तविक ज्ञान कार्य को संभाल सकता है।
विभिन्न बेंचमार्क में, Computer ने NVIDIA DGX Spark पर Qwen 3.8 27B चलाते समय सटीकता में Hermes और Pi से मेल खाया या उससे अधिक हो गया। तीन बेंचमार्क में से जो विलंबता और टोकन उपयोग की रिपोर्ट करते हैं, Computer BrowseComp और ParseBench-100 पर सबसे तेज़ था और तीनों पर सबसे कम टोकन का उपयोग करता था; Pi लोकल नॉलेज वर्क बेंच पर सबसे तेज़ था।
लाभ हमारे द्वारा किए गए विकल्पों से आए। हमने ऑन-डिमांड लोड होने वाले कौशल के साथ एक संक्षिप्त स्थानीय हार्नेस बनाया। हमने MCP सर्वर के बजाय कनेक्टर को कॉम्पैक्ट CLI टूल में परिवर्तित किया। सुरक्षा के लिए निष्पादन सैंडबॉक्स्ड था।
परिणाम यह भी दिखाते हैं कि कॉम्पैक्ट मॉडल के पास सुधार के लिए कहाँ गुंजाइश है। उदाहरण के लिए, Terminal Bench 2.1 के चुनौतीपूर्ण कोडिंग कार्यों पर, स्थानीय मॉडल सभी तीन हार्नेस में फ़्रंटियर मॉडल से पीछे है। सलाहकार एस्केलेशन अंतराल को कम करता है लेकिन पूरी तरह से बंद नहीं करता है; प्रदर्शन को और आगे बढ़ाने के लिए मॉडल क्षमताओं और स्थानीय हार्डवेयर में निरंतर सुधार अभी भी आवश्यक हैं।
स्थानीय बाधाओं के लिए हार्नेस और मॉडल बनाने का उद्देश्य उपयोगकर्ताओं को इस बात पर स्पष्ट नियंत्रण देना है कि कौन सी जानकारी उनकी मशीनों को छोड़ती है। उपयोगकर्ता के लिए लागत लाभ भी हैं। हम इन्हें एक व्यापक बदलाव के हिस्से के रूप में देखते हैं जिसमें तेजी से सक्षम एजेंट रिमोट इन्फ्रास्ट्रक्चर से व्यक्तिगत और स्थानीय उपकरणों में चले जाते हैं। हम उम्मीद करते हैं कि चिप्स, मॉडल और उपकरणों में प्रगति लगातार ज्ञान कार्य की सीमा का विस्तार करेगी जिसे Portable Computer स्थानीय रूप से संभाल सकता है।