निजी और लागत प्रभावी ज्ञान कार्य के लिए एक लोकल-फ़र्स्ट एजेंट

स्थानीय ज्ञान कार्य के लिए सह-डिज़ाइन किया गया एक हार्नेस और मॉडल, डिवाइस पर चल रहा है और मांग पर रिमोट क्षमताओं तक पहुँच रहा है।

लेखकPerplexity Research

Perplexity Portable Computer एक लोकल-फ़र्स्ट एजेंट है।

पूरा स्टैक डिफ़ॉल्ट रूप से स्थानीय स्तर पर चलता है। मॉडल, हार्नेस, बातचीत और ट्रेजेक्ट्री सभी उपयोगकर्ता की मशीन पर रहते हैं। जिन कार्यों के लिए बाहरी दुनिया की आवश्यकता होती है, जैसे कि वेब सर्च, कनेक्टर, या क्लाउड पर किसी मजबूत एडवाइज़र मॉडल तक एस्केलेशन, उन्हें केवल तभी और जब आवश्यक हो तब调用 किया जाता है और हमेशा उपयोगकर्ता द्वारा नियंत्रित किया जाता है। इसलिए संवेदनशील डेटा बिना अनुमति के कभी भी डिवाइस से बाहर नहीं जाता है, और स्थानीय मॉडल पर कोई इन्फेंस शुल्क नहीं लगता है: यह सिस्टम अपनी संरचना से ही निजी और लागत प्रभावी है।

एक प्रभावी लोकल-फ़र्स्ट एजेंट के लिए मॉडल और हार्नेस को एक साथ डिज़ाइन करने की आवश्यकता होती है। सामान्य-उद्देश्य वाले हार्नेस एक ऐसे फ़्रंटियर मॉडल मानते हैं जो लंबे संदर्भों को अवशोषित कर सके, एक व्यापक टूल सतह को नेविगेट कर सके, और लंबी क्षितिज पर योजना बना सके। स्थानीय मॉडल उन माँगों के तहत कम विश्वसनीय होते हैं। एक छोटे मॉडल को बड़े मॉडल के लिए बने हार्नेस को प्रबंधित करने के लिए कहने के बजाय, हमने दोनों को एक-दूसरे के इर्द-गिर्द आकार दिया: मॉडल की क्षमता प्रोफ़ाइल के अनुरूप एक हार्नेस, और उस हार्नेस का प्रभावी ढंग से उपयोग करने के लिए पोस्ट-ट्रेन किया गया एक मॉडल।

परिचय

हाल के महीनों में ज्ञान-कार्य कार्यों की एक विस्तृत श्रृंखला में एजेंट क्षमताएं तेजी से उन्नत हुई हैं। हालांकि इन अग्रिमों से उत्पादकता और दक्षता में बड़े लाभ मिलते हैं, लेकिन वे दो चुनौतियाँ भी पैदा करते हैं।

टोकन की खपत तेज़ी से बढ़ रही है, और इसके साथ कुल खर्च भी। जब रिमोट क्लस्टर पर चलने वाले क्लोज्ड-सोर्स मॉडल के API के माध्यम से इंटेलिजेंस तक पहुँचा जाता है, तो हर अनुरोध के साथ निजी जानकारी और बौद्धिक संपदा उपयोगकर्ता के डिवाइस से बाहर चली जाती है। जैसे-जैसे एजेंट व्यक्तिगत वर्कफ़्लो और पूरे संगठनों में स्केल करते हैं, टोकन का खर्च और डेटा का मूवमेंट को नियंत्रित करना तेजी से कठिन होता जाता है।

साथ ही, ओपन-सोर्स मॉडल और भी तेज़ी से सुधरे हैं। प्रगति बहुत छोटे और कुशल मॉडल जैसे कि NVIDIA Nemotron 3.5 Lightning (कुल 30B पैरामीटर), Qwen 3.6 (35B), और Qwen 3.8 (27B) में सबसे अधिक दिखाई देती है। ये छोटे मॉडल अपने वजन से अधिक प्रदर्शन करते हैं और अब जटिल एजेंट वर्कफ़्लो सक्षम हैं। लोकल-इन्फेंस हार्डवेयर समानांतर रूप से आगे बढ़ रहा है: NVIDIA DGX Spark जैसे सिस्टम अब इन मॉडल को स्थानीय रूप से चला सकते हैं। साथ में, ये रुझान पूरी तरह से ऑन-डिफ़्वाइस ऑपरेशन को व्यावहारिक बनाते हैं जबकि उपयोगकर्ताओं को आवश्यकता पड़ने पर बाहरी क्षमताओं, जैसे कि वेब सर्च, कनेक्टर, या क्लाउड-मॉडल एस्केलेशन का विकल्प चुनने की अनुमति देते हैं।

यह लोकल-फ़र्स्ट दृष्टिकोण महत्वपूर्ण लागत बचत सक्षम करता है, क्योंकि स्थानीय इन्फेंस प्रति-टोकन API शुल्क से बचाता है। यह स्वाभाविक रूप से गोपनीयता और बौद्धिक संपदा चिंताओं को भी हल करता है: निजी टोकन को कभी भी रिमोट क्लस्टर में प्रसारित करने की आवश्यकता नहीं होती है और वे स्थानीय डिवाइस की सीमा के भीतर सुरक्षित रूप से रहते हैं।

जून में, हमने पहला हाइब्रिड लोकल-सर्वर इन्फेंस ऑर्केस्ट्रेटर पेश किया जो यह तय करता है कि कौन सा काम डिवाइस पर चलना चाहिए और कौन सा काम क्लाउड में एजेंटों के पास जाना चाहिए। यहाँ हम बताते हैं कि हमने ऐसा लोकल-फ़र्स्ट एजेंट कैसे बनाया, जिसमें हार्नेस और एक-दूसरे के लिए सह-अनुकूलित मॉडल शामिल हैं।

हम मुख्य डिज़ाइन विकल्पों का अवलोकन देते हैं, तीन सार्वजनिक बेंचमार्क और हमारे आंतरिक लोकल नॉलेज वर्क बेंच में लोकप्रिय ओपन-सोर्स सामान्य-उद्देश्य वाले हार्नेस (Hermes और Pi) के मुकाबले Computer का मूल्यांकन करते हैं। हमारे बेंचमार्क पर, NVIDIA DGX Spark पर चलने वाले Qwen 3.8 27B मॉडल के साथ, Computer उच्चतम स्कोर प्राप्त करता है, Pi के लिए 77.6% और Hermes के लिए 74.0% की तुलना में 82.6%। PPLX 27B, Qwen 3.8 27B के शीर्ष पर हमारा पोस्ट-ट्रेन किया गया मॉडल, स्कोर को और बढ़ाकर 85.4% कर देता है।

लोकल नॉलेज वर्क बेंच स्कोर का बार चार्ट: Qwen 3.8 27B के साथ Computer, Pi और Hermes हार्नेस, और PPLX 27B के साथ Computer, जो 85.4% पर उच्चतम स्कोर करता है।
लोकल नॉलेज वर्क बेंच पर स्कोर, 53 प्रतिनिधि दिन-प्रतिदिन के ज्ञान-कार्य कार्यों का हमारा बेंचमार्क। प्रत्येक बार NVIDIA DGX Spark पर चलने वाला एक हार्नेस और मॉडल संयोजन है; PPLX 27B हमारा पोस्ट-ट्रेन किया गया मॉडल है। प्रति कार्य तीन परीक्षण; व्हिस्कर 95% विश्वास अंतराल हैं।

स्थानीय मॉडल के चारों ओर हार्नेस डिज़ाइन करें

हालांकि कॉम्पैक्ट ऑन-डिफ़्वाइस मॉडल पहले से ही काफी सक्षम हैं, फिर भी वे प्रदर्शन में बड़े फ़्रंटियर मॉडल से पीछे हैं। इन मॉडलों को प्रभावी ढंग से मार्गदर्शन करने और उनकी सीमाओं को दूर करने के लिए एक सावधानीपूर्वक डिज़ाइन किए गए हार्नेस की आवश्यकता होती है।

Pi और Hermes जैसे लोकप्रिय ओपन-सोर्स हार्नेस सामान्य साबित हुए हैं: वे आकार और वर्गों की एक विस्तृत विविधता वाले मॉडल के साथ अच्छी तरह से काम करते हैं। लेकिन वे ऑन-डिफ़्वाइस मॉडल की क्षमताओं के लिए अनुकूलित नहीं हैं। हमने इस सेटिंग के लिए विशेष रूप से स्थानीय हार्नेस को कुछ मुख्य सिद्धांतों के इर्द-गिर्द डिज़ाइन किया है।

संदर्भ दक्षता

हमारे हार्नेस को डिज़ाइन करने में मुख्य ध्यान मॉडल के संदर्भ का सर्वोत्तम उपयोग करना था।

यद्यपि Qwen 3.8 27B जैसे ऑन-डिफ़्वाइस मॉडल 260K टोकन की संदर्भ विंडो प्रदान करते हैं, हमने अनुभवजन्य रूप से पाया कि वे 100K टोकन से परे संघर्ष करने लगते हैं। इसलिए हम कोर हार्नेस को संक्षिप्त रखते हैं: एक न्यूनतम सिस्टम प्रॉम्प्ट और कोर टूल का एक छोटा सेट।

अन्य सभी क्षमताओं को ऑन-डिमांड कौशल में मॉड्यूलर किया जाता है जो पूरे ट्रेजेक्ट्री के दौरान लोड और अनलोड होते हैं। हमने सामान्य ज्ञान-कार्य कार्यों के लिए इन कौशलों को डिज़ाइन किया है: अनुसंधान, डेटा विज्ञान, डेटा विज़ुअलाइज़ेशन, दस्तावेज़ निर्माण, सॉफ़्टवेयर इंजीनियरिंग, और बहुत कुछ।

हार्नेस संदर्भ कॉम्पैक्शन का भी समर्थन करता है, जब कोई ट्रेजेक्ट्री लंबी हो जाती है तो बासी संदर्भ का सारांश देता है ताकि मॉडल अपनी प्रभावी विंडो के भीतर रहे।

कमांड-लाइन टूल के रूप में कनेक्टर

दिन-प्रतिदिन के ज्ञान कार्य के लिए अक्सर Gmail, GitHub, Outlook और Google Calendar जैसे कनेक्टर की आवश्यकता होती है। इन्हें आमतौर पर MCP सर्वर के रूप में हार्नेस के सामने उजागर किया जाता है, जिनकी बड़ी टूल परिभाषाएँ संदर्भ का एक बड़ा हिस्सा उपभोग करती हैं। इसके बजाय, हमने सबसे अधिक उपयोग किए जाने वाले MCPs को कॉम्पैक्ट, उपयोग में आसान कमांड-लाइन टूल में परिवर्तित कर दिया, जिन्हें कस्टम कौशल के साथ पूरक किया गया जो सीमित प्रभावी संदर्भ का बहुत बेहतर उपयोग करते हैं।

स्व-सत्यापन

जब एजेंट अपने स्वयं के कार्य को सत्यापित करता है तो प्रदर्शन में भी सुधार होता है। सत्यापन अतिरिक्त कदम जोड़ता है, लेकिन यह अंतिम परिणामों में काफी सुधार करता है और फ़्रंटियर मॉडल के अंतर को काफी हद तक कम करता है। इसे मॉडल द्वारा स्वयं या हुक के एक सेट द्वारा ट्रिगर किया जा सकता है जो ट्रेजेक्ट्री के स्वास्थ्य की निगरानी करते हैं और कुछ गलत होने पर स्व-सत्यापन का अनुरोध करते हैं।

सैंडबॉक्स्ड निष्पादन

हार्नेस उपयोगकर्ता के डिवाइस पर OS-स्तरीय सैंडबॉक्स में टूल निष्पादित करता है। सीमा नीति के अनुसार प्रक्रियाओं, फ़ाइल सिस्टम पथ और नेटवर्क एक्सेस को प्रतिबंधित करती है। यह एक त्रुटिपूर्ण कमांड के विस्फोट त्रिज्या को सीमित करता है। यदि सैंडबॉक्स अनुपलब्ध है, तो हार्नेस अनसैंडबॉक्स्ड निष्पादन के लिए कम होने के बजाय किसी भी टूल कॉल से पहले खुद को अक्षम कर देता है।

यह Pi और Hermes जैसे ओपन-सोर्स हार्नेस से अलग है, जो डिफ़ॉल्ट रूप से उपयोगकर्ता की अनुमति के साथ सीधे कमांड चलाते हैं। Computer में, आइसोलेशन हमेशा चालू रहता है, इसके लिए किसी कॉन्फ़िगरेशन की आवश्यकता नहीं होती है, और इसके बिना टूल नहीं चल सकते हैं।

नीचे दिया गया आरेख दिखाता है कि ये सिद्धांत निष्पादन लूप में कैसे फिट बैठते हैं। ऑर्केस्ट्रेटर नियतात्मक हार्नेस कोड है, LLM नहीं: यह लूप को बनाए रखता है, संदर्भ को इकट्ठा करता है, और नीति को लागू करता है। स्थानीय मॉडल अगली कार्रवाई का प्रस्ताव करता है; ऑर्केस्ट्रेटर सैंडबॉक्स में स्वीकृत टूल कॉल निष्पादित करता है और उनके परिणाम मॉडल को लौटाता है। वेब सर्च, कनेक्टर और एडवाइज़र कॉल केवल तभी और जब सक्षम और स्वीकृत हों, डिवाइस की सीमा को पार करते हैं।

स्थानीय हार्नेस निष्पादन लूप का आरेख: नियतात्मक ऑर्केस्ट्रेटर कोड संदर्भ को इकट्ठा करता है और सैंडबॉक्स्ड टूल चलाता है, स्थानीय मॉडल क्रियाओं का प्रस्ताव करता है, और ऑफ़-डिफ़्वाइस सेवाएँ वैकल्पिक और उपयोगकर्ता-नियंत्रित होती हैं।
स्थानीय हार्नेस किसी कार्य को कैसे चलाता है। नियतात्मक हार्नेस कोड लूप और सैंडबॉक्स्ड टूल को नियंत्रित करता है; स्थानीय मॉडल क्रियाओं का प्रस्ताव करता है। ऑफ़-डिफ़्वाइस सेवाएँ वैकल्पिक और उपयोगकर्ता-नियंत्रित होती हैं।

एक स्थानीय हार्नेस उसी मॉडल का अधिक लाभ उठाता है

समान ऑन-डिफ़्वाइस बेस मॉडल का उपयोग करके, हम वेब रिसर्च और मल्टीमॉडल दस्तावेज़ समझ पर सामान्य-उद्देश्य वाले विकल्पों के साथ हमारे स्थानीय हार्नेस की तुलना करते हैं। सभी हार्नेस NVIDIA DGX Spark पर चलने वाले मध्यम तर्क के साथ Qwen 3.8 27B मॉडल का उपयोग करते हैं। यह तुलना किसी भी मॉडल पोस्ट-ट्रेंडिंग से पहले, हार्नेस द्वारा ही योगदान की गई क्षमताओं को अलग करती है।

हम इन दो क्षमताओं पर ध्यान केंद्रित करते हैं क्योंकि ज्ञान कार्य अक्सर ग्राउंडेड आर्टिफ़ैक्ट का उत्पादन करने के लिए उपयोगकर्ता के डिवाइस पर निजी दस्तावेजों को वेब से सार्वजनिक जानकारी के साथ जोड़ता है। वेब सर्च के लिए कनेक्टिविटी की आवश्यकता होती है, लेकिन मॉडल इन्फेंस और निजी-दस्तावेज़ प्रसंस्करण स्थानीय बने रहते हैं। स्थानीय फ़ाइलें आधिकारिक स्रोत के रूप में काम करती हैं, सार्वजनिक स्रोत संदर्भ जोड़ते हैं, और उपयोगकर्ता पूरी तरह से ऑफ़लाइन कार्य के लिए वेब सर्च को पूरी तरह से अक्षम कर सकते हैं।

वेब रिसर्च

हम Perplexity के सर्च इंजन के साथ अपना स्थानीय हार्नेस बनाते हैं, जिसने स्वतंत्र मूल्यांकन में शीर्ष रैंकिंग हासिल की है। हार्नेस Search as Code इंटरफ़ेस के माध्यम से इस तक पहुँचता है।

हम 1,266 BrowseComp कार्यों पर शोध गुणवत्ता का मूल्यांकन करते हैं। Computer हमारे स्थानीय हार्नेस के साथ Perplexity के सर्च इन्फ्रास्ट्रक्चर का उपयोग करता है, जबकि Pi और Hermes अपने अनुशंसित सर्च प्रदाता Brave पर भरोसा करते हैं। Computer 66.7% सटीकता तक पहुँचता है, जिसकी तुलना में Pi के लिए 50.2% और Hermes के लिए 43.9% है।

Computer में सबसे कम औसत रिकॉर्ड किया गया वॉल समय और टोकन उपयोग भी है: प्रति कार्य 402.1 सेकंड और 852k टोकन, जबकि Hermes के लिए 1,020.9 सेकंड और 1.01 मिलियन टोकन, और Pi के लिए 826.0 सेकंड और 2.82 मिलियन टोकन हैं। इसलिए Computer Hermes की तुलना में 61% कम वॉल समय और 16% कम टोकन का उपयोग करता है, और Pi की तुलना में 51% कम वॉल समय और 70% कम टोकन का उपयोग करता है।

Qwen 3.8 27B के साथ Computer, Hermes और Pi के लिए प्रति कार्य औसत वॉल समय बनाम BrowseComp स्कोर का स्कैटर प्लॉट; Computer सबसे कम समय और सबसे कम टोकन के साथ उच्चतम स्कोर तक पहुँचता है।
ऑन-डिफ़्वाइस Qwen 3.8 27B मॉडल के साथ BrowseComp परिणाम: Computer, Hermes और Pi हार्नेस के लिए प्रति कार्य औसत वॉल समय बनाम स्कोर; बिंदु लेবেল प्रति कार्य औसत टोकन दिखाते हैं। अपूर्ण परिणाम शून्य स्कोर करते हैं, और समय और टोकन औसत रिकॉर्ड किए गए माप के बिना रोलआउट को बाहर करते हैं। व्हिस्कर स्कोर के लिए 95% विल्सन विश्वास अंतराल हैं।

ऑन-डिफ़्वाइस मल्टीमॉडल दस्तावेज़ समझ

कई दस्तावेज़ दृश्य रूप से जानकारी ले जाते हैं और सादे पाठ के रूप में पार्स करना मुश्किल होता है: PDF, स्कैन किए गए पृष्ठ, स्क्रीनशॉट, चार्ट और प्रस्तुतियाँ। ये वर्कफ़्लो OCR और छवि समझ पर निर्भर करते हैं, और स्वाभाविक रूप से मल्टीमॉडल मॉडल से सबसे अधिक लाभ उठाते हैं।

हार्नेस दस्तावेज़ पृष्ठों और छवियों को सीधे मॉडल को पास करता है, जो उन्हें समझता है और निकाले गए पाठ के साथ दृश्य साक्ष्य को जोड़ता है। डिवाइस पर इन फ़ाइलों को संसाधित करने से संवेदनशील दस्तावेज़ और उनकी निकाली गई सामग्री निजी रहती है।

हम ParseBench-100 पर मल्टीmodal दस्तावेज़ समझ का मूल्यांकन करते हैं, जो ParseBench बेंचमार्क का 100-कार्य सबसेट है, जिसमें चार्ट, लेआउट, टेबल, टेक्स्ट सामग्री और फ़ॉर्मेटिंग में से प्रत्येक के लिए 20 कार्य शामिल हैं।

Computer 65.1% का औसत स्कोर प्राप्त करता है, जबकि Hermes के लिए 34.6% और Pi के लिए 13.9% है। यह सबसे कम समय और सबसे कम टोकन के साथ कार्य भी पूरा करता है: प्रति कार्य औसतन 60.6 सेकंड और 20.1k टोकन, जबकि Hermes के लिए 108.3 सेकंड और 32.1k टोकन, और Pi के लिए 410.5 सेकंड और 829.1k टोकन हैं। Computer सभी पाँच दस्तावेज़ श्रेणियों में अग्रणी है, जिसमें चार्ट पर इसका सबसे बड़ा लाभ है। लेआउट सभी तीन हार्नेस के लिए कठिन बना हुआ है।

Qwen 3.8 27B के साथ Computer, Hermes और Pi के लिए प्रति कार्य औसत वॉल समय बनाम ParseBench-100 OCR स्कोर का स्कैटर प्लॉट; Computer सबसे कम समय और सबसे कम टोकन के साथ उच्चतम स्कोर तक पहुँचता है।
ऑन-डिफ़्वाइस Qwen 3.8 27B मॉडल के साथ ParseBench-100 OCR परिणाम: Computer, Hermes और Pi हार्नेस के लिए प्रति कार्य औसत वॉल समय बनाम स्कोर; बिंदु लेबल प्रति कार्य औसत टोकन दिखाते हैं। टोकन औसत रिकॉर्ड किए गए माप के साथ रोलआउट का उपयोग करते हैं। व्हिस्कर 95% विश्वास अंतराल हैं।

सारणी 1. ऑन-डिवाइस Qwen 3.8 27B मॉडल के साथ Computer, Hermes और Pi हार्नेस के लिए दस्तावेज़ श्रेणी द्वारा ParseBench-100 औसत स्कोर। Computer सभी पाँच श्रेणियों में अग्रणी है।

हार्नेस

चार्ट

लेआउट

टेबल

पाठ सामग्री

फ़ॉर्मेटिंग

Computer

76.5%

16.2%

72.7%

87.9%

72.4%

Hermes

29.3%

2.9%

44.1%

61.5%

35.2%

Pi

2.5%

0.1%

11.0%

29.7%

26.1%

सलाहकार एस्केलेशन के साथ फ़्रंटियर अंतर को कम करना

सावधानीपूर्वक डिज़ाइन किए गए हार्नेस के साथ भी, सबसे कठिन कार्य अभी भी कॉम्पैक्ट ऑन-डिफ़्वाइस मॉडल की क्षमताओं से अधिक हैं। ऐसे कार्यों के लिए, हार्नेस एक एडवाइज़र टूल उजागर करता है: जब इसे योजना बनाने, अस्पष्टता को हल करने, बार-बार विफलताओं से उबरने, या अंतिम परिणाम को सत्यापित करने में मदद की आवश्यकता होती है, तो स्थानीय मॉडल एक मजबूत फ़्रंटियर मॉडल से परामर्श कर सकता है।

स्थानीय मॉडल तय करता है कि सलाह का अनुरोध कब करना है, जबकि हार्नेस ऑर्केस्ट्रेटर टूल अधिकार बनाए रखता है और नियंत्रित करता है कि कौन सा संदर्भ भेजा जाता है। एस्केलेशन वैकल्पिक है। उपयोगकर्ता तय करता है कि इसे सक्षम करना है या नहीं और प्रत्येक एडवाइज़र कॉल को मैन्युअल रूप से या स्वचालित रूप से स्वीकृत करना है या नहीं।

एडवाइज़र कॉल से पहले, हार्नेस प्रासंगिक संदर्भ का चयन करता है, संवेदनशील जानकारी को चिह्नित करने के लिए PII क्लासिफायर लागू करता है, और उपयोगकर्ता को दिखाता है कि डिवाइस से क्या बाहर जाएगा। एडवाइज़र को केवल स्वीकृत संदर्भ प्राप्त होता है और यह पाठ मार्गदर्शन लौटाता है; इसकी डिवाइस की फ़ाइलों, टूल या बातचीत तक कोई प्रत्यक्ष पहुँच नहीं है। यह लागत और गोपनीयता दोनों में सुधार करता है, और हम भविष्य के कार्य में इस दिशा का और अधिक पता लगाने की योजना बना रहे हैं।

सलाहकार एस्केलेशन का आरेख: हार्नेस ऑर्केस्ट्रेटर टूल अधिकार बनाए रखता है और केवल स्वीकृत संदर्भ को सलाहकार मॉडल को भेजता है, जो टूल या फ़ाइलों तक प्रत्यक्ष पहुँच के बिना पाठ मार्गदर्शन लौटाता है।
रिमोट मार्गदर्शन, स्थानीय नियंत्रण। हार्नेस ऑर्केस्ट्रेटर टूल अधिकार बनाए रखता है और केवल एस्केलेशन के लिए स्वीकृत संदर्भ भेजता है। सलाहकार की टूल, फ़ाइलों या प्रतिक्रिया चैनल तक कोई प्रत्यक्ष पहुँच नहीं है; यह पाठ मार्गदर्शन लौटाता है जिसका उपयोग स्थानीय मॉडल कर सकता है।

हम चुनौतीपूर्ण सॉफ्टवेयर इंजीनियरिंग कार्यों पर इस दृष्टिकोण का परीक्षण करते हैं, जिनकी मजबूत तर्क की आवश्यकता होती है और जहाँ एक स्थानीय मॉडल सबसे अधिक बार कम पड़ता है। इसके लिए हम कोडिंग एजेंटों के लिए एक लोकप्रिय 89-कार्य बेंचमार्क Terminal Bench 2.1 का उपयोग करते हैं।

हम दो सवालों के जवाब देना चाहते हैं: फ़्रंटियर मॉडल के अंतर का कितना हिस्सा एडवाइज़र एस्केलेशन बंद कर सकता है, और किस कीमत पर। पूरी तरह से स्थानीय मॉडल चलाने के लिए लगभग कुछ भी खर्च नहीं होता है, क्योंकि इन्फेंस उपयोगकर्ता के हार्डवेयर पर होता है। हालांकि, एक बार जब मॉडल एडवाइज़र को कॉल करना शुरू कर देता है, तो यह API लागत उठाना शुरू कर देता है।

फ़्रंटियर प्रदर्शन के लिए बेसलाइन के रूप में, हम स्थानीय हार्नेस में काम करने वाले Claude Opus 5 का उपयोग करते हैं; स्थानीय मॉडल Qwen 3.8 27B है। अंत में, हम दोनों को जोड़ते हैं: Qwen 3.8 27B कार्य को निष्पादित करता है और मदद की आवश्यकता होने पर Claude Opus 5 एडवाइज़र तक एस्केलेट करता है। हम Pi या Hermes के साथ एडवाइज़र एस्केलेशन का मूल्यांकन नहीं करते हैं क्योंकि दोनों में से कोई भी समकक्ष एडवाइज़र टूल प्रदान नहीं करता है; एक को जोड़ने के लिए इसकी टूल सतह और ऑर्केस्ट्रम लॉजिक को संशोधित करने की आवश्यकता होगी, इसलिए परिणाम अब शेल्फ से बाहर का हार्नेस नहीं रहेगा।

एडवाइज़र एस्केलेशन Computer के स्कोर को 59.6% से बढ़ाकर 73.0% कर देता है, जो प्रति रोलआउट $0.415 की अनुमानित API लागत पर 13.5 प्रतिशत अंकों की वृद्धि है। अकेले Claude Opus 5 को चलाना प्रति रोलआउट $0.65 पर 82.4% तक पहुँच जाता है। इस प्रकार एस्केलेशन फ़्रंटियर की लागत के लगभग दो-तिहाई हिस्से पर फ़्रंटियर के अंतर के लगभग तीन-पाँचवें हिस्से को पुनर्प्राप्त करता है, और उपयोगकर्ता तय करता है कि वह व्यापार कब करने लायक है।

Terminal Bench 2.1 स्कोर बनाम प्रति रोलआउट API लागत का स्कैटर प्लॉट: Qwen 3.8 27B पूरी तरह से स्थानीय, Claude Opus 5 सलाहकार के साथ Qwen 3.8 27B, और अकेले Claude Opus 5, सभी Computer हार्नेस में।
89 कार्यों पर Terminal Bench 2.1 लागत-प्रदर्शन: स्कोर बनाम प्रति रोलआउट API लागत। सभी बिंदु Computer हार्नेस का उपयोग करते हैं: Qwen 3.8 27B पूरी तरह से स्थानीय, Claude Opus 5 सलाहकार तक एस्केलेट करने वाला Qwen 3.8 27B, और अकेले Claude Opus 5। डैश की गई लाइनें शून्य API लागत पर समान स्थानीय मॉडल चलाने वाले Pi और Hermes को दिखाती हैं। व्हिस्कर कार्य-बूस्ट्रैप 95% विश्वास अंतराल हैं; अपूर्ण रोलआउट शून्य स्कोर करते हैं।

हार्नेस और ज्ञान कार्य के लिए पोस्ट-ट्रेनिंग

अब तक, हमने हार्नेस के योगदान को अलग करने के लिए स्थानीय मॉडल को अपरिवर्तित रखा है। हार्नेस डिज़ाइन के स्थान पर होने के बाद, सबसे बड़े शेष लाभ मॉडल को ही अनुकूलित करने से आते हैं। Perplexity Computer उपयोग डेटा हमें दिखाता है कि लोग वास्तव में ज्ञान कार्य के लिए क्या करते हैं, जिसका उपयोग हम प्रशिक्षण डेटा को संश्लेषित करने के लिए करते हैं। हम उपयोगकर्ताओं द्वारा किए जाने वाले कार्यों के वास्तविक वितरण द्वारा निर्देशित Computer हार्नेस के भीतर स्थानीय मॉडल को पोस्ट-ट्रेन करते हैं।

विशेष रूप से, हम उपयोग के मामलों के एक विविध सेट की पहचान करते हैं जो विभिन्न मॉडल क्षमताओं, टूल और कनेक्टर का अभ्यास करते हैं। इन उपयोग के मामलों से हम यथार्थवादी सुदृढीकरण शिक्षण वातावरण को संश्लेषित करते हैं और चुनौतीपूर्ण लेकिन सत्यापन योग्य कार्यों को परिभाषित करते हैं: प्रत्येक कार्य में एक निर्देश, एक वातावरण, और एक वेरिफ़ायर शामिल होता है जो अंतिम परिणाम को स्कोर करता है, जहाँ वातावरण एक Docker कंटेनर है जिसमें हार्नेस संचालित होता है। महत्वपूर्ण रूप से, क्योंकि कार्य सिंथेटिक हैं, उनमें कोई वास्तविक दस्तावेज़ या उपयोगकर्ता जानकारी नहीं होती है।

हम दो-चरण के प्रशिक्षण के लिए इन वातावरणों का उपयोग करते हैं: रिजेक्शन फ़ाइन-ट्यूनिंग जिसके बाद सुदृढीकरण शिक्षण होता है। पहले चरण में, हम प्रत्येक कार्य के खिलाफ मॉडल को कई बार रोल आउट करते हैं, वेरिफ़ायर स्कोर द्वारा सर्वश्रेष्ठ ट्रेजेक्ट्री का चयन करते हैं, और सुपरवाइज़्ड लर्निंग के साथ उन पर प्रशिक्षण देते हैं। यह चरण विशिष्ट हार्नेस और कार्य वितरण के लिए मॉडल को प्रारंभ करता है। दूसरे चरण में, सुदृढीकरण शिक्षण मॉडल को और अधिक फ़ाइन-ट्यून करता है, जिससे यह अधिक मजबूत हो जाता है।

कार्यों का एक सबसेट प्रशिक्षण से बाहर रखा जाता है और अंतिम मूल्यांकन के लिए उपयोग किया जाता है; हम इस होल्ड-आउट सेट को लोकल नॉलेज वर्क बेंच कहते हैं: दिन-प्रतिदिन के ज्ञान कार्य की सात श्रेणियों में फैले 53 कार्य, गहरे शोध से लेकर दस्तावेज़ निर्माण तक। हम जल्द ही एक तकनीकी रिपोर्ट प्रकाशित करेंगे जो मॉडल प्रशिक्षण का विस्तार से वर्णन करती है, और हम इस मूल्यांकन बेंचमार्क को ओपन-सोर्स करने की योजना बना रहे हैं।

हमने इस दृष्टिकोण के साथ Qwen 3.8 27B को पोस्ट-ट्रेन किया, जिससे एक मॉडल तैयार हुआ जिसे हम PPLX 27B कहते हैं, और लोकल नॉलेज वर्क बेंच पर इसका मूल्यांकन किया। बेस Qwen 3.8 27B मॉडल के साथ, Computer उच्चतम स्कोर (82.6%, Pi के लिए 77.6% और Hermes के लिए 74.0% की तुलना में) प्राप्त करता है और सबसे कम टोकन (520k, Pi के लिए 681k और Hermes के लिए 634k की तुलना में) का उपयोग करता है। Pi प्रति कार्य 176 सेकंड पर सबसे तेज़ी से कार्य पूरा करता है, जबकि Computer के लिए 218 सेकंड और Hermes के लिए 292 सेकंड हैं। PPLX 27B Computer के स्कोर को 85.4% तक बढ़ाता है, अधिक टोकन (520k बनाम 678k) की लागत पर। इसका अनुमानित वॉल समय 250 सेकंड है।

लोकल नॉलेज वर्क बेंच स्कोर बनाम प्रति कार्य औसत वॉल समय का स्कैटर प्लॉट; Computer में चलने वाला PPLX 27B 85.4% पर उच्चतम स्कोर तक पहुँचता है।
लोकल नॉलेज वर्क बेंच पर पोस्ट-ट्रेनिंग परिणाम: स्कोर बनाम प्रति कार्य औसत वॉल समय; बिंदु लेबल हार्नेस, मॉडल और प्रति कार्य औसत टोकन दिखाते हैं। PPLX 27B हमारा पोस्ट-ट्रेन किया गया मॉडल है, जो Computer में चल रहा है। व्हिस्कर प्रत्येक तीन परीक्षणों के साथ 53 कार्यों पर 95% विश्वास अंतराल हैं।

सारणी 2. लोकल नॉलेज वर्क बेंच कार्य श्रेणियाँ।

श्रेणी

कार्य

शेयर

विवरण

गहन शोध

20

37.7%

जटिल प्रश्नों के उत्तर दें जिनके लिए मल्टी-हॉप वेब रिसर्च, सार्वजनिक डेटासेट, सांख्यिकी और स्रोत सत्यापन की आवश्यकता होती है।

डेटा, वित्त और प्रोक्योरमेंट

9

17.0%

डेटासेट को साफ़ करें, रिकॉर्ड का मिलान करें, खर्चों का ऑडिट करें, निवेश का विश्लेषण करें, आपूर्तिकर्ताओं का मूल्यांकन करें, और वित्तीय मेट्रिक्स की गणना करें।

दस्तावेज़, प्रस्तुतियाँ और डिज़ाइन

7

13.2%

पॉलिश्ड PDF, चालान, ऑनबोर्डिंग सामग्री, इवेंट संपार्श्विक और व्यावसायिक प्रस्तुतियाँ तैयार करें।

इंजीनियरिंग, IT और घटनाएँ

5

9.4%

घटनाओं की जाँच करें, लॉग का विश्लेषण करें, पुनर्प्राप्ति योजनाएँ लिखें, रिलीज़ की तैयारी का आकलन करें, और तकनीकी दस्तावेज़ीकरण को संश्लेषित करें।

अनुबंध, साक्ष्य और अनुपालन

5

9.4%

अनुबंधों की समीक्षा करें, साक्ष्यों की जाँच करें, रीकॉल की जाँच करें, संवेदनशील दस्तावेजों को रेडीक्ट करें, और अनुपालन आवश्यकताओं को सत्यापित करें।

डैशबोर्ड, सॉफ्टवेयर और विज़ुअलाइज़ेशन

4

7.5%

इंटरैक्टिव डैशबोर्ड, शैक्षिक माइक्रोसाइट्स, चार्ट और प्रोजेक्ट विज़ुअलाइज़ेशन बनाएँ।

लोग, परियोजनाएं और बैठकें

3

5.7%

बायोडाटा की जाँच करें, बैठक के निर्णयों को समेकित करें, और प्रोजेक्ट एक्शन ट्रैकर बनाए रखें।

कुल

53

100%

निष्कर्ष

हमारा शोध से पता चलता है कि एक मजबूत ओपन-सोर्स मॉडल, सक्षम स्थानीय हार्डवेयर और उनके लिए निर्मित हार्नेस संवेदनशील डेटा को डिवाइस से बाहर छोड़ने की आवश्यकता के बिना लगभग-शून्य इन्फेंस लागत पर वास्तविक ज्ञान कार्य को संभाल सकता है।

विभिन्न बेंचमार्क में, Computer ने NVIDIA DGX Spark पर Qwen 3.8 27B चलाते समय सटीकता में Hermes और Pi से मेल खाया या उससे अधिक हो गया। तीन बेंचमार्क में से जो विलंबता और टोकन उपयोग की रिपोर्ट करते हैं, Computer BrowseComp और ParseBench-100 पर सबसे तेज़ था और तीनों पर सबसे कम टोकन का उपयोग करता था; Pi लोकल नॉलेज वर्क बेंच पर सबसे तेज़ था।

लाभ हमारे द्वारा किए गए विकल्पों से आए। हमने ऑन-डिमांड लोड होने वाले कौशल के साथ एक संक्षिप्त स्थानीय हार्नेस बनाया। हमने MCP सर्वर के बजाय कनेक्टर को कॉम्पैक्ट CLI टूल में परिवर्तित किया। सुरक्षा के लिए निष्पादन सैंडबॉक्स्ड था।

परिणाम यह भी दिखाते हैं कि कॉम्पैक्ट मॉडल के पास सुधार के लिए कहाँ गुंजाइश है। उदाहरण के लिए, Terminal Bench 2.1 के चुनौतीपूर्ण कोडिंग कार्यों पर, स्थानीय मॉडल सभी तीन हार्नेस में फ़्रंटियर मॉडल से पीछे है। सलाहकार एस्केलेशन अंतराल को कम करता है लेकिन पूरी तरह से बंद नहीं करता है; प्रदर्शन को और आगे बढ़ाने के लिए मॉडल क्षमताओं और स्थानीय हार्डवेयर में निरंतर सुधार अभी भी आवश्यक हैं।

स्थानीय बाधाओं के लिए हार्नेस और मॉडल बनाने का उद्देश्य उपयोगकर्ताओं को इस बात पर स्पष्ट नियंत्रण देना है कि कौन सी जानकारी उनकी मशीनों को छोड़ती है। उपयोगकर्ता के लिए लागत लाभ भी हैं। हम इन्हें एक व्यापक बदलाव के हिस्से के रूप में देखते हैं जिसमें तेजी से सक्षम एजेंट रिमोट इन्फ्रास्ट्रक्चर से व्यक्तिगत और स्थानीय उपकरणों में चले जाते हैं। हम उम्मीद करते हैं कि चिप्स, मॉडल और उपकरणों में प्रगति लगातार ज्ञान कार्य की सीमा का विस्तार करेगी जिसे Portable Computer स्थानीय रूप से संभाल सकता है।