ప్రైవేట్ మరియు కాస్ట్-ఎఫెక్టివ్ నాలెడ్జ్ వర్క్ కోసం లోకల్-ఫస్ట్ ఏజెంట్
స్థానిక నాలెడ్జ్ వర్క్ కోసం సహ-డిజైన్ చేయబడిన హర్నెస్ మరియు మోడల్, పరికరంలో రన్ అవుతుంది మరియు ఆన్-డిమాండ్ రిమోట్ సామర్థ్యాలను యాక్సెస్ చేస్తుంది.
Perplexity Portable Computer అనేది లోకల్-ఫస్ట్ ఏజెంట్.
మొత్తం స్టాక్ డిఫాల్ట్గా స్థానికంగా నడుస్తుంది. మోడల్, హర్నెస్, సంభాషణ మరియు ట్రాజెక్టరీ అన్నీ వినియోగదారు మెషీన్లోనే ఉంటాయి. వెబ్ శోధన, కనెక్టర్లు లేదా క్లౌడ్లో బలమైన అడ్వైజర్ మోడల్కు ఎస్కలేషన్ వంటి బయటి ప్రపంచం అవసరమైన పనులు అవసరమైనప్పుడు మాత్రమే మరియు ఎల్లప్పుడూ వినియోగదారు ద్వారా గేట్ చేయబడి ఉంటాయి. అందువల్ల సున్నితమైన డేటా అనుమతి లేకుండా ఎప్పటికీ పరికరాన్ని విడిచిపెట్టదు మరియు స్థానిక మోడల్లకు ఇన్ఫరెన్స్ ఫీజు ఉండாது: సిస్టమ్ ప్రైవేట్ మరియు కాస్ట్-ఎఫెక్టివ్గా నిర్మించబడింది.
సమర్థవంతమైన లోకల్-ఫస్ట్ ఏజెంట్ కోసం మోడల్ మరియు హర్నెస్ కలిసి డిజైన్ చేయబడాలి. జనరల్-పర్పస్ హర్నెస్లు పొడవైన సందర్భాలను గ్రహించగల, విస్తృత టూల్ ఉపరితలాన్ని నావిగేట్ చేయగల మరియు సుదీర్ఘ క్షితిజాలపై ప్లాన్ చేయగల ఫ్రాంటియర్ మోడల్ను ఊహిస్తాయి. స్థానిక మోడల్లు ఆ డిమాండ్ల క్రింద తక్కువ విశ్వసనీయతను కలిగి ఉంటాయి. పెద్ద దాని కోసం నిర్మించిన హర్నెస్ను నిర్వహించమని చిన్న మోడల్ను అడగడానికి బదులుగా, మేము రెండింటిని ఒకదానికొకటి ఆకారంలో చేసాము: మోడల్ సామర్థ్య ప్రొఫైల్కు తగినట్లుగా ఒక హర్నెస్ మరియు ఆ హర్నెస్ను సమర్థవంతంగా ఉపయోగించడానికి పోస్ట్-ట్రైన్ చేయబడిన మోడల్.
పరిచయం
ఇటీవలి నెలల్లో ఏజెంటిక్ సామర్థ్యాలు విస్తృత శ్రేణి నాలెడ్జ్-వర్క్ పనులలో వేగంగా అభివృద్ధి చెందాయి. ఈ పురోగతులు ఉత్పాదకత మరియు సామర్థ్యంలో భారీ లాభాలను తెచ్చినప్పటికీ, అవి రెండు సవాళ్లను కూడా విసురుతాయి.
టోకెన్ వినియోగం వేగంగా పెరుగుతోంది, దాంతోపాటు మొత్తం ఖర్చు కూడా పెరుగుతోంది. రిమోట్ క్లస్టర్లలో నడుస్తున్న క్లోజ్డ్-సోర్స్ మోడల్స్ యొక్క APIల ద్వారా ఇంటెలిజెన్స్ యాక్సెస్ చేయబడినప్పుడు, ప్రతి అభ్యర్థనతో ప్రైవేట్ సమాచారం మరియు మేధో సంపత్తి వినియోగదారు పరికరం నుండి బయటకు వెళ్తాయి. ఏజెంట్లు వ్యక్తిగత వర్క్ఫ్లోలు మరియు మొత్తం సంస్థలలో స్కేల్ అయినప్పుడు, టోకెన్ వ్యయం మరియు డేటా కదలికలను నియంత్రించడం చాలా కష్టమవుతుంది.
అదే సమయంలో, ఓపెన్-సోర్స్ మోడల్స్ మరింత వేగంగా మెరుగుపడ్డాయి. NVIDIA Nemotron 3.5 Lightning (30B మొత్తం పారామీటర్లు), Qwen 3.6 (35B), మరియు Qwen 3.8 (27B) వంటి చాలా చిన్న మరియు సమర్థవంతమైన మోడళ్లలో పురోగతి ఎక్కువగా కనిపిస్తుంది. ఈ చిన్న మోడల్లు తమ బరువుకు మించి పనిచేస్తాయి మరియు ఇప్పుడు సంక్లిష్టమైన ఏజెంటిక్ వర్క్ఫ్లోలకు సామర్థ్యం కలిగి ఉన్నాయి. లోకల్-ఇన్ఫరెన్స్ హార్డ్వేర్ సమాంతరంగా అభివృద్ధి చెందుతోంది: NVIDIA DGX Spark వంటి సిస్టమ్లు ఇప్పుడు ఈ మోడళ్లను స్థానికంగా రన్ చేయగలవు. కలిసి, ఈ ట్రెండ్లు వెబ్ శోధన, కనెక్టర్లు లేదా క్లౌడ్-మోడల్ ఎస్కలేషన్ వంటి బాహ్య సామర్థ్యాలను అవసరమైనప్పుడు ఎంచుకోవడానికి వినియోగదారులను అనుమతించేటప్పుడు పూర్తి ఆన్-డివైస్ ఆపరేషన్ను ఆచరణాత్మకంగా చేస్తాయి.
ఈ లోకల్-ఫస్ట్ అప్రోచ్ గణనీయమైన ఖర్చు ఆదాను అనుమతిస్తుంది, ఎందుకంటే స్థానిక ఇన్ఫరెన్స్ ప్రతి-టోకెన్ API ఫీజులను నివారిస్తుంది. ఇది గోప్యత మరియు మేధో సంపత్తి ఆందోళనలను కూడా సహజంగా పరిష్కరిస్తుంది: ప్రైవేట్ టోకెన్లు రిమోట్ క్లస్టర్లకు ఎప్పటికీ ప్రసారం చేయబడవు మరియు స్థానిక పరికరం సరిహద్దులో సురక్షితంగా ఉంటాయి.
జూన్లో, ఆన్లైన్లో ఏ పని రన్ అవ్వాలి మరియు ఏ పని క్లౌడ్లోని ఏజెంట్లకు వెళ్లాలో నిర్ణయించే మొదటి హైబ్రిడ్ లోకల్-సర్వర్ ఇన్ఫరెన్స్ ఆర్కెస్ట్రేటర్ను మేము పరిచయం చేసాము. హర్నెస్ మరియు ఒకదానికొకటి సహ-ఆప్టిమైజ్ చేయబడిన మోడళ్లతో సహా మేము అటువంటి లోకల్-ఫస్ట్ ఏజెంట్ను ఎలా నిర్మించామో ఇక్కడ మేము వివరిస్తాము.
మేము కీలకమైన డిజైన్ ఎంపికల యొక్క అవలోకనాన్ని అందిస్తాము, మూడు పబ్లిక్ బెంచ్మార్క్లు మరియు మా ఇంటర్నల్ లోకల్ నాలెడ్జ్ వర్క్ బెంచ్లో ప్రముఖ ఓపెన్-సోర్స్ జనరల్-పర్పస్ హర్నెస్లకు (Hermes మరియు Pi) వ్యతిరేకంగా Computerను మూల్యాంకనం చేస్తాము. మా బెంచ్మార్క్లో, NVIDIA DGX స్పార్క్పై రన్ అవుతున్న Qwen 3.8 27B మోడల్తో, Computer అత్యధిక స్కోర్ను సాధించింది, Pi కోసం 77.6% మరియు Hermes కోసం 74.0% తో పోలిస్తే 82.6%. Qwen 3.8 27B పైన పోస్ట్-ట్రైన్ చేయబడిన మా మోడల్ PPLX 27B, స్కోర్ను మరింతగా 85.4%కి పెంచుతుంది.
స్థానిక మోడల్ చుట్టూ హర్నెస్ను డిజైన్ చేయండి
కాంపాక్ట్ ఆన్-డివైస్ మోడల్స్ ఇప్పటికే చాలా సామర్థ్యం కలిగి ఉన్నప్పటికీ, అవి పనితీరులో పెద్ద ఫ్రాంటియర్ మోడల్ కంటే ఇంకా వెనుకబడి ఉన్నాయి. ఈ మోడళ్లను సమర్థవంతంగా నడిపించడానికి మరియు వాటి పరిమితులను పరిష్కరించడానికి జాగ్రత్తగా డిజైన్ చేయబడిన హర్నెస్ అవసరం.
Pi మరియు Hermes వంటి ప్రసిద్ధ ఓపెన్-సోర్స్ హర్నెస్లు జనరల్ అని నిరూపించబడ్డాయి: అవి పరిమాణాలు మరియు తరగతుల్లో విస్తృత శ్రేణి మోడళ్లతో బాగా పనిచేస్తాయి. కానీ అవి ఆన్-డివైస్ మోడల్స్ సామర్థ్యాల కోసం ఆప్టిమైజ్ చేయబడలేదు. మేము ఈ సెట్టింగ్ కోసం ప్రత్యేకంగా స్థానిక హర్నెస్ను కొన్ని కీలక సూత్రాల చుట్టూ డిజైన్ చేసాము.
కాంటెక్స్ట్ సామర్థ్యం
మా హర్నెస్ను డిజైన్ చేయడంలో ప్రధాన దృష్టి మోడల్ సందర్భాన్ని ఉత్తమంగా ఉపయోగించడం.
Qwen 3.8 27B వంటి ఆన్-డివైస్ మోడల్లు 260K టోకెన్ల కాంటెక్స్ట్ విండోలను అందిస్తున్నప్పటికీ, 100K టోకెన్లకు మించి అవి కష్టపడటం ప్రారంభించినట్లు మేము అనుభవపూర్వకంగా కనుగొన్నాము. అందువల్ల మేము కోర్ హర్నెస్ను సంక్షిప్తంగా ఉంచుతాము: కనిష్ట సిస్టమ్ ప్రాంప్ట్ మరియు చిన్న కోర్ టూల్స్ సెట్.
అన్ని ఇతర సామర్థ్యాలు ఆన్-డిమాండ్ నైపుణ్యాలుగా మాడ్యులరైజ్ చేయబడతాయి, ఇవి ట్రాజెక్టరీ అంతటా లోడ్ అవుతాయి మరియు అన్ఇన్స్టాల్ చేయబడతాయి. పరిశోధన, డేటా సైన్స్, డేటా విజువలైజేషన్, డాక్యుమెంట్ క్రియేషన్, సాఫ్ట్వేర్ ఇంజనీరింగ్ మరియు మరెన్నో సాధారణ నాలెడ్జ్-వర్క్ పనుల కోసం మేము ఈ నైపుణ్యాలను డిజైన్ చేసాము.
ట్రాజెక్టరీ పెద్దదిగా మారినప్పుడు పాత సందర్భాన్ని సారాంశం చేస్తూ, మోడల్ దాని ప్రభావవంతమైన విండోలోనే ఉండేలా హర్నెస్ కాంటెక్స్ట్ కాంపాక్షన్కు కూడా మద్దతు ఇస్తుంది.
కమాండ్-లైన్ టూల్స్గా కనెక్టర్లు
రోజువారీ నాలెడ్జ్ వర్క్ తరచుగా Gmail, GitHub, Outlook మరియు Google Calendar వంటి కనెక్టర్లు అవసరం. ఇవి సాధారణంగా MCP సర్వర్లుగా హర్నెస్కు బహిర్గతం చేయబడతాయి, వీటి పెద్ద టూల్ నిర్వచనాలు సందర్భంలో గణనీయమైన భాగాన్ని వినియోగిస్తాయి. బదులుగా, పరిమిత ప్రభావవంతమైన సందర్భాన్ని మెరుగ్గా ఉపయోగించుకునే కస్టమ్ నైపుణ్యాలతో పూरकంగా, మేము అత్యధికంగా ఉపయోగించే MCPలను కాంపాక్ట్, ఉపయోగించడానికి సులభమైన కమాండ్-లైన్ టూల్స్గా మార్చాము.
స్వీయ-ధృవీకరణ
ఏజెంట్ తన స్వంత పనిని ధృవీకరించినప్పుడు కూడా పనితీరు మెరుగుపడుతుంది. ధృవీకరణ అదనపు దశలను జోడిస్తుంది, అయితే ఇది తుది ఫలితాలను బాగా మెరుగుపరుస్తుంది మరియు ఫ్రాంటియర్ మోడల్లతో ఉన్న అంతరాన్ని గణనీయంగా తగ్గిస్తుంది. ఇది మోడల్ ద్వారా లేదా ట్రాజెక్టరీ ఆరోగ్యాన్ని పర్యవేక్షించే మరియు ఏదైనా తప్పు జరిగినప్పుడు స్వీయ-ధృవీకరణను అభ్యర్థించే కొన్ని హుక్స్ ద్వారా ట్రిగర్ చేయబడుతుంది.
శాండ్బాక్స్డ్ ఎక్సిక్యూషన్
హర్నెస్ వినియోగదారు పరికరంలోని OS-స్థాయి శాండ్బాక్స్లో టూల్స్ను అమలు చేస్తుంది. సరిహద్దు పాలసీ ప్రకారం ప్రక్రియలు, ఫైల్సిస్టమ్ మార్గాలు మరియు నెట్వర్క్ యాక్సెస్ను పరిమితం చేస్తుంది. ఇది తప్పు కమాండ్ యొక్క వ్యాప్తి పరిధిని పరిమితం చేస్తుంది. శాండ్బాక్స్ అందుబాటులో లేకపోతే, అన్శాండ్బాక్స్డ్ ఎక్సిక్యూషన్కు క్షీణించడానికి బదులుగా హర్నెస్ టూల్ కాల్ల కంటే ముందే తనను తాను నిలిపివేస్తుంది.
ఇది Pi మరియు Hermes వంటి ఓపెన్-సోర్స్ హర్నెస్ల నుండి భిన్నంగా ఉంటుంది, ఇవి డిఫాల్ట్గా వినియోగదారు అనుమతులతో నేరుగా కమాండ్లను రన్ చేస్తాయి. Computerలో, ఐసోలేషన్ ఎల్లప్పుడూ ఆన్లో ఉంటుంది, కాన్ఫిగరేషన్ అవసరం లేదు మరియు ఇది లేకుండా టూల్స్ రన్ కాలേవు.
ఎక్సిక్యూషన్ లూప్లో ఈ సూత్రాలు ఎలా సరిపోతాయో క్రింది రేఖాచిత్రం చూపుతుంది. ఆర్కెస్ట్రేటర్ అనేది డిటర్మినిస్టిక్ హర్నెస్ కోడ్, LLM కాదు: ఇది లూప్ను నిర్వహిస్తుంది, సందర్భాన్ని అసెంబ్లి చేస్తుంది మరియు పాలసీని అమలు చేస్తుంది. స్థానిక మోడల్ తదుపరి చర్యను ప్రతిపాదిస్తుంది; ఆర్కెస్ట్రేటర్ శాండ్బాక్స్లో ఆమోదించబడిన టూల్ కాల్లను అమలు చేస్తుంది మరియు వాటి ఫలితాలను మోడల్కు తిరిగి ఇస్తుంది. వెబ్ శోధన, కనెక్టర్లు మరియు అడ్వైజర్ కాల్లు ప్రారంభించబడినప్పుడు మరియు ఆమోదించబడినప్పుడు మాత్రమే పరికర సరిహద్దును దాటుతాయి.
స్థానిక హర్నెస్ అదే మోడల్ నుండి ఎక్కువ ఫలితాన్ని ఇస్తుంది
అదే ఆన్-డివైస్ బేస్ మోడల్ను ఉపయోగించి, వెబ్ పరిశోధన మరియు మల్టీమోడల్ డాక్యుమెంట్ అవగాహనపై జనరల్-పర్పస్ ప్రత్యామ్నాయాలతో మా స్థానిక హర్నెస్ను మేము పోల్చాము. అన్ని హర్నెస్లు NVIDIA DGX స్పార్క్పై రన్ అవుతున్న మీడియం రీజనింగ్తో Qwen 3.8 27B మోడల్ను ఉపయోగిస్తాయి. ఈ పోలిక మోడల్ పోస్ట్-ట్రైనింగ్కు ముందు, హర్నెస్ ద్వారా అందించబడిన సామర్థ్యాలను వేరు చేస్తుంది.
గ్రౌండెడ్ ఆర్టిఫ్యాక్ట్ను రూపొందించడానికి నాలెడ్జ్ వర్క్ తరచుగా వినియోగదారు పరికరంలోని ప్రైవేట్ డాక్యుమెంట్లను వెబ్ నుండి పబ్లిక్ సమాచారంతో మిళితం చేస్తుంది కాబట్టి మేము ఈ రెండు సామర్థ్యాలపై దృష్టి పెడతాము. వెబ్ శోధనకు కనెక్టివిటీ అవసరం, కానీ మోడల్ ఇన్ఫరెన్స్ మరియు ప్రైవేట్-డాక్యుమెంట్ ప్రాసెసింగ్ స్థానికంగానే ఉంటాయి. స్థానిక ఫైల్లు అధికారిక మూలంగా పనిచేస్తాయి, పబ్లిక్ మూలాలు సందర్భాన్ని జోడిస్తాయి మరియు పూర్తిగా ఆఫ్లైన్ పని కోసం వినియోగదారులు వెబ్ శోధనను పూర్తిగా నిలిపివేయవచ్చు.
వెబ్ పరిశోధన
स्वतंत्र मूल्यांकनలో అగ్రశ్రేణిని సాధించిన Perplexity శోధన ఇంజిన్తో పాటు మేము మా స్థానిక హర్నెస్ను నిర్మిస్తాము. హర్నెస్ Search as Code ఇంటర్ఫేస్ ద్వారా దీన్ని యాక్సెస్ చేస్తుంది.
1,266 BrowseComp పనులపై మేము పరిశోధన నాణ్యతను మూల్యాంకనం చేస్తాము. Computer మా స్థానిక హర్నెస్తో పాటు Perplexity శోధన మౌలిక సదుపాయాలను ఉపయోగిస్తుంది, అయితే Pi మరియు Hermes వారి సిఫార్సు చేయబడిన శోధన ప్రొవైడర్ అయిన Braveపై ఆధారపడతాయి. Pi కోసం 50.2% మరియు Hermes కోసం 43.9% తో పోలిస్తే Computer 66.7% ఖచ్చితత్త్వాన్ని చేరుకుంటుంది.
Computer అత్యల్ప సగటు రికార్డ్ చేయబడిన వాల్ టైమ్ మరియు టోకెన్ వినియోగాన్ని కూడా కలిగి ఉంది: ప్రతి పనికి 402.1 సెకన్లు మరియు 852k టోకెన్లు, Hermes కోసం 1,020.9 సెకన్లు మరియు 1.01 మిలియన్ టోకెన్లు, మరియు Pi కోసం 826.0 సెకన్లు మరియు 2.82 మిలియన్ టోకెన్లతో పోలిస్తే. అందువల్ల Computer Hermes కంటే 61% తక్కువ వాల్ టైమ్ను మరియు 16% తక్కువ టోకెన్లను, మరియు Pi కంటే 51% తక్కువ వాల్ టైమ్ను మరియు 70% తక్కువ టోకెన్లను ఉపయోగిస్తుంది.
ఆన్-డివైస్ మల్టీమోడల్ డాక్యుమెంట్ అవగాహన
ብዙ ሰነዶች መረጃን በእይታ ያስተላልፋሉ እና እንደ ተራ 텍스트 ለመተንተን አስቸጋሪ ናቸው: PDFዎች, የተቃኙ ገጾች, ቅጽበታዊ ገጽ እይታዎች, ገበታዎች እና አቀራረቦች. እነዚህ የሥራ ፍሰቶች በOCR እና በምስል ግንዛቤ ላይ የተመሰረቱ እና ከተወለዱ ጀምሮ ባለብዙ ሞዴል ሞዴል በእጅጉ ይጠቀማሉ።
హర్నెస్ డాక్యుమెంట్ పేజీలను మరియు చిత్రాలను నేరుగా మోడల్కు పంపుతుంది, ఇది వాటిని అర్థం చేసుకుంటుంది మరియు దృశ్య సాక్ష్యాలను సంగ్రహించిన టెక్స్ట్తో మిళితం చేస్తుంది. ఈ ఫైళ్లను పరికరంలో ప్రాసెస్ చేయడం వల్ల సున్నితమైన డాక్యుమెంట్లు మరియు వాటి సంగ్రహించిన కంటెంట్ ప్రైవేట్గా ఉంటాయి.
ParseBench బెంచ్మార్క్ యొక్క 100-ടാસ્ક సబ్సెట్ అయిన ParseBench-100 పై మల్టీమోడల్ డాక్యుమెంట్ అవగాహనను మేము మూల్యాంకనం చేస్తాము, ఇందులో చార్ట్లు, లేఅవుట్, టేబుల్స్, టెక్స్ట్ కంటెంట్ మరియు ఫార్మాటింగ్ కోసం ప్రతిదానికీ 20 పనులు ఉంటాయి.
Hermes కోసం 34.6% మరియు Pi కోసం 13.9% తో పోలిస్తే Computer 65.1% సగటు స్కోర్ను చేరుకుంటుంది. ఇది అత్యల్ప సమయం మరియు అత్యస్సల్ప టోకెన్లతో పనులను పూర్తి చేస్తుంది: ప్రతి పనికి సగటున 60.6 సెకన్లు మరియు 20.1k టోకెన్లు, Hermes కోసం 108.3 సెకన్లు మరియు 32.1k టోకెన్లు, మరియు Pi కోసం 410.5 సెకన్లు మరియు 829.1k టోకెన్లతో పోలిస్తే. Computer అన్ని ఐదు డాక్యుమెంట్ వర్గాలలో ముందంజలో ఉంది, చార్ట్లపై దీని అతిపెద్ద ప్రయోజనం ఉంది. మూడు హర్నెస్లకు లేఅవుట్ కష్టంగానే ఉంది.
పట్టిక 1. ఆన్-డివైస్ Qwen 3.8 27B మోడల్తో Computer, Hermes, మరియు Pi హర్నెస్ల కోసం డాక్యుమెంట్ వర్గం వారీగా ParseBench-100 సగటు స్కోర్. Computer అన్ని ఐదు వర్గాలలో ముందంజలో ఉంది.
హర్నెస్ | చార్ట్ | లేఅవుట్ | పట్టిక | టెక్స్ట్ కంటెంట్ | ఫార్మాటింగ్ |
Computer | 76.5% | 16.2% | 72.7% | 87.9% | 72.4% |
Hermes | 29.3% | 2.9% | 44.1% | 61.5% | 35.2% |
Pi | 2.5% | 0.1% | 11.0% | 29.7% | 26.1% |
ಅಡ್వైజర్ ఎస్కలేషన్తో ఫ్రాంటియర్ అంతరాన్ని తగ్గించడం
జాగ్రత్తగా డిజైన్ చేయబడిన హర్నెస్ ఉన్నప్పటికీ, అత్యంత కష్టమైన పనులు ఇప్పటికీ కాంపాక్ట్ ఆన్-డివైస్ మోడల్ సామర్థ్యాలను మించిపోతాయి. అటువంటి పనుల కోసం, హర్నెస్ అడ్వైజర్ టూల్ను బహిర్గతం చేస్తుంది: ప్లానింగ్, అస్పష్టతను పరిష్కరించడం, పునరావృత వైఫల్యాల నుండి కోలుకోవడం లేదా తుది ఫలితాన్ని ధృవీకరించడంలో సహాయం కావాల్సి వచ్చినప్పుడు స్థానిక మోడల్ బలమైన ఫ్రాంటియర్ మోడల్ను సంప్రదించవచ్చు.
స్థానిక మోడల్ సలహా కోసం ఎప్పుడు అడగాలో నిర్ణయిస్తుంది, అయితే హర్నెస్ ఆర్కెస్ట్రేటర్ టూల్ అధికారాన్ని కలిగి ఉంటుంది మరియు ఏ సందర్భం పంపబడుతుందో నియంత్రిస్తుంది. ఎస్కలేషన్ ఐచ్ఛికం. దానిని ప్రారంభించాలా వద్దా మరియు ప్రతి అడ్వైజర్ కాల్ని మాన్యువల్గా లేదా ఆటోమేటిక్గా ఆమోదించాలా వద్దా అని వినియోగదారు నిర్ణయిస్తారు.
ಅಡ್వైజర్ కాల్కు ముందు, హర్నెస్ సంబంధిత సందర్భాన్ని ఎంపిక చేస్తుంది, సున్నితమైన సమాచారాన్ని ఫ్లాగ్ చేయడానికి PII వర్గీకరణను వర్తింపజేస్తుంది మరియు పరికరం నుండి ఏది బయటకు వెళ్తుందో వినియోగదారుకు చూపుతుంది. అడ్వైజర్ ఆమోదించப்பட்ட సందర్భాన్ని మాత్రమే అందుకుంటుంది మరియు టెక్స్ట్ మార్గదర్శకత్వాన్ని అందిస్తుంది; దీనికి పరికర ఫైళ్లు, టూల్స్ లేదా సంభాషణలకు ప్రత్యక్ష ప్రాప్యత లేదు. ఇది ఖర్చు మరియు గోప్యత రెండింటినీ మెరుగుపరుస్తుంది, మరియు భవిష్యత్తులో ఈ దిశను మరింత అన్వేషಿಸಲು మేము ప్లాన్ చేస్తున్నాము.
బలమైన రీజనింగ్ అవసరమయ్యే మరియు స్థానిక మోడల్ తరచుగా తక్కువగా ఉండే సవాలుతో కూడిన సాఫ్ట్వేర్ ఇంజనీరింగ్ పనులపై మేము ఈ విధానాన్ని పరీక్షిస్తాము. దీని కోసం మేము కోడింగ్ ఏజెంట్ల కోసం జనాదరణ పొందిన 89-టాస్క్ బెంచ్మార్క్ అయిన Terminal Bench 2.1 ను ఉపయోగిస్తాము.
మేము రెండు ప్రశ్నలకు సమాధానం ఇవ్వాలనుకుంటున్నాము: ఫ్రాంటియర్ మోడల్తో ఎంత అంతరాన్ని అడ్వైజర్ ఎస్కలేషన్ మూసివేయగలదు మరియు ఎంత ఖర్చుతో. పూర్తిగా స్థానిక మోడళ్లను రన్ చేయడానికి వాస్తవంగా ఏ খরচೂ లేదు, ఎందుకంటే ఇన్ఫరెన్స్ వినియోగదారు హార్డ్వేర్లో జరుగుతుంది. అయితే, మోడల్ అడ్వైజర్కు కాల్ చేయడం ప్రారంభించిన తర్వాత, అది API ఖర్చులను భరించడం ప్రారంభಿಸುತ್ತದೆ.
ఫ్రాంటియర్ పనితీరు కోసం బేస్లైన్గా, మేము స్థానిక హర్నెస్లో పనిచేస్తున్న Claude Opus 5 ను ఉపయోగిస్తాము; స్థానిక మోడల్ Qwen 3.8 27B. చివరగా, మేము రెండింటిని జత చేస్తాము: Qwen 3.8 27B పనిని అమలు చేస్తుంది మరియు సహాయం కావాల్సి వచ్చినప్పుడు Claude Opus 5 అడ్వైజర్కు ఎస్కలేట్ చేస్తుంది. మేము Pi లేదా Hermes తో అడ్వైజర్ ఎస్కలేషన్ను మూల్యాంకనం చేయము ఎందుకంటే ఏదీ తత్సమాన అడ్వైజర్ టూల్ను అందించదు; ఒకదాన్ని జోడించడానికి దాని టూల్ ఉపరితలం మరియు ఆర్కెస్ట్రేషన్ లాజిక్ను సవరించవలసి ఉంటుంది, కాబట్టి ఫలితం ఇకపై ఆఫ్-ది-షెల్ఫ్ హర్నెస్ను ప్రతిబింబించదు.
అడ్వైజర్ ఎస్కలేషన్ Computer యొక్క స్కోర్ను 59.6% నుండి 73.0%కి పెంచుతుంది, ప్రతి రోల్అవుట్కు $0.415 అంచనా వేయబడిన API ఖర్చుతో 13.5 శాతం పాయింట్ల లాభం. Claude Opus 5 ను మాత్రమే రన్ చేయడం రోల్అవుట్కు $0.65 వద్ద 82.4%కి చేరుకుంటుంది. తద్వారా ఎస్కలేషన్ ఫ్రాంటియర్ ఖర్చులో దాదాపు మూడింట రెండు వంతుల వద్ద ఫ్రాంటియర్తో ఉన్న అంతరాన్ని సుమారుగా ఐదింట మూడు వంతులు పునరుద్ధరిస్తుంది మరియు ఆ వ్యాపారం చేయడం విలువైనదేనా అని వినియోగదారు నిర్ణయించుకుంటారు.
హర్నెస్ మరియు నాలెడ్జ్ వర్క్ కోసం పోస్ట్-ట్రైనింగ్
ఇప్పటివరకు, హర్నెస్ అందించే వాటిని వేరు చేయడానికి మేము స్థానిక మోడల్ను మార్చకుండా ఉంచాము. హర్నెస్ డిజైన్ అమల్లోకి వచ్చిన తర్వాత, మోడల్ స్వయంగా అడాప్ట్ చేసుకోవడం ద్వారా అతిపెద్ద మిగిలిన లాభాలు వస్తాయి. Perplexity Computer వినియోగ డేటా ప్రజలు నాలెడ్జ్ వర్క్ కోసం వాస్తవంగా ఏమి చేస్తారో మాకు చూపుతుంది, దీనిని మేము శిక్షణ డేటాను సంశ్లేషణ చేయడానికి ఉపయోగిస్తాము. వినియోగదారులు నిర్వహించే పనుల వాస్తవ పంపిణీ ద్వారా మార్గనిర్దేశం చేయబడి, Computer హర్నెస్ లోపల మేము స్థానిక మోడల్ను పోస్ట్-ట్రైన్ చేస్తాము.
నిర్దిష్టంగా, వివిధ మోడల్ సామర్థ్యాలు, టూల్స్ మరియు కనెక్టర్లను వ్యాయామం చేసే విభిన్న ఉపయోగ కేసులను మేము గుర్తಿಸುತ್ತాము. ఈ ఉపయోగ కేసుల నుండి మేము వాస్తవిక రీన్ఫోర్స్మెంట్ లెర్నింగ్ ఎన్విరాన్మెంట్లను సంశ్లేషణ చేస్తాము మరియు సవాలుతో కూడిన కానీ ధృవీకరించదగిన పనులను నిర్వచಿಸುತ್ತాము: ప్రతి పని ఒక సూచన, ఒక ఎన్విరాన్మెంట్ మరియు తుది ఫలితాన్ని స్కోర్ చేసే ఒక వెరిఫైయర్ను కలిగి ఉంటుంది, ఇక్కడ ఎన్విరాన్మెంట్ అనేది హర్నెస్ పనిచేసే డాకర్ కంటైనర్. ముఖ్యం ఏమిటంటే, పనులు సింథటిక్ కాబట్టి, వాటిలో వాస్తవిక డాక్యుమెంట్లు లేదా వినియోగదారు సమాచారం ఉండవు.
రెండు దశల శిక్షణ కోసం మేము ఈ ఎన్విరాన్మెంట్లను ఉపయోగిస్తాము: రిజెక్షన్ ఫైన్-ట్యూనింగ్ తర్వాత రీన్ఫోర్స్మెంట్ లెర్నింగ్. మొదటి దశలో, మేము ప్రతి పనికి వ్యతిరేకంగా మోడల్ను బహుళ సార్లు రోల్అవుట్ చేస్తాము, వెరిఫైయర్ స్కోర్ ద్వారా ఉత్తమ ట్రాజెక్టరీలను ఎంచుకుంటాము మరియు పర్యవేక్షించబడిన అభ్యాసంతో వాటిపై శిక్షణ ఇస్తాము. ఈ దశ నిర్దిష్ట హర్నెస్ మరియు టాస్క్ డిస్ట్రిబ్యూషన్ కోసం మోడల్ను ప్రారంభిస్తుంది. రెండవ దశలో, రీన్ఫోర్స్మెంట్ లెర్నింగ్ మోడల్ను మరింత ఫైన్-ట్యూన్ చేస్తుంది, దానిని మరింత బలపరుస్తుంది.
పనుల యొక్క ఉపసమితి శిక్షణ నుండి నిలిపివేయబడుతుంది మరియు తుది మూల్యాంకనం కోసం ఉపయోగించబడుతుంది; మేము ఈ నిలిపివేయబడిన సెట్ను లోకల్ నాలెడ్జ్ వర్క్ బెంచ్ అని పిలుస్తాము: లోతైన పరిశోధన నుండి డాక్యుమెంట్ సృష్టి వరకు రోజువారీ నాలెడ్జ్ వర్క్ యొక్క ఏడు వర్గాలను విస్తరించిన 53 పనులు. మోడల్ శిక్షణను వివరంగా వివరించే సాంకేతిక నివేదికను మేము త్వరలో ప్రచురిస్తాము మరియు ఈ మూల్యాంకన బెంచ్మార్క్ను ఓపెన్-సోర్స్ చేయడానికి మేము ప్లాన్ చేస్తున్నాము.
ఈ విధానంతో మేము Qwen 3.8 27B ను పోస్ట్-ట్రైన్ చేసాము, PPLX 27B అని పిలిచే మోడల్ను ఉత్పత్తి చేసాము మరియు లోకల్ నాలెడ్జ్ వర్క్ బెంచ్పై దానిని మూల్యాంకనం చేసాము. బేస్ Qwen 3.8 27B మోడల్తో, Computer అత్యధిక స్కోర్ను సాధించింది (Pi కోసం 77.6% మరియు Hermes కోసం 74.0% తో పోలిస్తే 82.6%) మరియు అతితక్కువ టోకెన్లను ఉపయోగించింది (Pi కోసం 681k మరియు Hermes కోసం 634k తో పోలిస్తే 520k). Pi ప్రతి పనికి 176 సెకన్లలో పనులను వేగంగా పూర్తి చేస్తుంది, Computer కోసం 218 సెకన్లు మరియు Hermes కోసం 292 సెకన్లతో పోలిస్తే. PPLX 27B Computer యొక్క స్కోర్ను 85.4%కి పెంచుతుంది, ఎక్కువ టోకెన్ల ఖర్చుతో (520k తో పోలిస్తే 678k). దీని అంచనా వేయబడిన వాల్ టైమ్ 250 సెకన్లు.
ಪಟ್ಟಿ 2. లోకల్ నాలెడ్జ్ వర్క్ బెంచ్ టాస్క్ వర్గాలు.
వర్గం | పనులు | వాటా | వివరణ |
లోతైన పరిశోధన | 20 | 37.7% | మల్టీ-హాప్ వెబ్ పరిశోధన, పబ్లిక్ డేటాసెట్లు, గణాంకాలు మరియు మూల ధృవీకరణ అవసరమయ్యే సంక్లిష్ట ప్రశ్నలకు సమాధానం ఇవ్వండి. |
డేటా, ఫైనాన్స్ మరియు ప్రొక్యూర్మెంట్ | 9 | 17.0% | డేటాసెట్లను శుభ్రం చేయండి, రికార్డులను సరిపోల్చండి, ఖర్చులను ఆడిట్ చేయండి, పెట్టుబడులను విశ్లేషించండి, సరఫరాదారులను మూల్యాంకనం చేయండి మరియు ఆర్థిక మెట్రిక్లను లెక్కించండి. |
డాక్యుమెంట్లు, ప్రెజెంటేషన్లు మరియు డిజైన్ | 7 | 13.2% | మెరుగైన PDFలు, ఇన్వాయిస్లు, ఆన్బోర్డింగ్ మెటీరియల్లు, ఈవెంట్ కొల్లేటరల్ మరియు వ్యాపార ప్రెజెంటేషన్లను ఉత్పత్తి చేయండి. |
ఇంజనీరింగ్, IT మరియు సంఘటనలు | 5 | 9.4% | సంఘటనలను పరిశోధించండి, లాగ్లను విశ్లేషించండి, రికవరీ ప్రణాళికలను వ్రాయండి, విడుదల సన్నద్ధతను అంచనా వేయండి మరియు సాంకేతిక డాక్యుమెంటేషన్ను సంశ్లేషణ చేయండి. |
కాంట్రాక్ట్లు, సాక్ష్యాలు మరియు సమ్మతి | 5 | 9.4% | కాంట్రాక్ట్లను సమీక్షించండి, సాక్ష్యాలను స్క్రీన్ చేయండి, రీకాల్లను పరిశోధించండి, సున్నితమైన డాక్యుమెంట్లను రెడాక్ట్ చేయండి మరియు సమ్మతి అవసరాలను ధృవీకరించండి. |
డాష్బోర్డ్లు, సాఫ్ట్వేర్ మరియు విజువలైజేషన్ | 4 | 7.5% | ఇంటరాక్టివ్ డాష్బోర్డ్లు, విద్యా మైక్రೋసైట్లు, చార్ట్లు మరియు ప్రాజెక్ట్ విజువలైజేషన్లను రూపొందించండి. |
వ్యక్తులు, ప్రాజెక్ట్లు మరియు సమావేశాలు | 3 | 5.7% | రెజ్యూమ్లను స్క్రీన్ చేయండి, సమావేశ నిర్ణయాలను ఏకీకృతం చేయండి మరియు ప్రాజెక్ట్ యాక్షన్ ట్రాకర్లను నిర్వహించండి. |
మొత్తం | 53 | 100% |
ముగింపు
సున్నితమైన డేటా పరికరాన్ని విడిచిపెట్టాల్సిన అవసరం లేకుండా బలమైన ఓపెన్-సోర్స్ మోడల్, సామర్థ్యం గల స్థానిక హార్డ్వేర్ మరియు వాటి కోసం నిర్మించబడిన హర్నెస్ సున్నాకి దగ్గరగా ఉన్న ఇన్ఫరెన్స్ ఖర్చుతో వాస్తవిక నాలెడ్జ్ వర్క్ను నిర్వహించగలవని మా పరిశోధనបង្ហាញ్ చేస్తుంది.
विभिन्न బెంచ్మార్క్లలో, NVIDIA DGX స్పార్క్పై Qwen 3.8 27B ని రన్ చేస్తున్నప్పుడు Computer ఖచ్చితత్వంలో Hermes మరియు Pi లను సరిపోల్చింది లేదా మించిపోయింది. లేటెన్సీ మరియు టోకెన్ వినియోగాన్ని నివేదించే మూడు బెంచ్మార్క్లలో, Computer BrowseComp మరియు ParseBench-100 పై వేగంగా ఉంది మరియు మూడింటిలోనూ అతితక్కువ టోకెన్లను ఉపయోగించింది; Pi లోకల్ నాలెడ్జ్ వర్క్ బెంచ్పై వేగంగా ఉంది.
మేము చేసిన ఎంపికల నుండి లాభాలు వచ్చాయి. ఆన్-డిమాండ్ లోడ్ అయ్యే నైపుణ్యాలతో మేము సంక్షిప్త స్థానిక హర్నెస్ను నిర్మించాము. మేము కనెక్టర్లను MCP సర్వర్లకు బదులుగా కాంపాక్ట్ CLI టూల్స్గా మార్చాము. భద్రత కోసం ఎక్సిక్యూషన్ శాండ్బాక్స్ చేయబడింది.
కాంపాక్ట్ మోడల్లకు మెరుగుదల కోసం ఎక్కడ అవకాశం ఉందో కూడా ఫలితాలు చూపుతున్నాయి. ఉదాహరణకు, Terminal Bench 2.1 యొక్క సవాలుతో కూడిన కోడింగ్ పనులపై, స్థానిక మోడల్ మూడు హర్నెస్లలో ఫ్రాంటియర్ మోడల్ కంటే వెనుకబడి ఉంది. అడ్వైజర్ ఎస్కలేషన్ అంతరాన్ని తగ్గిస్తుంది కానీ పూర్తిగా మూసివేయదు; పనితీరును మరింత ముందుకు తీసుకెళ్లడానికి మోడల్ సామర్థ్యాలు మరియు స్థానిక హార్డ్వేర్లో నిరంతర మెరుగుదలలు ఇప్పటికీ అవసరం.
స్థానిక పరిమితుల కోసం హర్నెస్ మరియు మోడల్ను నిర్మించడం యొక్క ఉద్దేశ్యం ఏమిటంటే, వినియోగదారులకు ఏ సమాచారం వారి మెషీన్లను విడిచిపెడుతుందనే దానిపై స్పష్టమైన నియంత్రణను ఇవ్వడం. వినియోగదారుకు ఖర్చు ప్రయోజనాలు కూడా ఉన్నాయి. పెరుగుతున్న సామర్థ్యం గల ఏజెంట్లు రిమోట్ ఇన్ఫ్రాస్ట్రక్చర్ నుండి వ్యక్తిగత మరియు స్థానిక పరికరాలకు మళ్లే విస్తృత మార్పులో భాగంగా వీటిని మేము చూస్తాము. చిప్స్, మోడల్స్ మరియు పరికరాలలో పురోగతులు పోర్టబుల్ కంప్యూటర్ స్థానికంగా నిర్వహించే నాలెడ్జ్ వర్క్ యొక్క శ్రేణిని మరియు నాణ్యతను నిరంతరం విస్తరిస్తాయని మేము ఆశిస్తున్నాము.