Ένας πράκτορας με προτεραιότητα την τοπική εκτέλεση για ιδιωτική και αποδοτική εργασία γνώσης

Ένα πλαίσιο και ένα μοντέλο σχεδιασμένα από κοινού για τοπική εργασία γνώσης, που εκτελούνται στη συσκευα και προσπελάζουν απομακρυσμένες δυνατότητες κατ' απαίτηση.

ΣυγγραφείςPerplexity Research

Το Perplexity Portable Computer είναι ένας πράκτορας με προτεραιότητα την τοπική εκτέλεση (local-first).

Ολόκληρη η στοίβα εκτελείται τοπικά από προεπιλογή. Το μοντέλο, το πλαίσιο (harness), η συνομιλία και η τροχιά βρίσκονται όλα στο μηχάνημα του χρήστη. Η εργασία που απαιτεί τον έξω κόσμο, όπως η αναζήτηση στον Ιστό, σύνδεσμος ή η κλιμάκωση σε ένα ισχυρότερο μοντέλο-συμβουλό στο cloud, καλείται μόνο όταν είναι απαραίτητο και πάντα με τον έλεγχο του χρήστη. Συνεπώς, τα ευαίσθητα δεδομένα δεν φεύγουν ποτέ από τη συσκευα χωρίς άδεια, και τα τοπικά μοντέλα δεν φέρουν χρέωση εξαγωγής συμπερασμάτων (inference fee): το σύστημα είναι ιδιωτικό και αποδοτικό από πλευράς κόστους λόγω σχεδιασμού.

Ένας αποτελεσματικός πράκτορας με προτεραιότητα την τοπική εκτέλεση απαιτεί το μοντέλο και το πλαίσιο να σχεδιαστούν μαζί. Τα πλαίσια γενικής χρήσης προϋποθέτουν ένα μοντέλο αιχμής που μπορεί να απορροφήσει μεγάλα πλαίσια (contexts), να περιηγηθεί σε μια ευρεία επιφάνεια εργalείων και να σχεδιάσει σε μεγάλο ορίζοντα. Τα τοπικά μοντέλα είναι λιγότερο αξιόπιστα κάτω από αυτές τις απαιτήσεις. Αντί να ζητήσουμε από ένα μικρό μοντέλο να διαχειριστεί ένα πλαίσιο χτισμένο για ένα μεγάλο, διαμορφώσαμε τα δύο γύρω από το άλλο: ένα πλαίσιο προσαρμοσμένο στο προφίλ δυνατοτήτων του μοντέλου και ένα μοντέλο εκπαιδευμένο εκ των υστέρων ώστε να χρησιμοποιεί αυτό το πλαίσιο αποτελεσματικά.

Εισαγωγή

Οι δυνατότητες πρακτόρευσης τους τελευταίους μήνες έχουν εξελιχθεί ραγδαία σε ένα ευρύ φάσμα εργασιών γνώσης. Ενώ αυτές οι εξελίξεις φέρνουν μεγάλα κέρδη σε παραγωγικότητα και αποδοτικότητα, θέτουν επίσης δύο προκλήσεις.

Η κατανάλωση token αυξάνεται γρήγορα, και μαζί της η συνολική δαπάνη. Όταν η ευφυΐα προσπελάζεται μέσω των API μοντέλων ανοιχτού κώδικα που εκτελούνται σε απομακρυσμένες συστοιχίες, οι ιδιωτικές πληροφορίες και η πνευματική ιδιοκτησία φεύγουν από τη συσκευα του χρήστη με κάθε αίτημα. Καθώς οι πράκτορες κλιμακώνονται σε μεμονωμένες ροή εργασίας και ολόκληρους οργανισμούς, η δαπάνη token και η μεταφορά δεδομένων γίνονται ολοένα και πιο δύσκολο να διαχειριστούν.

Την ίδια στιγμή, τα μοντέλα ανοιχτού κώδικα έχουν βελτιωθεί με ακόμη ταχύτερο ρυθμό. Η πρόοδος είναι πιο ορατή σε πολύ μικρά και αποδοτικά μοντέλα, όπως τα NVIDIA Nemotron 3.5 Lightning (30B συνολικές παράμετροι), Qwen 3.6 (35B) και Qwen 3.8 (27B). Αυτά τα μικρά μοντέλα αποδίδουν υπεράνω του βάρους τους και είναι πλέον ικανά για σύνθετες ροή εργασίας πρακτόρευσης. Το υλικό τοπικής εξαγωγής συμπερασμάτων προχωρά παράλληλα: συστήματα όπως το NVIDIA DGX Spark μπορούν πλέον να εκτελούν αυτά τα μοντέλα τοπικά. Μαζί, αυτές οι τάσεις καθιστούν την πλήρη λειτουργία στη συσκευα πρακτική, επιτρέποντας παράλληλα στους χρήστες να επιλέγουν εξωτερικές δυνατότητες όταν χρειάζεται, όπως αναζήτηση στον Ιστό, σύνδεσμος ή κλιμάκωση μοντέλου cloud.

Αυτή η προσέγγιση προτεραιότητας στην τοπική εκτέλεση επιτρέπει σημαντική εξοικονόμηση κόστους, καθώς η τοπική εξαγωγή συμπερασμάτων αποφεύγει τις χρεώσεις API ανά token. Επίσης, επιλύει φυσικά τις ανησυχίες περί απορρήτου και πνευματικής ιδιοκτησίας: τα ιδιωτικά token δεν χρειάζεται ποτέ να μετακινηθούν σε απομακρυσμένες συστοιχίες και παραμένουν με ασφάλεια εντός των ορίων της τοπικής συσκευής.

Τον Ιούνιο, παρουσιάσαμε τον πρώτο υβριδικό ερχεστρωτή εξαγωγής συμπερασμάτων τοπικού διακομιστή που αποφασίζει ποια εργασία θα εκτελεστεί στη συσκευα και ποια θα μεταβεί σε πράκτορες στο cloud. Εδώ εξηγούμε πώς κατασκευάσαμε έναν τέτοιο πράκτορα με προτεραιότητα την τοπική εκτέλεση, συμπεριλαμβανομένου του πλαισίου και των μοντέλων που έχουν βελτιστοποιηθεί από κοινού.

Παρέχουμε μια επισκόπηση των βασικών επιλογών σχεδιασμού, αξιολογώντας το Computer έναντι δημοφιλών πλαισίων γενικής χρήσης ανοιχτού κώδικα (Hermes και Pi) σε τρία δημόσια σημεία αναφοράς (benchmarks) και το εσωτερικό μας Local Knowledge Work Bench. Στο δικό μας σημείο αναφοράς, με το μοντέλο Qwen 3.8 27B να εκτελείται σε ένα NVIDIA DGX Spark, το Computer πετυχαίνει την υψηλότερη βαθμολογία, 82,6% έναντι 77,6% για το Pi και 74,0% για το Hermes. Το PPLX 27B, το μοντέλο μας που εκπαιδεύτηκε εκ των υστέρων πάνω στο Qwen 3.8 27B, ανεβάζει τη βαθμολογία περαιτέρω στο 85,4%.

Ραβδόγραμμα των βαθμολογιών του Local Knowledge Work Bench: πλαίσια Computer, Pi και Hermes με Qwen 3.8 27B, και Computer με PPLX 27B, το οποίο σημειώνει την υψηλότερη βαθμολογία στο 85,4%.
Βαθμολογίες στο Local Knowledge Work Bench, το σημείο αναφοράς μας με 53 αντιπροσωπευτικές εργασίες καθημερινής εργασίας γνώσης. Κάθε ράβδος είναι ένας συνδυασμός πλαισίου και μοντέλου που εκτελείται σε ένα NVIDIA DGX Spark· το PPLX 27B είναι το εκπαιδευμένο εκ των υστέρων μοντέλο μας. Τρεις δοκιμές ανά εργασία· τα μουστάκια (whiskers) είναι διαστήματα εμπιστοσύνης 95%.

Σχεδιασμός του πλαισίου γύρω από το τοπικό μοντέλο

Αν και τα συμπαγή μοντέλα επί της συσκευής είναι ήδη αρκετά ικανά, εξακολουθούν να υπολείπονται των μεγαλύτερων μοντέλων αιχμής σε απόδοση. Απαιτείται ένα προσεκτικά σχεδιασμένο πλαίσιο για την αποτελεσματική καθοδήγηση αυτών των μοντέλων και την αντιμετώπιση των περιορισμών τους.

Τα δημοφιλή πλαίσια ανοιχτού κώδικα, όπως το Pi και το Hermes, έχουν αποδειχθεί γενικά: λειτουργούν καλά με μια ευρεία ποικιλία μοντέλων σε διάφορα μεγέθη και κατηγορίες. Ωστόσο, δεν είναι βελτιστοποιημένα για τις δυνατότητες των μοντέλων επί της συσκευής. Σχεδιάσαμε το τοπικό πλαίσιο ειδικά για αυτό το περιβάλλον, γύρω από μερικές βασικές αρχές.

Αποδοτικότητα πλαισίου

Η κύρια εστίαση στον σχεδιασμό του πλαισίου μας ήταν η καλύτερη δυνατή αξιοποίηση του πλαισίου του μοντέλου.

Αν και τα μοντέλα επί της συσκευής, όπως το Qwen 3.8 27B, προσφέρουν παραθύρια πλαισίου 260K token, διαπιστώσαμε εμπειρικά ότι αρχίζουν να δυσκολεύονται πέافة των 100K token. Επομένως, διατηρούμε το βασικό πλαίσιο συνοπτικό: μια ελάχιστη προτροπή συστήματος (system prompt) και ένα μικρό σύνολο βασικών εργalείων.

Όλες οι άλλες δυνατότητες είναι αρθρωτές (modularized) σε δεξιότητα κατ' απαίτηση που φορτώνονται και εκφορτώνονται καθ' όλη τη διάρκεια της τροχιάς. Σχεδιάσαμε αυτές τις δεξιότητα για κοινές εργασίες εργασίας γνώσης: έρευνα, επιστήμη δεδομένων, οπτικοποίηση δεδομένων, δημιουργία εγγράφων, μηχανική λογισμικού και άλλα.

Το πλαίσιο υποστηρίζει επίσης τη συμπύκνωση πλαισίου, συνοψίζοντας το παλαιωμένο πλαίσιο όταν μια τροχιά μεγαλώνει, ώστε το μοντέλο να παραμένει εντός του αποτελεσματικού του παραθύρου.

Σύνδεσμος ως εργalεία γραμμής εντολών

Η καθημερινή εργασία γνώσης απαιτεί συχνά σύνδεσμος όπως το Gmail, το GitHub, το Outlook και το Google Calendar. Αυτά εκτίθενται συνήθως σε ένα πλαίσιο ως διακομιστές MCP, των οποίων οι μεγάλοι ορισμοί εργalείων καταναλώνουν σημαντικό μερίδιο του πλαισίου. Αν αυτού, μετατρέψαμε τα πιο χρησιμοποιούμενα MCP σε συμπαγή, εύχρηστα εργalεία γραμμής εντολών, συμπληρωμένα με προσαρμοσμένες δεξιότητα που αξιοποιούν πολύ καλύτερα το περιορισμένο αποτελεσματικό πλαίσιο.

Αυτο-επαλήθευση

Η απόδοση βελτιώνεται επίσης όταν ο πράκτορας επαληθεύει τη δική του εργασία. Η επαλήθευση προσθέτει επιπλέον βήματα, αλλά βελτιώνει σημαντικά τα τελικά αποτελέσματα και περιορίζει ουσιαστικά το χάσμα από τα μοντέλα αιχμής. Μπορεί να ενεργοποιηθεί από το ίδιο το μοντέλο ή από ένα σύνολο αγκίστρων (hooks) που παρακολουθούν την υγεία της τροχιάς και ζητούν αυτο-επαλήθευση όταν κάτι πάει στραβά.

Εκτέλεση σε Sandbox

Το πλαίσιο εκτελεί εργalεία σε ένα sandbox επιπέδου OS στη συσκευα του χρήστη. Τα όρια περιορίζουν τις διεργασίες, τις διαδρομές του συστήματος αρχείων και την πρόσβαση στο δίκτυο σύμφωνα με την πολιτική. Αυτό περιορίζει την ακτίνα ζημιάς μιας εσφαλμένης εντολής. Εάν το sandbox δεν είναι διαθέσιμο, το πλαίσιο απενεργοποιείται πριν από οποιαδήποτε κλήση εργalείου αντί να υποβαθμιστεί σε εκτέλεση χωρίς sandbox.

Αυτό διαφέρει από τα πλαίσια ανοιχτού κώδικα όπως το Pi και το Hermes, τα οποία εκτελούν εντολές απευθείας με τα δικαιώματα του χρήστη από προεπιλογή. Στο Computer, η απομόνωση είναι πάντα ενεργή, δεν απαιτεί καμία διαμόρφωση και τα εργalεία δεν μπορούν να εκτελεστούν χωρίς αυτήν.

Το παρακάτω διάγραμμα δείχνει πώς αυτές οι αρχές συνδέονται στον βρόχο εκτέλεσης. Ο ορχεστρωτής είναι ντετερμινιστικός κώδικας πλαισίου και όχι LLM: διατηρεί τον βρόχο, συνθέτει το πλαίσιο και επιβάλλει την πολιτική. Το τοπικό μοντέλο προτείνει την επόμενη ενέργεια· ο ορχεστρωτής εκτελεί εγκεκριμένες κλήσεις εργalείων στο sandbox και επιστρέφει τα αποτελέσματά τους στο μοντέλο. Η αναζήτηση στον Ιστό, οι σύνδεσμος και οι κλήσεις συμβούλων διαπερνούν τα όρια της συσκευής μόνο όταν είναι ενεργοποιημένες και εγκεκριμένες.

Διάγραμμα του βρόχου εκτέλεσης του τοπικού πλαισίου: ο ντετερμινιστικός κώδικας ορχεστρωτή συνθέτει το πλαίσιο και εκτελεί εργalεία σε sandbox, το τοπικό μοντέλο προτείνει ενέργειες και οι υπηρεσίες εκτός συσκευής είναι προαιρετικές και ελέγχονται από τον χρήστη.
Πώς το τοπικό πλαίσιο εκτελεί μια εργασία. Ο ντετερμινιστικός κώδικας πλαισίου ελέγχει τον βρόχο και τα εργalεία σε sandbox· το τοπικό μοντέλο προτείνει ενέργειες. Οι υπηρεσίες εκτός συσκευής είναι προαιρετικές και ελέγχονται από τον χρήστη.

Ένα τοπικό πλαίσιο αξιοποιεί περισσότερο το ίδιο μοντέλο

Χρησιμοποιώντας το ίδιο βασικό μοντέλο επί της συσκευής, συγκρίνουμε το τοπικό μας πλαίσιο με εναλλακτικές λύσεις γενικής χρήσης στην έρευνα ιστού και την πολυτροπική κατανόηση εγγράφων. Όλα τα πλαίσια χρησιμοποιούν το μοντέλο Qwen 3.8 27B με μέτριο συλλογισμό, εκτελούμενο σε ένα NVIDIA DGX Spark. Αυτή η σύγκριση απομονώνει τις δυνατότητες που συνεισφέρει το ίδιο το πλαίσιο, πριν από οποιαδήποτε εκπαίδευση του μοντέλου εκ των υστέρων.

Εστιάζουμε σε αυτές τις δύο δυνατότητες επειδή η εργασία γνώσης συνδυάζει συχνά ιδιωτικά έγγραφα στη συσκευα του χρήστη με δημόσιες πληροφορίες από τον Ιστό για την παραγωγή ενός τεκμηριωμένου αντικείμενο. Η αναζήτηση στον Ιστό απαιτεί συνδεσιμότητα, αλλά η εξαγωγή συμπερασμάτων του μοντέλου και η επεξεργασία ιδιωτικών εγγράφων παραμένουν τοπικές. Τα τοπικά αρχεία χρησιμεύουν ως η αυθεντική πηγή, οι δημόσιες πηγές προσθέτουν πλαίσιο και οι χρήστες μπορούν να απενεργοποιήσουν εντελώς την αναζήτηση στον Ιστό για πλήρως offline εργασία.

Έρευνα ιστού

Κατασκευάζουμε το τοπικό μας πλαίσιο παράλληλα με τη μηχανή αναζήτησης του Perplexity, η οποία έχει πετύχει κορυφαίες κατατάξεις σε εξρευνήσεις ανεξάρτητων αξιολογήσεων. Το πλαίσιο έχει πρόσβαση σε αυτήν μέσω της διεπαφής Search as Code.

Αξιολογούμε την ποιότητα της έρευνας σε 1.266 εργασίες BrowseComp. Το Computer χρησιμοποιεί την υποδομή αναζήτησης του Perplexity μαζί με το τοπικό μας πλαίσιο, ενώ το Pi και το Hermes βασίζονται στο Brave, τον προτεινόμενο πάροχο αναζήτησης. Το Computer φτάνει σε ακρίβεια 66,7%, σε σύγκριση με 50,2% για το Pi και 43,9% για το Hermes.

Το Computer έχει επίσης τον χαμηλότερο μέσο καταγεγραμμένο χρόνο τοίχου (wall time) και χρήση token: 402,1 δευτερόλεπτα και 852k token ανά εργασία, σε σύγκριση με 1.020,9 δευτερόλεπτα και 1,01 εκατομμύρια token για το Hermes, και 826,0 δευτερόλεπτα και 2,82 εκατομμύρια token για το Pi. Συνεπώς, το Computer χρησιμοποιεί 61% λιγότερο χρόνο τοίχου και 16% λιγότερα token από το Hermes, και 51% λιγότερο χρόνο τοίχου και 70% λιγότερα token από το Pi.

Διάγραμμα διασποράς της βαθμολογίας BrowseComp έναντι του μέσου χρόνου τοίχου ανά εργασία για τα Computer, Hermes και Pi με Qwen 3.8 27B· το Computer φτάνει στην υψηλότερη βαθμολογία με τον λιγότερο χρόνο και τα λιγότερα token.
Αποτελέσματα BrowseComp με το μοντέλο Qwen 3.8 27B επί της συσκευής: βαθμολογία έναντι μέσου χρόνου τοίχου ανά εργασία για τα πλαίσια Computer, Hermes και Pi· οι ετικέτες σημείων δείχνουν τα μέση token ανά εργασία. Τα ημιτελή αποτελέσματα βαθμολογούνται με μηδέν, και οι μέσοι όροι χρόνου και token εξαιρούν αναπτύξεις χωρίς καταγεγραμμένες μετρήσεις. Τα μουστάκια είναι διαστήματα εμπιστοσύνης Wilson 95% για τη βαθμολογία.

Πολυτροπική κατανόηση εγγράφων επί της συσκευής

Πολλά έγγραφα μεταφέρουν πληροφορίες οπτικά και είναι δύσκολο να αναλυθούν ως απλό κείμενο: PDF, σαρωμένες σελίδες, στιγμιότυπα οθόνης, διαγράμματα και παρουσιάσεις. Αυτές οι ροή εργασίας εξαρτώνται από το OCR και την κατανόηση εικόνας, και επωφελούνται περισσότερο από ένα εγγενώς πολυτροπικό μοντέλο.

Το πλαίσιο μεταβιβάζει σελίδες εγγράφων και εικόνες απευθείας στο μοντέλο, το οποίο τις κατανοεί και συνδυάζει οπτικά στοιχεία με το εξαγόμενο κείμενο. Η επεξεργασία αυτών των αρχείων στη συσκευα διατηρεί τα ευαίσθητα έγγραφα και το εξαγόμενο περιεχόμενό τους ιδιωτικά.

Αξιολογούμε την πολυτροπική κατανόηση εγγράφων στο ParseBench-100, ένα υποσύνολο 100 εργασιών του σημείου αναφοράς ParseBench, με 20 εργασίες η κάθε μία για διαγράμματα, διάταξη, πίνακες, περιεχόμενο κειμένου και μορφοποίηση.

Το Computer φτάνει σε μέση βαθμολογία 65,1%, σε σύγκριση με 34,6% για το Hermes και 13,9% για το Pi. Ολοκληρώνει επίσης εργασίες με τον λιγότερο χρόνο και τα λιγότερα token: κατά μέσο όρο 60,6 δευτερόλεπτα και 20,1k token ανά εργασία, σε σύγκριση με 108,3 δευτερόλεπτα και 32,1k token για το Hermes, και 410,5 δευτερόλεπτα και 829,1k token για το Pi. Το Computer προηγείται και στις πέντε κατηγορίες εγγράφων, με το μεγαλύτερο πλεονέκτημά του στα διαγράμματα. Η διάταξη παραμένει δύσκολη και για τα τρία πλαίσια.

Διάγραμμα διασποράς της βαθμολογίας OCR του ParseBench-100 έναντι του μέσου χρόνου τοίχου ανά εργασία για τα Computer, Hermes και Pi με Qwen 3.8 27B· το Computer φτάνει στην υψηλότερη βαθμολογία με τον λιγότερο χρόνο και τα λιγότερα token.
Αποτελέσματα OCR ParseBench-100 με το μοντέλο Qwen 3.8 27B επί της συσκευής: βαθμολογία έναντι μέσου χρόνου τοίχου ανά εργασία για τα πλαίσια Computer, Hermes και Pi· οι ετικέτες σημείων δείχνουν τα μέση token ανά εργασία. Οι μέσοι όροι token χρησιμοποιούν αναπτύξεις με καταγεγραμμένες μετρήσεις. Τα μουστάκια είναι διαστήματα εμπιστοσύνης 95%.

Πίνακας 1. Μέση βαθμολογία ParseBench-100 ανά κατηγορία εγγράφου για τα πλαίσια Computer, Hermes και Pi με το μοντέλο Qwen 3.8 27B επί της συσκευής. Το Computer προηγείται και στις πέντε κατηγορίες.

Πλαίσιο

Διάγραμμα

Διάταξη

Πίνακας

Περιεχόμενο κειμένου

Μορφοποίηση

Computer

76,5%

16,2%

72,7%

87,9%

72,4%

Hermes

29,3%

2,9%

44,1%

61,5%

35,2%

Pi

2,5%

0,1%

11,0%

29,7%

26,1%

Μείωση του χάσματος της αιχμής με κλιμάκωση συμβούλου (advisor escalation)

Ακόμη και με ένα προσεκτικά σχεδιασμένο πλαίσιο, οι πιο δύσκολες εργασίες εξακολουθούν να υπερβαίνουν τις δυνατότητες ενός συμπαγούς μοντέλου επί της συσκευής. Για τέτοιες εργασίες, το πλαίσιο εκθέτει ένα εργalείο συμβούλου: το τοπικό μοντέλο μπορεί να συμβουλευτεί ένα ισχυρότερο μοντέλο αιχμής όταν χρειάζεται βοήθεια στον σχεδιασμό, την επίλυση ασάφειας, την ανάκαμψη từ επαναλαμβανόμενες αποτυχίες ή την επαλήθευση του τελικού αποτελέσματος.

Το τοπικό μοντέλο αποφασίζει πότε θα ζητήσει συμβουλή, ενώ ο ορχεστρωτής του πλαισίου διατηρεί την εξουσία επί των εργalείων και ελέγχει ποιο πλαίσιο αποστέλλεται. Η κλιμάκωση είναι προαιρετική. Ο χρήστης αποφασίζει αν θα την ενεργοποιήσει και αν θα εγκρίνει κάθε κλήση συμβούλου χειροκίνητα ή αυτόματα.

Πριν από μια κλήση συμβούλου, το πλαίσιο επιλέγει το σχετικό πλαίσιο, εφαρμόζει έναν ταξινομητή PII για να επισημάνει ευαίσθητες πληροφορίες και δείχνει στον χρήστη τι θα έφευγε από τη συσκευα. Ο σύμβουλος λαμβάνει μόνο το εγκεκριμένο πλαίσιο και επιστρέφει καθοδήγηση κειμένου· δεν έχει άμεση πρόσβαση στα αρχεία, τα εργalεία ή τις συνομιλίες της συσκευής. Αυτό βελτιώνει τόσο το κόστος όσο και το απόρρητο, και σχεδιάζουμε να εξερευνήσουμε περαιτέρω αυτήν την κατεύθυνση σε μελλοντική εργασία.

Διάγραμμα της κλιμάκωσης συμβούλου: ο ορχεστρωτής του πλαισίου διατηρεί την εξουσία επί των εργalείων και στέλνει μόνο το εγκεκριμένο πλαίσιο στο μοντέλο συμβούλου, το οποίο επιστρέφει καθοδήγηση κειμένου χωρίς άμεση πρόσβαση σε εργalεία ή αρχεία.
Απομακρυσμένη καθοδήγηση, τοπικός έλεγχος. Ο ορχεστρωτής του πλαισίου διατηρεί την εξουσία επί των εργalείων και στέλνει μόνο το πλαίσιο που έχει εγκριθεί για κλιμάκωση. Ο σύμβουλος δεν έχει άμεση πρόσβαση σε εργalεία, αρχεία ή το κανάλι απόκρισης· επιστρέφει καθοδήγηση κειμένου την οποία μπορεί να χρησιμοποιήσει το τοπικό μοντέλο.

Δοκιμάζουμε αυτήν την προσέγγιση σε απαιτητικές εργασίες μηχανικής λογισμικού, οι οποίες απαιτούν ισχυρό συλλογισμό και είναι ο τομέας όπου ένα τοπικό μοντέλο υστερεί συχνότερα. Για αυτό χρησιμοποιούμε το Terminal Bench 2.1, ένα δημοφιλές σημείο αναφοράς 89 εργασιών για πράκτορες κωδικοποίησης.

Θέλουμε να απαντήσουμε σε δύο ερωτήσεις: πόσο από το χάσμα προς ένα μοντέλο αιχμής μπορεί να κλείσει η κλιμάκωση συμβούλου και με ποιο κόστος. Τα πλήρως τοπικά μοντέλα δεν κοστίζουν σχεδόν τίποτα στην εκτέλεση, καθώς η εξαγωγή συμπερασμάτων συμβαίνει στο υλικό του χρήστη. Ωστόσο, μόλις το μοντέλο αρχίσει να καλεί τον σύμβουλο, αρχίζει να επιβαρύνεται με κόστη API.

Ως σημείο αναφοράς (baseline) για την απόδοση αιχμής, χρησιμοποιούμε το Claude Opus 5 που λειτουργεί στο τοπικό πλαίσιο· το τοπικό μοντέλο είναι το Qwen 3.8 27B. Τέλος, συνδυάζουμε τα δύο: το Qwen 3.8 27B εκτελεί την εργασία και κλιμακώνει σε έναν σύμβουλο Claude Opus 5 όταν χρειάζεται βοήθεια. Δεν αξιολογούμε την κλιμάκωση συμβούλου με το Pi ή το Hermes επειδή κανένα από τα δύο δεν παρέχει ισotímo εργalείο συμβούλου· η προσθήκη ενός τέτοιου εργalείου θα απαιτούσε την τροποποίηση της επιφάνειας εργalείων και της λογικής ερχεστρωσής του, οπότε το αποτέλεσμα δεν θα αντιπροσώπευε πλέον το έτοιμο πλαίσιο.

Η κλιμάκωση συμβούλου αυξάνει τη βαθμολογία του Computer από 59,6% σε 73,0%, μια αύξηση 13,5 ποσοστιαίων μονάδων, με εκτιμώμενο κόστος API 0,415 $ ανά ανάπτυξη (rollout). Η εκτέλεση του Claude Opus 5 μόνο του φτάνει στο 82,4% με 0,65 $ ανά ανάπτυξη. Συνεπώς, η κλιμάκωση ανακτά περίπου τα τρία πέμπτα του χάσματος προς την αιχμή με περίπου τα δύο τρίτα του κόστους της αιχμής, και ο χρήστης αποφασίζει πότε αξίζει να κάνει αυτήν την ανταλλαγή.

Διάγραμμα διασποράς της βαθμολογίας Terminal Bench 2.1 έναντι του κόστους API ανά ανάπτυξη: Qwen 3.8 27B πλήρως τοπικό, Qwen 3.8 27B με σύμβουλο Claude Opus 5, και Claude Opus 5 μόνο του, όλα στο πλαίσιο Computer.
Απόδοση-κόστος Terminal Bench 2.1 σε 89 εργασίες: βαθμολογία έναντι κόστους API ανά ανάπτυξη. Όλα τα σημεία χρησιμοποιούν το πλαίσιο Computer: Qwen 3.8 27B πλήρως τοπικό, Qwen 3.8 27B με κλιμάκωση σε σύμβουλο Claude Opus 5, και Claude Opus 5 μόνο του. Οι διακεκομμένες γραμμές δείχνουν τα Pi και Hermes να εκτελούν το ίδιο τοπικό μοντέλο με μηδενικό κόστος API. Τα μουστάκια είναι διαστήματα εμπιστοσύνης 95% bootstrap εργασιών· οι ημιτελείς αναπτύξεις βαθμολογούνται με μηδέν.

Εκπαίδευση εκ των υστέρων (post-training) για το πλαίσιο και την εργασία γνώσης

Μέχρι στιγμής, έχουμε διατηρήσει το τοπικό μοντέλο αμετάβλητο για να απομονώσουμε τι συνεισφέρει το πλαίσιο. Με τον σχεδιασμό του πλαισίου στη θέση του, τα μεγαλύτερα εναπομείναντα κέρδη προέρχονται από την προσαρμογή του ίδιου του μοντέλου. Τα δεδομένα χρήσης του Perplexity Computer μας δείχνουν τι κάνουν πραγματικά οι άνθρωποι για την εργασία γνώσης, τα οποία χρησιμοποιούμε για να συνθέσουμε δεδομένα εκπαίδευσης. Εκπαιδεύουμε εκ των υστέρων το τοπικό μοντέλο μέσα στο πλαίσιο του Computer, καθοδηγούμενοι από την πραγματική κατανομή των εργασιών που εκτελούν οι χρήστες.

Συγκεκριμένα, εντοπίζουμε ένα ποικιλόμορφο σύνολο περιπτώσεων χρήσης που ασκούν διαφορετικές δυνατότητες μοντέλων, εργalεία και σύνδεσμος. Από αυτές τις περιπτώσεις χρήσης συνθέτουμε ρεαλιστικά περιβάλλοντα μάθησης ενίσχυσης (reinforcement learning) και ορίζουμε απαιτητικές αλλά επαληθεύσιμες εργασίες: κάθε εργασία αποτελείται από μια οδηγία, ένα περιβάλλον και έναν επαληθευτή που βαθμολογεί το τελικό αποτέλεσμα, όπου το περιβάλλον είναι ένα container Docker στο οποίο λειτουργεί το πλαίσιο. Σημαντικό είναι ότι, επειδή οι εργασίες είναι συνθετικές, δεν περιέχουν πραγματικά έγγραφα ή πληροφορίες χρήστη.

Χρησιμοποιούμε αυτά τα περιβάλλοντα για εκπαίδευση δύο σταδίων: fine-tuning απόρριψης ακολουθούμενο από μάθηση ενίσχυσης. Στο πρώτο στάδιο, αναπτύσσουμε το μοντέλο έναντι κάθε εργασίας πολλαπλές φορές, επιλέγουμε τις καλύτερες τροχιές με βάση τη βαθμολογία του επαληθευτή και εκπαιδεύουμε σε αυτές με επιβλεπόμενη μάθηση. Αυτό το στάδιο προετοιμάζει το μοντέλο για το συγκεκριμένο πλαίσιο και την κατανομή εργασιών. Στο δεύτερο στάδιο, η μάθηση ενίσχυσης βελτιώνει περαιτέρω το μοντέλο, καθιστώντας το πιο ισχυρό.

Ένα υποσύνολο εργασιών κρατείται εκτός εκπαίδευσης και χρησιμοποιείται για την τελική αξιολόγηση· αποκαλούμε αυτό το σύνολο που κρατήθηκε Local Knowledge Work Bench: 53 εργασίες που εκτείνονται σε επτά κατηγορίες καθημερινής εργασίας γνώσης, από βαθιά έρευνα έως δημιουργία εγγράφων. Σύντομα θα δημοσιεύσουμε μια τεχνική αναφορά που περιγράφει λεπτομερώς την εκπαίδευση του μοντέλου και σχεδιάζουμε να διαθέσουμε αυτό το σημείο αναφοράς αξιολόγησης ως ανοιχτού κώδικα.

Εκπαιδεύσαμε εκ των υστέρων το Qwen 3.8 27B με αυτήν την προσέγγιση, παράγοντας ένα μοντέλο που αποκαλούμε PPLX 27B, και το αξιολογήσαμε στο Local Knowledge Work Bench. Με το βασικό μοντέλο Qwen 3.8 27B, το Computer πετυχαίνει την υψηλότερη βαθμολογία (82,6%, σε σύγκριση με 77,6% για το Pi και 74,0% για το Hermes) και χρησιμοποιεί τα λιγότερα token (520k, έναντι 681k για το Pi και 634k για το Hermes). Το Pi ολοκληρώνει τις εργασίες ταχύτερα σε 176 δευτερόλεπτα ανά εργασία, σε σύγκριση με 218 δευτερόλεπτα για το Computer και 292 δευτερόλεπτα για το Hermes. Το PPLX 27B ανεβάζει τη βαθμολογία του Computer στο 85,4%, με κόστος περισσότερα token (678k έναντι 520k). Ο εκτιμώμενος χρόνος τοίχου του είναι 250 δευτερόλεπτα.

Διάγραμμα διασποράς της βαθμολογίας Local Knowledge Work Bench έναντι του μέσου χρόνου τοίχου ανά εργασία· το PPLX 27B που εκτελείται στο Computer φτάνει στην υψηλότερη βαθμολογία στο 85,4%.
Αποτελέσματα εκπαίδευσης εκ των υστέρων στο Local Knowledge Work Bench: βαθμολογία έναντι μέσου χρόνου τοίχου ανά εργασία· οι ετικέτες σημείων δείχνουν το πλαίσιο, το μοντέλο και τα μέση token ανά εργασία. Το PPLX 27B είναι το εκπαιδευμένο εκ των υστέρων μοντέλο μας, που εκτελείται στο Computer. Τα μουστάκια είναι διαστήματα εμπιστοσύνης 95% σε 53 εργασίες με τρεις δοκιμές η καθεμία.

Πίνακας 2. Κατηγορίες εργασιών του Local Knowledge Work Bench.

Κατηγορία

Εργασίες

Μερίδιο

Περιγραφή

Εις βάθος έρευνα

20

37,7%

Απάντηση σε σύνθετα ερωτήματα που απαιτούν έρευνα ιστού πολλαπλών βημάτων, δημόσια σύνολα δεδομένων, στατιστικά και επαλήθευση πηγών.

Δεδομένα, οικονομικά και προμήθειες

9

17,0%

Καθαρισμός συνόλων δεδομένων, συμφωνία εγγραφών, έλεγχος εξόδων, ανάλυση επενδύσεων, αξιολόγηση προμηθευτών και υπολογισμός οικονομικών δεικτών.

Έγγραφα, παρουσιάσεις και σχεδιασμός

7

13,2%

Παραγωγή στιλπνών PDF, τιμολογίων, υλικών ενσωμάτωσης (onboarding), υλικού εκδηλώσεων και επιχειρηματικών παρουσιάσεων.

Μηχανική, IT και συμβάντα (incidents)

5

9,4%

Διερεύνηση συμβάντων, ανάλυση αρχείων καταγραφής (logs), συγγραφή σχεδίων ανάκαμψης, αξιολόγηση ετοιμότητας κυκλοφορίας και σύνθεση τεχνικής τεκμηρίωσης.

Συμβάσεις, αποδεικτικά στοιχεία και συμμόρφωση

5

9,4%

Αναθεώρηση συμβάσεων, έλεγχος αποδεικτικών στοιχείων, διερεύνηση ανακλήσεων, διαγραφή ευαίσθητων εγγράφων και επαλήθευση απαιτήσεων συμμόρφωσης.

Πίνακες εργalείων (dashboards), λογισμικό και οπτικοποίηση

4

7,5%

Κατασκευή διαδραστικών πινάκων εργalείων, εκπαιδευτικών microsites, διαγραμμάτων και οπτικοποιήσεων έργων.

Άνθρωποι, έργα και συναντήσεις

3

5,7%

Έλεγχος βιογραφικών, ενοποίηση αποφάσεων συναντήσεων και διατήρηση ιχνηλατών ενεργειών έργου.

Σύνολο

53

100%

Συμπέρασμα

Η έρευνά μας δείχνει ότι ένα ισχυρό μοντέλο ανοιχτού κώδικα, με ικανό τοπικό υλικό και ένα πλαίσιο χτισμένο γι' αυτά, μπορεί να χειριστεί πραγματική εργασία γνώσης με σχεδόν μηδενικό κόστος εξαγωγής συμπερασμάτων, χωρίς να απαιτείται η απομάκρυνση ευαίσθητων δεδομένων από τη συσκευα.

Σε όλα τα διάφορα σημεία αναφοράς, το Computer ταίριαξε ή ξεπέρασε το Hermes και το Pi σε ακρίβεια, εκτελώντας το Qwen 3.8 27B σε ένα NVIDIA DGX Spark. Μεταξύ των τριών σημείων αναφοράς που αναφέρουν τη λανθάνουσα κατάσταση (latency) και τη χρήση token, το Computer ήταν το ταχύτερο στο BrowseComp και το ParseBench-100 και χρησιμοποίησε τα λιγότερα token και στα τρία· το Pi ήταν το ταχύτερο στο Local Knowledge Work Bench.

Τα κέρδη προήλθαν από επιλογές που κάναμε. Κατασκευάσαμε ένα συνοπτικό τοπικό πλαίσιο με δεξιότητα που φορτώνονται κατ' απαίτηση. Μετατρέψαμε τους σύνδεσμος σε συμπαγή εργalεία CLI αντί για διακομιστές MCP. Η εκτέλεση ήταν σε sandbox για λόγους ασφαλείας.

Τα αποτελέσματα δείχνουν επίσης πού τα συμπαγή μοντέλα έχουν περιθώρια βελτίωσης. Για παράδειγμα, στις απαιτητικές εργασίες κωδικοποίησης του Terminal Bench 2.1, το τοπικό μοντέλο υστερεί σε σχέση με το μοντέλο αιχμής και στα τρία πλαίσια. Η κλιμάκωση συμβούλου στενεύει αλλά δεν κλείνει πλήρως το χάσμα· εξακολουθούν να απαιτούνται συνεχιζόμενες βελτιώσεις στις δυνατότητες των μοντέλων και στο τοπικό υλικό για να προωθηθεί η απόδοση περαιτέρω.

Ο σκοπός της κατασκευής του πλαισίου και του μοντέλου για τοπικούς περιορισμούς είναι να δοθεί στους χρήστες ρητός έλεγχος σχετικά με το ποια πληροφορία φεύγει από τα μηχανάνειά τους. Υπάρχουν επίσης οφέλη κόστους για τον χρήστη. Τα βλέπουμε αυτά ως μέρος μιας ευρύτερης μετατόπισης στην οποία ολοένα και πιο ικανοί πράκτορες μετακινούνται από την απομακρυσμένη υποδομή σε μεμονωμένες και τοπικές συσκευές. Αναμένουμε ότι οι εξελίξεις στα τσιπ, τα μοντέλα και τις συσκευές θα επεκτείνουν συνεχώς το εύρος και την ποιότητα της εργασίας γνώσης που χειρίζεται το Portable Computer τοπικά.