Жеке және үнемді білім беру жұмыстарына арналған жергілікті агент

Құрылғыда жұмыс істейтін және сұраныс бойынша қашықтағы мүмкіндіктерге қол жеткізетін, жергілікті білім беру жұмыстарына арналған орта мен модель.

АвторларPerplexity Research

Perplexity Portable Computer — жергілікті жүйеге басымдық беретін агент.

Бүкіл стек әдепкі бойынша жергілікті түрде жұмыс істейді. Модель, орта (harness), диалог және траектория толығымен пайдаланушының компьютерінде орналасады. Сыртқы әлемді қажет ететін жұмыс, мысалы, веб-іздеу, коннекторлар немесе бұлттағы қуаттырақ кеңесші модельге көшу тек қажет болған жағдайда ғана және әрқашан пайдаланушының рұқсатымен іске қосылады. Сондықтан құпия деректер ешқашан рұқсатсыз құрылғыдан шықпайды және жергілікті модельдер үшін шығарып алу (inference) ақысы алынмайды: жүйе дизайн бойынша құпия және үнемді болып табылады.

Тиімді жергілікті агент модель мен ортаның (harness) бірге жобалануын талап етеді. Жалпы мақсаттағы орталар ұзақ контексттерді қабылдай алатын, кең құралдар жиынтығын басқара алатын және ұзақ мерзімді жоспарлай алатын шекті (frontier) модельді болжайды. Жергілікті модельдер мұндай талаптарға сай келгенде онша сенімді емес. Кішкентай модельден үлкен модельге арналған ортаны басқаруды сұраудың орнына, біз екеуін бір-біріне бейімдеп жасадық: модельдің мүмкіндіктер профиліне бейімделген орта және осы ортаны тиімді пайдалану үшін кейіннен оқытылған модель.

Кіріспе

Соңғы айларда агенттік мүмкіндіктер білім беру жұмыстарының кең спектрі бойынша қарқынды түрде дамыды. Бұл жетістіктер өнімділік пен тиімділіктің айтарлықтай өсуіне әкелсе де, олар екі қиындықты тудырады.

Токендерді тұтыну тез өсуде, ал онымен бірге жалпы шығындар да артып келеді. Қашықтағы кластерлерде жұмыс істейтін жабық кодты модельдердің API интерфейстері арқылы интеллектке қол жеткізілген кезде, әрбір сұрау сайын жеке ақпарат пен зияткерлік меншік пайдаланушының құрылғысынан шығып кетеді. Агенттер жеке жұмыс процестері мен бүкіл ұйымдар бойынша ауқымды түрде кеңейген сайын, токен шығындары мен деректердің қозғалысын басқару қиындай түседі.

Сонымен қатар, ашық кодты модельдер одан да жылдам қарқынмен жақсарды. Прогресс NVIDIA Nemotron 3.5 Lightning (барлығы 30B параметр), Qwen 3.6 (35B) және Qwen 3.8 (27B) сияқты өте кішкентай және тиімді модельдерде ең айқын көрінеді. Бұл кішкентай модельдер өз салмағынан әлдеқайда жоғары нәтиже көрсетеді және қазір күрделі агенттік жұмыс процестерін атқара алады. Жергілікті вывод жабдықтары да қатар дамып келеді: NVIDIA DGX Spark сияқты жүйелер енді бұл модельдерді жергілікті түрде іске қоса алады. Біріктірілген бұл трендтер веб-іздеу, коннекторлар немесе бұлттық модельге көшу сияқты сыртқы мүмкіндіктерді қажет кезде қосуға мүмкіндік бере отырып, толықтай құрылғыішілік жұмысты жүзеге асыруды практикалық тұрғыдан тиімді етеді.

Бұл жергілікті тәсіл шығындарды айтарлықтай үнемдеуге мүмкіндік береді, өйткені жергілікті вывод әр токен үшін API ақысын төлеуден сақтайды. Сондай-ақ ол құпиялылық пен зияткерлік меншік мәселелерін табиғи түрде шешеді: жеке токендер ешқашан қашықтағы кластерлерге берілмейді және жергілікті құрылғы шекарасында қауіпсіз сақталады.

Маусым айында біз қандай жұмыс құрылғыда орындалуы керек, ал қайсысы бұлттағы агенттерге жіберілуі тиіс екенін шешетін алғашқы гибридті жергілікті-серверлік вывод оркестравторын ұсындық. Мұнда біз осындай жергілікті агентті қалай құрғанымызды, соның ішінде ортаны және бір-біріне оңтайландырылған модельдерді түсіндіреміз.

Біз негізгі дизайн таңдауларына шолу жасаймыз және үш жалпыға қолжетімді бенчмарк пен ішкі Local Knowledge Work Bench негізінде Computer жүйесін танымал ашық кодты жалпы мақсаттағы орталармен (Hermes және Pi) салыстырамыз. Біздің бенчмаркта NVIDIA DGX Spark жүйесінде жұмыс істейтін Qwen 3.8 27B моделі бар Computer ең жоғары ұпайға қол жеткізеді: Pi үшін 77.6% және Hermes үшін 74.0% болса, Computer 82.6% жинайды. Qwen 3.8 27B негізінде кейіннен оқытылған моделіміз PPLX 27B бұл ұпайды тағы да 85.4%-ға дейін арттырады.

Local Knowledge Work Bench ұпайларының бағандық диаграммасы: Qwen 3.8 27B бар Computer, Pi және Hermes орталары, және 85.4% көрсеткішімен ең жоғары ұпай жинаған PPLX 27B бар Computer.
Күнделікті білім беру жұмыстарының 53 өкілдік тапсырмасынан тұратын бенчмаркымыз Local Knowledge Work Bench жүйесіндегі ұпайлар. Әрбір баған — NVIDIA DGX Spark жүйесінде жұмыс істейтін орта мен модель комбинациясы; PPLX 27B — біздің кейінгі оқытылған моделіміз. Әр тапсырма үшін үш сынақ; мұртшалар 95% сенімділік интервалын көрсетеді.

Жергілікті модельге арналған ортаны жобалау

Ықшам құрылғыішілік модельдер өте қабілетті болғанымен, олар өнімділігі жағынан үлкенірек шекті модельдерден әлі де қалып қояды. Бұл модельдерді тиімді бағыттау және олардың шектеулерін еңсеру үшін мұқият жобаланған орта қажет.

Pi және Hermes сияқты танымал ашық кодты орталардың әмбебап екендігі дәлелденді: олар әртүрлі өлшемдер мен кластардағы модельдердің кең ауқымымен жақсы жұмыс істейді. Бірақ олар құрылғыішілік модельдердің мүмкіндіктеріне оңтайландырылмаған. Біз жергілікті ортаны арнайы осы жағдай үшін, бірнеше негізгі принциптерге сүйене отырып жобаладық.

Контекст тиімділігі

Біздің ортаны жобалаудағы басты назарымыз модельдің контекстін барынша тиімді пайдалану болды.

Qwen 3.8 27B сияқты құрылғыішілік модельдер 260K токеннен тұратын контекст терезелерін ұсынғанымен, тәжірибе көрсеткендей, олар 100K токеннен асқанда қинала бастайды. Сондықтан біз негізгі ортаны ықшам ұстаймыз: минималды жүйелік нұсқаулық және негізгі құралдардың шағын жиынтығы.

Барлық басқа мүмкіндіктер траектория барысында жүктелетін және түсірілетін сұраныс бойынша жұмыс істейтін модульдік дағдыларға бөлінген. Біз бұл дағдыларды зерттеу, деректер ғылымы, деректерді визуализациялау, құжаттарды жасау, бағдарламалық қамтамасыз ету инженериясы және т.б. сияқты жалпы білім беру жұмыстарына арнап жобаладық.

Сондай-ақ орта траектория ұзарған кезде ескірген контекстті жинақтап, модельдің өзінің тиімді терезесінде қалуын қамтамасыз ететін контекстті жинақтауды қолдайды.

Командалық жол құралдары ретіндегі коннекторлар

Күнделікті білім беру жұмыстары жиі Gmail, GitHub, Outlook және Google Calendar сияқты коннекторларды талап етеді. Олар әдетте ортаға контексттің айтарлықтай бөлігін тұтынатын үлкен құрал анықтамалары бар MCP серверлері ретінде ұсынылады. Оның орнына біз шектеулі тиімді контекстті әлдеқайда жақсы пайдаланатын реттелетін дағдылармен толықтырылған, ең көп қолданылатын MCP-лерді ықшам, қолдануға оңай командалық жол құралдарына түрлендірдік.

Өзін-өзі тексеру

Сондай-ақ агент өз жұмысын өзі тексерген кезде өнімділік жақсарады. Тексеру қосымша қадамдарды қосады, бірақ ол соңғы нәтижелерді едәуір жақсартады және шекті модельдерге дейінгі алшақтықты айтарлықтай қысқартады. Оны модельдің өзі немесе траекторияның денсаулығын бақылайтын және бірдеңе дұрыс болмай қалғанда өзін-өзі тексеруді сұрайтын қа钩тар жиынтығы іске қоса алады.

Құмсалғышта орындау

Орта пайдаланушының құрылғысындағы ОС деңгейіндегі құмсалғышта құралдарды орындайды. Шекара саясатқа сәйкес процестерді, файлдық жүйе жолдарын және желілік қатынасты шектейді. Бұл қате пәрменнің әсер ету радиუსын шектейді. Егер құмсалғыш қолжетімсіз болса, орта құмсалғышсыз орындауға көшудің орнына, кез келген құрал шақыру алдында өзін өшіреді.

Бұл әдепкі бойынша пәрмендерді тікелей пайдаланушының рұқсаттарымен орындайтын Pi және Hermes сияқты ашық кодты орталардан ерекшеленеді. Computer жүйесінде оқшаулау әрқашан қосулы болады, ешқандай конфигурацияны қажет етпейді және құралдар онсыз жұмыс істей алмайды.

Төмендегі диаграмма бұл принциптердің орындалу циклінде қалай үйлесетінін көрсетеді. Оркестратор — LLM емес, детерминирленген орта коды: ол циклді сақтайды, контекстті жинайды және саясатты жүзеге асырады. Жергілікті модель келесі әрекетті ұсынады; оркестратор құмсалғышта (sandbox) мақұлданған құрал шақыруларын орындайды және олардың нәтижелерін модельге қайтарады. Веб-іздеу, коннекторлар және кеңесші шақырулары тек қосылған және мақұлданған кезде ғана құрылғы шекарасынан өтеді.

Жергілікті ортаның орындалу циклінің диаграммасы: детерминирленген оркестратор коды контекстті жинайды және құмсалғыш құралдарын іске қосады, жергілікті модель әрекеттерді ұсынады, ал құрылғыдан тыс қызметтер қосымша болып табылады және пайдаланушы рұқсатымен басқарылады.
Жергілікті орта тапсырманы қалай орындайды. Детерминирленген орта коды цикл мен құмсалғыш құралдарын басқарады; жергілікті модель әрекеттерді ұсынады. Құрылғыдан тыс қызметтер қосымша болып табылады және пайдаланушы рұқсатымен басқарылады.

Жергілікті орта бір модельден көбірек нәтиже алады

Біз бірдей құрылғыішілік базалық модельді пайдалана отырып, веб-зерттеу және мультимодальды құжаттарды түсіну бойынша жергілікті ортамызды жалпы мақсаттағы баламалармен салыстырамыз. Барлық орталар NVIDIA DGX Spark жүйесінде жұмыс істейтін, орташа пайымдауы бар Qwen 3.8 27B моделін пайдаланады. Бұл салыстыру кез келген модельді кейіннен оқытуға дейін, ортаның өзі қосқан мүмкіндіктерді бөліп көрсетеді.

Біз осы екі мүмкіндікке назар аударамыз, өйткені білім беру жұмыстары негізделген артефакт жасау үшін пайдаланушы құрылғысындағы жеке құжаттарды вебтегі жалпыға қолжетімді ақпаратпен жиі біріктіреді. Веб-іздеу қосылымды қажет етеді, бірақ модельді түсіндіру және жеке құжаттарды өңдеу жергілікті күйінде қалады. Жергілікті файлдар сенімді көз ретінде қызмет етеді, қоғамдық көздер контекст қосады және пайдаланушылар толығымен офлайн режимде жұмыс істеу үшін веб-іздеуді толығымен өшіре алады.

Веб-зерттеу

Тәуелсіз бағалауларда жоғары орындарға қол жеткізген Perplexity іздеу жүйесімен бірге жергілікті ортамызды құрамыз. Орта оған Search as Code интерфейсі арқылы қол жеткізеді.

Біз зерттеу сапасын 1266 BrowseComp тапсырмасы бойынша бағалаймыз. Computer локальді ортамызбен бірге Perplexity іздеу инфрақұрылымын пайдаланады, ал Pi және Hermes олардың ұсынылатын іздеу провайдері Brave жүйесіне сүйенеді. Pi үшін 50.2% және Hermes үшін 43.9% болса, Computer 66.7% дәлдікке жетеді.

Сондай-ақ Computer ең аз орташа жазылған қабырға уақыты мен токен пайдалану көрсеткішіне ие: Hermes үшін 1,020.9 секунд және 1.01 миллион токен және Pi үшін 826.0 секунд және 2.82 миллион токен болса, әр тапсырма үшін 402.1 секунд және 852k токен жұмсайды. Демек, Computer Hermes-ке қарағанда 61%-ға аз қабырға уақытын және 16%-ға аз токенді, ал Pi-ге қарағанда 51%-ға аз қабырға уақытын және 70%-ға аз токенді пайдаланады.

Qwen 3.8 27B бар Computer, Hermes және Pi үшін BrowseComp ұпайы мен әр тапсырма үшін орташа қабырға уақытының шашырау диаграммасы; Computer ең аз уақыт пен ең аз токендермен ең жоғары ұпайға жетеді.
Құрылғыішілік Qwen 3.8 27B моделімен BrowseComp нәтижелері: Computer, Hermes және Pi орталары үшін әр тапсырма бойынша орташа қабырға уақытына қарсы ұпай; нүкте белгілері әр тапсырма үшін орташа токендерді көрсетеді. Аяқталмаған нәтижелер нөл ұпай алады, ал уақыт пен токен орташа мәндері өлшемдері жазылмаган rollout-тарды қоспайды. Мұртшалар — ұпай үшін 95% Wilson сенімділік интервалдары.

Құрылғыішілік мультимодальды құжаттарды түсіну

Көптеген құжаттар ақпаратты визуалды түрде жеткізеді және жай мәтін ретінде талдау қиын: PDF файлдары, сканерленген беттер, скриншоттар, диаграммалар және презентациялар. Бұл жұмыс процестері OCR және кескінді түсінуге тәуелді және жергіліктен мультимодальды модельден көбірек пайда көреді.

Орта құжат беттері мен кескіндерді тікелей модельге жібереді, ол оларды түсінеді және визуалды дәлелдерді шығарылған мәтінмен біріктіреді. Бұл файлдарды құрылғыда өңдеу құпия құжаттар мен олардың шығарылған мазмұнын қауіпсіз сақтайды.

Біз мультимодальды құжаттарды түсінуді ParseBench бенчмаркының 100 тапсырмадан тұратын ішкі жиынтығы ParseBench-100 бойынша бағалаймыз, оның ішінде диаграммалар, макет, кестелер, мәтін мазмұны және пішімдеу үшін әрқайсысы 20 тапсырмадан тұрады.

Hermes үшін 34.6% және Pi үшін 13.9% болса, Computer 65.1% орташа ұпайға жетеді. Ол сондай-ақ тапсырмаларды ең аз уақытпен және ең аз токендермен орындайды: Hermes үшін 108.3 секунд және 32.1k токен және Pi үшін 410.5 секунд және 829.1k токен болса, әр тапсырма үшін орта есеппен 60.6 секунд және 20.1k токен жұмсайды. Computer барлық бес құжат санатында көш бастап тұр, ең үлкен артықшылығы диаграммаларда байқалады. Макет барлық үш орта үшін де қиын болып қала береді.

Qwen 3.8 27B бар Computer, Hermes және Pi үшін ParseBench-100 OCR ұпайы мен әр тапсырма үшін орташа қабырға уақытының шашырау диаграммасы; Computer ең аз уақыт пен ең аз токендермен ең жоғары ұпайға жетеді.
Құрылғыішілік Qwen 3.8 27B моделімен ParseBench-100 OCR нәтижелері: Computer, Hermes және Pi орталары үшін әр тапсырма бойынша орташа қабырға уақытына қарсы ұпай; нүкте белгілері әр тапсырма үшін орташа токендерді көрсетеді. Токендердің орташа мәндері жазылған өлшемдері бар rollout-тарды пайдаланады. Мұртшалар — 95% сенімділік интервалдары.

1-кесте. Құрылғыішілік Qwen 3.8 27B моделі бар Computer, Hermes және Pi орталары үшін құжат санаты бойынша ParseBench-100 орташа ұпайы. Computer барлық бес санатта көш бастап тұр.

Орта

Диаграмма

Макет

Кесте

Мәтін мазмұны

Пішімдеу

Computer

76.5%

16.2%

72.7%

87.9%

72.4%

Hermes

29.3%

2.9%

44.1%

61.5%

35.2%

Pi

2.5%

0.1%

11.0%

29.7%

26.1%

Кеңесшіге жүгіну арқылы шекті алшақтықты қысқарту

Мұқият жобаланған ортаның өзінде, ең қиын тапсырмалар ықшам құрылғыішілік модельдің мүмкіндіктерінен әлі де асып түседі. Мұндай тапсырмалар үшін орта кеңесші құралын ұсынады: жергілікті модель жоспарлау, анық еместікті шешу, қайталанатын қателерден қалпына келтіру немесе соңғы нәтиже көмек қажет болған кезде қуаттырақ шекті модельге жүгіне алады.

Жергілікті модель кеңес сұрау қашан қажет екенін шешеді, ал орта оркестраторы құрал өкілеттігін сақтайды және қандай контекст жіберілетінін басқарады. Кеңесшіге жүгіну міндетті емес. Пайдаланушы оны қосуды және әр кеңесші шақыруын қолмен немесе автоматты түрде мақұлдауды өзі шешеді.

Кеңесшіні шақыру алдында орта тиісті контекстті таңдайды, сезімтал ақпаратты белгілеу үшін PII жіктеуішін қолданады және пайдаланушыға құрылғыдан не кететінін көрсетеді. Кеңесші тек мақұлданған контекстті алады және мәтіндік нұсқаулықты қайтарады; оның құрылғының файлдарына, құралдарына немесе диалогтарына тікелей қатынасы жоқ. Бұл шығындар мен құпиялылықты жақсартады, және біз болашақ жұмыста бұл бағытты одан әрі зерттеуді жоспарлап отырмыз.

Кеңесшіге жүгіну диаграммасы: орта оркестраторы құрал өкілеттігін сақтайды және кеңесші модельге тек мақұлданған контекстті жібереді, ол құралдарға немесе файлдарға тікелей қатынаусыз мәтіндік нұсқаулықты қайтарады.
Қашықтан басқару, жергілікті бақылау. Орта оркестраторы құрал өкілеттігін сақтайды және тек көтеру үшін мақұлданған контекстті жібереді. Кеңесшінің құралдарға, файлдарға немесе жауап каналына тікелей қатынасы жоқ; ол жергілікті модель пайдалануы мүмкін мәтіндік нұсқаулықты қайтарады.

Біз бұл тәсілді күшті пайымдауды талап ететін және жергілікті модель көбінесе жетіспейтін күрделі бағдарламалық жасақтама тапсырмаларында сынаймыз. Ол үшін біз кодтау агенттеріне арналған танымал 89 тапсырмалық бенчмарк Terminal Bench 2.1 қолданамыз.

Біз екі сұраққа жауап бергіміз келеді: шекті модельге дейінгі алшақтықтың қанша бөлігін кеңесшіге жүгіну арқылы жабуға болады және қандай бағамен. Толығымен жергілікті модельдерді іске қосу ешқандай шығынды талап етпейді, өйткені вывод пайдаланушының жабдығында орындалады. Алайда модель кеңесшіні шақыра бастағаннан кейін ол API шығындарына ұшырай бастайды.

Шекті өнімділік үшін баזис ретінде біз жергілікті ортада жұмыс істейтін Claude Opus 5 қолданамыз; жергілікті модель — Qwen 3.8 27B. Соңында біз екеуін біріктіреміз: Qwen 3.8 27B тапсырманы орындайды және көмек қажет болған кезде Claude Opus 5 кеңесшісіне жүгінеді. Біз Pi немесе Hermes көмегімен кеңесшіге жүгінуді бағаламаймыз, өйткені екеуі де балама кеңесші құрамын ұсынбайды; біреуін қосу оның құрал бетін және оркестрация логикасын өзгертуді талап етеді, сондықтан нәтиже дайын ортаны көрсетпейтін болады.

Кеңесшіге жүгіну Computer ұпайын 59.6%-дан 73.0%-ға дейін арттырады, бұл бір rollout үшін шамамен $0.415 API шығынымен 13.5 пайыздық тармаққа өсуді білдіреді. Claude Opus 5 өзін ғана іске қосу rollout үшін $0.65 кезінде 82.4%-ға жетеді. Осылайша, жүгіну шекті мәнге дейінгі алшақтықтың шамамен үш бестен бірін шекті құнының үш екі бөлігіне қалпына келтіреді, және пайдаланушы бұл мәміленің жасауға тұрарлық екенін шешеді.

Terminal Bench 2.1 ұпайы мен rollout үшін API құнының шашырау диаграммасы: толығымен жергілікті Qwen 3.8 27B, Claude Opus 5 кеңесшісі бар Qwen 3.8 27B және тек Claude Opus 5, барлығы Computer ортасында.
89 тапсырма бойынша Terminal Bench 2.1 құн-өнімділігі: rollout үшін API құнына қарсы ұпай. Барлық нүктелер Computer ортасын пайдаланады: толығымен жергілікті Qwen 3.8 27B, Claude Opus 5 кеңесшісіне жүгінетін Qwen 3.8 27B және тек Claude Opus 5. Үзілмелі сызықтар нөлдік API құнымен сол жергілікті модельді іске қосатын Pi мен Hermes көрсетеді. Мұртшалар — тапсырманы bootstrap-тау 95% сенімділік интервалдары; аяқталмаған rollout-тар нөл ұпай алады.

Орта мен білім беру жұмыстарына арналған кейінгі оқыту

Осы уақытқа дейін біз ортаның қосқан үлесін бөліп көрсету үшін жергілікті модельді өзгертпедік. Орта дизайны орнында болған кезден бастап, қалған ең үлкен жетістіктер модельдің өзін бейімдеуден келеді. Perplexity Computer пайдалану деректері бізге адамдардың білім беру жұмыстары үшін нақты не істейтінін көрсетеді, біз оны оқыту деректерін синтездеу үшін пайдаланамыз. Біз пайдаланушылар орындайтын тапсырмалардың нақты таралуына сүйене отырып, Computer ортасының ішінде жергілікті модельді кейінгі оқытудан өткіземіз.

Атап айтқанда, біз әртүрлі модель мүмкіндіктерін, құралдар мен коннекторларды іске қосатын әртүрлі пайдалану жағдайларын анықтаймыз. Осы пайдалану жағдайларынан біз шынайы артықшылықты оқыту орталарын синтездейміз және күрделі, бірақ тексерілетін тапсырмаларды анықтаймыз: әр тапсырма нұсқаулықтан, ортадан және соңғы нәтижеге баға қоятын тексерушіден тұрады, мұндағы орта — орта жұмыс істейтін Docker контейнері. Ең бастысы, тапсырмалар синтетикалық болғандықтан, оlarda ешқандай нақты құжаттар немесе пайдаланушы ақпараты жоқ.

Біз бұл орталарды екі сатылы оқыту үшін қолданамыз: қабылдамауды нақтылау (rejection fine-tuning), одан кейін артықшылықты оқыту (reinforcement learning). Бірінші кезеңде біз модельді әр тапсырмаға қарсы бірнеше рет іске қосамыз, тексеруші ұпайы бойынша ең жақсы траекторияларды таңдаймыз және олармен бақыланатын оқыту арқылы оқытамыз. Бұл кезең модельді нақты орта мен тапсырмалардың таралуына инициализациялайды. Екінші кезеңде артықшылықты оқыту модельді одан әрі нақтылап, оны тұрақтырақ етеді.

Тапсырмалардың бір бөлігі оқытудан бөлек сақталады және соңғы бағалау үшін қолданылады; біз бұл бөлінген жиынтықты Local Knowledge Work Bench деп атаймыз: бұл терең зерттеуден бастап құжаттарды жасауға дейінгі күнделікті білім беру жұмыстарының жеті санатты қамтитын 53 тапсырмасы. Біз жақын арада модельді оқытуды егжей-тегжейлі сипаттайтын техникалық есепті жариялаймыз және бұл бағалау бенчмаркын ашық кодты етуді жоспарлап отырмыз.

Біз осы тәсілмен Qwen 3.8 27B оқытып, PPLX 27B деп аталатын модельді шығардық және оны Local Knowledge Work Bench жүйесінде бағаладық. Базалық Qwen 3.8 27B моделі арқылы Computer ең жоғары ұпайға қол жеткізеді (Pi үшін 77.6% және Hermes үшін 74.0% болса, 82.6%) және ең аз токендерді пайдаланады (Pi үшін 681k және Hermes үшін 634k болса, 520k). Pi тапсырмаларды ең жылдам аяқтайды — әр тапсырма үшін 176 секунд, ал Computer үшін 218 секунд және Hermes үшін 292 секунд. PPLX 27B көбірек токендерді тұтыну арқылы (520k-ге қарсы 678k) Computer ұпайын 85.4%-ға дейін көтереді. Оның болжалды қабырға уақыты — 250 секунд.

Local Knowledge Work Bench ұпайы мен әр тапсырма үшін орташа қабырға уақытының шашырау диаграммасы; Computer жүйесінде жұмыс істейтін PPLX 27B 85.4% ең жоғары ұпайға жетеді.
Local Knowledge Work Bench жүйесіндегі кейінгі оқыту нәтижелері: әр тапсырма үшін орташа қабырға уақытына қарсы ұпай; нүкте белгілері ортаны, модельді және әр тапсырма үшін орташа токендерді көрсетеді. PPLX 27B — Computer жүйесінде жұмыс істейтін кейінгі оқытылған моделіміз. Мұртшалар — әрқайсысы үш сынағы бар 53 тапсырма бойынша 95% сенімділік интервалдары.

2-кесте. Local Knowledge Work Bench тапсырма санаттары.

Санат

Тапсырмалар

Үлес

Сипаттама

Терең зерттеу

20

37.7%

Көп қадамды веб-зерттеуді, жалпыға қолжетімді деректер жиынын, статистиканы және көзді тексеруді талап ететін күрделі сұрақтарға жауап беру.

Деректер, қаржы және сатып алу

9

17.0%

Деректер жиынын тазарту, жазбаларды сәйкестендіру, шығындарды аудиттен өткізу, инвестицияларды талдау, жеткізушілерді бағалау және қаржылық көрсеткіштерді есептеу.

Құжаттар, презентациялар және дизайн

7

13.2%

Сапалы PDF файлдарын, шот-фактураларды, кіріспе материалдарды, іс-шара материалдарын және бизнес-презентацияларды дайындау.

Инженерия, IT және инциденттер

5

9.4%

Инциденттерді зерттеу, журналдарды талдау, қалпына келтіру жоспарларын жазу, шығарылымға дайындықты бағалау және техникалық құжаттаманы синтездеу.

Келісімшарттар, дәлелдемелер және сәйкестік

5

9.4%

Келісімшарттарды қарап шығу, дәлелдемелерді тексеру, қайта шақыруларды зерттеу, сезімтал құжаттарды жасыру және сәйкестік талаптарын тексеру.

Бақылау тақталары, бағдарламалық жасақтама және визуализация

4

7.5%

Интерактивті бақылау тақталарын, білім беру микросайттарын, диаграммаларды және жоба визуализацияларын жасау.

Адамдар, жобалар және кездесулер

3

5.7%

Түйіндемелерді тексеру, жиналыс шешімдерін біріктіру және жоба әрекеттерін қадағалау құралдарын жүргізу.

Барлығы

53

100%

Қорытынды

Біздің зерттеуіміз көрсеткендей, қабілетті жергілікті жабдығы мен олар үшін жасалған ортасы бар мықты ашық кодты модель сезімтал деректердің құрылғыдан шығуын талап етпестен, нөлге жуық вывод құнымен нақты білім беру жұмыстарын атқара алады.

Әртүрлі бенчмарктер бойынша Computer NVIDIA DGX Spark жүйесінде Qwen 3.8 27B іске қоса отырып, дәлдік бойынша Hermes пен Pi көрсеткіштеріне жетті немесе асып түсті. Кідіріс пен токендерді пайдалану туралы хабарлайтын үш бенчмарктің ішінде Computer BrowseComp және ParseBench-100 бойынша ең жылдам болды және үшеуінде де ең аз токендерді пайдаланды; Pi Local Knowledge Work Bench жүйесінде ең жылдам болды.

Табыстар біз жасаған таңдаулардың арқасында келді. Біз сұраныс бойынша жүктелетін дағдылары бар ықшам жергілікті орта құрдық. Біз коннекторларды MCP серверлерінің орнына ықшам CLI құралдарына айналдырдық. Қауіпсіздік үшін орындау құмсалғышқа қойылды.

Нәтижелер сонымен қатар ықшам модельдердің жақсартуға орын барын көрсетеді. Мысалы, Terminal Bench 2.1 күрделі кодтау тапсырмаларында жергілікті модель барлық үш орта бойынша шекті модельден қалып қояды. Кеңесшіге жүгіну алшақтықты тарылтады, бірақ толығымен жаппайды; өнімділікті одан әрі арттыру үшін модель мүмкіндіктері мен жергілікті жабдықты үздіксіз жетілдіру әлі де қажет.

Жергілікті шектеулер үшін орта мен модельді құрудың мақсаты — пайдаланушыларға қандай ақпарат өз машиналарынан кететінін анық бақылауға мүмкіндік беру. Сондай-ақ пайдаланушы үшін шығындарды үнемдеу артықшылықтары бар. Біз мұны мүмкіндіктері артып келе жатқан агенттер қашықтағы инфрақұрылымнан жеке және жергілікті құрылғыларға ауысатын кеңірек өзгерістің бөлігі ретінде көреміз. Чиптер, модельдер мен құрылғылар саласындағы жетістіктер Portable Computer жергілікті түрде өңдейтін білім беру жұмыстарының ауқымы мен сапасын үздіксіз кеңейте береді деп күтеміз.