Özel ve Maliyet Etkin Bilgi Çalışması için Yerel Öncelikli Bir Ajan

Cihaz üzerinde çalışan ve talep üzerine uzak yeteneklere erişen, yerel bilgi çalışması için ortak tasarlanmış bir donanım katmanı ve model.

YazarlarPerplexity Research

Perplexity Portable Computer, yerel öncelikli bir ajandır.

Tüm yığın varsayılan olarak yerel olarak çalışır. Model, donanım katmanı, konuşma ve yörünge tamamen kullanıcının makinesinde bulunur. Web araması, bağlayıcılar veya bulutta daha güçlü bir danışman modele yönlendirme gibi dış dünya gerektiren işler, yalnızca gerektiğinde çağrılır ve her zaman kullanıcı tarafından denetlenir. Bu nedenle hassas veriler asla izinsiz olarak cihazı terk etmez ve yerel modeller hiçbir çıkarım ücreti taşımaz: sistem, yapısı gereği hem gizli hem de maliyet etkindir.

Etkili bir yerel öncelikli ajan, modelin ve donanım katmanının birlikte tasarlanmasını gerektirir. Genel amaçlı donanım katmanları; uzun bağlamları sindirebilen, geniş bir araç yüzeyinde gezinebilen ve uzun ufuklarda plan yapabilen öncü bir model varsayar. Yerel modeller bu talepler altında daha az güvenilirdir. Küçük bir modelden büyük bir model için oluşturulmuş bir donanım katmanını yönetmesini istemek yerine, ikisini birbirine göre şekillendirdik: modelin yetenek profiline göre uyarlanmış bir donanım katmanı ve bu donanım katmanını etkili bir şekilde kullanmak üzere sonradan eğitilmiş bir model.

Giriş

Son aylarda ajan yetenekleri, çok çeşitli bilgi çalışması görevlerinde hızla ilerledi. Bu ilerlemeler üretkenlik ve verimlilikte büyük artışlar sağlarken, aynı zamanda iki zorluğu da beraberinde getiriyor.

Token tüketimi hızla artıyor ve bununla birlikte genel harcamalar da yükseliyor. Uzak kümelemelerde çalışan kapalı kaynaklı modellerin API'leri aracılığıyla zekaya erişildiğinde, her istekte özel bilgiler ve fikri mülkiyet kullanıcının cihazını terk eder. Ajanlar bireysel iş akışları ve tüm organizasyonlar ölçeğinde yayıldıkça, token harcaması ve veri hareketi yönetilmesi giderek zorlaşan bir hal alıyor.

Aynı zamanda, açık kaynaklı modeller bundan da hızlı bir şekilde gelişti. İlerleme; NVIDIA Nemotron 3.5 Lightning (toplam 30B parametre), Qwen 3.6 (35B) ve Qwen 3.8 (27B) gibi çok küçük ve verimli modellerde en belirgin halindedir. Bu küçük modeller kapasitelerinin üzerinde performans göstermekte ve artık karmaşık ajan iş akışları gerçekleştirebilmektedir. Yerel çıkarım donanımı da paralel olarak ilerlemektedir: NVIDIA DGX Spark gibi sistemler artık bu modelleri yerel olarak çalıştırabilmektedir. Bu eğilimler bir araya geldiğinde, web araması, bağlayıcılar veya bulut modeline yönlendirme gibi harici özelliklerin gerektiğinde seçilmesine olanak tanırken, tamamen cihaz üzerinde çalışmayı pratik hale getirir.

Bu yerel öncelikli yaklaşım, yerel çıkarım token başına API ücretlerini ortadan kaldırdığı için önemli maliyet tasarrufları sağlar. Aynı zamanda gizlilik ve fikri mülkiyet endişelerini doğal olarak çözer: özel token'ların uzak kümelere iletilmesine gerek kalmaz ve yerel cihazın sınırları içinde güvenli bir şekilde kalır.

Haziran ayında, hangi işin cihaz üzerinde çalıştırılması gerektiğine ve hangi işin buluttaki ajanlara gitmesi gerektiğine karar veren ilk hibrit yerel-sunucu çıkarım düzenleyicisini tanıttık. Burada, birbirine göre ortak optimize edilmiş model ve donanım katmanı dahil olmak üzere böyle bir yerel öncelikli ajanı nasıl oluşturduğumuzu açıklıyoruz.

Temel tasarım seçimlerine genel bir bakış sunuyor; Computer'ı üç genel benchmark ve dahili Yerel Bilgi Çalışması Benchmark'ımız (Local Knowledge Work Bench) üzerinden popüler açık kaynaklı genel amaçlı donanım katmanlarıyla (Hermes ve Pi) karşılaştırıyoruz. Benchmark'ımızda, bir NVIDIA DGX Spark üzerinde çalışan Qwen 3.8 27B modeliyle Computer, Pi için %77,6 ve Hermes için %74,0'e karşı %82,6 ile en yüksek puanı elde ediyor. Qwen 3.8 27B üzerinde sonradan eğittiğimiz modelimiz PPLX 27B, puanı %85,4'e kadar yükseltiyor.

Yerel Bilgi Çalışması Benchmark puanlarının çubuk grafiği: Qwen 3.8 27B ile Computer, Pi ve Hermes donanım katmanları ve en yüksek puanı %85,4 ile alan PPLX 27B'li Computer.
Temsili 53 günlük bilgi çalışması görevinden oluşan benchmark'ımız olan Yerel Bilgi Çalışması Benchmark'ındaki puanlar. Her çubuk, bir NVIDIA DGX Spark üzerinde çalışan bir donanım katmanı ve model kombinasyonudur; PPLX 27B sonradan eğitilmiş modelimizdir. Görev başına üç deneme; bıyıklar (whiskers) %95 güven aralıklarıdır.

Donanım katmanını yerel model etrafında tasarlayın

Kompakt cihaz içi modeller halihazırda oldukça yetenekli olsa da, performans açısından hala daha büyük öncü modellerin gerisinde kalmaktadır. Bu modelleri etkili bir şekilde yönlendirmek ve sınırlamalarını ele almak için dikkatlice tasarlanmış bir donanım katmanı gereklidir.

Pi ve Hermes gibi popüler açık kaynaklı donanım katmanlarının genel amaçlı olduğu kanıtlanmıştır: boyutlar ve sınıflar genelinde çok çeşitli modellerle iyi çalışırlar. Ancak cihaz içi modellerin yetenekleri için optimize edilmemişlerdir. Yerel donanım katmanını bu ortam için özel olarak, birkaç temel prensip etrafında tasarladık.

Bağlam verimliliği

Donanım katmanımızı tasarlarken temel odak noktamız, modelin bağlamından en iyi şekilde yararlanmak oldu.

Qwen 3.8 27B gibi cihaz içi modeller 260K tokenlık bağlam pencereleri sunsa da, ampirik olarak 100K token sonrasında zorlanmaya başladıklarını gördük. Bu nedenle çekirdek donanım katmanını kısa ve öz tutuyoruz: minimum düzeyde bir sistem istemi ve küçük bir çekirdek araç seti.

Diğer tüm yetenekler, yörünge boyunca yüklenen ve kaldırılan isteğe bağlı beceriler halinde modülerleştirilmiştir. Bu becerileri yaygın bilgi çalışması görevleri için tasarladık: araştırma, veri bilimi, veri görselleştirme, belge oluşturma, yazılım mühendisliği ve daha fazlası.

Donanım katmanı ayrıca bağlam sıkıştırmasını destekleyerek, bir yörünge uzadığında eskiyen bağlamı özetler ve böylece modelin etkili penceresi içinde kalmasını sağlar.

Komut satırı araçları olarak bağlayıcılar

Günlük bilgi çalışması genellikle Gmail, GitHub, Outlook ve Google Takvim gibi bağlayıcılar gerektirir. Bunlar genellikle bir donanım katmanına, büyük araç tanımları bağlamın önemli bir kısmını tüketen MCP sunucuları olarak sunulur. Bunun yerine, en çok kullanılan MCP'leri, sınırlı etkili bağlamdan çok daha iyi yararlanan özel becerilerle desteklenen kompakt, kullanımı kolay komut satırı araçlarına dönüştürdük.

Öz doğrulama

Ajan kendi çalışmasını doğruladığında performans da artar. Doğrulama ekstra adımlar ekler, ancak nihai sonuçları büyük ölçüde iyileştirir ve öncü modellerle olan farkı önemli ölçüde daraltır. Modelin kendisi tarafından veya yörüngenin sağlığını izleyen ve bir şeyler ters gittiğinde öz doğrulama talep eden bir dizi kanca (hook) tarafından tetiklenebilir.

Korumalı alanda yürütme

Donanım katmanı, araçları kullanıcının cihazındaki işletim sistemi düzeyinde bir korumalı alanda yürütür. Sınır, işlemleri, dosya sistemi yollarını ve ağ erişimini politikaya göre kısıtlar. Bu, hatalı bir komutun etki yarıçapını sınırlar. Korumalı alan kullanılamıyorsa, donanım katmanı korumasız yürütmeye düşmek yerine herhangi bir araç çağrısından önce kendini devre dışı bırakır.

Bu, komutları varsayılan olarak doğrudan kullanıcının izinleriyle çalıştıran Pi ve Hermes gibi açık kaynaklı donanım katmanlarından farklıdır. Computer'da yalıtım her zaman açıktır, yapılandırma gerektirmez ve araçlar bunun olmadan çalışamaz.

Aşağıdaki diyagram, bu prensiplerin yürütme döngüsünde nasıl bir araya geldiğini göstermektedir. Düzenleyici bir LLM değil, belirleyici bir donanım katmanı kodudur: döngüyü sürdürür, bağlamı bir araya getirir ve politikayı uygular. Yerel model sonraki eylemi önerir; düzenleyici onaylanan araç çağrılarını korumalı alanda yürütür ve sonuçlarını modele geri döndürür. Web araması, bağlayıcılar ve danışman çağrıları, yalnızca etkinleştirildiğinde ve onaylandığında cihaz sınırını geçer.

Yerel donanım katmanı yürütme döngüsü diyagramı: belirleyici düzenleyici kodu bağlamı toplar ve korumalı alan araçlarını çalıştırır, yerel model eylemleri önerir ve cihaz dışı hizmetler isteğe bağlı olup kullanıcı tarafından denetlenir.
Yerel donanım katmanının bir görevi nasıl yürüttüğü. Belirleyici donanım katmanı kodu döngüyü ve korumalı alan araçlarını kontrol eder; yerel model eylemleri önerir. Cihaz dışı hizmetler isteğe bağlı olup kullanıcı tarafından denetlenir.

Yerel bir donanım katmanı aynı modelden daha fazlasını elde etmeyi sağlar

Aynı cihaz içi temel modeli kullanarak yerel donanım katmanımızı web araştırması ve çok modlu belge anlama konularında genel amaçlı alternatiflerle karşılaştırıyoruz. Tüm donanım katmanları, bir NVIDIA DGX Spark üzerinde çalışan, orta düzey muhakemeye sahip Qwen 3.8 27B modelini kullanır. Bu karşılaştırma, herhangi bir model sonradan eğitiminden bağımsız olarak, doğrudan donanım katmanının kendisinin katkıda bulunduğu yetenekleri izole eder.

Bu iki yeteneğe odaklanıyoruz çünkü bilgi çalışması genellikle kullanıcının cihazındaki özel belgeleri web'den gelen kamuya açık bilgilerle birleştirerek topraklanmış bir yapıt üretir. Web araması bağlantı gerektirir, ancak model çıkarımı ve özel belge işleme yerel kalır. Yerel dosyalar yetkili kaynak olarak hizmet eder, kamu kaynakları bağlam ekler ve kullanıcılar tamamen çevrimdışı çalışma için web aramasını tamamen devre dışı bırakabilir.

Web araştırması

Yerel donanım katmanımızı, bağımsız değerlendirmelerde en üst sıralara ulaşmış olan Perplexity'nin arama motoruyla birlikte oluşturuyoruz. Donanım katmanı buna Search as Code arayüzü üzerinden erişir.

Araştırma kalitesini 1.266 BrowseComp görevinde değerlendiriyoruz. Computer, yerel donanım katmanımızın yanı sıra Perplexity'nin arama altyapısını kullanırken, Pi ve Hermes önerilen arama sağlayıcıları olan Brave'e güveniyor. Computer, Pi için %50,2 ve Hermes için %43,9'a kıyasla %66,7 doğruluğa ulaşıyor.

Computer ayrıca en düşük ortalama kaydedilen duvar saati süresine ve token kullanımına sahiptir: görev başına Hermes için 1.020,9 saniye ve 1,01 milyon token, Pi için ise 826,0 saniye ve 2,82 milyon token'a kıyasla görev başına 402,1 saniye ve 852k token. Bu nedenle Computer, Hermes'e göre %61 daha az duvar saati süresi ve %16 daha az token, Pi'ye göre ise %51 daha az duvar saati süresi ve %70 daha az token kullanır.

Qwen 3.8 27B ile Computer, Hermes ve Pi için görev başına ortalama duvar saati süresine karşı BrowseComp puanının saçılım grafiği; Computer en az süre ve en az token ile en yüksek puana ulaşır.
Cihaz içi Qwen 3.8 27B modeliyle BrowseComp sonuçları: Computer, Hermes ve Pi donanım katmanları için görev başına ortalama duvar saati süresine karşı puan; nokta etiketleri görev başına ortalama token'ları gösterir. Tamamlanmamış sonuçlar sıfır puan alır ve süre ile token ortalamaları kaydedilmiş ölçümleri olmayan rollout'ları hariç tutar. Bıyıklar, puan için %95 Wilson güven aralıklarıdır.

Cihaz üzerinde çok modlu belge anlama

Birçok belge bilgiyi görsel olarak taşır ve düz metin olarak ayrıştırılması zordur: PDF'ler, taranmış sayfalar, ekran görüntüleri, grafikler ve sunumlar. Bu iş akışları OCR ve görüntü anlamaya dayanır ve en çok yerel olarak çok modlu bir modelden fayda sağlar.

Donanım katmanı belge sayfalarını ve görüntüleri doğrudan modele aktarır; model bunları anlar ve görsel kanıtı çıkarılan metinle birleştirir. Bu dosyaların cihaz üzerinde işlenmesi, hassas belgeleri ve çıkarılan içeriklerini gizli tutar.

Çok modlu belge anlamayı, ParseBench benchmark'ının grafikler, düzen, tablolar, metin içeriği ve biçimlendirme için her biri 20 görev içeren 100 görevlik bir alt kümesi olan ParseBench-100 üzerinde değerlendiriyoruz.

Computer; Hermes için %34,6 ve Pi için %13,9'a kıyasla %65,1'lik bir ortalama puana ulaşmaktadır. Ayrıca görevleri en az süre ve en az token ile tamamlar: ortalama olarak görev başına Hermes için 108,3 saniye ve 32,1k token, Pi için 410,5 saniye ve 829,1k token'a kıyasla görev başına 60,6 saniye ve 20,1k token kullanır. Computer, en büyük avantajını grafikte göstererek beş belge kategorisinin tümünde liderdir. Düzen, her üç donanım katmanı için de zor olmaya devam etmektedir.

Qwen 3.8 27B ile Computer, Hermes ve Pi için görev başına ortalama duvar saati süresine karşı ParseBench-100 OCR puanının saçılım grafiği; Computer en az süre ve en az token ile en yüksek puana ulaşır.
Cihaz içi Qwen 3.8 27B modeliyle ParseBench-100 OCR sonuçları: Computer, Hermes ve Pi donanım katmanları için görev başına ortalama duvar saati süresine karşı puan; nokta etiketleri görev başına ortalama token'ları gösterir. Token ortalamaları kaydedilmiş ölçümleri olan rollout'ları kullanır. Bıyıklar %95 güven aralıklarıdır.

Tablo 1. Cihaz içi Qwen 3.8 27B modeline sahip Computer, Hermes ve Pi donanım katmanları için belge kategorisine göre ParseBench-100 ortalama puanı. Computer beş kategorinin tümünde liderdir.

Donanım Katmanı

Grafik

Düzen

Tablo

Metin içeriği

Biçimlendirme

Computer

%76,5

%16,2

%72,7

%87,9

%72,4

Hermes

%29,3

%2,9

%44,1

%61,5

%35,2

Pi

%2,5

%0,1

%11,0

%29,7

%26,1

Danışman yönlendirmesiyle öncü farkını daraltma

Dikkatlice tasarlanmış bir donanım katmanıyla bile, en zor görevler hala kompakt bir cihaz içi modelin yeteneklerini aşmaktadır. Bu tür görevler için donanım katmanı bir danışman aracı sunar: yerel model; planlama, belirsizliği çözme, tekrarlanan hatalardan kurtulma veya nihai sonucu doğrulama konusunda yardıma ihtiyaç duyduğunda daha güçlü bir öncü modele danışabilir.

Yerel model ne zaman tavsiye isteyeceğine karar verirken, donanım katmanı düzenleyicisi araç yetkisini elinde tutar ve hangi bağlamın gönderileceğini kontrol eder. Yönlendirme isteğe bağlıdır. Kullanıcı bunu etkinleştirip etkinleştirmeyeceğine ve her danışman çağrısını manuel olarak mı yoksa otomatik olarak mı onaylayacağına karar verir.

Bir danışman çağrısından önce donanım katmanı ilgili bağlamı seçer, hassas bilgileri işaretlemek için bir PII sınıflandırıcı uygular ve kullanıcıya cihazdan neyin ayrılacağını gösterir. Danışman yalnızca onaylanan bağlamı alır ve metin rehberliği döndürür; cihazın dosyalarına, araçlarına veya konuşmalarına doğrudan erişimi yoktur. Bu hem maliyeti hem de gizliliği artırır ve bu yönü gelecekteki çalışmalarda daha fazla incelemeyi planlıyoruz.

Danışman yönlendirmesi diyagramı: donanım katmanı düzenleyicisi araç yetkisini elinde tutar ve araçlara veya dosyalara doğrudan erişimi olmadan metin rehberliği döndüren danışman modele yalnızca onaylanmış bağlamı gönderir.
Uzak rehberlik, yerel kontrol. Donanım katmanı düzenleyicisi araç yetkisini korur ve yalnızca yönlendirme için onaylanan bağlamı gönderir. Danışmanın araçlara, dosyalara veya yanıt kanalına doğrudan erişimi yoktur; yerel modelin kullanabileceği metin rehberliği döndürür.

Bu yaklaşımı, güçlü muhakeme gerektiren ve yerel bir modelin en sık yetersiz kaldığı zorlu yazılım mühendisliği görevlerinde test ediyoruz. Bunun için kodlama ajanları için popüler bir 89 görevlik benchmark olan Terminal Bench 2.1'i kullanıyoruz.

İki soruyu yanıtlamak istiyoruz: danışman yönlendirmesi öncü bir modele olan mesafenin ne kadarını kapatabilir ve hangi maliyetle. Tamamen yerel modellerin çalıştırılması neredeyse hiç maliyet getirmez, çünkü çıkarım kullanıcının donanımında gerçekleşir. Ancak model danışmanı çağırmaya başladığında API maliyetleri oluşmaya başlar.

Öncü performans için temel çizgi olarak, yerel donanım katmanında çalışan Claude Opus 5'i kullanıyoruz; yerel model ise Qwen 3.8 27B'dir. Son olarak ikisini eşleştiriyoruz: Qwen 3.8 27B görevi yürütür ve yardıma ihtiyaç duyduğunda Claude Opus 5 danışmanına yönlendirir. Pi veya Hermes ile danışman yönlendirmesini değerlendirmiyoruz çünkü hiçbiri eşdeğer bir danışman aracı sağlamamaktadır; bir tane eklemek, araç yüzeyini ve düzenleme mantığını değiştirmeyi gerektireceğinden sonuç artık kullanıma hazır donanım katmanını temsil etmez.

Danışman yönlendirmesi, rollout başına tahmini $0,415 API maliyetiyle Computer'ın puanını %59,6'dan %73,0'e (13,5 yüzde puanlık bir kazanç) çıkarır. Yalnızca Claude Opus 5 çalıştırmak rollout başına $0,65 ile %82,4'e ulaşır. Dolayısıyla yönlendirme, öncünün maliyetinin yaklaşık üçte ikisinde öncüye olan mesafenin kabaca beşte üçünü telafi eder ve kullanıcı bu takasın yapmaya değer olup olmadığına karar verir.

Rollout başına API maliyetine karşı Terminal Bench 2.1 puanının saçılım grafiği: Tamamen yerel Qwen 3.8 27B, Claude Opus 5 danışmanlı Qwen 3.8 27B ve tek başına Claude Opus 5, hepsi Computer donanım katmanında.
89 görevde Terminal Bench 2.1 maliyet performansı: rollout başına API maliyetine karşı puan. Tüm noktalar Computer donanım katmanını kullanır: tamamen yerel Qwen 3.8 27B, bir Claude Opus 5 danışmanına yönlendiren Qwen 3.8 27B ve tek başına Claude Opus 5. Kesikli çizgiler, aynı yerel modeli sıfır API maliyetiyle çalıştıran Pi ve Hermes'i gösterir. Bıyıklar görev önyüklemeli %95 güven aralıklarıdır; tamamlanmamış rollout'lar sıfır puan alır.

Donanım katmanı ve bilgi çalışması için sonradan eğitim

Şimdiye kadar, donanım katmanının ne katkıda bulunduğunu izole etmek için yerel modeli değiştirmeden tuttuk. Donanım katmanı tasarımı yerindeyken, kalan en büyük kazançlar modelin kendisini uyarlamaktan gelmektedir. Perplexity Computer kullanım verileri bize insanların bilgi çalışması için aslında ne yaptığını gösterir ve biz de bunu eğitim verilerini sentezlemek için kullanırız. Kullanıcıların gerçekleştirdiği gerçek görev dağılımının rehberliğinde, yerel modeli Computer donanım katmanı içinde sonradan eğitiriz.

Somut olarak, farklı model yeteneklerini, araçları ve bağlayıcıları çalıştıran çok çeşitli kullanım durumları belirleriz. Bu kullanım durumlarından gerçekçi pekiştirmeli öğrenme ortamları sentezler ve zorlu ancak doğrulanabilir görevler tanımlarız: her görev bir yönerge, bir ortam ve donanım katmanının üzerinde çalıştığı ortamın bir Docker kapsayıcısı olduğu, nihai sonucu puanlayan bir doğrulayıcıdan oluşur. Önemli olan, görevlerin sentetik olması nedeniyle gerçek belge veya kullanıcı bilgisi içermemesidir.

Bu ortamları iki aşamalı eğitim için kullanıyoruz: reddetme ince ayarı (rejection fine-tuning) ve ardından pekiştirmeli öğrenme. İlk aşamada, modeli her bir görev karşısında birden çok kez çalıştırıyor, doğrulayıcı puanına göre en iyi yörüngeleri seçiyor ve bunlarla denetimli öğrenme gerçekleştiriyoruz. Bu aşama, modeli belirli donanım katmanı ve görev dağılımı için başlatır. İkinci aşamada, pekiştirmeli öğrenme modeli daha da ince ayardan geçirerek onu daha sağlam hale getirir.

Görevlerin bir alt kümesi eğitimden hariç tutulur ve nihai değerlendirme için kullanılır; bu hariç tutulan sete Yerel Bilgi Çalışması Benchmark'ı (Local Knowledge Work Bench) adını veriyoruz: derin araştırmadan belge oluşturmaya kadar günlük bilgi çalışmasının yedi kategorisine yayılmış 53 görev. Yakında model eğitimini ayrıntılı olarak açıklayan teknik bir rapor yayınlayacağız ve bu değerlendirme benchmark'ını açık kaynaklı hale getirmeyi planlıyoruz.

Qwen 3.8 27B'yi bu yaklaşımla sonradan eğittik, PPLX 27B adını verdiğimiz bir model ürettik ve bunu Yerel Bilgi Çalışması Benchmark'ında değerlendirdik. Temel Qwen 3.8 27B modeliyle Computer, en yüksek puanı elde eder (Pi için %77,6 ve Hermes için %74,0'e kıyasla %82,6) ve en az token'ı kullanır (Pi için 681k ve Hermes için 634k'ya kıyasla 520k). Pi, Computer için 218 saniye ve Hermes için 292 saniyeye kıyasla görev başına 176 saniye ile görevleri en hızlı tamamlayan modeldir. PPLX 27B, Computer'ın puanını daha fazla token maliyetiyle (520k yerine 678k) %85,4'e çıkarır. Tahmini duvar saati süresi 250 saniyedir.

Görev başına ortalama duvar saati süresine karşı Yerel Bilgi Çalışması Benchmark puanının saçılım grafiği; Computer'da çalışan PPLX 27B %85,4 ile en yüksek puana ulaşır.
Yerel Bilgi Çalışması Benchmark'ındaki sonradan eğitim sonuçları: görev başına ortalama duvar saati süresine karşı puan; nokta etiketleri donanım katmanını, modeli ve görev başına ortalama token'ları gösterir. PPLX 27B, Computer'da çalışan sonradan eğitilmiş modelimizdir. Bıyıklar, her biri üç denemeden oluşan 53 görev üzerindeki %95 güven aralıklarıdır.

Tablo 2. Yerel Bilgi Çalışması Benchmark görev kategorileri.

Kategori

Görevler

Pay

Açıklama

Derin araştırma

20

%37,7

Çok aşamalı web araştırması, genel veri kümeleri, istatistikler ve kaynak doğrulaması gerektiren karmaşık soruları yanıtlayın.

Veri, finans ve tedarik

9

%17,0

Veri kümelerini temizleyin, kayıtları uzlaştırın, giderleri denetleyin, yatırımları analiz edin, tedarikçileri değerlendirin ve finansal metrikleri hesaplayın.

Belgeler, sunumlar ve tasarım

7

%13,2

Özenle hazırlanmış PDF'ler, faturalar, işe alım materyalleri, etkinlik materyalleri ve iş sunumları üretin.

Mühendislik, BT ve olaylar

5

%9,4

Olayları araştırın, günlükleri analiz edin, kurtarma planları yazın, sürüm hazırlığını değerlendirin ve teknik belgeleri sentezleyin.

Sözleşmeler, kanıtlar ve uyumluluk

5

%9,4

Sözleşmeleri inceleyin, kanıtları tarayın, geri çağırmaları araştırın, hassas belgeleri karartın ve uyumluluk gereksinimlerini doğrulayın.

Panolar, yazılım ve görselleştirme

4

%7,5

Etkileşimli panolar, eğitsel mikro siteler, grafikler ve proje görselleştirmeleri oluşturun.

İnsanlar, projeler ve toplantılar

3

%5,7

Özgeçmişleri tarayın, toplantı kararlarını konsolide edin ve proje eylem takipleri sağlayın.

Toplam

53

%100

Sonuç

Araştırmamız, yetenekli yerel donanıma ve bunlar için oluşturulmuş bir donanım katmanına sahip güçlü bir açık kaynaklı modelin, hassas verilerin cihazı terk etmesini gerektirmeden, sıfıra yakın çıkarım maliyetiyle gerçek bilgi çalışmasının üstesinden gelebileceğini göstermektedir.

Çeşitli benchmark'lar boyunca Computer, bir NVIDIA DGX Spark üzerinde Qwen 3.8 27B çalıştırırken doğruluk açısından Hermes ve Pi ile eşleşti veya onları aştı. Gecikme ve token kullanımını bildiren üç benchmark arasında Computer, BrowseComp ve ParseBench-100'de en hızlısıydı ve üçünde de en az token'ı kullandı; Pi ise Yerel Bilgi Çalışması Benchmark'ında en hızlısıydı.

Kazançlar yaptığımız seçimlerden geldi. Talep üzerine yüklenen becerilere sahip kısa ve öz yerel bir donanım katmanı oluşturduk. Bağlayıcıları MCP sunucuları yerine kompakt CLI araçlarına dönüştürdük. Yürütme, güvenlik için korumalı alana alındı.

Sonuçlar aynı zamanda kompakt modellerin iyileştirme alanına sahip olduğu yerleri de göstermektedir. Örneğin, Terminal Bench 2.1'in zorlu kodlama görevlerinde yerel model, üç donanım katmanında da öncü modelin gerisinde kalmaktadır. Danışman yönlendirmesi aradaki farkı daraltmakta ancak tamamen kapatmamaktadır; performansı daha ileri taşımak için model yeteneklerinde ve yerel donanımda sürekli iyileştirmelere hala ihtiyaç duyulmaktadır.

Donanım katmanını ve modeli yerel kısıtlamalar için oluşturmanın amacı, kullanıcılara hangi bilgilerin makinelerini terk edeceği konusunda açık kontrol vermektir. Kullanıcı için maliyet faydaları da vardır. Bunları, giderek daha yetenekli ajanların uzak altyapıdan bireysel ve yerel cihazlara taşındığı daha geniş bir değişimin parçası olarak görüyoruz. Çiplerde, modellerde ve cihazlarda yapılacak ilerlemelerin, Portable Computer'ın yerel olarak işlediği bilgi çalışmasının kapsamını ve kalitesini sürekli olarak genişleteceğini umuyoruz.

}}}})();