프라이버시와 비용 효율성을 모두 갖춘 지식 노동을 위한 로컬 우선 에이전트
로컬 지식 노동을 위해 함께 설계된 하니스와 모델로, 기기상에서 실행되며 필요에 따라 원격 기능에 액세스합니다.
Perplexity Portable Computer는 로컬 우선 에이전트입니다.
전체 스택은 기본적으로 로컬에서 실행됩니다. 모델, 하니스, 대화, 트래젝토리 모두 사용자의 기기 상에 존재합니다. 웹 검색, 커넥터, 또는 클라우드의 더 강력한 어드바이저 모델로의 에스컬레이션과 같이 외부 세계가 필요한 작업은 필요할 때만 호출되며 항상 사용자에 의해 제어됩니다. 따라서 민감한 데이터는 허가 없이 기기를 절대 떠나지 않으며, 로컬 모델에는 추론 비용이 부과되지 않습니다. 즉, 시스템은 구조적으로 프라이버시가 보장되고 비용 효율적입니다.
효과적인 로컬 우선 에이전트를 구현하려면 모델과 하니스가 함께 설계되어야 합니다. 범용 하니스는 긴 컨텍스트를 흡수하고, 넓은 도구 인터페이스를 탐색하며, 긴 호환성에 걸쳐 계획을 세울 수 있는 프런티어 모델을 가정합니다. 로컬 모델은 이러한 요구 사항 하에서 신뢰성이 떨어집니다. 큰 모델용으로 빌드된 하니스를 작은 모델에게 관리하도록 요구하기보다는, 모델의 역량 프로파일에 맞춤화된 하니스와 해당 하니스를 효과적으로 사용하도록 사후 학습된 모델이라는 서로를 보완하는 두 가지 요소를 설계했습니다.
소개
최근 몇 달 동안 지식 노동 작업의 광범위한 영역에서 에이전트 역량이 급격히 발전했습니다. 이러한 발전은 생산성과 효율성 측면에서 큰 향상을 가져오는 동시에 두 가지 과제를 제기합니다.
토큰 소비량이 빠르게 증가함에 따라 전체 비용도 함께 증가하고 있습니다. 원격 클러스터에서 실행되는 클로즈드소스 모델의 API를 통해 지능형 기능에 액세스할 때마다, 요청이 있을 때마다 개인 정보와 지식 재산이 사용자의 기기를 떠나게 됩니다. 에이전트가 개별 워크플로우 및 전체 조직 전반으로 확장됨에 따라 토큰 지출과 데이터 이동을 거버넌스하기가 점점 더 어려워지고 있습니다.
동시에 오픈소스 모델은 훨씬 더 빠른 속도로 개선되었습니다. 진화는 NVIDIA Nemotron 3.5 Lightning(총 300억 개 파라미터), Qwen 3.6(350억 개), Qwen 3.8(270억 개)과 같이 매우 작고 효율적인 모델에서 가장 두드러지게 나타납니다. 이러한 소형 모델들은 체급 이상의 성능을 발휘하며 이제 복잡한 에이전트 워크플로우를 수행할 수 있습니다. 로컬 추론 하드웨어 역시 병행하여 발전하고 있습니다. NVIDIA DGX Spark와 같은 시스템을 통해 이제 이러한 모델들을 로컬에서 실행할 수 있습니다. 이러한 트렌드가 결합되어, 웹 검색, 커넥터, 클라우드 모델 에스컬레이션 등 외부 기능이 필요할 때 사용자가 이를 선택할 수 있도록 허용하는 동시에 완전한 온디바이스 작동을 실현 가능하게 만듭니다.
이러한 로컬 우선 접근 방식은 로컬 추론을 통해 토큰당 API 비용을 방지함으로써 상당한 비용 절감을 가능하게 합니다. 또한 프라이버시 및 지식 재산권 문제를 자연스럽게 해결합니다. 프라이빗 토큰을 원격 클러스터로 전송할 필요가 없으며 로컬 기기의 경계 내에 안전하게 유지됩니다.
6월에는 어떤 작업을 온디바이스에서 실행하고 어떤 작업을 클라우드의 에이전트로 보낼지 결정하는 최초의 하이브리드 로컬-서버 추론 오케스트레이터를 선보였습니다. 여기서는 하니스와 서로를 위해 최적화된 모델을 포함하여 이러한 로컬 우선 에이전트를 어떻게 구축했는지 설명합니다.
주요 설계 선택 사항에 대한 개요를 제공하고, 세 가지 공개 벤치마크 및 내부 Local Knowledge Work Bench에서 인기 있는 오픈소스 범용 하니스(Hermes 및 Pi)와 Computer를 평가합니다. NVIDIA DGX Spark에서 실행되는 Qwen 3.8 27B 모델을 사용한 당사의 벤치마크에서 Computer는 Pi의 77.6% 및 Hermes의 74.0%에 비해 가장 높은 82.6%의 점수를 달성했습니다. Qwen 3.8 27B를 기반으로 사후 학습된 모델인 PPLX 27B는 점수를 85.4%로 더욱 끌어올립니다.
로컬 모델을 중심으로 하니스 설계
컴팩트한 온디바이스 모델은 이미 상당히 유능하지만, 성능 면에서는 여전히 대형 프런티어 모델에 미치지 못합니다. 이러한 모델들을 효과적으로 유도하고 한계를 극복하기 위해 신중하게 설계된 하니스가 필요합니다.
Pi 및 Hermes와 같은 인기 있는 오픈소스 하니스는 다양한 크기와 클래스의 모델과 잘 작동한다는 범용성이 입증되었습니다. 하지만 온디바이스 모델의 역량에 최적화되어 있지는 않습니다. 당사는 몇 가지 핵심 원칙을 바탕으로 이 환경에 특화된 로컬 하니스를 설계했습니다.
컨텍스트 효율성
하니스를 설계할 때의 주된 초점은 모델의 컨텍스트를 최대한 활용하는 것이었습니다.
Qwen 3.8 27B와 같은 온디바이스 모델은 260K 토큰의 컨텍스트 윈도우를 제공하지만, 경험적으로 100K 토큰을 넘어가면 성능 저하가 발생한다는 것을 발견했습니다. 따라서 핵심 하니스를 간결하게 유지합니다. 최소한의 시스템 프롬프트와 소수의 핵심 도구만 사용합니다.
다른 모든 기능은 트래젝토리 전반에 걸쳐 로드 및 언로드되는 온디맨드 스킬로 모듈화됩니다. 이러한 스킬은 리서치, 데이터 과학, 데이터 시각화, 문서 작성, 소프트웨어 엔지니어링 등 일반적인 지식 노동 작업을 위해 설계되었습니다.
또한 하니스는 컨텍스트 압축을 지원하여, 트래젝토리가 길어지면 오래된 컨텍스트를 요약함으로써 모델이 유효한 윈도우 내에 머물도록 유지합니다.
명령줄 도구로서의 커넥터
일상적인 지식 노동에는 종종 Gmail, GitHub, Outlook, Google Calendar와 같은 커넥터가 필요합니다. 이들은 대개 MCP 서버로서 하니스에 노출되는데, 그 대규모 도구 정의가 컨텍스트의 상당 부분을 소비합니다. 대신, 당사는 가장 많이 사용되는 MCP들을 간결하고 사용하기 쉬운 명령줄 도구로 변환하고, 제한된 유효 컨텍스트를 훨씬 더 잘 활용할 수 있게 해주는 커스텀 스킬로 보완했습니다.
자체 검증
에이전트가 자신의 작업을 스스로 검증할 때 성능도 향상됩니다. 검증은 추가 단계를 수반하지만 최종 결과를 크게 개선하고 프런티어 모델과의 격차를 실질적으로 좁혀줍니다. 이는 모델 자체에 의해 트리거되거나 트래젝토리의 상태를 모니터링하고 문제가 발생했을 때 자체 검증을 요청하는 일련의 훅에 의해 트리거될 수 있습니다.
샌드박스 실행
하니스는 사용자의 기기에서 OS 수준의 샌드박스 내에서 도구를 실행합니다. 경계는 정책에 따라 프로세스, 파일 시스템 경로, 네트워크 액세스를 제한합니다. 이는 잘못된 명령으로 인한 피해 반경을 제한합니다. 샌드박스를 사용할 수 없는 경우, 하니스는 샌드박스가 해제된 실행으로 성능을 떨어뜨리는 대신 도구를 호출하기 전에 스스로를 비활성화합니다.
이는 기본적으로 사용자의 권한으로 명령을 직접 실행하는 Pi 및 Hermes와 같은 오픈소스 하니스와 다릅니다. Computer에서는 격리 기능이 항상 켜져 있고 별도의 설정이 필요하지 않으며, 이 기능 없이는 도구가 실행될 수 없습니다.
아래 다이어그램은 이러한 원칙들이 실행 루프에서 어떻게 조화를 이루는지를 보여줍니다. 오케스트레이터는 LLM이 아닌 결정론적 하니스 코드입니다. 루프를 유지하고, 컨텍스트를 조립하며, 정책을 강제합니다. 로컬 모델은 다음 행동을 제안하고, 오케스트레이터는 샌드박스에서 승인된 도구 호출을 실행한 후 그 결과를 모델에 반환합니다. 웹 검색, 커넥터, 어드바이저 호출은 활성화되고 승인된 경우에만 기기 경계를 넘습니다.
동일한 모델의 성능을 극대화하는 로컬 하니스
동일한 온디바이스 베이스 모델을 사용하여, 웹 리서치와 멀티모달 문서 이해 영역에서 당사의 로컬 하니스를 범용 대안들과 비교합니다. 모든 하니스는 NVIDIA DGX Spark에서 실행되는 중간 추론 단계의 Qwen 3.8 27B 모델을 사용합니다. 이 비교는 모델 사후 학습 이전에 하니스 자체가 기여한 역량만을 분리하여 보여줍니다.
지식 노동은 종종 사용자의 기기에 있는 비공개 문서와 웹의 공개 정보를 결합하여 근거 있는 아티팩트를 생성하기 때문에 이 두 가지 역량에 집중합니다. 웹 검색에는 연결성이 필요하지만, 모델 추론과 비공개 문서 처리는 로컬에 유지됩니다. 로컬 파일은 권위 있는 소스 역할을 하고, 공개 소스는 컨텍스트를 추가하며, 사용자는 완전한 오프라인 작업을 위해 웹 검색을 완전히 비활성화할 수 있습니다.
웹 리서치
당사는 독립적인 평가에서 최고 순위를 달성한 Perplexity의 검색 엔진과 함께 로컬 하니스를 구축했습니다. 하니스는 Search as Code 인터페이스를 통해 이에 액세스합니다.
1,266개의 BrowseComp 작업에서 리서치 품질을 평가합니다. Computer는 로컬 하니스와 함께 Perplexity의 검색 인프라를 사용하는 반면, Pi와 Hermes는 권장 검색 제공업체인 Brave에 의존합니다. Computer는 66.7%의 정확도를 기록하여 Pi(50.2%)와 Hermes(43.9%)를 앞섰습니다.
또한 Computer는 평균 기록 작업 시간 및 토큰 사용량에서도 가장 우수한 결과를 보였습니다. 작업당 402.1초 및 852k 토큰을 기록하여, Hermes(1,020.9초 및 101만 토큰)와 Pi(826.0초 및 282만 토큰)에 비해 우수했습니다. 결과적으로 Computer는 Hermes에 비해 작업 시간을 61%, 토큰을 16% 적게 사용하며, Pi에 비해서는 작업 시간을 51%, 토큰을 70% 적게 사용합니다.
온디바이스 멀티모달 문서 이해
많은 문서는 시각적 형태로 정보를 전달하며 PDF, 스캔된 페이지, 스크린샷, 차트, 프레젠테이션과 같이 일반 텍스트로 구문 분석하기 어렵습니다. 이러한 워크플로우는 OCR 및 이미지 이해에 의존하며, 네이티브 멀티모달 모델로부터 가장 큰 혜택을 받습니다.
하니스는 문서 페이지와 이미지를 모델에 직접 전달하며, 모델은 이를 이해하고 시각적 증거와 추출된 텍스트를 결합합니다. 이러한 파일들을 기기에서 처리함으로써 민감한 문서와 추출된 콘텐츠의 프라이버시가 유지됩니다.
차트, 레이아웃, 표, 텍스트 콘텐츠, 서식 각 20개씩 총 100개의 작업으로 구성된 ParseBench 벤치마크의 하위 집합인 ParseBench-100을 통해 멀티모달 문서 이해를 평가합니다.
Computer는 평균 65.1%의 점수를 기록하여 Hermes(34.6%)와 Pi(13.9%)를 앞섰습니다. 또한 최소한의 시간과 토큰으로 작업을 완료했습니다. 작업당 평균 60.6초 및 20.1k 토큰을 기록해 Hermes(108.3초, 32.1k 토큰) 및 Pi(410.5초, 829.1k 토큰)보다 우수했습니다. Computer는 5개 문서 카테고리 모두에서 선두를 차지했으며, 차트 카테고리에서 가장 큰 격차를 보였습니다. 레이아웃은 세 하니스 모두에게 여전히 어려운 영역으로 남아 있습니다.
표 1. 온디바이스 Qwen 3.8 27B 모델을 탑재한 Computer, Hermes 및 Pi 하니스의 문서 카테고리별 ParseBench-100 평균 점수. Computer가 5개 카테고리 모두에서 선두를 차지했습니다.
하니스 | 차트 | 레이아웃 | 표 | 텍스트 콘텐츠 | 서식 |
Computer | 76.5% | 16.2% | 72.7% | 87.9% | 72.4% |
Hermes | 29.3% | 2.9% | 44.1% | 61.5% | 35.2% |
Pi | 2.5% | 0.1% | 11.0% | 29.7% | 26.1% |
어드바이저 에스컬레이션을 통한 프런티어 격차 좁히기
신중하게 설계된 하니스를 사용하더라도 가장 어려운 작업은 여전히 콤팩트한 온디바이스 모델의 능력을 넘어섭니다. 이러한 작업을 위해 하니스는 어드바이저 도구를 노출합니다. 즉, 로컬 모델은 계획 수립, 모호성 해결, 반복된 실패로부터의 복구 또는 최종 결과 검증에 도움이 필요할 때 더 강력한 프런티어 모델과 상담할 수 있습니다.
로컬 모델은 조언을 요청할 시기를 결정하며, 하니스 오케스트레이터는 도구 권한을 유지하고 전송되는 컨텍스트를 제어합니다. 에스컬레이션은 선택 사항입니다. 사용자가 활성화 여부를 결정하고 각 어드바이저 호출을 수동 또는 자동으로 승인할지 여부를 결정합니다.
어드바이저 호출 전에 하니스는 관련 컨텍스트를 선택하고, PII 분류기를 적용하여 민감한 정보를 플래그 지정하며, 기기를 떠나게 될 내용을 사용자에게 보여줍니다. 어드바이저는 승인된 컨텍스트만 수신하고 텍스트 가이던스를 반환하며, 기기의 파일, 도구 또는 대화에 직접 액세스할 수 없습니다. 이는 비용과 프라이버시를 모두 향상시키며, 향후 작업에서 이 방향을 더 탐구할 계획입니다.
강한 추론 능력이 요구되며 로컬 모델이 가장 자주 한계를 드러내는 까다로운 소프트웨어 엔지니어링 작업에서 이 접근 방식을 테스트합니다. 이를 위해 코딩 에이전트를 위한 인기 있는 89개 작업 벤치마크인 Terminal Bench 2.1을 사용합니다.
어드바이저 에스컬레이션이 프런티어 모델과의 격차를 얼마나 좁힐 수 있는지, 그리고 그 비용은 얼마인지라는 두 가지 질문에 답하고자 합니다. 완전한 로컬 모델은 사용자의 하드웨어에서 추론이 이루어지므로 실행 비용이 사실상 거의 들지 않습니다. 그러나 모델이 어드바이저를 호출하기 시작하면 API 비용이 발생하기 시작합니다.
프런티어 성능의 기준으로 로컬 하니스에서 작동하는 Claude Opus 5를 사용하며, 로컬 모델은 Qwen 3.8 27B입니다. 마지막으로 두 모델을 결합합니다. Qwen 3.8 27B가 작업을 실행하고 도움이 필요할 때 Claude Opus 5 어드바이저로 에스컬레이션합니다. Pi나 Hermes는 동등한 어드바이저 도구를 제공하지 않으므로 어드바이저 에스컬레이션을 평가하지 않습니다. 이를 추가하려면 도구 인터페이스와 오케스트레이션 로직을 수정해야 하므로 결과가 더 이상 기성 하니스를 대표할 수 없기 때문입니다.
어드바이저 에스컬레이션은 Computer의 점수를 59.6%에서 73.0%로 13.5 퍼센트 포인트 높여주며, 롤아웃당 예상 API 비용은 $0.415입니다. Claude Opus 5 단독 실행 시 롤아웃당 $0.65의 비용으로 82.4%에 도달합니다. 따라서 에스컬레이션은 프런티어 비용의 약 2/3 수준으로 프런티어와의 격차를 약 3/5 회복하며, 해당 비용을 지불할 가치가 있는지는 사용자가 결정합니다.
하니스 및 지식 노동을 위한 사후 학습
지금까지는 하니스가 기여한 부분을 분리하기 위해 로컬 모델을 그대로 유지했습니다. 하니스 설계가 완료된 상태에서 남은 가장 큰 향상은 모델 자체를 적응시키는 것에서 비롯됩니다. Perplexity Computer 사용 데이터는 사람들이 지식 노동을 위해 실제로 수행하는 작업을 보여주며, 당사는 이를 활용해 학습 데이터를 합성합니다. 사용자가 수행하는 실제 작업 분포의 안내에 따라 Computer 하니스 내부에서 로컬 모델을 사후 학습시킵니다.
구체적으로, 다양한 모델 기능, 도구, 커넥터를 활용하는 다양한 사용 사례를 식별합니다. 이러한 사용 사례로부터 현실적인 강화 학습 환경을 합성하고 도전적이면서도 검증 가능한 작업을 정의합니다. 각 작업은 지침, 환경, 그리고 하니스가 작동하는 도커 컨테이너인 환경 내에서 최종 결과를 채점하는 검증기로 구성됩니다. 중요하게도, 작업들은 합성된 것이므로 실제 문서나 사용자 정보가 포함되어 있지 않습니다.
이러한 환경을 거부 기반 미세 조정과 그 뒤를 잇는 강화 학습의 2단계 학습에 사용합니다. 첫 번째 단계에서는 각 작업에 대해 모델을 여러 번 롤아웃하고 검증기 점수에 따라 가장 우수한 트래젝토리를 선택하여 지도 학습을 통해 모델을 학습시킵니다. 이 단계는 특정 하니스와 작업 분포에 맞게 모델을 초기화합니다. 두 번째 단계에서는 강화 학습을 통해 모델을 추가로 미세 조정하여 더욱 견고하게 만듭니다.
작업의 일부는 학습에서 제외하여 최종 평가에 사용합니다. 이 보류 세트를 Local Knowledge Work Bench라고 부르며, 심층 리서치부터 문서 작성에 이르기까지 일상적인 지식 노동의 7개 카테고리에 걸친 53개의 작업으로 구성되어 있습니다. 곧 모델 학습에 대해 자세히 설명하는 기술 보고서를 출판할 예정이며, 이 평가 벤치마크를 오픈소스화할 계획입니다.
이 접근 방식으로 Qwen 3.8 27B를 사후 학습하여 PPLX 27B라는 모델을 제작했으며, 이를 Local Knowledge Work Bench에서 평가했습니다. 베이스 Qwen 3.8 27B 모델을 사용할 때, Computer는 가장 높은 점수(Pi의 77.6% 및 Hermes의 74.0%에 비해 82.6%)를 달성하고 가장 적은 토큰(Pi의 681k 및 Hermes의 634k에 비해 520k)을 사용했습니다. Pi는 작업당 218초가 걸린 Computer와 292초가 걸린 Hermes에 비해 작업당 176초로 가장 빠르게 작업을 완료했습니다. PPLX 27B는 더 많은 토큰(520k 대비 678k)을 사용하는 비용으로 Computer의 점수를 85.4%로 끌어올립니다. 예상 작업 시간은 250초입니다.
표 2. Local Knowledge Work Bench 작업 카테고리.
카테고리 | 작업 | 비율 | 설명 |
심층 리서치 | 20 | 37.7% | 다중 홉 웹 리서치, 공개 데이터셋, 통계, 소스 검증이 필요한 복잡한 질문에 답변합니다. |
데이터, 금융, 조달 | 9 | 17.0% | 데이터셋 정리, 기록 대사, 지출 감사, 투자 분석, 공급업체 평가, 재무 지표 계산을 수행합니다. |
문서, 프레젠테이션, 디자인 | 7 | 13.2% | 품질 높은 PDF, 송장, 온보딩 자료, 이벤트 홍보물, 비즈니스 프레젠테이션을 제작합니다. |
엔지니어링, IT, 인시던트 | 5 | 9.4% | 인시던트 조사, 로그 분석, 복구 계획 작성, 릴리스 준비 상태 평가, 기술 문서 합성을 수행합니다. |
계약서, 증빙 자료, 규정 준수 | 5 | 9.4% | 계약서 검토, 증빙 자료 검토, 리콜 조사, 민감한 문서 마스킹, 규정 준수 요건 검증을 수행합니다. |
대시보드, 소프트웨어, 시각화 | 4 | 7.5% | 인터랙티브 대시보드, 교육용 마이크로사이트, 차트, 프로젝트 시각화를 구축합니다. |
인력, 프로젝트, 회의 | 3 | 5.7% | 이력서 검토, 회의 결정 사항 통합, 프로젝트 조치 사항 추적기를 유지 관리합니다. |
합계 | 53 | 100% |
결론
당사의 연구에 따르면, 뛰어난 오픈소스 모델과 역량 있는 로컬 하드웨어, 그리고 이를 위해 구축된 하니스가 결합되면 민감한 데이터를 기기 밖으로 내보내지 않고도 거의 제로에 가까운 추론 비용으로 실제 지식 노동을 처리할 수 있습니다.
다양한 벤치마크 전반에서 Computer는 NVIDIA DGX Spark에서 Qwen 3.8 27B를 실행하면서 정확도 측면에서 Hermes 및 Pi와 동등하거나 그 이상의 성능을 보였습니다. 지연 시간과 토큰 사용량을 보고하는 세 가지 벤치마크 중 Computer는 BrowseComp 및 ParseBench-100에서 가장 빠른 속도를 보였고 세 가지 모두에서 가장 적은 토큰을 사용했으며, Local Knowledge Work Bench에서는 Pi가 가장 빨랐습니다.
이러한 향상은 당사의 선택에서 비롯되었습니다. 온디맨드로 로드되는 스킬을 갖춘 간결한 로컬 하니스를 구축했습니다. 커넥터를 MCP 서버 대신 컴팩트한 CLI 도구로 변환했습니다. 보안을 위해 실행은 샌드박스 처리되었습니다.
또한 결과는 콤팩트한 모델에 개선의 여지가 있는 영역을 보여줍니다. 예를 들어, 까다로운 코딩 작업인 Terminal Bench 2.1에서는 세 가지 하니스 모두에서 로컬 모델이 프런티어 모델에 미치지 못합니다. 어드바이저 에스컬레이션은 격차를 좁히지만 완전히 해소하지는 못하며, 성능을 더 끌어올리기 위해서는 모델 역량과 로컬 하드웨어의 지속적인 개선이 여전히 필요합니다.
로컬 제약 조건에 맞춰 하니스와 모델을 구축한 목적은 어떤 정보가 자신의 기기를 떠나는지에 대해 사용자에게 명시적인 제어권을 부여하는 것입니다. 또한 사용자에게 비용적인 이점도 제공합니다. 우리는 이것이 점점 더 유능한 에이전트가 원격 인프라에서 개인 및 로컬 기기로 이동하는 광범위한 변화의 일환이라고 봅니다. 칩, 모델, 기기의 발전으로 Portable Computer가 로컬에서 처리할 수 있는 지식 노동의 범위가 지속적으로 확장될 것으로 기대합니다.