Brain: 지식 위키로서의 에이전틱 메모리

오프라인으로 컴파일되고 온디맨드로 탐색되는 구조화되고 추적 가능하며 자기 개선되는 마크다운 파일 시스템.

작성자Perplexity Engineering

Computer 사용자는 수개월과 수백 개의 세션에 걸쳐 작업을 수행합니다. 10번째 세션까지 시스템은 첫 번째 세션보다 훨씬 더 생산적이어야 합니다. 사용자, 사용자의 선호도, 이미 완료된 작업에 대한 컨텍스트를 축적해야 합니다.

예를 들어, 사용자가 이전에 설명한 워크플로우의 다이어그램을 그리라는 요청을 받으면 Computer는 세부 정보를 기억하고 이를 사용하여 사용자가 선호하는 스타일로 그림을 만들어 출력해야 합니다. 사용자가 워크플로우의 세부 정보를 다시 설명하거나 PNG 아티팩트보다 PDF를 선호한다는 선호도를 반복할 필요가 없으며, 시스템은 과거 세션에서 해당 컨텍스트를 정확하게 복구하고 자동으로 적용할 수 있어야 합니다.

메모리는 지속적인 에이전트 개선의 기초입니다. 효과적인 메모리 시스템은 구조화되고, 추적 가능하며, 적응 가능해야 하며, 에이전트가 각 작업에 적절한 폭과 깊이로 검색할 수 있도록 하는 동시에 모든 결정을 가장 최신 정보에 근거하게 해야 합니다.

소개

에이전트에 관련 컨텍스트를 부여하는 것은 다면적인 문제입니다. 첫째, 에이전트는 무엇이 존재하며 어떻게 액세스하는지 알아야 합니다. 둘째, 유용한 정보 조각을 찾았을 때 그것이 완전하고 정확하며 최신 상태인지 확신해야 합니다. 고립된 사실은 에이전트가 관련 정보를 찾고, 신뢰할 수 있는 소스에서 온 것인지 확인하며, 더 최신 관찰로 업데이트할 필요가 없는지 확인할 수 없는 한 가치가 제한적입니다.

정적 메모리 파일을 모델 컨텍스트에 직접 채워 넣으면 에이전트에 대한 접근성이 극대화되지만 고전적인 정밀도-재현율 트레이드오프가 발생합니다. 정보가 너무 많으면 관련성이 점점 떨어지는 항목으로 에이전트의 컨텍스트 창이 포화되고, 너무 적으면 관련 컨텍스트가 부족하여 답변 품질이 저하됩니다. 대조적으로 외부 데이터베이스에 대한 온디맨드 액세스는 더 유연하지만 탐색의 부담을 에이전트에 지웁니다. 벡터 데이터베이스는 종종 연결 해제된 조각을 저장하고, 그래프 데이터베이스는 에이전트가 효과적으로 쿼리하는 방법을 알도록 요구합니다.

최근에 당사는 양쪽의 장점을 모두 제공하는 Computer 메모리 시스템의 핵심 구성 요소인 Brain을 도입했습니다. Brain은 정적 메모리 파일과 증거 위에 위치하는 구조화된 지식 위키입니다. 인용은 주장을 해당 소스에 연결하고, 관련 정보 조각은 측면으로 연결됩니다. 조직된 위키는 필요에 따라 컨텍스트를 탐색 가능하게 만드는 동시에 상세한 아티팩트는 그 아래 계층에 유지됩니다.

엔티티를 노드로, 관련 주제를 연결하는 에지를 연결한 그래프 형태의 Brain 지식 위키.
합성 페르소나를 기반으로 하는 샘플 Brain.

Brain은 지속형 메모리 저장소, 쿼리에 답변하기 위해 메모리를 사용하는 포어그라운드 에이전트, 메모리를 업데이트하고 개선하는 백그라운드 에이전트라는 세 가지 주요 구성 요소가 있는 포괄적인 메모리 시스템에 연결됩니다. 다음 그림은 Brain의 전체 시스템 아키텍처 내에 위치한 이러한 구성 요소를 보여줍니다.

지속적인 메모리 저장소, 메모리를 읽는 포어그라운드 에이전트, 메모리를 업데이트하는 백그라운드 에이전트를 보여주는 아키텍처 다이어그램.
메모리 시스템은 공유 지속형 메모리, 메모리를 사용하는 포어그라운드 에이전트, 메모리를 업데이트하는 백그라운드 에이전트로 구성됩니다.

이 문서에서는 각 계층을 심도 있게 설명하며, Brain이 메모리를 조직하는 방식, 에이전트가 이를 사용하는 방식, 백그라운드 프로세스가 최신 상태로 유지하는 방식을 설명합니다. 또한 Brain의 설계를 검증하는 내부 평가 결과를 제시하여 더 낮은 비용으로 에이전트 성능을 향상시킨다는 것을 보여줍니다.

메모리 조직 및 저장소

메모리는 모든 컨텍스트를 프롬프트에 강제로 넣지 않고도 사용자의 전체 기록으로 확장되는 표현이 필요합니다. Computer의 메모리 시스템은 지속적인 컨텍스트를 파일 시스템으로 표현합니다. Brain은 원본 소스 전체의 지식을 합성하고, 관련 주제를 연결하며, 주장을 이를 지원하는 세션 및 파일에 다시 연결합니다. 아래에 자세히 설명된 이 구조를 통해 에이전트에 특히 적합한 형식으로 메모리를 조직할 수 있습니다.

파일 시스템 기반 메모리

컴퓨터 세션은 이미 파일 시스템, 셸, I/O 유틸리티가 포함된 샌드박스에서 실행됩니다. Brain을 설계할 때 모델과 에이전트 메모리 간의 인터페이스에 가능한 한 새로운 메커니즘을 적게 도입하고자 했습니다. 이것이 바로 파일 시스템 네이티브 컨텍스트 계층 위에 Brain을 구축한 이유입니다. 메모리는 memory/ 디렉터리 아래의 샌드박스 내 파일로 구체화되며, 에이전트는 다른 모든 것에 사용하는 것과 동일한 도구를 메모리 파일에도 그대로 사용합니다.

메모리 트리의 루트에는 다양한 추상화 수준에서 컨텍스트를 유지하는 세 가지 최상위 디렉터리가 있습니다. knowledge/는 Brain 자체이며 엔티티, 개념, 활성 프로젝트 및 과거 학습을 연결하는 합성된 지식 위키입니다. notes/는 주제별 폴더로 조직된 요약된 스니펫을 포함합니다. sessions/은 원본 기록으로서 인덱스, 요약 및 전체 트랜스크립트를 보유합니다. 아래 그림은 레이아웃의 단순화된 보기를 보여줍니다.

knowledge/, notes/, sessions/ 하위 폴더가 있는 memory/를 보여주는 디렉터리 트리.
메모리 파일 시스템 레이아웃의 샘플 뷰.

표면은 의도적으로 중복됩니다. 간단하고 단일 홉 질문의 경우 키워드에 대해 /notes 내의 스니펫을 검색하는 것으로 충분한 경우가 많지만, /knowledge 계층은 수주 또는 수개월의 Computer 세션에 걸쳐 증거를 연결해야 하는 질문에 가장 유용합니다.

Brain: 지식 위키

Brain은 연결된 마크다운 파일 시스템인 LLM 위키로 형식화됩니다. 이러한 가볍게 구조화된 마크다운 형태는 기존 컨텍스트에 대한 전체적인 보기를 제공하므로 에이전트는 사용 가능한 레코드, 이들의 관계, 찾을 위치를 쉽게 이해할 수 있습니다. 각 페이지는 하나의 주제에 대해 유지 관리되는 뷰이며, 링크를 통해 추가 탐색을 쉽게 하면서 혼자 읽을 때도 유용해야 합니다.

링크에는 두 가지 유형이 있습니다. [[wikilinks]]는 컨텍스트 에지입니다. 페이지를 측면으로 연결하며, 프로젝트는 소유자, 클라이언트 또는 의존하는 개념에 연결될 수 있습니다. 이를 따라가면 "내가 알아야 할 다른 사항은 무엇인가요?"에 답할 수 있습니다. [cite:N] 참조는 증거 에지입니다. 주장을 아래로 향하게 하여 이를 지원하는 원본 세션 또는 커넥터 소스에 연결합니다. 이를 따라가면 "이것이 사실이라는 것을 어떻게 알 수 있나요?"에 답할 수 있습니다.

아래 그림은 합성 페르소나이자 접근성 연구원인 나디아를 위해 Brain의 일부가 어떻게 생겼는지 보여줍니다. 그녀의 Brain에는 샘플 프로젝트, 일본의 유니버설 디자인 스프린트에 대한 페이지가 포함되어 있으며 세션과 커넥터의 지식을 합성합니다. 그래프 뷰는 페이지에 있는 컨텍스트와 증거 에지가 관련 엔티티와 소스를 연결하는 방법을 보여줍니다.

마크다운으로 렌더링된 샘플 Brain 위키 페이지로, 인라인으로 위키링크와 인용 에지를 보여줍니다.
Brain은 마크다운 파일 시스템입니다.
연결된 엔티티와 소스의 그래프로 시각화된 샘플 Brain 위키 페이지의 서브그래프.
임베디드 컨텍스트와 증거 에지가 쉬운 탐색을 위한 그래프 구조를 형성합니다.

Brain은 버전 기록을 보존하기 위해 Git을 백업으로 사용하여 끊임없이 진화하는 특성을 지원합니다. 시간이 지남에 따라 페이지를 편집할 수 있으며, 변경 로그는 주요 업데이트를 기록하여 에이전트가 과거 버전과 차이를 쉽게 검사할 수 있도록 합니다. 이는 여러 에이전트가 동시에 Brain을 사용하고 업데이트할 수 있으므로 매우 중요한 에이전트 조정도 지원합니다.

Brain 사용하기

사용자 쿼리에 답변할 때 에이전트는 적절한 세부 수준에서 올바른 컨텍스트를 찾을 수 있어야 합니다. Brain의 구조 덕분에 에이전트는 메모리를 쉽게 탐색할 수 있습니다. 에이전트는 관련 정보를 찾기 위해 컨텍스트 링크 따라가기, 주장을 확인하기 위해 증거 링크 따라가기, 추가 컨텍스트를 얻고 합성하기 위해 서브에이전트 호출하기 등의 실행 가능한 단계 중에서 선택할 수 있습니다. 당사는 관련 정보에 대한 에이전트의 접근 용이성을 극대화하는 것을 목표로 여러 가지 방식으로 에이전트 탐색 프로세스를 유도합니다.

탐색 전략

초기 사용자 메시지 내에 Brain의 컴팩트한 인덱스가 포함되어 있으므로 에이전트는 이미 존재하는 것에 대한 작업 지식으로 시작합니다. 그런 다음 에이전트는 인덱스에서 참조하는 특정 항목 읽기, 페이지 전체를 검색하기 위해 grep 사용, 링크 따라가기 및 인용 검사, Git 리비전 비교, 세션 또는 원본 궤적으로 내려가기 등 친숙한 작업을 사용하여 Brain과 상호 작용합니다. 아래 코드 블록은 합성 페르소나에 대한 샘플 명령을 보여줍니다.

bash
# 1. Orient: the index is a map of everything known cat memory/knowledge/index.md # 2. Target: find pages that touch the question grep -Ril "kyoto\|sendai" memory/knowledge/ # 3. Read the page; follow context edges as needed cat memory/knowledge/projects/japan-universal-design-sprint.md cat memory/knowledge/entities/sora-city-laboratory.md # via [[wikilink]] cat memory/knowledge/entities/sapphir-mobility-coop.md # via [[wikilink]] # 4. Only if the claim must be verified: resolve evidence # city bases → [cite:1], [cite:10] → pplx://sessions/<id> # # Example (pseudo, replace with your real tool): # pplx-session-fetch 1eaf53d4-09e0-5823-bb96-c8662f582708 --slice <slice-id> # 5. Some evidence lives outside the sessions # meeting slots → [cite:15] → connector://google-calendar # # pplx-connector-fetch google-calendar --query "japan-sprint"

에이전트는 고정된 파이프라인이 아니라 자기 주도적 루프를 통해 이 컨텍스트를 탐색합니다. 따라서 에이전트는 찾은 컨텍스트에 만족할 때까지 검색을 계속할 수 있습니다. 또한 에이전트는 세부 정보를 찾거나 확인하기 위해 인용 및 증거를 검사할 시기를 선택할 수 있습니다. 사소한 선호도 문제는 단일 Brain 페이지에서 직접 채택될 수 있는 반면, 중대한 결정이나 소스 간의 충돌은 인용을 따르고 원본 레코드를 읽는 것을 정당화할 수 있습니다. 그래프 기반 구조를 통해 에이전트는 관련 정보를 맹목적으로 검색하는 대신 구체적인 다음 단계 중에서 선택할 수 있습니다.

페이지 간 링크와 원본 소스에 대한 인용을 따라 에이전트가 Brain을 점진적으로 탐색하는 흐름도.
에이전트는 작업에 충분한 컨텍스트가 있다고 만족할 때까지 Brain 링크를 따라 새로운 Brain 페이지나 증거 소스로 이동할 수 있습니다.

파일 구체화

에이전트 탐색이 작동하려면 에이전트는 샌드박스 파일 시스템을 통해 전체 memory/ 트리에 액세스할 수 있어야 합니다. 샌드박스가 부팅될 때마다 전체 트리를 로컬로 복사하는 것은 에이전트가 해당 파일의 대다수를 건드리지 않기 때문에 비용이 많이 들고 불필요합니다. 또 다른 옵션은 원격 파일 시스템을 사용하여 에이전트가 로컬로 복사하지 않고도 모든 파일에 액세스할 수 있도록 하는 것입니다. 그러나 에이전트는 단일 명령에서 수천 개의 파일 시스템 작업을 수행하는 경우가 많으며, 각각이 네트워크 요청이 되면 왕복 비용이 탐색 루프를 지배하기 시작합니다. 내부 테스트에서 원격 FUSE 기반 경로에 대한 간단한 grep 워크로드는 로컬 파일에 대한 동등한 작업보다 대략 400~500배 느렸습니다.

대신, 더 큰 코퍼스가 메모리 검색 시스템 뒤에 남아 있는 동안 구체화된 파일의 로컬 작업 세트를 구축합니다. Computer는 부팅될 때 초기 맵(최근 메모리, 세션, 요약 및 사용 가능한 지식에서 가져옴)을 샌드박스에 프리로드합니다. Computer 에이전트는 시맨틱 검색을 수행하고 새로운 파일 세트를 로드할 수 있는 서브에이전트인 메모리 에이전트에 액세스할 수 있습니다. 필요한 컨텍스트가 없을 때 Computer는 필요한 정보에 대한 설명과 함께 메모리 에이전트를 호출할 수 있습니다. 메모리 에이전트는 파일을 검색하여 즉각적인 텍스트 합성을 반환하고 지원 레코드를 메모리 트리 아래의 파일로 구체화합니다. 이런 방식으로 작업 세트는 자연스럽고 점진적으로 시간이 지남에 따라 확장되어 이미 존재하는 증거에 대한 안정적인 경로와 소스 관계를 보존합니다.

초기 파일 프리로드 및 온디맨드 메모리 에이전트 검색이 파일을 샌드박스로 구체화하는 것을 보여주는 다이어그램.
메모리 에이전트에 의한 세션 프리로드 및 시맨틱 검색은 에이전트가 가장 필요로 할 가능성이 높은 파일의 초기 맵을 로드합니다.

이 설계는 지연 시간 병목 현상을 깔끔하게 해결합니다. 관련 파일을 로컬에 저장하면 탐색에 필요한 파일 시스템 작업이 빠르게 유지되며, 일괄 검색을 통해 각 파일에 대해 별도의 통화를 요구하거나 많은 수의 관련 없는 파일을 로드하지 않고도 구체화된 파일 풀을 성장시킬 수 있습니다. 중첩 에이전트 설계는 또한 메인 에이전트가 매번 전체 백엔드 코퍼스를 직접 검색할 필요 없이 에이전트 검색의 이점을 Computer에 제공하여 최고 가치 정보를 위해 자체 컨텍스트 창을 보존합니다.

Brain 유지 관리

사용자는 자신이 수행하는 작업과 나누는 대화로부터 지속적으로 학습하므로 에이전트 메모리도 마찬가지여야 합니다. Brain이 유용하게 유지되려면 가장 중요한 지식의 간결한 표현이어야 합니다. 중요한 새 엔티티에 대해 새 페이지를 생성하고, 관련 Brain 페이지에 새 정보를 추가하고, 오래된 컨텍스트를 시의적절하게 제거해야 합니다. 예를 들어 사용자의 직업이 변경되면 Brain은 해당 변경 사항을 반영해야 하며, 사용자의 새로운 직업을 포함하고 새로운 책임 및 프로젝트와 관련된 우선순위 정보를 포함해야 합니다.

Brain은 Dream이라고 부르는 백그라운드 에이전트에 의해 유지 관리됩니다. Dream 에이전트는 파일 기반 메모리에 대해 오프라인으로 실행되며, 새로운 정보를 Brain 업데이트로 합성합니다. Brain 업데이트가 일관되고 정확하도록 보장하기 위한 Dream 전용 가드레일과 함께 이 작업을 효율적으로 수행하도록 Dream 에이전트의 범위와 동작을 신중하게 정의했습니다.

Dream: 메모리 정제를 위한 백그라운드 에이전트

Dream 에이전트는 대화형 Computer 세션이 가질 수 있는 것과 동일한 파일 시스템 및 읽기 전용 도구에 대한 액세스 권한이 있는 샌드박스에서 실행되지만, 유일한 목표는 향후 세션을 위한 컨텍스트를 개선하는 것입니다. 각 실행은 사용자의 컨텍스트를 처음부터 다시 구축하는 대신 이전 실행에서 생성된 Brain에서 시작됩니다. 그런 다음 현재 Brain을 사용하여 방향을 잡고 향후 실행에 사용할 업데이트된 Brain을 생성합니다.

루프 다이어그램: 대화형 세션이 Dream에 피드백을 제공하고, Dream이 Brain을 업데이트하며, 이것이 향후 세션을 개선합니다.
Dream 에이전트는 백그라운드에서 작업하여 Brain을 업데이트하며 자기 개선 루프를 형성합니다.

Dream 에이전트는 하나의 프롬프트로 평탄화된 고정된 입력을 받는 대신 환경을 수신하고 탐색 방법을 결정합니다. 파일 기반 메모리를 탐색하고, 승인된 읽기 전용 커넥터 도구를 사용하여 지식을 검증하고, 메모리 에이전트를 포함한 작업의 제한된 부분을 서브에이전트에 위임할 수 있습니다. Dream 에이전트의 범위와 책임은 스킬로 지정됩니다.

대략적으로 Dream 실행은 4단계로 구성됩니다:

  1. 방향 설정: 에이전트는 순서가 지정된 방향 설정 절차를 완료합니다. 권한 있는 범위, 상시 지침, 삭제 로그, 추가 입력 및 중지 조건을 식별합니다.
  2. 세션 요약: 마지막 업데이트 이후 새로운 세션(또는 새로운 턴이 있는 세션) 각각에 대해 에이전트는 세션의 짧은 요약을 작성(또는 업데이트)합니다.
  3. 주제에 사실 첨부하기: 에이전트는 중요하다고 판단되는 모든 관찰을 적절한 홈(주로 위키 페이지)에 추가합니다. 가능할 때 인증된 커넥터를 조사하고 쿼리합니다.
  4. 지식 위키 업데이트: 에이전트는 발견한 내용을 바탕으로 위키를 업데이트합니다. 지속적인 주제에 대한 새 페이지를 생성하고, 현재 합성이 변경되었을 때 페이지를 수정하며, 사실적 주장을 뒷받침하는 새 링크나 인용을 추가할 수 있습니다. 현재 그래프가 이미 올바른 경우 변경하지 않도록 선택할 수도 있습니다.

Brain에 대한 모든 업데이트가 완전하고 일관되도록 보장하기 위해 에이전트는 제안된 상태를 스테이징된 출력 트리에 작성합니다. 에이전트가 필요하다고 판단한 모든 업데이트를 완료할 때까지 영구적인 변경은 이루어지지 않습니다. 하나의 에이전트 프로세스에서 이러한 결정을 조정하면 관련 없는 페이지가 아니라 전체적으로 그래프를 업데이트할 수 있습니다.

Brain 페이지에 대한 제안된 업데이트를 생성하는 Dream 실행의 수영 레인 다이어그램.
Dream 에이전트는 기존 Brain과 새로운 정보를 사용하여 업데이트를 제안하고 작성합니다.

모든 변경 사항은 두 가지 유형의 검증 검사를 통과해야 합니다. 결정론적 유효성 검사 검사는 페이지가 잘 형성되어 있고 필수 프런트매터 및 인용 형식과 같은 객관적인 기준을 충족하는지 확인합니다. 시맨틱 검증 검사는 제안된 합성이 수집된 증거에 의해 뒷받침되며 나머지 그래프와 일관성을 유지하는지 확인합니다. 에이전트가 성공적으로 완료되면 통제된 동기화 단계에서 스테이징된 출력을 이전 상태와 비교하고 변경 사항을 리포지토리에 적용합니다. 동기화 단계가 완료되면 최종 편집 세트는 Git 버전 기록을 통해 검사할 수 있습니다.

Brain 검증

유용한 메모리 시스템은 관련 증거를 보존하고, 필요할 때 표면에 노출하며, 에이전트가 해당 증거를 올바른 답변으로 변환하도록 지원해야 합니다. 따라서 당사는 통제된 오프라인 제거, 연속 쌍 재생, 무작위 프로덕션 실험 등 여러 수준에서 Brain을 평가합니다.

오프라인 평가

당사의 주요 오프라인 평가는 44개의 합성 페르소나에 걸쳐 640개의 질문으로 구성된 내부 데이터셋을 사용합니다. 페르소나는 사용자 프라이버시를 보호하기 위해 프로덕션 쿼리 텍스트를 포함하지 않으면서 세션 주기, 턴 수, 주제 혼합 및 팩트 밀도에서 프로덕션 유래 패턴을 재현합니다. 각 계정은 메모리 추출, 대화 요약, Dream의 지식 위키 컴파일을 포함한 프로덕션 메모리 파이프라인을 통해 채워집니다. 각 질문에 대해 정답은 계정 기록에 있는 특정 증거와 기계적으로 연결됩니다.

예를 들어, 앞에서 소개한 접근성 연구원 합성 페르소나인 나디아의 경우 데이터셋에는 "교토와 센다이에서 어떤 단체와 미팅을 하고 있나요?"라는 질문이 포함됩니다. 정답(교토의 Sora City Lab과 센다이의 Sapphir Mobility Coop)은 해당 위키 페이지에 직접 나타납니다.

컴파일된 지식 위키를 활성화한 상태와 비활성화한 상태에서 동일한 질문과 계정을 비교합니다. 다른 메모리 표면은 두 조건 모두에서 계속 사용할 수 있습니다. 이는 메모리가 없는 상태와 비교하는 것이 아니라 Brain의 증분 기여도를 격리하기 위한 것입니다. 전반적으로 Brain은 답변 정확도를 0.600에서 0.661로 6.1퍼센트 포인트 향상시켰고, 근거 회수율을 0.573에서 0.625로 5.2퍼센트 포인트 향상시켰습니다. 이러한 효과는 선호도(+10.2 pp), 시간적 추론(+8.6 pp), 이전 활동에서 세부 정보 추출(+10.2 pp)과 관련된 질문에서 가장 컸습니다. 질문의 84%에서 에이전트는 골드 증거에 바인딩된 소스를 확인 가능하게 터치했습니다.

질문 범주에 걸쳐 Brain 유무에 따른 답변 정확도와 증거 회수율을 비교하는 막대 차트.
Brain은 내부 벤치마크의 성능을 향상시킵니다.

또한 두 개의 공개 벤치마크의 하위 집합에서 일치하는 Brain 제거를 실행했습니다. LoCoMo에서 위키를 제거하면 서로 다른 모델로 세 번 실행한 결과 답변 정확도가 평균 4.6퍼센트 포인트 감소했습니다. LongMemEval-S에서는 통계적으로 유의미한 변화가 발생하지 않았습니다. 이 결과는 Brain의 의도된 역할과 일치합니다. LongMemEval-S는 주로 개별 세션에서 사실 복구를 테스트하며, 여기서 기본 트랜스크립트는 답변으로 가는 중복 경로를 제공합니다. LoCoMo는 대화, 화자, 날짜 전반에 걸쳐 분산된 증거에 더 큰 중점을 두어 위키의 교차 세션 합성이 기여할 수 있는 기회를 더 많이 만듭니다.

전반적으로 Brain이 활성화된 상태에서 프로덕션 에이전트는 LongMemEval-S에서 0.91의 답변 정확도를 달성했고 LoCoMo에서 0.83을 달성했습니다. 이러한 실험은 벤치마크 하위 집합을 사용했기 때문에 결정적인 벤치마크 결과는 아닙니다. 그러나 제거는 특히 대화 전반에 걸쳐 증거를 통합해야 할 때 위키가 성능을 향상시킨다는 강력한 신호를 제공합니다. Brain은 최적화된 벤치마크 전용 검색 시스템이 아니라 Computer의 일부이므로 프로덕션 워크플로우를 더 밀접하게 닮은 작업으로 경쟁력이 더욱 높아질 것으로 믿습니다.

온라인 평가

오프라인 데이터셋은 실제 사용자 기록의 모든 기능을 포착할 수 없으므로 신선한 프로덕션 유래 코호트에 대한 일일 쌍 평가도 실행합니다. Brain이 활성화된 상태와 비활성화된 상태에서 일치하는 사용자 상태에 대해 동일한 고정된 질문에 답변한 다음 정확성, 최신성, 회수율을 평가합니다.

6월 18일에 보고된 예비 결과에 따르면 Brain은 답변 정확도를 25%, 회수율을 16% 향상시킵니다. 이러한 성능 향상은 계속 유지되었으며, 지난 30일 동안 Brain이 활성화된 세션은 모든 실행 및 모든 평가된 차원에서 대조군을 능가했습니다. 절대적인 측면에서 Computer 사용자는 정확도 9.3포인트, 최신성 8.0포인트, 회수율 8.9포인트의 향상을 누렸습니다. Brain이 활성화된 궤적은 또한 약 15% 적은 토큰을 사용하고, 비용이 10% 절감되었으며, 생성 완료가 10% 더 빨라졌습니다.

토큰, 비용, 지연 시간 감소와 함께 정확성, 최신성, 회수율의 향상을 보여주는 온라인 쌍 평가 결과 차트.
Brain은 답변 품질을 높이고 비용을 줄입니다.

지속적인 개선

사용자에게 최고의 메모리 경험을 제공하기 위해 Brain을 계속 개선해 왔습니다. 최근 변경 사항 중 하나는 에이전트가 나중에 검색하고 읽도록 요구하는 대신 Brain의 컴팩트한 인덱스를 에이전트의 초기 컨텍스트에 직접 배치하는 것입니다. 무작위 실험에서 이 프리필 처리는 Brain 사용량을 늘리고 메모리 관련 불만을 6.9% 줄였습니다.

오프라인 평가 하네스는 자율 개선 파이프라인의 일부 역할도 합니다. Brain의 메모리 서브에이전트, 검색 스킬, 프롬프트에 대한 제안된 변경 사항은 내부 데이터셋 및 공개 벤치마크에 대한 일치하는 제거를 거쳐 실행됩니다. Computer 에이전트는 각 반복의 변경 사항, 델타 및 비용을 내구성 있는 레코드로 보존하고 숫자를 움직이는 변경 사항만 유지하면서 결과를 자율적으로 반복할 수 있습니다. 그 결과 Brain의 평가자가 최적화 역할도 수행하여 향후 개선을 주도하는 시스템이 만들어집니다.

결론

지속적인 학습은 몇 주와 몇 달 동안 작동하는 에이전트 시스템을 구축하기 위한 결정적인 과제 중 하나입니다. 메모리 아키텍처는 에이전트가 일반적인 툴셋을 사용하여 직접 탐색할 수 있는 환경으로 노출하는 것이 가장 좋습니다. Brain이 위에 구조화된 지식 위키로 있는 파일 시스템으로 메모리를 노출하면 간단하고 친숙한 도구를 통해 컨텍스트를 효율적으로 탐색할 수 있습니다.

Brain은 자기 개선을 위해 설계되어 사용량이 증가함에 따라 메모리 시스템이 계속 개선될 수 있습니다. Dream 백그라운드 에이전트는 새로운 정보를 Brain 업데이트로 요약하여 포어그라운드 에이전트가 항상 가장 최근 컨텍스트의 조직된 보기로 새 세션을 시작할 수 있도록 합니다. 평가 하네스는 핵심 메모리 아키텍처 및 에이전트 대면 인터페이스에 대한 자가 연구 루프의 테스트 그라운드 역할도 합니다.

이미 Brain은 더 정확하고 성능이 뛰어난 에이전트 세션을 구현하는 동시에 사용되는 토큰을 줄였습니다. Brain을 Computer의 프로덕션 스택과 신중하게 공동 설계한 덕분에 이러한 이점이 사용자에게 직접적인 혜택으로 이어집니다.

Computer의 메모리 품질을 향상시키기 위해 더 많은 기능을 계속 구축하고 있습니다. 그동안 Brain이 활성화된 사용자의 경우 모든 세션마다 메모리가 개선됩니다.