Brain: Bộ nhớ tác nhân như một Wiki kiến thức

Một hệ thống tệp Markdown có cấu trúc, có thể truy nguyên, tự cải tiến, được biên dịch ngoại tuyến và điều hướng theo yêu cầu.

Tác giảPerplexity Engineering

Người dùng Computer thực hiện công việc kéo dài hàng tháng và hàng trăm phiên. Đến phiên thứ mười, hệ thống sẽ hiệu quả hơn nhiều so với phiên đầu tiên. Nó nên tích lũy ngữ cảnh về người dùng, sở thích của họ và công việc đã được thực hiện.

Ví dụ, khi được yêu cầu vẽ một sơ đồ về một quy trình làm việc mà người dùng đã giải thích trước đó, Computer nên nhớ lại các chi tiết và sử dụng chúng để tạo và xuất ra một hình vẽ theo phong cách ưa thích của người dùng. Người dùng không cần phải giải thích lại các chi tiết của quy trình làm việc hoặc nhắc lại sở thích của họ đối với các tạo phẩm PDF thay vì PNG; hệ thống nên có khả năng khôi phục chính xác ngữ cảnh đó từ các phiên trước và áp dụng nó tự động.

Bộ nhớ là nền tảng cho sự cải tiến liên tục của tác nhân. Một hệ thống bộ nhớ hiệu quả nên có cấu trúc, có thể truy nguyên và thích ứng, cho phép các tác nhân tìm kiếm ở độ rộng và độ sâu phù hợp cho mỗi tác vụ đồng thời gắn kết mọi quyết định trong thông tin hiện tại nhất.

Giới thiệu

Truyền đạt ngữ cảnh có liên quan cho các tác nhân là một vấn đề đa dạng. Đầu tiên, các tác nhân cần biết những gì tồn tại và cách truy cập nó. Thứ hai, khi chúng tìm thấy một mẩu thông tin hữu ích, chúng cần phải chắc chắn rằng nó hoàn chỉnh, chính xác và cập nhật. Một sự thật biệt lập có giá trị hạn chế trừ khi tác nhân có thể tìm thấy thông tin liên quan, xác minh rằng nó đến từ một nguồn đáng tin cậy và đảm bảo rằng nó không cần phải được cập nhật bằng một quan sát gần đây hơn.

Nhồi nhét các tệp bộ nhớ tĩnh trực tiếp vào ngữ cảnh mô hình tối đa hóa khả năng tiếp cận đối với các tác nhân, nhưng trình bày một đánh đổi độ chính xác - thu hồi cổ điển. Quá nhiều thông tin sẽ bão hòa cửa sổ ngữ cảnh của tác nhân với các mục có mức độ liên quan ngày càng nhỏ, trong khi quá ít sẽ làm giảm chất lượng câu trả lời do thiếu ngữ cảnh liên quan. Ngược lại, quyền truy cập theo yêu cầu vào các cơ sở dữ liệu bên ngoài linh hoạt hơn, nhưng chuyển gánh nặng điều hướng sang tác nhân. Cơ sở dữ liệu vector thường lưu trữ các đoạn rời rạc và cơ sở dữ liệu biểu đồ yêu cầu tác nhân biết cách truy vấn hiệu quả.

Gần đây, chúng tôi đã giới thiệu Brain, một thành phần cốt lõi trong hệ thống bộ nhớ của Computer mang lại những điều tuyệt vời nhất của cả hai thế giới. Brain là một wiki kiến thức có cấu trúc nằm trên các tệp bộ nhớ tĩnh và bằng chứng. Các trích dẫn liên kết các xác nhận với nguồn của chúng và các mẩu thông tin liên quan được kết nối theo chiều ngang. Wiki được tổ chức làm cho ngữ cảnh có thể điều hướng theo yêu cầu, trong khi các tạo phẩm chi tiết được giữ lại ở lớp bên dưới nó.

Wiki kiến thức Brain được xem như một biểu đồ, với các thực thể là các nút và các cạnh kết nối các chủ đề liên quan.
Một Brain mẫu dựa trên một nhân vật tổng hợp.

Brain kết nối với một hệ thống bộ nhớ toàn diện với ba thành phần chính: lưu trữ bộ nhớ bền vững, các tác nhân nền trước sử dụng bộ nhớ để trả lời các truy vấn, và các tác nhân nền cập nhật và cải thiện bộ nhớ. Hình sau mô tả các thành phần này nằm trong kiến trúc hệ thống tổng thể của Brain.

Sơ đồ kiến trúc hiển thị bộ nhớ lưu trữ bền vững, các tác nhân nền trước đọc bộ nhớ và các tác nhân nền cập nhật bộ nhớ.
Hệ thống bộ nhớ bao gồm bộ nhớ bền vững được chia sẻ, các tác nhân nền trước sử dụng bộ nhớ và các tác nhân nền cập nhật bộ nhớ.

Trong bài viết này, chúng tôi mô tả chi tiết từng lớp, giải thích cách Brain tổ chức bộ nhớ, cách các tác nhân sử dụng nó và cách các quy trình nền giữ cho nó luôn cập nhật. Chúng tôi cũng trình bày kết quả từ các đánh giá nội bộ xác thực thiết kế của Brain, chứng minh rằng nó cải thiện hiệu suất tác nhân với chi phí thấp hơn.

Tổ chức và lưu trữ bộ nhớ

Bộ nhớ cần một đại diện có quy mô mở rộng đến toàn bộ lịch sử của người dùng mà không ép buộc mọi mảnh ngữ cảnh vào lời nhắc. Hệ thống bộ nhớ của Computer biểu diễn ngữ cảnh bền vững như một hệ thống tệp. Brain tổng hợp kiến thức trên các nguồn thô, kết nối các chủ đề liên quan và kết nối các tuyên bố trở lại các phiên và tệp hỗ trợ chúng. Cấu trúc này, được chi tiết bên dưới, cho phép chúng ta tổ chức bộ nhớ ở một hình thức đặc biệt phù hợp cho các tác nhân.

Bộ nhớ dựa trên hệ thống tệp

Các phiên Computer đã nằm trong một sandbox với một hệ thống tệp, một shell và các tiện ích I/O. Khi thiết kế Brain, chúng tôi muốn giới thiệu ít máy móc mới nhất có thể trong giao diện giữa mô hình và bộ nhớ tác nhân. Đây là lý do tại sao chúng tôi xây dựng Brain dựa trên lớp ngữ cảnh gốc của hệ thống tệp. Bộ nhớ được hiện thực hóa dưới dạng các tệp trong sandbox dưới thư mục memory/ và tác nhân chỉ đơn giản sử dụng các công cụ tương tự trên các tệp bộ nhớ mà nó đã sử dụng cho mọi thứ khác.

Ở gốc của cây bộ nhớ nằm ba thư mục cấp cao duy trì ngữ cảnh ở các mức độ trừu tượng khác nhau. knowledge/ là chính Brain, một wiki kiến thức tổng hợp liên kết các thực thể, khái niệm, các dự án đang hoạt động và những bài học trước đây; notes/ chứa các đoạn mã được chắt lọc được tổ chức thành các thư mục theo chủ đề; và sessions/ chứa các chỉ mục, tóm tắt và bản ghi đầy đủ như lịch sử thô. Hình ảnh dưới đây cho thấy một cái nhìn đơn giản hóa của bố cục.

Cây thư mục hiển thị memory/ với các thư mục con knowledge/, notes/ và sessions/.
Một chế độ xem mẫu của bố cục hệ thống tệp bộ nhớ.

Các bề mặt được thiết kế dư thừa một cách có chủ đích. Đối với các câu hỏi đơn giản, một bước nhảy, thường là đủ để tìm kiếm các đoạn mã trong /notes cho một từ khóa, trong khi lớp /knowledge hữu ích nhất cho các câu hỏi đòi hỏi phải ghép nối bằng chứng qua nhiều tuần hoặc nhiều tháng phiên Computer.

Brain: Wiki kiến thức

Brain được định dạng như một LLM wiki, một hệ thống các tệp Markdown được liên kết. Hình thức Markdown có cấu trúc nhẹ này cung cấp một cái nhìn toàn diện về ngữ cảnh hiện có, để các tác nhân có thể dễ dàng hiểu những bản ghi nào khả dụng, cách chúng liên quan và tìm chúng ở đâu. Mỗi trang là một chế độ xem được duy trì của một chủ đề; nó sẽ vẫn hữu ích khi đọc một mình đồng thời giúp việc khám phá tiếp theo trở nên dễ dàng thông qua các liên kết.

Các liên kết có hai loại. [[wikilinks]] là các cạnh ngữ cảnh. Chúng kết nối các trang theo chiều ngang; một dự án có thể liên kết với chủ sở hữu, khách hàng hoặc các khái niệm mà nó phụ thuộc. Việc theo dõi chúng trả lời "còn gì nữa tôi cần biết?". Các tham chiếu [cite:N] là các cạnh bằng chứng. Chúng kết nối các tuyên bố hướng xuống các phiên thô hoặc các nguồn trình kết nối hỗ trợ chúng. Việc theo dõi chúng trả lời "làm thế nào tôi biết điều này là đúng?"

Các số liệu dưới đây mô tả một phần của Brain sẽ trông như thế nào đối với một nhân vật tổng hợp, một nhà nghiên cứu khả năng tiếp cận tên là Nadia. Brain của cô ấy bao gồm một trang về một dự án mẫu, một sprint thiết kế phổ quát ở Nhật Bản, tổng hợp kiến thức từ các phiên và trình kết nối. Chế độ xem biểu đồ minh họa cách các cạnh ngữ cảnh và bằng chứng có trong trang liên kết các thực thể và nguồn liên quan.

Một trang wiki Brain mẫu được kết xuất dưới dạng Markdown, hiển thị các wikilink và các cạnh trích dẫn nội tuyến.
Brain là một hệ thống các tệp Markdown.
Một biểu đồ con từ một trang wiki Brain mẫu, trực quan hóa như một biểu đồ các thực thể và nguồn được kết nối.
Ngữ cảnh được nhúng và các cạnh bằng chứng tạo thành cấu trúc biểu đồ để điều hướng dễ dàng.

Brain được hỗ trợ bởi Git để duy trì lịch sử phiên bản, hỗ trợ bản chất không ngừng phát triển của nó. Các trang có thể được chỉnh sửa theo thời gian, trong khi nhật ký thay đổi ghi lại các cập nhật quan trọng và cho phép các tác nhân dễ dàng kiểm tra các phiên bản trước và các tệp khác biệt. Điều này cũng hỗ trợ sự phối hợp giữa các tác nhân, điều này rất quan trọng vì nhiều tác nhân có thể đang sử dụng và cập nhật Brain cùng một lúc.

Sử dụng Brain

Khi trả lời một truy vấn của người dùng, các tác nhân cần có khả năng tìm thấy ngữ cảnh phù hợp ở mức độ chi tiết phù hợp. Cấu trúc của Brain giúp các tác nhân dễ dàng khám phá bộ nhớ. Các tác nhân có thể chọn giữa các bước hành động như theo các liên kết ngữ cảnh để tìm thông tin liên quan, theo các liên kết bằng chứng để xác minh các tuyên bố, hoặc gọi một tác nhân phụ để lấy và tổng hợp ngữ cảnh bổ sung. Chúng tôi hướng dẫn quy trình khám phá của tác nhân theo một số cách nhằm tối đa hóa sự dễ dàng tiếp cận của tác nhân đối với thông tin liên quan.

Chiến lược khám phá

Chúng tôi bao gồm một chỉ mục nhỏ gọn của Brain trong thông điệp người dùng ban đầu, vì vậy tác nhân bắt đầu với kiến thức làm việc về những gì đã tồn tại. Sau đó, tác nhân tương tác với Brain bằng cách sử dụng các thao tác quen thuộc: đọc các mục cụ thể được tham chiếu bởi chỉ mục, sử dụng grep để tìm kiếm trên các trang, theo các liên kết và kiểm tra các trích dẫn, so sánh các phiên bản Git, và đi sâu vào các phiên hoặc quỹ đạo thô. Khối mã dưới đây mô tả các lệnh mẫu cho một nhân vật tổng hợp.

bash
# 1. Orient: the index is a map of everything known cat memory/knowledge/index.md # 2. Target: find pages that touch the question grep -Ril "kyoto\|sendai" memory/knowledge/ # 3. Read the page; follow context edges as needed cat memory/knowledge/projects/japan-universal-design-sprint.md cat memory/knowledge/entities/sora-city-laboratory.md # via [[wikilink]] cat memory/knowledge/entities/sapphir-mobility-coop.md # via [[wikilink]] # 4. Only if the claim must be verified: resolve evidence # city bases → [cite:1], [cite:10] → pplx://sessions/<id> # # Example (pseudo, replace with your real tool): # pplx-session-fetch 1eaf53d4-09e0-5823-bb96-c8662f582708 --slice <slice-id> # 5. Some evidence lives outside the sessions # meeting slots → [cite:15] → connector://google-calendar # # pplx-connector-fetch google-calendar --query "japan-sprint"

Các tác nhân khám phá ngữ cảnh này thông qua một vòng lặp tự định hướng, thay vì một đường ống cố định. Do đó, tác nhân có thể tiếp tục tìm kiếm cho đến khi nó hài lòng với ngữ cảnh được tìm thấy. Tác nhân cũng có thể chọn thời điểm kiểm tra các trích dẫn và bằng chứng để tìm hoặc xác minh chi tiết. Một vấn đề sở thích nhỏ có thể được áp dụng trực tiếp từ một trang Brain duy nhất, trong khi một quyết định quan trọng hoặc một xung đột giữa các nguồn có thể biện minh cho việc theo dõi trích dẫn và đọc bản ghi gốc. Cấu trúc dựa trên biểu đồ cho phép tác nhân chọn giữa các bước tiếp theo cụ thể, thay vì tìm kiếm không mục đích để tìm thông tin liên quan.

Sơ đồ luồng của một tác nhân khám phá dần Brain bằng cách theo các liên kết giữa các trang và trích dẫn đến các nguồn thô.
Tác nhân có thể theo các liên kết Brain đến các trang Brain mới hoặc các nguồn bằng chứng cho đến khi nó hài lòng rằng nó có đủ ngữ cảnh cho tác vụ.

Hiện thực hóa tệp

Để việc khám phá của tác nhân hoạt động, tác nhân cần có quyền truy cập vào toàn bộ cây memory/ thông qua hệ thống tệp sandbox. Sao chép toàn bộ cây cục bộ mỗi khi sandbox khởi động là tốn kém và không cần thiết, vì tác nhân sẽ không chạm vào phần lớn các tệp đó. Một tùy chọn khác là sử dụng hệ thống tệp từ xa, để các tác nhân có thể truy cập bất kỳ tệp nào mà không cần sao chép chúng cục bộ. Tuy nhiên, các tác nhân thường thực hiện hàng nghìn thao tác hệ thống tệp trong một lệnh duy nhất; nếu mỗi lệnh trở thành một yêu cầu mạng, chi phí vòng khứ hồi bắt đầu chi phối vòng lặp khám phá. Trong thử nghiệm nội bộ, các khối lượng công việc grep đơn giản qua đường dẫn được hỗ trợ FUSE từ xa chậm hơn khoảng 400 đến 500 lần so với các thao tác tương đương trên các tệp cục bộ.

Thay vào đó, chúng tôi xây dựng một tập làm việc cục bộ gồm các tệp được hiện thực hóa, trong khi tập ngữ liệu lớn hơn nằm đằng sau hệ thống truy xuất bộ nhớ. Computer tải trước một bản đồ ban đầu (lấy từ các ký ức gần đây, các phiên, tóm tắt và kiến thức có sẵn) lên sandbox khi nó khởi động. Các tác nhân Computer có quyền truy cập vào Tác nhân Bộ nhớ, một tác nhân phụ có thể thực hiện tìm kiếm ngữ nghĩa và tải một tập hợp tệp mới. Khi ngữ cảnh cần thiết vắng mặt, Computer có thể gọi Tác nhân Bộ nhớ với mô tả về thông tin được yêu cầu. Tác nhân Bộ nhớ tìm kiếm trên các tệp, trả về một tổng hợp văn bản tức thì và hiện thực hóa các bản ghi hỗ trợ dưới dạng tệp dưới cây bộ nhớ. Bằng cách này, tập làm việc mở rộng tự nhiên và dần dần theo thời gian, bảo tồn các đường dẫn ổn định và mối quan hệ nguồn cho bằng chứng đã có mặt.

Sơ đồ hiển thị việc tải trước tệp ban đầu cộng với việc truy xuất Tác nhân Bộ nhớ theo yêu cầu hiện thực hóa các tệp vào sandbox.
Tải trước phiên và truy xuất ngữ nghĩa bởi Tác nhân Bộ nhớ tải một bản đồ ban đầu gồm các tệp mà tác nhân có nhiều khả năng cần nhất.

Thiết kế này giải quyết một cách gọn gàng vấn đề nghẽn cổ chai độ trễ. Lưu trữ các tệp có liên quan cục bộ đảm bảo rằng các thao tác hệ thống tệp bắt buộc để khám phá vẫn nhanh chóng và việc truy xuất theo lô cho phép nhóm các tệp được hiện thực hóa phát triển mà không yêu cầu các lệnh gọi riêng biệt cho từng tệp hoặc tải một số lượng lớn các tệp không liên quan. Thiết kế tác nhân lồng nhau cũng mang lại cho Computer những lợi ích của việc truy xuất tác nhân mà không yêu cầu tác nhân chính tìm kiếm trực tiếp toàn bộ tập ngữ liệu phụ trợ mọi lúc, bảo hiểm cửa sổ ngữ cảnh của chính nó cho thông tin có giá trị cao nhất.

Duy trì Brain

Người dùng không ngừng học hỏi từ công việc họ làm và các cuộc trò chuyện họ có, vì vậy bộ nhớ tác nhân cần làm điều tương tự. Để Brain duy trì sự hữu ích, nó nên là một đại diện súc tích của kiến thức quan trọng nhất. Các trang mới nên được tạo cho các thực thể mới quan trọng, thông tin mới nên được thêm vào các trang Brain có liên quan và ngữ cảnh lỗi thời nên được loại bỏ theo mùa. Ví dụ, nếu công việc của người dùng thay đổi, Brain nên phản ánh sự thay đổi đó; nó nên chứa công việc mới của người dùng và ưu tiên thông tin liên quan đến các trách nhiệm và dự án mới của họ.

Brain được duy trì bởi các tác nhân nền mà chúng tôi gọi là Dream. Các tác nhân Dream chạy ngoại tuyến trên bộ nhớ dựa trên tệp, tổng hợp thông tin mới thành các cập nhật Brain. Chúng tôi đã xác định cẩn thận phạm vi và hành vi của các tác nhân Dream để thực hiện hiệu quả nhiệm vụ này, cùng với các biện pháp bảo vệ dành riêng cho Dream để đảm bảo các cập nhật Brain nhất quán và chính xác.

Dream: Tác nhân nền để tinh chỉnh bộ nhớ

Các tác nhân Dream chạy trong các sandbox có quyền truy cập vào cùng một hệ thống tệp và các công cụ chỉ đọc mà một phiên Computer tương tác sẽ có, nhưng mục tiêu duy nhất của chúng là cải thiện ngữ cảnh cho các phiên tương lai. Mỗi lần chạy bắt đầu từ Brain được tạo bởi các lần chạy trước đó thay vì xây dựng lại ngữ cảnh của người dùng từ đầu. Sau đó, nó sử dụng Brain hiện tại đó để định hướng cho chính nó và tạo ra một Brain được cập nhật để các lần chạy trong tương lai sử dụng.

Sơ đồ vòng lặp: các phiên tương tác cung cấp cho Dream, cập nhật Brain, cải thiện các phiên trong tương lai.
Các tác nhân Dream hoạt động ở chế độ nền để cập nhật Brain, tạo thành một vòng lặp tự cải tiến.

Một tác nhân Dream nhận được một môi trường và quyết định cách khám phá nó, thay vì nhận được một đầu vào cố định được làm phẳng thành một lời nhắc. Nó có thể điều hướng bộ nhớ dựa trên tệp, sử dụng các công cụ trình kết nối chỉ đọc được phê duyệt để xác minh một mảnh kiến thức và ủy quyền các phần công việc bị giới hạn cho các tác nhân phụ, bao gồm Tác nhân Bộ nhớ. Phạm vi và trách nhiệm của tác nhân Dream được chỉ định dưới dạng một Skill.

Nhìn chung, một lượt chạy Dream bao gồm 4 giai đoạn:

  1. Định hướng: Tác nhân hoàn thành một thủ tục định hướng có thứ tự. Nó xác định phạm vi có thẩm quyền, hướng dẫn đứng, nhật ký xóa, các đầu vào bổ sung và các điều kiện dừng.
  2. Tóm tắt các phiên: Đối với mỗi phiên mới (hoặc có các lượt mới) kể từ bản cập nhật cuối cùng, tác nhân viết (hoặc cập nhật) một bản tóm tắt ngắn về phiên đó.
  3. Đính kèm sự thật vào các chủ đề: Tác nhân thêm mọi quan sát mà nó cho là quan trọng vào ngôi nhà thích hợp của nó, thường là một trang wiki. Nó thăm dò và truy vấn các trình kết nối được xác thực khi có sẵn.
  4. Cập nhật wiki kiến thức: Tác nhân cập nhật wiki dựa trên những phát hiện của nó. Nó có thể tạo các trang mới cho các chủ đề bền bỉ, sửa đổi các trang khi tổng hợp hiện tại đã thay đổi, hoặc thêm các liên kết hoặc trích dẫn mới hỗ trợ một tuyên bố thực tế. Nó cũng có thể chọn không thực hiện thay đổi nào khi biểu đồ hiện tại đã chính xác.

Để đảm bảo rằng bất kỳ cập nhật nào đối với Brain đều hoàn chỉnh và nhất quán, các tác nhân ghi trạng thái được đề xuất vào một cây đầu ra được dàn dựng. Không có thay đổi vĩnh viễn nào được thực hiện cho đến khi tác nhân thực hiện tất cả các cập nhật mà nó cho là cần thiết. Việc phối hợp các quyết định đó trong một quy trình tác nhân làm cho việc cập nhật biểu đồ tổng thể trở nên khả thi thay vì như các trang không liên quan.

Sơ đồ luồng của một lần chạy Dream tạo ra các cập nhật được đề xuất cho các trang Brain.
Các tác nhân Dream sử dụng Brain hiện có và thông tin mới để đề xuất và viết các cập nhật.

Bất kỳ thay đổi nào cũng phải vượt qua hai loại kiểm tra xác minh. Kiểm tra xác thực xác định đảm bảo rằng các trang được định dạng đúng và đáp ứng các tiêu chí khách quan, chẳng hạn như frontmatter bắt buộc và định dạng trích dẫn. Kiểm tra xác minh ngữ nghĩa đảm bảo rằng một tổng hợp được đề xuất được hỗ trợ bởi bằng chứng đã thu thập và vẫn nhất quán với phần còn lại của biểu đồ. Sau khi tác nhân hoàn thành thành công, một bước đồng bộ hóa được kiểm soát sẽ so sánh đầusetOutput được dàn dựng với trạng thái trước đó và áp dụng các thay đổi cho kho lưu trữ. Khi một bước đồng bộ hóa hoàn tất, tập hợp chỉnh sửa cuối cùng có thể kiểm tra được thông qua lịch sử phiên bản Git.

Xác thực Brain

Một hệ thống bộ nhớ hữu ích phải bảo tồn bằng chứng có liên quan, đưa nó lên bề mặt khi cần thiết và giúp tác nhân chuyển đổi bằng chứng đó thành một câu trả lời chính xác. Do đó, chúng tôi đánh giá Brain ở nhiều cấp độ: cắt bỏ ngoại tuyến được kiểm soát, phát lại ghép đôi liên tục và các thí nghiệm sản xuất ngẫu nhiên.

Đánh giá ngoại tuyến

Đánh giá ngoại tuyến chính của chúng tôi sử dụng một tập dữ liệu nội bộ gồm 640 câu hỏi trên 44 nhân vật tổng hợp. Các nhân vật tái tạo các mẫu bắt nguồn từ sản xuất về nhịp độ phiên, số lượng lượt, hỗn hợp chủ đề và mật độ sự thật, đồng thời không chứa văn bản truy vấn sản xuất để bảo vệ quyền riêng tư của người dùng. Mỗi tài khoản được điền thông qua quy trình bộ nhớ sản xuất, bao gồm trích xuất bộ nhớ, tóm tắt cuộc hội thoại và quá trình biên dịch wiki kiến thức của Dream. Đối với mỗi câu hỏi, câu trả lời chính xác được gắn kết một cách máy móc với bằng chứng cụ thể có trong lịch sử của tài khoản.

Ví dụ, đối với Nadia, nhân vật tổng hợp nhà nghiên cứu khả năng tiếp cận được giới thiệu trước đó, tập dữ liệu bao gồm câu hỏi: "Tôi đang gặp những tổ chức nào ở Kyoto và Sendai?". Câu trả lời (Sora City Lab ở Kyoto và Sapphir Mobility Coop ở Sendai) xuất hiện trực tiếp trên trang Wiki tương ứng.

Chúng tôi so sánh các câu hỏi và tài khoản giống nhau khi bật so với tắt wiki kiến thức đã biên dịch. Các bề mặt bộ nhớ khác vẫn khả dụng trong cả hai điều kiện. Điều này cách ly sự đóng góp gia tăng của Brain, thay vì so sánh bộ nhớ với không có bộ nhớ. Nhìn chung, Brain đã làm tăng độ chính xác của câu trả lời từ 0.600 lên 0.661, mức tăng 6.1 điểm phần trăm, và khả năng thu hồi bằng chứng từ 0.573 lên 0.625, mức tăng 5.2 điểm phần trăm. Hiệu ứng lớn nhất đối với các câu hỏi về sở thích (+10.2 điểm phần trăm), lập luận theo thời gian (+8.6 điểm phần trăm) và trích xuất chi tiết từ hoạt động trước đó (+6.9 điểm phần trăm). Trên 84% câu hỏi, tác nhân đã xác minh chạm vào một nguồn liên kết đến bằng chứng chuẩn.

Biểu đồ cột so sánh độ chính xác của câu trả lời và khả năng thu hồi bằng chứng có và không có Brain qua các danh mục câu hỏi.
Brain cải thiện hiệu suất trên điểm chuẩn nội bộ của chúng tôi.

Chúng tôi cũng chạy các phép cắt bỏ Brain phù hợp trên các tập con của hai điểm chuẩn công khai. Trên LoCoMo, việc loại bỏ wiki làm giảm độ chính xác của câu trả lời xuống 4.6 điểm phần trăm trung bình, qua ba lần chạy với các mô hình khác nhau. Trên LongMemEval-S, nó không tạo ra thay đổi có ý nghĩa thống kê nào. Kết quả này phù hợp với vai trò dự định của Brain. LongMemEval-S chủ yếu kiểm tra việc phục hồi các sự thật từ các phiên riêng lẻ, nơi các bản ghi cơ bản cung cấp một đường dẫn dự phòng đến câu trả lời. LoCoMo đặt trọng tâm lớn hơn vào bằng chứng nằm rải rác trên các cuộc trò chuyện, người nói và ngày tháng, tạo ra nhiều cơ hội hơn cho sự tổng hợp giữa các phiên của wiki đóng góp.

Nhìn chung, với Brain được bật, tác nhân sản xuất đạt được 0.91 độ chính xác câu trả lời trên LongMemEval-S và 0.83 trên LoCoMo. Do các thí nghiệm này sử dụng các tập con điểm chuẩn, chúng không phải là kết quả điểm chuẩn dứt khoát. Tuy nhiên, các phép cắt bỏ vẫn cung cấp tín hiệu mạnh mẽ rằng wiki cải thiện hiệu suất, đặc biệt là khi bằng chứng phải được tích hợp qua các cuộc trò chuyện. Vì Brain là một phần của Computer, thay vì một hệ thống truy xuất cụ thể theo điểm chuẩn được tối ưu hóa, chúng tôi tin rằng tính cạnh tranh sẽ chỉ tăng lên với các nhiệm vụ giống với quy trình làm việc sản xuất hơn.

Đánh giá trực tuyến

Các tập dữ liệu ngoại tuyến không thể nắm bắt mọi tính năng lịch sử người dùng thực tế, vì vậy chúng tôi cũng chạy một đánh giá ghép đôi hàng ngày trên các nhóm sản xuất mới. Các câu hỏi cố định giống nhau được trả lời dựa trên trạng thái người dùng khớp với Brain được bật và tắt, sau đó được đánh giá về độ chính xác, tính cập nhật và khả năng thu hồi.

Kết quả sơ bộ được báo cáo vào ngày 18 tháng 6 đã chứng minh rằng Brain làm tăng độ chính xác của câu trả lời thêm 25% và khả năng thu hồi thêm 16%. Những cải thiện hiệu suất này tiếp tục được duy trì; trong 30 ngày qua, các phiên bật Brain đã vượt trội hơn nhóm đối chứng trong mọi lần chạy và mọi chiều được đánh giá. Theo giá trị tuyệt đối, người dùng Computer đã tận hưởng những cải tiến 9.3 điểm về độ chính xác, 8.0 điểm về tính cập nhật và 8.9 điểm về khả năng thu hồi. Các quỹ đạo bật Brain cũng sử dụng ít hơn khoảng 15% token, chi phí ít hơn 10% và hoàn thành việc tạo nhanh hơn 10%.

Biểu đồ kết quả đánh giá ghép đôi trực tuyến cho thấy mức tăng về độ chính xác, tính cập nhật và khả năng thu hồi bên cạnh việc giảm token, chi phí và độ trễ.
Brain làm tăng chất lượng câu trả lời và giảm chi phí.

Cải tiến liên tục

Chúng tôi tiếp tục tinh chỉnh Brain để mang lại trải nghiệm bộ nhớ tốt nhất cho người dùng. Một thay đổi gần đây đặt chỉ mục nhỏ gọn của Brain trực tiếp vào ngữ cảnh ban đầu của tác nhân thay vì yêu cầu tác nhân khám phá và đọc nó sau. Trong một thử nghiệm ngẫu nhiên, phương pháp điền trước này đã làm tăng việc sử dụng Brain và giảm sự không hài lòng liên quan đến bộ nhớ đi 6.9%.

Khung đánh giá ngoại tuyến cũng đồng thời là một phần của đường ống cải tiến tự động. Các thay đổi được đề xuất đối với tác nhân phụ bộ nhớ, kỹ năng truy xuất và lời nhắc của Brain được chạy thông qua các phép cắt bỏ phù hợp trên tập dữ liệu nội bộ và các điểm chuẩn công khai của chúng tôi. Các tác nhân Computer có thể lặp lại trên kết quả một cách tự động, bảo tồn sự thay đổi, độ lệch và chi phí của mỗi lần lặp như một bản ghi bền bỉ và chỉ giữ lại các thay đổi di chuyển các con số. Kết quả là một hệ thống trong đó các trình đánh giá của Brain cũng là các trình tối ưu hóa của nó, thúc đẩy các cải tiến trong tương lai.

Kết luận

Học tập liên tục là một trong những thách thức xác định để xây dựng các hệ thống tác nhân hoạt động trong nhiều tuần và nhiều tháng. Chúng tôi tin rằng kiến trúc bộ nhớ được phơi bày tốt nhất dưới dạng các môi trường mà các tác nhân có thể trực tiếp khám phá bằng cách sử dụng bộ công cụ thông thường của chúng. Việc phơi bày bộ nhớ như một hệ thống tệp, với Brain như một wiki kiến thức có cấu trúc bên trên, làm cho ngữ cảnh có thể điều hướng hiệu quả thông qua các công cụ đơn giản và quen thuộc.

Brain được thiết kế để tự cải tiến, sao cho hệ thống bộ nhớ có thể tiếp tục tốt hơn khi việc sử dụng tăng lên. Các tác nhân nền Dream chắt lọc thông tin mới thành các bản cập nhật Brain, đảm bảo rằng các tác nhân nền trước luôn bắt đầu một phiên mới với chế độ xem có tổ chức về ngữ cảnh gần đây nhất. Khung đánh giá đồng thời là một nền tảng thử nghiệm cho các vòng tự động nghiên cứu trên kiến trúc bộ nhớ cốt lõi và các giao diện hướng tác nhân.

Brain đã mang lại các phiên tác nhân chính xác và hiệu quả hơn đồng thời giảm số lượng token được chi tiêu. Sự đồng thiết kế cẩn thận của chúng tôi đối với Brain với ngăn xếp sản xuất của Computer đảm bảo những lợi ích này chuyển hóa trực tiếp thành lợi ích thực tế cho người dùng.

Chúng tôi đang tiếp tục xây dựng thêm nhiều tính năng để cải thiện chất lượng bộ nhớ của Computer. Trong thời gian chờ đợi, đối với người dùng đã bật Brain, bộ nhớ sẽ cải thiện theo mỗi phiên.