Cách Perplexity xây dựng độ chính xác vào AI tiên tiến

Trọng tâm cốt lõi của chúng tôi luôn là xây dựng độ chính xác vào AI tiên tiến. Lần đầu tiên, chúng tôi chia sẻ một phần công nghệ đằng sau cách chúng tôi làm điều đó.

Sứ mệnh của chúng tôi là tiếp sức cho sự tò mò, dành cho những ai muốn biết nhiều hơn và làm được nhiều hơn với kho tri thức của nhân loại. Để làm được điều đó, trọng tâm cốt lõi của chúng tôi luôn là làm cho các mô hình AI tiên tiến nhất trở nên chính xác hơn trên Perplexity.

Lần đầu tiên, chúng tôi chia sẻ một trong những công nghệ đằng sau cách chúng tôi làm điều đó. Hôm nay, nhóm nghiên cứu của chúng tôi đã công bố một nghiên cứu chuyên sâu về mặt kỹ thuật về các LLM tăng cường tìm kiếm.

Có hàng chục quy trình chúng tôi sử dụng để phát triển độ chính xác, và đây là một góc nhìn hiếm hoi bên trong một trong số đó: hậu huấn luyện các mô hình AI tiên tiến để đạt hiệu suất tốt nhất so với các tiêu chuẩn độ chính xác cho các sản phẩm Perplexity như Search, Comet và Computer.

Chúng tôi huấn luyện hành vi trước khi tìm kiếm

Một công cụ trả lời đòi hỏi các mô hình nền tảng phải làm được nhiều việc hơn là chỉ tạo ra văn bản trôi chảy. Chúng phải tìm kiếm bằng chứng, tuân theo yêu cầu của người dùng, sử dụng các công cụ một cách chính xác và biến công việc đó thành một câu trả lời tập trung.

Chúng tôi tiến hành hậu huấn luyện cho việc đó theo hai giai đoạn. Đầu tiên, chúng tôi dạy mô hình cách ứng xử bên trong sản phẩm, bao gồm cách tuân theo hướng dẫn, duy trì tính nhất quán và sử dụng các công cụ theo đúng cách. Sau đó, chúng tôi huấn luyện mô hình này trên các tác vụ tìm kiếm khó hơn để mô hình giỏi hơn trong việc tìm kiếm bằng chứng, sử dụng nó hiệu quả và trả lời hiệu quả hơn.

Phương pháp theo từng giai đoạn là một trong những điểm khác biệt đơn giản giữa Perplexity và thiết lập trình bao bọc (wrapper) truyền thống có tích hợp mô hình và quyền truy cập web. Đó là lý do tại sao cùng một mô hình có thể tạo ra các kết quả khác nhau ở các sản phẩm khác nhau, và tại sao nó có thể hoạt động tốt hơn trong Perplexity so với một chế độ triển khai đơn giản hơn.

Các câu hỏi đòi hỏi sự tổng hợp

Một số câu hỏi là việc tra cứu dễ dàng. Những câu hỏi khác đòi hỏi mô hình phải kết nối bằng chứng trên nhiều nguồn.

Chúng tôi huấn luyện trên các câu hỏi đòi hỏi mô hình phải kết nối bằng chứng qua các nguồn. Đối với các câu hỏi thực tế, chúng tôi sử dụng các tác vụ buộc mô hình phải tìm kiếm, suy luận và xác minh thay vì vội vàng đưa ra câu trả lời từ một manh mối hiển nhiên duy nhất. Nhiều câu hỏi đòi hỏi phải kết nối thông tin qua nhiều nguồn. Chúng đòi hỏi mô hình phải chuyển từ bằng chứng này sang bằng chứng khác và xây dựng câu trả lời từ chuỗi đó.

Chúng tôi cũng huấn luyện trên các định dạng phản hồi khác nhau, để mô hình luôn giữ được độ chính xác cho dù người dùng muốn một đoạn văn, một danh sách, một bảng hay cấu trúc khác. Kết quả là khả năng tổng hợp tốt hơn, bao gồm các câu trả lời kết nối bằng chứng qua các nguồn thay vì chỉ truy xuất các sự thật đơn lẻ.

Các tác vụ mở cần có tiêu chuẩn

Perplexity được sử dụng cho nhiều mục đích hơn là chỉ tra cứu sự thật. Rất nhiều công việc mang tính mở, bao gồm viết lại, chỉnh sửa, tóm tắt, giải thích và lên kế hoạch.

Những tác vụ đó không có một câu trả lời chính xác duy nhất, nhưng chúng vẫn cần các tiêu chuẩn. Đối với công việc mang tính mở, chúng tôi sử dụng các tiêu chí đánh giá (rubric) vốn là các bước kiểm tra có cấu trúc để xem xét liệu phản hồi có thực sự hoàn thành công việc hay không. Liệu nó có tuân theo các hướng dẫn không? Liệu nó có bảo tồn ý nghĩa không? Liệu nó có giải quyết được vấn đề của người dùng không?

Điều đó cho phép chúng tôi huấn luyện các tác vụ mở với các tiêu chuẩn rõ ràng thay vì coi chúng như văn bản tự do.

Độ chính xác được đặt lên trước sự ưu tiên

Đối với các tác vụ thực tế, câu trả lời phải chính xác trước khi được ghi nhận là hữu ích hơn hoặc được viết tốt hơn. Đối với các tác vụ mở, phản hồi phải thỏa mãn tiêu chí đánh giá trước khi các phẩm chất khác phát huy tác dụng.

Điều đó giúp hệ thống tập trung vào nội dung cốt lõi thay vì hình thức. Nó giúp ngăn chặn một lỗi phổ biến là các câu trả lời nghe có vẻ hay hơn nhưng thực chất lại không tốt hơn. Thành quả mang lại là ít câu trả lời bóng bẩy hơn nhưng lại sụp đổ khi bị kiểm tra kỹ lưỡng.

Hiệu suất đóng góp vào chất lượng câu trả lời

Chúng tôi cũng huấn luyện mô hình sử dụng tính năng tìm kiếm một cách có kỷ luật.

Bất kỳ bước tìm kiếm bổ sung nào cũng phải cải thiện câu trả lời, và một phản hồi dài hơn phải xứng đáng với độ dài của nó. Khi việc tìm kiếm thêm hoặc từ ngữ thừa không giúp ích gì, hệ thống nên dừng lại.

Điều đó tạo ra các câu trả lời dễ sử dụng hơn và duy trì sự tập trung cho mô hình khi nó xử lý các chuỗi hành động dài hơn, nơi các lỗi nhỏ tích tụ lại.

Các câu trả lời tốt hơn đòi hỏi nỗ lực không ngừng

Chất lượng tìm kiếm đến từ cách sản phẩm huấn luyện mô hình thu thập bằng chứng, trả lời có kỷ luật, xử lý công việc mở và dừng lại khi có đủ sự hỗ trợ.

Khi các hệ thống AI đảm nhận các công việc dài hơn và mang tính tự chủ cao hơn, quá trình huấn luyện đó định hình chất lượng của từng câu trả lời và mọi thứ được xây dựng dựa trên chúng. Chúng tôi chưa bao giờ tuyên bố Perplexity chính xác 100%, nhưng chúng tôi khẳng định là công ty AI quan tâm đến điều đó nhất và nỗ lực hết mình vì nó một cách bền bỉ. Chúng tôi khuyến khích tất cả người dùng cung cấp phản hồi về các câu trả lời trên Perplexity của họ, bởi vì chúng tôi luôn không ngừng lặp lại và cải tiến.