Giới thiệu LLM trực tuyến PPLX

API Mô hình Ngôn ngữ Lớn Trực tuyến đầu tiên thuộc loại này

Perplexity releases first "Live" LLM

API Mô hình Ngôn ngữ Lớn Trực tuyến đầu tiên thuộc loại này.

Chúng tôi rất vui mừng được chia sẻ hai mô hình PPLX mới: pplx-7b-onlinepplx-70b-online! Các mô hình trực tuyến của chúng tôi tập trung vào việc cung cấp các phản hồi hữu ích, cập nhật và thực tế, đồng thời có sẵn công khai qua pplx-api, biến đây thành API đầu tiên thuộc loại này. pplx-7b-onlinepplx-70b-online cũng có thể truy cập qua Perplexity Labs, nền tảng thử nghiệm LLM của chúng tôi.

Các LLM đã thay đổi cách chúng ta tìm kiếm thông tin. Tuy nhiên, có hai hạn chế với hầu hết các LLM hiện nay:

Tính cập nhật: Các LLM thường gặp khó khăn trong việc chia sẻ thông tin cập nhật.

Hiện tượng ảo giác: Các LLM cũng có thể đưa ra các tuyên bố không chính xác.

Các mô hình pplx-7b-onlinepplx-70b-online của chúng tôi giải quyết các hạn chế hiện tại bằng cách bổ sung cung cấp thông tin hữu ích, thực tế và cập nhật trong các phản hồi của mình.

LLM Trực tuyến PPLX

Các LLM của chúng tôi, pplx-7b-onlinepplx-70b-online, là LLM trực tuyến vì chúng có thể sử dụng kiến thức từ internet, và do đó có thể tận dụng thông tin cập nhật nhất khi tạo phản hồi. Bằng cách cung cấp cho các LLM của chúng tôi kiến thức từ web, các mô hình của chúng tôi phản hồi chính xác các truy vấn nhạy cảm về thời gian, khai thác kiến thức vượt ra ngoài tập dữ liệu huấn luyện của chúng. Điều này có nghĩa là các LLM trực tuyến của Perplexity có thể trả lời các truy vấn như “Tỷ số trận đấu của đội Warriors tối qua là gì?” vốn là thách thức đối với các mô hình ngoại tuyến. Ở mức độ tổng quan, đây là cách LLM trực tuyến của chúng tôi hoạt động:

  1. Tận dụng các mô hình mã nguồn mở: các mô hình PPLX của chúng tôi được xây dựng dựa trên các mô hình cơ sở mistral-7bllama2-70b.
  2. Công nghệ tìm kiếm nội bộ: cơ sở hạ tầng tìm kiếm, lập chỉ mục và thu thập dữ liệu nội bộ của chúng tôi cho phép chúng tôi bổ sung cho các LLM những thông tin phù hợp, cập nhật và có giá trị nhất. Chỉ mục tìm kiếm của chúng tôi rất lớn, được cập nhật thường xuyên và sử dụng các thuật toán xếp hạng phức tạp để đảm bảo các trang web chất lượng cao, không tối ưu hóa công cụ tìm kiếm (non-SEO) được ưu tiên. Các đoạn trích trang web, mà chúng tôi gọi là “snippets”, được cung cấp cho các mô hình pplx-online của chúng tôi để cho phép đưa ra phản hồi với thông tin cập nhật nhất.
  3. Tinh chỉnh: các mô hình PPLX của chúng tôi đã được tinh chỉnh để sử dụng hiệu quả các đoạn trích nhằm cung cấp thông tin cho phản hồi của chúng. Sử dụng các nhà thầu dữ liệu nội bộ của chúng tôi, chúng tôi tuyển chọn kỹ lưỡng các tập huấn luyện chất lượng cao, đa dạng và lớn nhằm đạt hiệu suất cao trên nhiều trục như tính hữu ích, tính xác thực và tính cập nhật. Các mô hình của chúng tôi được tinh chỉnh thường xuyên để liên tục cải thiện hiệu suất.

Đánh giá LLM Trực tuyến của Perplexity

Sứ mệnh của Perplexity là xây dựng công cụ trả lời tốt nhất thế giới - nơi mọi người tin tưởng để khám phá và mở rộng kiến thức của họ. Để đạt được điều này, chúng tôi rất tập trung vào việc cung cấp thông tin hữu ích, thực tế và cập nhật. Để đo lường hiệu suất của các LLM trên các trục này, chúng tôi đã tuyển chọn các tập dữ liệu đánh giá để phản ánh các trường hợp sử dụng đầy thử thách nhưng thực tế cho các công cụ trả lời. Đối với mỗi truy vấn trong mỗi tập đánh giá, các nhà thầu đã được cung cấp hai phản hồi mô hình và được hướng dẫn chọn phản hồi hoạt động tốt hơn theo các tiêu chí sau:

  • Tính hữu ích: phản hồi nào trả lời truy vấn và tuân theo các hướng dẫn được chỉ định tốt hơn?
  • Tính xác thực: phản hồi nào cung cấp câu trả lời chính xác hơn mà không bị ảo giác, ngay cả đối với các câu hỏi đòi hỏi kiến thức rất chính xác hoặc chuyên ngành?
  • Tính cập nhật (lấy cảm hứng từ FreshLLMs): phản hồi nào chứa nhiều thông tin cập nhật hơn? Một mô hình xuất sắc trong tiêu chí này nếu nó có thể trả lời các truy vấn bằng thông tin “mới”.

Ngoài ba tiêu chí trên, các phản hồi của mô hình cũng được đánh giá một cách toàn diện. Để đánh giá phản hồi một cách toàn diện, những người đánh giá được yêu cầu chọn phản hồi mà họ muốn nhận hơn từ một trợ lý con người đang hỗ trợ giải đáp truy vấn.

Tuyển chọn Tập dữ liệu Đánh giá

Đối với đánh giá này, chúng tôi đã tuyển chọn cẩn thận một tập hợp các câu lệnh đa dạng với mục tiêu đánh giá hiệu quả tính hữu ích, tính xác thực và tính cập nhật. Mỗi câu lệnh được chọn thủ công, đảm bảo mức độ kiểm soát cao đối với chất lượng và độ liên quan của dữ liệu. Tập dữ liệu bao gồm một loạt các câu lệnh của công cụ trả lời và bao gồm tổng quan toàn diện về những gì chúng tôi muốn Perplexity vượt trội. Điều này rất quan trọng để các đánh giá hiệu suất mô hình của chúng tôi có tín hiệu cao.

Mỗi tập trong ba tập đánh giá chứa 50 câu lệnh. Một số ví dụ từ các tập này bao gồm:

  • Tính hữu ích: Tạo bảng liệt kê tất cả các cầu thủ bóng đá Hoa Kỳ đã thi đấu trong trận chung kết World Cup và tạo các cột cho các thống kê của họ như bàn thắng, kiến tạo, v.v.
  • Tính xác thực: Giải thích độ bền của thép AISI 1015 và AISI 1040.
  • Tính cập nhật: Công ty xe tự hành nào đã bị cấm hoạt động tại San Francisco vào năm 2023?

Tạo Phản hồi cho Mô hình

Chúng tôi đã đánh giá bốn mô hình:

pplx-7b-online: Mô hình của Perplexity, bao gồm quyền truy cập vào thông tin từ internet. Mô hình này đã được tinh chỉnh bằng mistral-7b.

pplx-70b-online: Mô hình của Perplexity, bao gồm quyền truy cập vào thông tin từ internet. Mô hình này đã được tinh chỉnh bằng llama2-70b.

gpt-3.5-turbo-1106: Mô hình của OpenAI, được truy cập qua API và không có thêm bất kỳ sự bổ sung nào. Lưu ý rằng chúng tôi đã thực hiện đánh giá này bằng mô hình gpt-3.5 mới nhất.

llama2-70b-chat: Mô hình của Meta AI, được truy cập qua pplx-api của chúng tôi và không có thêm bất kỳ sự bổ sung nào.

Đối với mỗi câu lệnh, cùng các kết quả tìm kiếm và đoạn trích được cung cấp cho các mô hình pplx-7b-onlinepplx-70b-online. Tất cả các phản hồi được tạo bằng các siêu tham số và câu lệnh hệ thống giống nhau.

Câu lệnh Hệ thống

plaintext
Current date: Monday, November 20, 2023.

Xếp hạng Phản hồi của Mô hình Bằng Đánh giá của Con người

Đối với mỗi lần so sánh theo cặp, các nhà thầu nội bộ của chúng tôi được cung cấp chính câu lệnh đó, các tiêu chí đánh giá (tức là tính hữu ích, tính xác thực hoặc tính cập nhật) và các phản hồi của mô hình được hiển thị cạnh nhau. Thứ tự của các phản hồi được ngẫu nhiên hóa ở mỗi lượt, và các mô hình nguồn không được tiết lộ cho người đánh giá. Người đánh giá được hướng dẫn chọn phản hồi mà họ ưu tiên một cách toàn diện, cũng như phản hồi nào hoạt động tốt hơn về tiêu chí đánh giá cụ thể, cho phép hòa nhau ở cả hai trường hợp. Cuối cùng, người đánh giá được phép sử dụng tìm kiếm internet để xác minh độ chính xác của các phản hồi. Chúng tôi đã xây dựng công cụ xếp hạng ưu thích nội bộ của riêng mình để thực hiện đánh giá này.

Kết quả Đánh giá

Chúng tôi sử dụng các bảng xếp hạng ưu tiên theo cặp thu thập được từ đánh giá của con người để tính điểm Elo cho từng tác vụ đối với mỗi mô hình. Điểm Elo thường được sử dụng để xếp hạng một nhóm người chơi trong các cuộc thi theo phong cách giải đấu nhằm đo lường hiệu suất tương đối của người chơi. Khi áp dụng cho các mô hình ngôn ngữ lớn, những điểm số này cung cấp dự đoán về khả năng một người đánh giá là con người có thể ưu tiên đầu ra của mô hình này hơn mô hình khác.

Mặc dù điểm Elo thường được tính cho một chuỗi so sánh để giải thích cho những thay đổi về năng lực của người chơi, chúng tôi nhắm mục tiêu định lượng hiệu suất của các mô hình có năng lực không thể thay đổi. Do đó, chúng tôi áp dụng phương pháp luận Bootstrap Elo được mô tả trong Duan và cộng sự và cũng được sử dụng bởi lmsys cho Chatbot Arena của họ, bao gồm việc tính điểm Elo cho nhiều hoán vị ngẫu nhiên của các phép so sánh. Đối với các tính toán của mình, chúng tôi đã tính điểm Elo trên 5000 hoán vị và sử dụng phân phối của các điểm Elo này để tính khoảng tin cậy 95%.

Các kết quả, được hiển thị trong Hình 1, chứng minh rằng các mô hình PPLX của chúng tôi có thể sánh ngang và thậm chí vượt qua hiệu suất của gpt-3.5 đối với các trường hợp sử dụng liên quan đến Perplexity. Cụ thể, các phản hồi của mô hình pplx-7b-onlinepplx-70b-online được những người đánh giá là con người ưa chuộng hơn các phản hồi của mô hình gpt-3.5llama2-70b nhờ các câu trả lời chính xác và cập nhật.

Các mô hình pplx-7b-onlinepplx-70b-online hoạt động tốt hơn gpt-3.5llama2-70b, trên các tiêu chí tính cập nhật, tính xác thựctính toàn diện.

Hình 1. Điểm Elo ước tính và khoảng tin cậy 95% cho pplx-7b (-online), pplx-70b (-online), llama2-70b và gpt-3.5 trên bốn tập đánh giá khác nhau. Ví dụ, trên trục tính cập nhật, pplx-7b và pplx-70b hoạt động tốt hơn gpt-3.5 và llama2-70b, với điểm Elo ước tính lần lượt là 1100,6 và 1099,6 so với 879,3 và 920,3.

Chúng tôi cũng tính toán tỷ lệ thắng theo cặp từ đánh giá. Kết quả, được hiển thị trong Hình 2, minh họa có lẽ không có gì đáng ngạc nhiên, các phản hồi của mô hình trực tuyến pplx được ưa chuộng hơn các mô hình khác về tính cập nhậttính xác thực.

Hình 2. Tỷ lệ thắng của các mô hình trên trục dọc so với các mô hình trên trục ngang. Ví dụ, các phản hồi của pplx-70b (-online) được đánh giá là vượt trội về mặt tổng thể so với gpt-3.5 trên 64% các truy vấn và các phản hồi của gpt-3.5 được đánh giá là vượt trội về mặt tổng thể so với pplx-70b (-online) trên 24% các truy vấn.

Dưới đây là một ví dụ từ tập dữ liệu đánh giá tính cập nhật của chúng tôi.

Câu lệnh: Có bao nhiêu người ở Hoa Kỳ có giấy phép lái xe?

pplx-7b-online

Vào năm 2023, có khoảng 243,4 triệu tài xế được cấp phép tại Hoa Kỳ, bao gồm 89% người trưởng thành ở Hoa Kỳ. Con số này đã tăng từ 238,6 triệu vào năm 2022. Tỷ lệ tài xế được cấp phép khác nhau giữa các nhóm tuổi và tiểu bang khác nhau. Ví dụ, vào năm 2019, 84,1% dân số Hoa Kỳ có giấy phép lái xe. Tỷ lệ tài xế được cấp phép cao nhất là ở độ tuổi từ 25 đến 49, với 90,1% dân số có giấy phép lái xe. Tại California, có 27 triệu tài xế được cấp phép, biến nơi đây thành tiểu bang có số lượng tài xế được cấp phép cao nhất.

pplx-70b-online

Vào năm 2021, khoảng 233 triệu người sở hữu giấy phép lái xe hợp lệ tại Hoa Kỳ. Đến năm 2023, số lượng tài xế được cấp phép tại Hoa Kỳ dự kiến sẽ đạt 243,4 triệu, bao gồm 89% người trưởng thành ở Hoa Kỳ. Điều này thể hiện sự gia tăng từ 238,6 triệu vào năm 2022.

gpt-3.5

Là một mô hình ngôn ngữ AI, tôi không có quyền truy cập dữ liệu thời gian thực. Tuy nhiên, tính đến năm 2021, ước tính có khoảng 227 triệu người tại Hoa Kỳ sở hữu giấy phép lái xe hợp lệ. Xin lưu ý rằng con số này có thể đã thay đổi kể từ đó, vì vậy tốt nhất bạn nên tham khảo số liệu thống kê chính thức mới nhất để có thông tin chính xác nhất.

llama2-70b

Tôi không có quyền truy cập dữ liệu thời gian thực, nhưng tôi có thể cung cấp một số thông tin về số lượng người xấp xỉ tại Hoa Kỳ có giấy phép lái xe. Theo Cục Đường cao tốc Liên bang, có khoảng 227,8 triệu tài xế được cấp phép tại Hoa Kỳ tính đến năm 2020. Con số này bao gồm cả tài xế thương mại và phi thương mại. Cần lưu ý rằng con số này có thể là một ước tính thấp hơn thực tế, vì nó không tính đến những cá nhân có thể có giấy phép lái xe nhưng không lái xe thường xuyên hoặc hoàn toàn không lái xe. Ngoài ra, con số này không bao gồm các cá nhân không đủ điều kiện nhận giấy phép lái xe, chẳng hạn như những người dưới 16 tuổi hoặc có các khuyết tật nhất định. Cũng quan trọng cần lưu ý là số lượng tài xế được cấp phép có thể thay đổi theo tiểu bang, với một số tiểu bang có tỷ lệ tài xế được cấp phép cao hơn những tiểu bang khác.

Nhìn chung, kết quả đánh giá chứng minh rằng các mô hình PPLX của chúng tôi có thể sánh ngang và thậm chí vượt trội hơn gpt-3.5llama2-70b về các trường hợp sử dụng liên quan đến Perplexity, đặc biệt trong việc cung cấp các phản hồi chính xác và cập nhật.

Truy cập Các Mô hình Trực tuyến của Perplexity

Chúng tôi rất vui mừng thông báo rằng pplx-api đang chuyển dần từ giai đoạn thử nghiệm (beta) sang phát hành công khai rộng rãi! Đây là lần đầu tiên các mô hình pplx-7b-onlinepplx-70b-online của chúng tôi có thể truy cập thông qua pplx-api. Ngoài ra, các mô hình pplx-7b-chatpplx-70b-chat của chúng tôi đã thoát khỏi giai đoạn alpha và hiện có thể truy cập thông qua bản phát hành chung của chúng tôi.

Cùng với điều này, chúng tôi đang giới thiệu một cấu trúc định giá mới dựa trên mức sử dụng. Chúng tôi rất hào hứng khi người dùng tận dụng cơ sở hạ tầng tối tân của chúng tôi, sử dụng NVIDIA H100s để cung cấp khả năng suy luận cực nhanh. Người dùng Pro sẽ nhận được khoản tín dụng pplx-api định kỳ 5 đô la hàng tháng. Đối với tất cả người dùng khác, giá sẽ được xác định dựa trên mức sử dụng. Để đăng ký làm người dùng Pro, hãy nhấp vào đây. Liên hệ với api@perplexity.ai để có các yêu cầu thương mại.

Bảng điều khiển LLM trực tuyến PPLX

Tài nguyên Bổ sung:

Những người đóng góp:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats