介紹 PPLX 線上 LLM
首個同類型的線上 LLM API

首個同類型的線上 LLM API。
我們很高興與您分享兩款全新的 PPLX 模型:pplx-7b-online 和 pplx-70b-online!我們的線上模型致力於提供有幫助、最新且符合事實的回答,並透過 pplx-api 公開供大眾使用,使其成為首個同類型的 API。pplx-7b-online 和 pplx-70b-online 也可透過我們的 LLM 實驗平台 Perplexity Labs 存取。
LLM 已經改變了我們獲取資訊的方式。然而,目前大多數 LLM 存在兩個侷限:
時效性:LLM 在分享最新資訊方面往往表現不佳。
幻覺問題:LLM 也可能會輸出不準確的陳述。
我們的 pplx-7b-online 和 pplx-70b-online 模型透過在回應中額外提供有幫助、符合事實且最新的資訊,解決了目前的這些侷限。
PPLX 線上 LLM
我們的 LLM,即 pplx-7b-online 和 pplx-70b-online,之所以被稱為線上 LLM,是因為它們可以使用來自網際網路的知識,因此在形成回應時能利用最新的資訊。透過為我們的 LLM 提供網路上的知識,我們的模型能準確地回應對時間敏感的查詢,從而挖掘超出其訓練語料庫的知識。這意味著 Perplexity 的線上 LLM 可以回答諸如「昨晚勇士隊比賽的比分是多少?」這類對離線模型而言極具挑戰性的查詢。概括來說,這就是我們線上 LLM 的運作方式:
- 利用開源模型: 我們的 PPLX 模型建立在
mistral-7b和llama2-70b基礎模型之上。 - 內部搜尋技術: 我們內部的搜尋、索引和爬取基礎架構使我們能夠利用最相關、最新且有價值的資訊來增強 LLM。我們的搜尋索引龐大,會定期更新,並使用先進的排名演算法,確保高質量、非 SEO 垃圾網站的內容獲得優先順序。我們將網頁摘錄(我們稱為「snippets」)提供給我們的
pplx-online模型,以實現提供最新資訊的回應。 - 微調:我們的 PPLX 模型經過微調,能有效利用摘錄內容來完善其回應。我們透過內部的數據承包商,精心策劃高質量、多樣化且龐大的訓練集,以在有用性、事實準確性和時效性等各個維度上實現高性能。我們的模型會定期進行微調,以持續提升效能。
評估 Perplexity 的線上 LLM
Perplexity 的使命是打造世界上最好的答案引擎——一個讓人們信任以發現和擴展知識的引擎。為了實現這一目標,我們深耕於提供有幫助、符合事實且最新的資訊。為了在這些維度上衡量我們 LLM 的效能,我們策劃了評估數據集,以反映答案引擎所面臨的具體且具有挑戰性的現實應用場景。對於每個評估集中的每個查詢,承包商會收到兩個模型回應,並被指示根據以下標準選出表現較好的回應:
- 有用性:哪個回應更能回答查詢並遵循指定的指令?
- 事實準確性:哪個回應提供了更準確的答案且無幻覺,即使對於需要非常精確或小眾知識的問題也是如此?
- 時效性(靈感來自 FreshLLMs):哪個回應包含更新的資訊?如果模型能夠以「新鮮」的資訊回答查詢,則該模型在此準則上表現出色。
除了上述三個準則外,模型回應也進行了整體評估。為了進行整體評估,評估人員被要求選擇他們更希望從一位協助該查詢的人類助理那裡獲得的回應。
策劃評估集
針對此次評估,我們精心策劃了一組多樣化的提示,目標是有效評估有用性、事實準確性和時效性。每個提示均經過人工選擇,確保對數據的質量和相關性有高度的控制。該數據集涵蓋了廣泛的答案引擎提示,並全面概括了我們希望 Perplexity 在哪些方面表現卓越。這對於我們進行模型效能評估以獲得高信噪比至關重要。
三個評估集中的每一個都包含 50 個提示。這些集合中的一些範例包括:
- 有用性:建立一個在世界盃決賽中出場的美國足球運動員表格,並為他們的統計數據(如進球、助攻等)建立欄位。
- 事實準確性:解釋 AISI 1015 和 AISI 1040 鋼的韌性。
- 時效性: 哪家自動駕駛汽車公司在 2023 年被舊金山禁止營運?
生成模型回應
我們評估了四種模型:
pplx-7b-online:Perplexity 的模型,包含存取網際網路資訊的權限。該模型使用 mistral-7b 進行微調。
pplx-70b-online:Perplexity 的模型,包含存取網際網路資訊的權限。該模型使用 llama2-70b 進行微調。
gpt-3.5-turbo-1106:OpenAI 的模型,透過 API 存取且無任何額外增強。請注意,我們是使用最新的 gpt-3.5 模型進行此次評估的。
llama2-70b-chat:Meta AI 的模型,透過我們的 pplx-api 存取且無任何額外增強。
對於每個提示,相同的搜尋結果和摘錄內容會提供給 pplx-7b-online 和 pplx-70b-online 模型。所有回應均使用相同的超參數和系統提示進行生成。
系統提示
Current date: Monday, November 20, 2023.透過人工評估對模型回應進行排名
對於每一次配對比較,我們的內部承包商會收到提示本身、評估標準(即有用性、事實準確性或時效性)以及並排顯示的模型回應。回應的順序在每回合都是隨機的,且來源模型不會向評估者透露。評估者被要求選出他們整體上更偏好的回應,以及在特定評估準則上表現更好的回應,兩者均允許平手。最後,評估者可以使用網路搜尋來核實回應的準確性。我們建立了自己內部的偏好排名工具來進行此次評估。
評估結果
我們使用從人工評估中收集的配對偏好排名,來計算每個模型的每項任務 Elo 分數。Elo 分數常用於在錦標賽風格的比賽中對參賽者群體進行排名,以衡量參賽者的相對表現。當應用於大型語言模型時,這些分數能預測人類評估者青睞一個模型輸出勝過另一個模型的可能性。
雖然 Elo 分數通常是針對一系列比較來計算,以考慮參賽者能力的變化,但我們的目標是量化那些能力不會改變的模型的表現。因此,我們採用了 Duan et al. 描述並被 lmsys 用於其 Chatbot Arena 的 Bootstrap Elo 方法,這需要針對多次隨機比較排列來計算 Elo 分數。在我們的計算中,我們針對 5000 次排列進行了 Elo 分數計算,並利用這些 Elo 分數的分佈來計算 95% 的信賴區間。
如圖 1 所示,結果證明我們的 PPLX 模型在與 Perplexity 相關的應用場景中,表現可以與 gpt-3.5 相媲美,甚至超越它。特別是,人類評估者更偏好 pplx-7b-online 和 pplx-70b-online 模型所提供的準確且最新的回應,而非 gpt-3.5 和 llama2-70b 的回應。
pplx-7b-online 和 pplx-70b-online 在時效性、事實準確性和整體標準上,表現優於 gpt-3.5 和 llama2-70b。

我們還根據評估結果計算了配對勝率。如圖 2 所示的結果說明,毫不意外地,在時效性和事實準確性方面,人類更偏好 pplx 線上模型的回應。

以下是我們時效性評估數據集中的一個範例。
提示:美國有多少人擁有駕駛執照?
pplx-7b-online
2023 年,美國預計有 2.434 億名持證駕駛,佔美國成年人口的 89%。此數字從 2022 年的 2.386 億增加。持證駕駛的百分比在不同年齡組和州份之間有所差異。例如,2019 年,84.1% 的美國人口擁有駕駛執照。持證駕駛比例最高的是 25 至 49 歲年齡組,該群體中有 90.1% 的人口擁有駕駛執照。在加利福尼亞州,有 2700 萬名持證駕駛,使其成為持證駕駛人數最多的州。
pplx-70b-online
2021 年,美國約有 2.33 億人持有有效駕駛執照。到 2023 年,美國持證駕駛的人數預計將達到 2.434 億,其中包括 89% 的美國成年人。這代表從 2022 年的 2.386 億有所增加。
gpt-3.5
作為一個 AI 語言模型,我無法存取即時數據。然而,截至 2021 年,據估計美國約有 2.27 億人持有有效駕駛執照。請注意,此數字自那時起可能已發生變化,因此最好參考最新的官方統計數據以獲取最準確的資訊。
llama2-70b
我無法存取即時數據,但我可以提供一些關於美國擁有駕駛執照的人數近似資訊。根據聯邦公路管理局的數據,截至 2020 年,美國約有 2.278 億名持證駕駛。此數字包括商業和非商業駕駛。值得注意的是,這個數字很可能被低估了,因為它沒有考慮到那些可能擁有駕駛執照但並不經常駕駛或完全不駕駛的個人。此外,這個數字不包括那些沒有資格獲得駕駛執照的個人,例如 16 歲以下或有特定殘疾的人。同樣重要的是要注意,持證駕駛的人數可能會因州而異,有些州的持證駕駛比例高於其他州。
總體而言,評估結果證明我們的 PPLX 模型在與 Perplexity 相關的應用場景中,特別是在提供準確且最新的回應方面,可以與 gpt-3.5 和 llama2-70b 相媲美,甚至表現得更好。
存取 Perplexity 的線上模型
我們很高興地宣布 pplx-api 正從測試版階段過渡至全面公開發布!這是我們的 pplx-7b-online 和 pplx-70b-online 模型首次可以透過 pplx-api 存取。此外,我們的 pplx-7b-chat 和 pplx-70b-chat 模型已結束 Alpha 測試,現在可透過我們的正式發布版本進行存取。
在此基礎上,我們引進了新的基於使用量的定價結構。我們很興奮用戶能使用我們最先進的基礎架構,該架構利用 NVIDIA H100s 提供極速推理。Pro 用戶每月將收到 5 美元的循環 pplx-api 點數。對於所有其他用戶,定價將根據使用量決定。欲註冊成為 Pro 用戶,請點選此處。商業查詢請聯絡 api@perplexity.ai。

其他資源:
- 在此開始使用 pplx-api。
- 透過 Perplexity Labs 免費試用我們的線上模型。
- 透過 pplx-api 文件了解更多關於我們 API 的資訊。
- 有興趣加入一個高影響力、高節奏且致力於打造最佳答案引擎的團隊嗎?加入我們!
- 加入我們日益壯大的 Discord 社群!
貢獻者:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats