隆重介紹 PPLX 網上 LLM

首創的網上 LLM API

Perplexity releases first "Live" LLM

首創的網上 LLM API。

我們很高興分享兩個全新的 PPLX 模型:pplx-7b-onlinepplx-70b-online!我們的網上模型專注於提供實用、最新且真實的回應,並透過 pplx-api 公開提供,使其成為首創的 API。pplx-7b-onlinepplx-70b-online 亦可透過我們的 LLM 試驗場 Perplexity Labs 進行存取。

LLM 改變了我們尋找資訊的方式。然而,現今大多數 LLM 存在兩個限制:

時效性:LLM 通常難以分享最新的資訊。

幻覺:LLM 亦會輸出不準確的陳述。

我們的 pplx-7b-onlinepplx-70b-online 模型透過在回應中額外提供實用、真實且最新的資訊,來解決目前的限制。

PPLX 網上 LLM

我們的 LLM(pplx-7b-onlinepplx-70b-online)為網上 LLM,因為它們可以使用來自互聯網的知識,因而在形成回應時能夠善用最新的資訊。透過為我們的 LLM 提供來自網絡的知識,我們的模型能夠精確回應具時間敏感性的查詢,從而解鎖其訓練語料庫以外的知識。這意味著 Perplexity 的網上 LLM 可以回答諸如「昨晚勇士隊的比賽比分是多少?」這類對離線模型而言深具挑戰性的查詢。從高層次來看,這正是我們網上 LLM 的運作方式:

  1. 善用開源模型:我們的 PPLX 模型是以 mistral-7bllama2-70b 基礎模型為基礎建構的。
  2. 內部搜尋技術:我們的內部搜尋、索引與網路爬蟲基礎設施讓我們能夠為 LLM 增添最相關、最新且最有價值的資訊。我們的搜尋索引規模龐大,會定期更新,並使用複雜的排序演算法以確保優先處理高品質、非 SEO 優化的網站。我們稱之為「摘要」的網站摘錄會提供給我們的 pplx-online 模型,以便能夠提供包含最新資訊的回應。
  3. 微調:我們的 PPLX 模型經過微調,能有效使用摘要來提供其回應。透過我們的內部數據外包商,我們悉心策劃高品質、多元且龐大的訓練集,以便在實用性、真實性與時效性等各個面向達到高效能。我們的模型會定期進行微調,以持續提升效能。

評估 Perplexity 的網上 LLM

Perplexity 的使命是建立全球最佳的解答引擎——一個讓人們信任以探索並擴展其知識的引擎。為了達成此目標,我們深切專注於提供實用、真實且最新的資訊。為了在此等面向對我們的 LLM 效能進行基準測試,我們策劃了評估資料集,以反映解答引擎具挑戰性且實際的使用情境。對於每個評估集中的每個查詢,外包商會獲得兩個模型的回應,並獲指示針對以下標準選擇表現較佳的回應:

  • 實用性:哪一個回應能更妥善地解答查詢並遵循指定的指示?
  • 真實性:哪一個回應能在沒有幻覺的情況下提供更準確的答案,即使針對需要極為精確或小眾知識的問題亦然?
  • 時效性(受 FreshLLMs啟發):哪一個回應包含更多最新資訊?若模型能夠以「新鮮」的資訊回答查詢,即在此標準上表現出色。

除了上述三項標準外,模型回應亦獲得了整體評估。為了整體評估回應,評估人員被要求選出他們更願意從協助處理查詢的人類助理那裡收到的回應。

策劃評估集

針對此評估,我們悉心策劃了一組多元的提示,旨在有效評估實用性、真實性與時效性。每個提示均經人手挑選,確保對資料品質與相關性的高度控制。該資料集涵蓋廣泛的解答引擎提示,並全面概括了我們希望 Perplexity 擅長的領域。這對於我們確保模型效能評估具備高信號至關重要。

這三個評估集中的每一個均包含 50 個提示。這些集中的部分範例包括:

  • 實用性:建立一份曾在世界盃決賽中上陣的所有美國足球員表格,並為其進球、助攻等統計數據建立欄位。
  • 真實性:解釋 AISI 1015 與 AISI 1040 鋼材的韌性。
  • 時效性:哪一家自動駕駛汽車公司於 2023 年遭到三藩市禁行?

生成模型回應

我們評估了四個模型:

pplx-7b-online:Perplexity 的模型,包含對互聯網資訊的存取權限。此模型使用 mistral-7b 進行微調。

pplx-70b-online:Perplexity 的模型,包含對互聯網資訊的存取權限。此模型使用 llama2-70b 進行微調。

gpt-3.5-turbo-1106:OpenAI 的模型,透過 API 存取且沒有額外的擴充。請注意,我們是使用最新的 gpt-3.5 模型進行此評估。

llama2-70b-chat:Meta AI 的模型,透過我們的 pplx-api 存取且沒有額外的擴充。

針對每個提示,相同的搜尋結果與摘要皆會提供予 pplx-7b-onlinepplx-70b-online 模型。所有回應皆使用相同的超參數與系統提示生成。

系統提示

plaintext
Current date: Monday, November 20, 2023.

透過人類評估對模型回應進行排序

針對每次成對比較,我們的內部外包商會獲得提示本身、評估標準(即實用性、真實性或時效性),以及並排顯示的模型回應。回應的順序在每一輪中均會隨機化,且來源模型不會向評估人員透露。評估人員獲指示選出其整體偏好的回應,以及哪一個在特定評估標準上表現較佳,兩者皆允許平手。最後,評估人員獲准使用互聯網搜尋來驗證回應的準確性。我們建立了專屬的內部偏好排序工具來進行此評估。

評估結果

我們使用從人類評估中收集到的成對偏好排序,為每個模型計算每個任務的 Elo 分數。Elo 分數常用於在錦標賽風格的競賽中對一族選手進行排名,以衡量選手的相對表現。當應用於大型語言模型時,這些分數能預測人類評估人員偏好某個模型輸出而非另一個模型的可能性。

雖然 Elo 分數通常是針對一系列比較計算以反映選手能力的變化,但我們的目標是量化能力不會改變的模型的表現。因此,我們採用了 Duan 等人 所述且亦被 lmsys 用於其 Chatbot Arena 的 Bootstrap Elo 方法論,這涉及為比較的許多隨機排列計算 Elo 分數。對於我們的計算,我們在 5000 次排列上計算了 Elo 分數,並使用這些 Elo 分數的分佈來計算 95% 信賴區間。

如圖 1 所示的結果證明,我們的 PPLX 模型在與 Perplexity 相關的使用情境中能夠媲美甚至超越 gpt-3.5 的效能。特別是由於其準確且最新的答案,pplx-7b-onlinepplx-70b-online 模型回應受到人類評估人員的青睞,勝過 gpt-3.5llama2-70b 模型回應。

pplx-7b-onlinepplx-70b-online時效性真實性整體標準上的表現均優於 gpt-3.5llama2-70b

圖 1. pplx-7b (-online)、pplx-70b (-online)、llama2-70b 與 gpt-3.5 在四個不同評估集上的預估 Elo 分數與 95% 信賴區間。例如,在時效性軸上,pplx-7b 與 pplx-70b 的表現優於 gpt-3.5 與 llama2-70b,其預估 Elo 分數分別為 1100.6 與 1099.6,相較於 879.3 與 920.3。

我們亦計算了評估中的成對勝率。如圖 2 所示的結果說明,毫不意外地,pplx 網上模型回應在時效性真實性上較其他模型更受青睞。

圖 2. 縱軸上的模型對橫軸上模型的勝率。例如,在 64% 的查詢中,pplx-70b (-online) 的回應被評定為整體優於 gpt-3.5,而在 24% 的查詢中,gpt-3.5 的回應被評定為整體優於 pplx-70b (-online)。

以下是來自我們時效性評估資料集的範例。

提示:美國有多少人擁有駕駛執照?

pplx-7b-online

在 2023 年,美國預計有 2.434 億名持牌駕駛者,其中包括 89% 的美國成年人。此數字已從 2022 年的 2.386 億增加。持牌駕駛者的百分比因不同年齡層與州份而異。例如,在 2019 年,84.1% 的美國人口擁有駕駛執照。持牌駕駛者比例最高的是 25 至 49 歲族群,佔該年齡層人口的 90.1%。在加利福尼亞州,有 2,700 萬名持牌駕駛者,使其成為持牌駕駛者人數最多的州份。

pplx-70b-online

在 2021 年,美國約有 2.33 億人持有有效的駕駛執照。到了 2023 年,美國持牌駕駛者的數量預計將達到 2.434 億,其中包括 89% 的美國成年人。這代表著較 2022 年的 2.386 億有所增加。

gpt-3.5

作為一個 AI 語言模型,我無法存取即時數據。然而,截至 2021 年,估計美國約有 2.27 億人持有有效的駕駛執照。請注意,此數字自當時起可能已有所變更,因此最好參閱最新的官方統計數據以獲取最準確的資訊。

llama2-70b

我無法存取即時數據,但我可以提供一些關於美國擁有駕駛執照的大約人數的資訊。根據聯邦公路管理局的資料,截至 2020 年,美國大約有 2.278 億名持牌駕駛者。此數字包含商業與非商業駕駛者。值得注意的是,此數字可能被低估了,因為它未將可能擁有駕駛執照但並不經常或完全不駕駛的個人計算在內。此外,此數字不包含不符合駕駛執照資格的個人,例如 16 歲以下或有特定殘疾的人士。同樣重要的是要注意,持牌駕駛者的數量會因州而異,某些州的持牌駕駛者比例高於其他州。

整體而言,評估結果證明我們的 PPLX 模型在與 Perplexity 相關的使用情境中能夠媲美甚至超越 gpt-3.5llama2-70b,特別是在提供準確且最新的回應方面。

存取 Perplexity 的網上模型

我們非常榮幸地宣佈 pplx-api 正在脫離測試版,進入公眾全面發布階段!這是我們的 pplx-7b-onlinepplx-70b-online 模型首次能夠透過 pplx-api 進行存取。此外,我們的 pplx-7b-chatpplx-70b-chat 模型已脫離 alpha 版,現已可透過我們的全面發布版本進行存取。

隨之而來的是,我們將推出全新的基於使用的定價結構。我們很高興讓用戶使用我們頂尖的基礎設施,該設施利用 NVIDIA H100s 來提供極速的推論。Pro 用戶將可獲得每月經常性的 $5 美元 pplx-api 點數。對於所有其他用戶,定價將根據使用情況而定。要註冊成為 Pro 用戶,請按此處。如有商業查詢,請聯絡 api@perplexity.ai。

PPLX-online llm 儀表板

其他資源:

貢獻者:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats