Perplexity Sonar 在全新搜尋競技場評估中表現優異

Perplexity Sonar 模型在搜尋評估中奪得榜首

簡而言之

  • 排名第 1:Sonar-Reasoning-Pro-High 獲得了 1136 (±21/−19) 的競技場評分 (Arena Score),與 Google 的 Gemini-2.5-Pro-Grounding (1142 +14/-17) 並列第一。在直接對決中,Sonar-Reasoning-Pro-High 有 53% 的勝率高於 Gemini-2.5-Pro-Grounding。
  • Sonar 的統治地位: Perplexity 模型包辦了第 1 到第 4 名,顯著優於 Google 和 OpenAI 的其他評估模型。
  • 推理優勢: 結合推理能力的模型 (sonar-reasoning-pro 和 sonar-reasoning) 排名較高,這與觀察到的一般用戶對推理模型的偏好相符 (排行榜前 3 名)。
  • 搜尋深度: Sonar 模型執行更深度的搜尋並考慮更多來源,平均引用的來源數量是同類 Gemini 模型的 2-3 倍。

______

LM Arena 剛發布了他們的 新搜尋競技場排行榜 (Search Arena leaderboard),根據人類偏好比較了搜尋增強型 LLM 系統。Perplexity 的 Sonar-Reasoning-Pro 模型與 Gemini-2.5-Pro-Grounding 並列第一,其餘的 Sonar 模型表現皆優於 Gemini-2.0-Flash-Grounding 以及 OpenAI 所有的網頁搜尋模型。

搜尋競技場基準測試

與 SimpleQA 專注於狹義的事實準確性不同,LM Arena 評估模型在編碼、寫作、研究和建議等領域處理真實用戶查詢時的表現。在搜尋競技場 (Search Arena) 中,評估重點在於時事,並包含更長、更複雜的提示詞,收集了跨 11 個模型的超過 10,000 個用戶偏好投票。在 2025 年 3 月 18 日至 4 月 13 日期間,搜尋競技場要求用戶輸入提示詞,並選擇哪個模型的回應更符合其資訊需求。

Sonar 模型效能結果

Perplexity 的 Sonar 模型表現優於許多頂尖的先進模型,包括 Gemini 2.0 Flash 和 GPT 4o Search。我們的 Sonar-Reasoning-Pro 模型獲得了 1136 分,與 Gemini-2.5-Pro-Grounding (1142) 並列榜首。

在直接對決中,Sonar-Reasoning-Pro-High 有 53% 的勝率高於 Gemini-2.5-Pro-Grounding。

搜尋競技場的評估揭示了三個與人類偏好強相關的因素:

  • 更長的回應 (係數 0.255,p<0.05)
  • 較高的引用次數 (係數 0.234,p<0.05)
  • 來自社群網頁來源的引用

排行榜顯示用戶明確偏好具有推理增強功能的模型,其中 Sonar-Reasoning-ProSonar-Reasoning 佔據了前三名中的兩席。對照實驗強化了這些發現,顯示在控制引用數量後,模型排名趨於一致,這表明搜尋深度是顯著的效能差異因素。

Perplexity 的 Sonar 模型具有明顯更高的搜尋深度,ppl-sonar-pro-high 引用的來源數量是同類 Gemini 模型的 2-3 倍。

這對用戶意味著什麼

對於 Perplexity 用戶而言,這些結果證實了 Sonar 模型在廣泛的主題中提供了同類最佳的準確性、全面的來源歸屬以及高品質的回應。

Perplexity Pro 用戶可以透過在設定中將 Sonar 設為預設模型,繼續受益於這些頂尖模型。API 用戶可以透過我們的 Sonar API 服務存取這些功能,並使用靈活的搜尋模式來平衡效能與成本效益。

儘管我們為這一成就感到自豪,但我們仍致力於持續改進。搜尋競技場評估提供了關於用戶偏好的寶貴見解,這將為我們持續的開發工作提供參考。

Sonar 簡介

歡迎參加由 Perplexity 共同創辦人兼 CTO Denis Yarats 於 4 月 24 日上午 11 點 (太平洋時間) 主持的 API 概覽說明會。Denis 將概述 Perplexity 的 API,分享基準測試結果,並介紹 API 的使用案例。

在此註冊。

開始使用 Sonar。