Perplexity Sonar 在全新搜索竞技场评估中占据主导地位

Perplexity Sonar 模型在搜索评估中占据领先地位

简而言之

  • 排名第 1: Sonar-Reasoning-Pro-High 获得了 1136(+21/−19)分的竞技场评分,与 Google 的 Gemini-2.5-Pro-Grounding(1142 +14/-17)并列第一。在直接对决中,Sonar-Reasoning-Pro-High 胜过 Gemini-2.5-Pro-Grounding 的比例为 53%。
  • Sonar 的主导地位: Perplexity 模型包揽了第 1 至第 4 名,显著优于 Google 和 OpenAI 的其他评估模型。
  • 推理优势: 结合了推理能力(sonar-reasoning-pro 和 sonar-reasoning)的模型排名更高,这与观察到的一般用户对推理模型的偏好一致(排行榜前 3 名)。
  • 搜索深度: Sonar 模型执行更深入的搜索并考虑更多来源,平均引用的来源数量是同类 Gemini 模型的 2-3 倍。

______

LM Arena 刚刚发布了其 全新的搜索竞技场排行榜,基于人类偏好对搜索增强型 LLM 系统进行了比较。Perplexity 的 Sonar-Reasoning-Pro 模型与 Gemini-2.5-Pro-Grounding 并列第一,其余 Sonar 模型也均优于 Gemini-2.0-Flash-Grounding 及 OpenAI 的所有网络搜索模型。

搜索竞技场基准测试

与 SimpleQA 专注于狭义的事实准确性不同,LM Arena 评估模型在编码、写作、研究和推荐等方面的真实用户查询表现。通过搜索竞技场,评估侧重于时事,并纳入了更长、更复杂的提示词,在 11 个模型中收集了超过 10,000 条人类偏好投票。在 2025 年 3 月 18 日至 4 月 13 日期间,搜索竞技场要求用户进行提示并选择哪个模型响应能更好地满足其信息需求。

Sonar 模型表现结果

Perplexity 的 Sonar 模型表现优于许多顶尖的先进模型,包括 Gemini 2.0 Flash 和 GPT 4o Search。我们的 Sonar-Reasoning-Pro 模型获得了 1136 分,与 Gemini-2.5-Pro-Grounding(1142 分)在榜首位置打成平手。

在直接对决中,Sonar-Reasoning-Pro-High 胜过 Gemini-2.5-Pro-Grounding 的比例为 53%。

搜索竞技场的评估揭示了与人类偏好密切相关的三个因素:

  • 更长的响应(系数 0.255,p<0.05)
  • 更高的引用计数(系数 0.234,p<0.05)
  • 来自社区网络来源的引用

排行榜显示用户明显偏好增强了推理能力模型,Sonar-Reasoning-ProSonar-Reasoning 占据了前三名中的两个席位。对照实验强化了这些发现,表明在控制引用变量后,模型排名趋于一致,这说明搜索深度是显著的性能差异化因素。

Perplexity 的 Sonar 模型具有明显更高的搜索深度,ppl-sonar-pro-high 引用的来源数量是同等 Gemini 模型的 2-3 倍。

这对用户意味着什么

对于 Perplexity 用户而言,这些结果证实 Sonar 模型在广泛的主题范围内提供了业界领先的准确性、全面的来源归因以及高质量的响应。

Perplexity Pro 用户可以通过在 设置 中将 Sonar 设为默认模型,继续受益于这些顶级模型。API 用户可以通过我们的 Sonar API 产品 访问这些功能,并使用灵活的搜索模式来平衡性能与成本效率。

虽然我们为这一成就感到自豪,但我们仍专注于持续改进。搜索竞技场的评估提供了宝贵的用户偏好洞察,这将为我们持续的开发工作提供参考。

Sonar 简介

欢迎参加于太平洋时间 4 月 24 日上午 11 点由 Perplexity 联合创始人兼 CTO Denis Yarats 主持的 API 概览讲座。Denis 将概述 Perplexity 的 API,分享基准测试结果及 API 应用案例。

点击此处注册。

开始使用 Sonar。