文章
Perplexity Sonar在新搜索领域评估中占据主导地位

总结
排名第一: Sonar-Reasoning-Pro-High取得了1136(±21/−19)的竞赛分数,与谷歌的Gemini-2.5-Pro-Grounding(1142 +14/-17)在统计上并列第一。在直接的对抗中,Sonar-Reasoning-Pro-High以53%的概率击败Gemini-2.5-Pro-Grounding。
Sonar主导地位: Perplexity模型获得了第1至第4名,显著超越了谷歌和OpenAI评估的其他模型。
推理优势: 采用推理能力的模型(sonar-reasoning-pro和sonar-reasoning)排名更高,与观察到用户偏好推理模型的普遍趋势一致(排行榜前3名)。
搜索深度:Sonar模型执行更深层次的搜索,并考虑更多来源,平均引用次数是可比较的Gemini模型的2-3倍。
LM Arena刚刚发布了最新的搜索领域排行榜,比较基于人类偏好的搜索增强型LLM系统。Perplexity的Sonar-Reasoning-Pro模型与Gemini-2.5-Pro-Grounding并列第一名,其余Sonar模型表现优于Gemini-2.0-Flash-Grounding和所有OpenAI的网页搜索模型。

搜索领域基准测试
与SimpleQA专注于狭义事实准确性不同,LM Arena评估模型在编码、写作、研究和推荐方面对真实用户查询的响应。搜索领域评估重点关注时事,并包括更长、更复杂的提示,收集了超过10,000次人类偏好投票,涉及11个模型。在2025年3月18日至4月13日期间,搜索领域让用户提示并选择哪个模型的响应更好地满足他们的信息需求。
Sonar模型表现结果
Perplexity的Sonar模型超越了包括Gemini 2.0 Flash和GPT 4o Search在内的许多顶尖的先进模型。我们的Sonar-Reasoning-Pro模型取得了1136的分数,与Gemini-2.5-Pro-Grounding(1142)在顶部位置统计上并列。
在直接对抗中,Sonar-Reasoning-Pro-High以53%的概率击败了Gemini-2.5-Pro-Grounding。

搜索领域评估揭示了与人类偏好高度相关的三个因素:
更长的响应(系数0.255,p<0.05)
更高的引用次数(系数0.234,p<0.05)
来自社区网络来源的引用
排行榜显示用户明显偏好推理增强型模型,Sonar-Reasoning-Pro和Sonar-Reasoning占据了前三名中的两个位置。控制实验加固了这些发现,表明控制引用次数使模型排名趋同,建议搜索深度是一个显著的性能区分因素。

Perplexity的Sonar模型具有显著更高的搜索深度,其中ppl-sonar-pro-high的引用次数是等效Gemini模型的2-3倍。
这对用户意味着什么
对于Perplexity用户,这些结果证实了Sonar模型在大量主题上提供了最佳的准确性、全面的来源归属和高质量的响应。
Perplexity Pro用户可以通过在设置中将Sonar设置为默认模型继续从这些表现卓越的模型中获益。API用户可以通过我们的Sonar API产品访问这些功能,具有灵活的搜索模式以平衡性能和成本效率。
虽然我们为这一成就感到自豪,但我们仍然专注于持续改进。搜索领域评估提供了关于用户偏好的宝贵见解,将会指导我们的持续开发工作。

Sonar简介
加入Perplexity联合创始人兼CTO Denis Yarats的4月24日上午11点太平洋时间的概述会,Denis将提供Perplexity API的概述,分享基准测试结果和API使用案例。
在此注册。