Perplexity Sonar доминирует в новой оценке Search Arena

Модели Perplexity Sonar заняли лидирующие позиции в оценке поиска

Кратко о главном

  • 1-е место: Sonar-Reasoning-Pro-High достигла оценки Arena Score 1136 (±21/−19), разделив первое место с моделью Google Gemini-2.5-Pro-Grounding (1142 +14/-17). В прямом сравнении Sonar-Reasoning-Pro-High превзошла Gemini-2.5-Pro-Grounding в 53% случаев.
  • Доминирование Sonar: Модели Perplexity заняли с 1-го по 4-е места, значительно опередив другие оцениваемые модели от Google и OpenAI.
  • Преимущество в логическом выводе: Модели, включающие возможности логического вывода (sonar-reasoning-pro и sonar-reasoning), заняли более высокие позиции, что соответствует общим предпочтениям пользователей в отношении моделей с логическим выводом (топ-3 в таблице лидеров).
  • Глубина поиска: Модели Sonar выполняют более глубокий поиск и учитывают больше источников, в среднем цитируя в 2–3 раза больше источников, чем сопоставимые модели Gemini.

______

LM Arena только что выпустила новую таблицу лидеров Search Arena, в которой сравниваются системы LLM с поисковой поддержкой на основе предпочтений пользователей. Модель Perplexity Sonar-Reasoning-Pro разделила первое место с Gemini-2.5-Pro-Grounding, при этом остальные модели Sonar показали лучшие результаты, чем Gemini-2.0-Flash-Grounding и все модели веб-поиска от OpenAI.

Бенчмаркинг Search Arena

В отличие от SimpleQA, которая фокусируется на узкой фактической точности, LM Arena оценивает работу моделей на реальных запросах пользователей, включая программирование, написание текстов, исследования и рекомендации. В рамках Search Arena оценка фокусируется на текущих событиях и включает более длинные и сложные промпты, собирая более 10 000 отзывов пользователей по 11 моделям. В период с 18 марта по 13 апреля 2025 года Search Arena предлагала пользователям вводить запросы и выбирать, какой ответ модели лучше соответствует их потребностям в информации.

Результаты производительности моделей Sonar

Модели Perplexity Sonar превзошли многие передовые современные модели, включая Gemini 2.0 Flash и GPT 4o Search. Наша модель Sonar-Reasoning-Pro получила оценку 1136, статистически разделив первое место с Gemini-2.5-Pro-Grounding (1142).

В прямом сравнении Sonar-Reasoning-Pro-High превзошла Gemini-2.5-Pro-Grounding в 53% случаев.

Оценка Search Arena выявила три фактора, сильно коррелирующих с предпочтениями пользователей:

  • Более длинные ответы (коэф. 0,255, p<0,05)
  • Более высокое количество цитирований (коэф. 0,234, p<0,05)
  • Цитирование из веб-источников сообщества

Таблица лидеров показала явное предпочтение пользователей к моделям с улучшенным логическим выводом: Sonar-Reasoning-Pro и Sonar-Reasoning заняли две из трех верхних позиций. Контрольные эксперименты подтвердили эти выводы, показав, что при учете цитирования рейтинги моделей сближаются, что говорит о том, что глубина поиска является значимым фактором производительности.

Модели Perplexity Sonar имели значительно большую глубину поиска: ppl-sonar-pro-high цитировала в 2–3 раза больше источников, чем эквивалентные модели Gemini.

Что это значит для пользователей

Для пользователей Perplexity эти результаты подтверждают, что модели Sonar обеспечивают лучшую в своем классе точность, исчерпывающее указание источников и высококачественные ответы по широкому кругу тем.

Пользователи Perplexity Pro могут продолжить пользоваться преимуществами этих высокопроизводительных моделей, установив Sonar в качестве модели по умолчанию в настройках. Пользователи API могут получить доступ к этим возможностям через наши предложения Sonar API с гибкими режимами поиска для баланса производительности и экономической эффективности.

Хотя мы гордимся этим достижением, мы продолжаем фокусироваться на постоянном улучшении. Оценка Search Arena дает ценную информацию о предпочтениях пользователей, которая будет учитываться в нашей дальнейшей разработке.

Введение в Sonar

Присоединяйтесь к соучредителю и техническому директору Perplexity Денису Ярацу для обзора нашего API 24 апреля в 11:00 по тихоокеанскому времени. Денис представит обзор API Perplexity, поделится результатами бенчмарков и примерами использования API.

Зарегистрироваться здесь.

Начните работу с Sonar.