Perplexity Sonar, 새로운 검색 아레나 평가 석권
Perplexity Sonar 모델, 검색 평가에서 상위권 차지

요약
- 1위: Sonar-Reasoning-Pro-High은 1136(±21/−19)점의 아레나 점수를 기록하며, Google의 Gemini-2.5-Pro-Grounding(1142 +14/-17)과 통계적으로 공동 1위를 차지했습니다. 일대일 대결에서 Sonar-Reasoning-Pro-High는 Gemini-2.5-Pro-Grounding을 53%의 확률로 앞섰습니다.
- Sonar의 압도적 우위: Perplexity 모델은 1위부터 4위까지를 모두 차지했으며, Google 및 OpenAI의 다른 평가 모델을 크게 앞섰습니다.
- 추론의 강점: 추론 기능을 통합한 모델(sonar-reasoning-pro 및 sonar-reasoning)이 더 높은 순위를 기록했으며, 이는 추론 모델에 대한 일반적인 사용자 선호도(리더보드 상위 3위)와 일치합니다.
- 검색 깊이: Sonar 모델은 더 깊은 검색을 수행하며 더 많은 출처를 고려합니다. 평균적으로 유사한 Gemini 모델보다 2~3배 더 많은 출처를 인용합니다.
______
LM 아레나는 인간의 선호도를 기반으로 검색 증강 LLM 시스템을 비교하는 새로운 검색 아레나 리더보드를 발표했습니다. Perplexity의 Sonar-Reasoning-Pro 모델은 Gemini-2.5-Pro-Grounding과 공동 1위를 차지했으며, 나머지 Sonar 모델들도 Gemini-2.0-Flash-Grounding 및 OpenAI의 모든 웹 검색 모델을 능가하는 성과를 보였습니다.

검색 아레나 벤치마킹
SimpleQA가 좁은 범위의 사실적 정확성에 초점을 맞춘 것과 달리, LM 아레나는 코딩, 작문, 연구, 추천 등 실제 사용자 쿼리에 대한 모델의 성능을 평가합니다. 검색 아레나 평가에서는 시사 문제에 중점을 두고 더 길고 복잡한 프롬프트를 포함하여, 11개 모델에 걸쳐 10,000건 이상의 인간 선호도 투표를 수집했습니다. 2025년 3월 18일부터 4월 13일까지 검색 아레나는 사용자들에게 프롬프트를 입력하게 하고, 정보 요구 사항을 더 잘 충족하는 모델 응답을 선택하도록 했습니다.
Sonar 모델 성능 결과
Perplexity의 Sonar 모델은 Gemini 2.0 Flash 및 GPT 4o Search를 포함한 다수의 최신 모델을 능가했습니다. 당사의 Sonar-Reasoning-Pro 모델은 1136점을 획득하여 Gemini-2.5-Pro-Grounding(1142점)과 함께 통계적으로 공동 1위를 차지했습니다.

검색 아레나 평가 결과, 인간의 선호도와 강하게 상관관계가 있는 세 가지 요인이 밝혀졌습니다:
- 더 긴 응답 (계수 0.255, p<0.05)
- 더 높은 인용 횟수 (계수 0.234, p<0.05)
- 커뮤니티 웹 출처 인용
리더보드에서는 추론 기능이 강화된 모델에 대한 사용자 선호도가 뚜렷하게 나타났으며, Sonar-Reasoning-Pro와 Sonar-Reasoning이 상위 3위권 내에 두 자리를 차지했습니다. 대조 실험을 통해 이러한 결과를 재확인한 결과, 인용을 통제했을 때 모델 순위가 수렴하는 것으로 나타나 검색 깊이가 중요한 성능 차별화 요소임을 시사했습니다.

사용자를 위한 의미
Perplexity 사용자에게 이러한 결과는 Sonar 모델이 광범위한 주제에 걸쳐 업계 최고의 정확도, 포괄적인 출처 귀속 및 고품질 응답을 제공함을 입증합니다.
Perplexity Pro 사용자는 설정에서 Sonar를 기본 모델로 지정하여 이러한 최고 성능의 모델을 계속 활용할 수 있습니다. API 사용자는 성능과 비용 효율성의 균형을 맞추기 위한 유연한 검색 모드를 갖춘 Sonar API 제품군을 통해 이러한 기능을 이용할 수 있습니다.
우리는 이러한 성과를 자랑스럽게 생각하며, 지속적인 개선에 전념하고 있습니다. 검색 아레나 평가는 향후 개발 노력에 반영될 귀중한 사용자 선호도 통찰력을 제공합니다.

Sonar 소개
Perplexity 공동 창립자이자 CTO인 Denis Yarats와 함께 4월 24일 오전 11시(태평양 표준시 기준)에 진행되는 당사 API 개요 세션에 참여하세요. Denis는 Perplexity의 API 개요를 제공하고, 벤치마크 결과와 API 사용 사례를 공유할 예정입니다.
여기에서 등록하세요.