Το Perplexity Sonar κυριαρχεί στη νέα αξιολόγηση Search Arena
Τα μοντέλα Perplexity Sonar καταλαμβάνουν κορυφαίες θέσεις στην αξιολόγηση αναζήτησης

Συνοπτικά
- Συν-1η Θέση: Το Sonar-Reasoning-Pro-High πέτυχε Βαθμολογία Arena 1136 (±21/−19), ισοβαθμώνοντας στην πρώτη θέση με το Gemini-2.5-Pro-Grounding της Google (1142 +14/-17). Σε άμεσες αναμετρήσεις, το Sonar-Reasoning-Pro-High κέρδισε το Gemini-2.5-Pro-Grounding στο 53% των περιπτώσεων.
- Κυριαρχία Sonar: Τα μοντέλα της Perplexity εξασφάλισαν τις θέσεις 1 έως 4, ξεπερνώντας σημαντικά άλλα αξιολογημένα μοντέλα από την Google και την OpenAI.
- Πλεονέκτημα Συλλογιστικής: Τα μοντέλα που ενσωματώνουν δυνατότητες συλλογιστικής (sonar-reasoning-pro και sonar-reasoning) κατατάχθηκαν υψηλότερα, ευθυγραμμιζόμενα με τη γενική προτίμηση χρηστών που παρατηρήθηκε για τα μοντέλα συλλογιστικής (top 3 στον πίνακα κατάταξης).
- Βάθος Αναζήτησης: Τα μοντέλα Sonar εκτελούν βαθύτερη αναζήτηση και εξετάζουν περισσότερες πηγές, αναφέροντας κατά μέσο όρο 2-3 φορές περισσότερες πηγές από τα αντίστοιχα μοντέλα Gemini.
______
Το LM Arena μόλις κυκλοφόρησε τον νέο πίνακα κατάταξης Search Arena που συγκρίνει συστήματα LLM με ενισχυμένη αναζήτηση βάσει της ανθρώπινης προτίμησης. Το μοντέλο Sonar-Reasoning-Pro της Perplexity ισοβάθμησε στην πρώτη θέση με το Gemini-2.5-Pro-Grounding, ενώ τα υπόλοιπα μοντέλα Sonar ξεπέρασαν σε απόδοση το Gemini-2.0-Flash-Grounding και όλα τα μοντέλα ισet διαδικτυακής αναζήτησης της OpenAI.

Αξιολόγηση Search Arena
Σε αντίθεση με την εστίαση του SimpleQA σε στενή ακρίβεια γεγονότων, το LM Arena αξιολογεί την απόδοση των μοντέλων σε πραγματικά ερωτήματα χρηστών σε προγραμματισμό, συγγραφή, έρευνα και προτάσεις. Με το Search Arena, η αξιολόγηση επικεντρώνεται σε τρέχοντα γεγονότα και περιλαμβάνει μεγαλύτερα, πιο σύνθετα prompts, συλλέγοντας πάνω από 10.000 ψήφους ανθρώπινης προτίμησης σε 11 μοντέλα. Μεταξύ 18 Μαρτίου και 13 Απριλίου 2025, το Search Arena ζήτησε από τους χρήστες να εισάγουν prompts και να επιλέξουν ποια απόκριση μοντέλου ικανοποίησε καλύτερα τις πληροφοριακές τους ανάγκες.
Αποτελέσματα Απόδοσης Μοντέλων Sonar
Τα μοντέλα Sonar της Perplexity ξεπέρασαν σε απόδοση πολλά από τα κορυφαία προηγμένα μοντέλα, συμπεριλαμβανομένων των Gemini 2.0 Flash και GPT 4o Search. Το μοντέλο μας Sonar-Reasoning-Pro πέτυχε βαθμολογία 1136, ισοβαθμώντας στατιστικά με το Gemini-2.5-Pro-Grounding (1142) στην κορυφαία θέση.

Η αξιολόγηση του Search Arena αποκάλυψε τρεις παράγοντες που συσχετίζονται έντονα με την ανθρώπινη προτίμηση:
- Μεγαλύτερες αποκρίσεις (συντελεστής 0.255, p<0,05)
- Υψηλότεροι αριθμοί παραπομπών (συντελεστής 0.234, p<0,05)
- Παραπομπές από κοινοτικές διαδικτυακές πηγές
Ο πίνακας κατάταξης έδειξε σαφή προτίμηση των χρηστών για μοντέλα με ενισχυμένη συλλογιστική (reasoning), με τα Sonar-Reasoning-Pro και Sonar-Reasoning να καταλαμβάνουν δύο από τις τρεις πρώτες θέσεις. Τα πειράματα ελέγχου ενίσχυσαν αυτά τα ευρήματα, δείχνοντας ότι ο έλεγχος για παραπομπές προκάλεσε τη σύγκλιση των κατατάξεων των μοντέλων, υποδεικνύοντας ότι το βάθος αναζήτησης αποτελεί σημαντικό διαφοροποιητή απόδοσης.

Τι Σημαίνει Αυτό για τους Χρήστες
Για τους χρήστες της Perplexity, αυτά τα αποτελέσματα επιβεβαιώνουν ότι τα μοντέλα Sonar παρέχουν κορυφαία ακρίβεια στην κατηγορία τους, ολοκληρωμένη απόδοση πηγών και υψηλής ποιότητας αποκρίσεις σε ένα ευρύ φάσμα θεμάτων.
Οι χρήστες του Perplexity Pro μπορούν να συνεχίσουν να επωφελούνται από αυτά τα κορυφαία σε απόδοση μοντέλα ορίζοντας το Sonar ως το προεπιλεγμένο τους μοντέλο στις ρυθμίσεις. Οι χρήστες API μπορούν να έχουν πρόσβαση σε αυτές τις δυνατότητες μέσω των προσφορών Sonar API μας με ευέλικτες λειτουργίες αναζήτησης για την εξισορρόπηση της απόδοσης και της αποδοτικότητας κόστους
Παρόλο που είμαστε περήφανοι για αυτό το επίτευγμα, παραμένουμε προσηλωμένοι στη συνεχή βελτίωση. Η αξιολόγηση Search Arena παρέχει πολύτιμες γνώσεις σχετικά με τις προτιμήσεις των χρηστών που θα τροφοδοτήσουν τις τρέχουσες προσπάθειες ανάπτυξής μας.

Εισαγωγή στο Sonar
Ελάτε με τον συνιδρυτή και CTO της Perplexity, Denis Yarats, για μια επισκόπηση του API μας στις 24 Απριλίου στις 11 π.μ. PT. Ο Denis θα παράσχει μια επισκόπηση των API της Perplexity, θα μοιραστεί αποτελέσματα benchmark και περιπτώσεις χρήσης του API.
Εγγραφείτε εδώ.