Παρουσίαση των διαδικτυακών LLMs PPLX
Το πρώτο διαδικτυακό API LLM του είδους του

Το πρώτο διαδικτυακό API LLM του είδους του.
Είμαστε στην ευχάριστη θέση να μοιραστούμε δύο νέα μοντέλα PPLX: τα pplx-7b-online και pplx-70b-online! Τα διαδικτυακά μας μοντέλα εστιάζουν στην παροχή χρήσιμων, ενημερωμένων και βασισμένων σε γεγονότα απαντήσεων, και είναι διαθέσιμα στο κοινό μέσω του pplx-api, καθιστώντας το ένα API μοναδικό στο είδος του. Τα pplx-7b-online και pplx-70b-online είναι επίσης προσβάσιμα μέσω του Perplexity Labs, του πεδίου δοκιμών LLM μας.
Τα LLMs έχουν μεταμορφώσει τον τρόπο με τον οποίο βρίσκουμε πληροφορίες. Ωστόσο, υπάρχουν δύο περιορισμοί στα περισσότερα LLMs σήμερα:
Ενημερότητα: Τα LLMs συχνά δυσκολεύονται να μοιραστούν ενημερωμένες πληροφορίες.
Ψευδαισθήσεις: Τα LLMs μπορούν επίσης να παράγουν ανακριβείς δηλώσεις.
Τα μοντέλα μας pplx-7b-online και pplx-70b-online αντιμετωπίζουν τους τρέχοντες περιορισμούς παρέχοντας επιπλέον χρήσιμες, βασισμένες σε γεγονότα και ενημερωμένες πληροφορίες στις απαντήσεις τους.
Διαδικτυακά LLM PPLX
Τα LLMs μας, τα pplx-7b-online και pplx-70b-online, είναι διαδικτυακά LLMs επειδή μπορούν να χρησιμοποιήσουν γνώση από το διαδίκτυο και συνεπώς μπορούν να αξιοποιήσουν τις πιο ενημερωμένες πληροφορίες κατά τη διατύπωση μιας απάντησης. Παρέχοντας στα LLMs μας γνώση από τον ιστό, τα μοντέλα μας απαντούν με ακρίβεια σε ερωτήματα ευαίσθητα στον χρόνο, ξεκλειδώνοντας γνώση πέρα από το σώμα εκπαίδευσής τους. Αυτό σημαίνει ότι τα διαδικτυακά LLMs του Perplexity μπορούν να απαντήσουν σε ερωτήματα όπως «Ποιο ήταν το σκορ του αγώνα των Warriors χθες το βράδυ;» τα οποία είναι δύσκολα για τα μη συνδεδεμένα μοντέλα. Σε υψηλό επίπεδο, έτσι λειτουργεί το διαδικτυακό μας LLM:
- Αξιοποίηση μοντέλων ανοιχτού κώδικα: τα μοντέλα PPLX μας βασίζονται στα βασικά μοντέλα
mistral-7bκαιllama2-70b. - Εσωτερική τεχνολογία αναζήτησης: η εσωτερική μας υποδομή αναζήτησης, ευρετηρίασης και ανίχνευσης μας επιτρέπει να επαυξάνουμε τα LLMs με τις πιο σχετικές, ενημερωμένες και πολύτιμες πληροφορίες. Το ευρετήριο αναζήτησής μας είναι μεγάλο, ενημερώνεται σε τακτική βάση και χρησιμοποιεί εξελιγμένους αλγόριθμους κατάταξης για να διασφαλίσει ότι δίνεται προτεραιότητα σε ιστότοπους υψηλής ποιότητας που δεν βασίζονται σε SEO. Τα αποσπάσματα ιστότοπων, τα οποία αποκαλούμε «αποσπάσματα» (snippets), παρέχονται στα μοντέλα
pplx-onlineμας για να επιτρέπονται απαντήσεις με τις πιο ενημερωμένες πληροφορίες. - Βελτιστοποίηση (Fine-tuning): τα μοντέλα PPLX μας έχουν υποβληθεί σε λεπτή ρύθμιση για να χρησιμοποιούν αποτελεσματικά αποσπάσματα ώστε να ενημερώνουν τις απαντήσεις τους. Χρησιμοποιώντας τους εσωτερικούς μας εργολάβους δεδομένων, επιμελούμαστε προσεκτικά υψηλής ποιότητας, ποικιλόμορφα και μεγάλα σύνολα εκπαίδευσης προκειμένου να πετύχουμε υψηλή απόδοση σε διάφορους άξονες όπως η χρησιμότητα, η εγκυρότητα και η φρεσκάδα. Τα μοντέλα μας ρυθμίζονται τακτικά για τη συνεχή βελτίωση της απόδοσης.
Αξιολόγηση των διαδικτυακών LLMs του Perplexity
Η αποστολή του Perplexity είναι να δημιουργήσει την καλύτερη μηχανή απαντήσεων στον κόσμο - μία στην οποία οι άνθρωποι εμπιστεύονται για να ανακαλύψουν και να επκτείνουν τη γνώση τους. Για να το πετύχουμε αυτό, είμαστε βαθιά αφοσιωeni στην παροχή χρήσιμων, βασισμένων σε γεγονότα και ενημερωμένων πληροφοριών. Για να αξιολογήσουμε την απόδοση των LLMs μας σε αυτούς τους άξονες, επιμεληθήκαμε σύνολα δεδομένων αξιολόγησης ώστε να αντικατοπτρίζουν απαιτητικές αλλά ρεαλιστικές περιπτώσεις χρήσης για μηχανές απαντήσεων. Για κάθε ερώτημα σε κάθε σύνολο αξιολόγησης, δόθηκαν στους εργολάβους δύο απαντήσεις μοντέλων και τους δόθηκε η εντολή να επιλέξουν την απάντηση που είχε καλύτερη απόδοση για τα ακόλουθα κριτήρια:
- Χρησιμότητα: ποια απάντηση απαντά στο ερώτημα και ακολουθεί τις καθορισμένες οδηγίες καλύτερα;
- Εγκυρότητα: ποια απάντηση παρέχει πιο ακριβείς απαντήσεις χωρίς ψευδαισθήσεις, ακόμη και για ερωτήσεις που απαιτούν πολύ ακριβή ή εξειδικευμένη γνώση;
- Φρεσκάδα (εμπνευσμένη από FreshLLMs): ποια απάντηση περιέχει πιο ενημερωμένες πληροφορίες; Ένα μοντέλο διαπρέπει σε αυτό το κριτήριο εάν είναι σε θέση να απαντήσει σε ερωτήματα με «φρέσκιες» πληροφορίες.
Εκτός από τα τρία παραπάνω κριτήρια, οι απαντήσεις των μοντέλων αξιολογήθηκαν επίσης ολιστικά. Για να αξιολογηθούν οι απαντήσεις ολιστικά, ζητήθηκε από τους αξιολογητές να επιλέξουν την απάντηση που θα προτιμούσαν να λάβουν από έναν ανθρώπινο βοηθό που βοηθά με το ερώτημα.
Επιμέλεια του συνόλου αξιολόγησης
Για αυτήν την αξιολόγηση, επιμεληθήκαμε προσεκτικά ένα ποικιλόμορφο σύνολο προτροπών με στόχο την αποτελεσματική αξιολόγηση της χρησιμότητας, της εγκυρότητας και της φρεσκάδας. Κάθε προτροπή επιλέχθηκε χειροκίνητα, διασφαλίζοντας υψηλό επίπεδο ελέγχου ως προς την ποιότητα και τη συνάφεια των δεδομένων. Το σύνολο δεδομένων καλύπτει ένα ευρύ φάσμα προτροπών μηχανών απαντήσεων και περιλαμβάνει μια περιεκτική επισκόπηση του τι θέλουμε να διακρίνεται το Perplexity. Αυτό είναι κρίσιμο για να έχουν τα μοντέλα μας υψηλό σήμα στις αξιολογήσεις απόδοσης.
Κάθε ένα από τα τρία σύνολα αξιολόγησης περιέχει 50 προτροπές. Ορισμένα παραδείγματα από αυτά τα σύνολα περιλαμβάνουν:
- Χρησιμότητα: Δημιουργήστε έναν πίνακα με όλους τους ποδοσφαιριστές των ΗΠΑ που έπαιξαν στους τελικούς του Παγκοσμίου Κυπέλλου και φτιάξτε στήλες για τα στατιστικά τους, όπως γκολ, ασίστ κ.λπ.
- Εγκυρότητα: Εξηγήστε τη σκληρότητα των χαλύβων AISI 1015 και AISI 1040.
- Ενημερότητα: Ποια εταιρεία αυτόνομων αυτοκινήτων απαγορεύτηκε στο Σαν Φρανσίσκο το 2023;
Δημιουργία απαντήσεων μοντέλων
Αξιολογήσαμε τέσσερα μοντέλα:
pplx-7b-online: Το μοντέλο του Perplexity, το οποίο περιλαμβάνει πρόσβαση σε πληροφορίες από το διαδίκτυο. Αυτό το μοντέλο ρυθμίστηκε λεπtομερώς χρησιμοποιώντας το mistral-7b.
pplx-70b-online: Το μοντέλο του Perplexity, το οποίο περιλαμβάνει πρόσβαση σε πληροφορίες από το διαδίκτυο. Αυτό το μοντέλο ρυθμίστηκε λεπτομερώς χρησιμοποιώντας το llama2-70b.
gpt-3.5-turbo-1106: Το μοντέλο της OpenAI, στο οποίο γίνεται πρόσβαση μέσω του API και χωρίς πρόσθετες επαυξήσεις. Σημειώστε ότι πραγματοποιήσαμε αυτήν την αξιολόγηση χρησιμοποιώντας το νεότερο μοντέλο gpt-3.5.
llama2-70b-chat: Το μοντέλο της Meta AI, στο οποίο γίνεται πρόσβαση μέσω του pplx-api μας και χωρίς πρόσθετες επαυξήσεις.
Για κάθε προτροπή, τα ίδια αποτελέσματα αναζήτησης και αποσπάσματα παραχωρήθηκαν στα μοντέλα pplx-7b-online και pplx-70b-online. Όλες οι απαντήσεις δημιουργήθηκαν χρησιμοποιώντας τις ίδιες υπερπαραμέτρους και προτροπή συστήματος.
Προτροπή συστήματος
Current date: Monday, November 20, 2023.Κατάταξη απαντήσεων μοντέλων με ανθρώπινη αξιολόγηση
Για κάθε ζευγαρωτή σύγκριση, στους εσωτερικούς μας εργολάβους δόθηκε η ίδια η προτροπή, τα κριτήρια αξιολόγησης (δηλαδή, χρησιμότητα, εγκυρότητα ή φρεσκάδα) και οι απαντήσεις του μοντέλου που εμφανίζονταν δίπλα-δίκλα. Η σειρά των απαντήσεων τυχαιοποιούνταν σε κάθε στροφή και τα μοντέλα προέλευσης δεν αποκαλύπτονταν στον αξιολογητή. Οι αξιολογητές έλαβαν εντολή να επιλέξουν την απάντηση που προτιμούν ολιστικά, καθώς και ποια έχει καλύτερη απόδοση στο συγκεκριμένο κριτήριο αξιολόγησης, με δυνατότητα ισοπαλίας και για τα δύο. Τέλος, οι αξιολογητές είχαν τη δυνατότητα να χρησιμοποιήσουν την αναζήτηση στο διαδίκτυο για να επαληθεύσουν την ακρίβεια των απαντήσεων. Δημιουργήσαμε το δικό μας εσωτερικό εργαλείο κατάταξης προτίμησης για τη διεξαγωγή αυτής της αξιολόγησης.
Αποτελέσματα αξιολόγησης
Χρησιμοποιούμε τις ζευγαρωτές κατατάξεις προτίμησης που συλλέχθηκαν από την ανθρώπινη αξιολόγηση για να υπολογίσουμε βαθμολογίες Elo ανά εργασία για κάθε μοντέλο. Οι βαθμολογίες Elo χρησιμοποιούνται συνήθως για την κατάταξη ενός πληθυσμού παικτών σε διαγωνισμούς τύπου τουρνουά για τη μέτρηση της σχετικής απόδοσης των παικτών. Όταν εφαρμόζονται σε μεγάλα γλωσσικά μοντέλα, αυτές οι βαθμολογίες παρέχουν μια πρόβλεψη για το πόσο πιθανό είναι ένας ανθρώipνος αξιολογητής να ευνοήσει την έξοδο ενός μοντέλου έναντι ενός άλλου.
Ενώ οι βαθμολογίες Elo υπολογίζονται τυπικά για μια ακολουθία συγκρίσεων ώστε να λαμβάνονται υπόψη οι αλλαγές στις ικανότητες των παικτών, στοχεύουμε να ποσοτικοποιήσουμε την απόδοση των μοντέλων των οποίων οι ικανότητες δεν μπορούν να αλλάξουν. Αντίστοιχα, υιοθετούμε τη μεθοδολογία Bootstrap Elo που περιγράφεται από τους Duan et al και χρησιμοποιείται επίσης από το lmsys για το Chatbot Arena τους, η οποία συνεπάγεται τον υπολογισμό βαθμολογιών Elo για πολλές τυχαίες μεταθέσεις των συγκρίσεων. Για τους υπολογισμούς μας, υπολογίσαμε βαθμολογίες Elo σε 5000 μεταθέσεις και χρησιμοποιήσαμε τις κατανομές αυτών των βαθμολογιών Elo για να υπολογίσουμε διαστήματα εμπιστοσύνης 95%.
Τα αποτελέσματα, που φαίνονται στο Σχήμα 1, δείχνουν ότι τα μοντέλα PPLX μας μπορούν να ταιριάξουν και ακόμη και να ξεπεράσουν την απόδοση του gpt-3.5 σε περιπτώσεις χρήσης που σχετίζονται με το Perplexity. Συγκεκριμένα, οι απαντήσεις των μοντέλων pplx-7b-online και pplx-70b-online προτιμώνται έναντι των απαντήσεων των μοντέλων gpt-3.5 και llama2-70b από ανθρώπινους αξιολογητές για τις ακριβείς και ενημερωμένες απαντήσεις τους.
Τα pplx-7b-online και pplx-70b-online αποδίδουν καλύτερα από τα gpt-3.5 και llama2-70b, στα κριτήρια φρεσκάδας, εγκυρότητας και ολιστικού χαρακτήρα.

Υπολογίσαμε επίσης τα ζευγαρωτά ποσοστά νικών από την αξιολόγηση. Τα αποτελέσματα, που φαίνονται στο Σχήμα 2, δείχνουν, ίσως χωρίς έκπληξη, ότι οι απαντήσεις του διαδικτυακού μοντέλου pplx προτιμώνται από άλλων στη φρεσκάδα και στην εγκυρότητα.

Ακολουθεί ένα παράδειγμα από το σύνολο δεδομένων αξιολόγησης φρεσκάδας μας.
Προτροπή: Πόσοι άνθρωποι στις ΗΠΑ διαθέτουν άδεια οδήγησης;
pplx-7b-online
Το 2023, προβλέπεται να υπάρχουν 243,4 εκατομμύρια αδειούχοι οδηγοί στις Ηνωμένες Πολιτείες, ποσοστό που περιλαμβάνει το 89% των ενηλίκων των ΗΠΑ. Ο αριθμός αυτός έχει αυξηθεί από 238,6 εκατομμύρια το 2022. Το ποσοστό των αδειούχων οδηγών ποικίλλει ανάλογα με τις διάφορες ηλικιακές ομάδες και πολιτείες. Για παράδειγμα, το 2019, το 84,1% του πληθυσμού των ΗΠΑ είχε άδεια οδήγησης. Το υψηλότερο ποσοστό αδειούχων οδηγών παρατηρείται στις ηλικίες 25 έως 49 ετών, με το 90,1% του πληθυσμού να διαθέτει άδεια οδήγησης. Στην Καλιφόρνια, υπήρχαν 27 εκατομμύρια αδειούχοι οδηγοί, καθιστώντας την πολιτεία με τον υψηλότερο αριθμό αδειούχων οδηγών.
pplx-70b-online
Το 2021, περίπου 233 εκατομμύρια άνθρωποι διέθεταν έγκυρη άδεια οδήγησης στις Ηνωμένες Πολιτείες. Μέχρι το 2023, ο αριθμός των αδειούχων οδηγών στις ΗΠΑ προβλέπεται να φτάσει τα 243,4 εκατομμύρια, ο οποίος περιλαμβάνει το 89% των ενηλίκων των ΗΠΑ. Αυτό αντιπροσωπεύει αύξηση από τα 238,6 εκατομμύρια το 2022.
gpt-3.5
Ως γλωσσικό μοντέλο AI, δεν έχω πρόσβαση σε δεδομένα σε πραγματικό χρόνο. Ωστόσο, από το 2021, εκτιμήθηκε ότι περίπου 227 εκατομμύρια άνθρωποι στις Ηνωμένες Πολιτείες διέθεταν έγκυρη άδεια οδήγησης. Λάβετε υπόψη ότι αυτός ο αριθμός ενδέχεται να έχει αλλάξει από τότε, επομένως είναι πάντα καλύτερο να ανατρέχετε στα πιο πρόσφατα επίσημα στατιστικά στοιχεία για τις πιο ακριβείς πληροφορίες.
llama2-70b
Δεν έχω πρόσβαση σε δεδομένα σε πραγματικό χρόνο, αλλά μπορώ να παράσχω ορισμένες πληροφορίες σχετικά με τον κατά προσέγγιση αριθμό των ανθρώπων στις Ηνωμένες Πολιτείες που διαθέτουν άδεια οδήγησης. Σύμφωνα με την Ομοσπονδιακή Διοίκηση Αυτοκινητοδρόμων, υπήρχαν περίπου 227,8 εκατομμύρια αδειούχοι οδηγοί στις Ηνωμένες Πολιτείες από το 2020. Αυτός ο αριθμός περιλαμβάνει τόσο επαγγελματίες όσο και μη επαγγελματίες οδηγούς. Αξίζει να σημειωθεί ότι αυτός ο αριθμός είναι πιθανώς υποτιμημένος, καθώς δεν λαμβάνει υπόψη άτομα που ενδέχεται να έχουν άδεια οδήγησης αλλά δεν οδηγούν τακτικά ή καθόλου. Επιπλέον, αυτός ο αριθμός δεν περιλαμβάνει άτομα που δεν είναι επιλέξιπια για άδεια οδήγησης, όπως όσοι είναι κάτω των 16 ετών ή έχουν ορισμένες αναπηρίες. Είναι επίσης σημαντικό να σημειωθεί ότι ο αριθμός των αδειούχων οδηγών μπορεί να ποικίλλει ανά πολιτεία, με ορισμένες πολιτείες να έχουν υψηλότερο ποσοστό αδειούχων οδηγών από άλλες.
Συνολικά, τα αποτελέσματα της αξιολόγησης αποδεικνύουν ότι τα μοντέλα PPLX μας μπορούν να ταιριάξουν και ακόμη και να ξεπεράσουν τα gpt-3.5 και llama2-70b σε περιπτώσεις χρήσης που σχετίζονται με το Perplexity, ιδίως όσον αφορά την παροχή ακριβών και ενημερωμένων απαντήσεων.
Πρόσβαση στα διαδικτυακά μοντέλα του Perplexity
Είμαστε ενθουσιασμένοι να ανακοινώσουμε ότι το pplx-api περνά από το στάδιο της δοκιμής (beta) στην ευρεία δημόσια κυκλοφορία! Αυτή είναι η πρώτη φορά που τα μοντέλα μας pplx-7b-online και pplx-70b-online είναι προσβάσιμα μέσω του pplx-api. Επιπλέον, τα μοντέλα μας pplx-7b-chat και pplx-70b-chat είναι εκτός άλφα και είναι πλέον προσβάσιμα με τη γενική μας κυκλοφορία.
Με αυτό, εισάγουμε μια νέα δομή τιμολόγησης βάσει χρήσης. Είμαστε ενθουσιασμένοι που οι χρήστες μας θα αξιοποιήσουν την υπερσύγχρονη υποδομή μας, η οποία χρησιμοποιεί NVIDIA H100s για να παρέχει εξαιρετικά γρήγορη εξαγωγή συμπερασμάτων. Οι χρήστες Pro θα λάβουν μια επαναλαμβανόμενη πίστωση $5 μηνιαίως για το pplx-api. Για όλους τους άλλους χρήστες, η τιμολόγηση θα καθορίζεται με βάση τη χρήση. Για να εγγραφείτε ως χρήστης Pro, κάντε κλικ εδώ. Επικοινωνήστε στο api@perplexity.ai για εμπορικές ερωτήσεις.

Πρόσθετοι πόροι:
- Ξεκινήστε με το pplx-api εδώ.
- Δοκιμάστε τα διαδικτυακά μας μοντέλα δωρεάν με το Perplexity Labs.
- Μάθετε περισσότερα σχετικά με το API μας μέσω της τεκμηρίωσης του pplx-api.
- Ενδιαφέρεστε να εργαστείτε σε μια ομάδα υψηλού αντίκτυπου και υψηλής ταχύτητας που χτίζει την καλύτερη μηχανή απαντήσεων; Ελάτε μαζί μας!
- Γίνετε μέλος της αναπτυσσόμενης κοινότητάς μας στο Discord!
Συνεργάτες:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats