Memperkenalkan LLM online PPLX

API LLM Online pertama dari jenisnya

Perplexity releases first "Live" LLM

API LLM Online pertama dari jenisnya.

Kami dengan senang hati membagikan dua model PPLX baru: pplx-7b-online dan pplx-70b-online! Model online kami berfokus untuk memberikan respons yang membantu, aktual, dan mutakhir, serta tersedia secara publik melalui pplx-api, menjadikannya API pertama dari jenisnya. pplx-7b-online dan pplx-70b-online juga dapat diakses melalui Perplexity Labs, taman bermain LLM kami.

LLM telah mengubah cara kita menemukan informasi. Namun, ada dua keterbatasan pada sebagian besar LLM saat ini:

Kebaruan: LLM sering kali kesulitan membagikan informasi terbaru.

Halusinasi: LLM juga dapat menghasilkan pernyataan yang tidak akurat.

Model pplx-7b-online dan pplx-70b-online kami mengatasi keterbatasan saat ini dengan memberikan informasi tambahan yang membantu, aktual, dan mutakhir dalam responsnya.

LLM Online PPLX

LLM kami, pplx-7b-online dan pplx-70b-online, adalah LLM online karena dapat menggunakan pengetahuan dari internet, dan dengan demikian dapat memanfaatkan informasi paling mutakhir saat menyusun respons. Dengan membekali LLM kami dengan pengetahuan dari web, model kami merespons kueri yang sensitif terhadap waktu secara akurat, membuka pengetahuan di luar korpus pelatihannya. Ini berarti LLM online Perplexity dapat menjawab kueri seperti “Berapa skor pertandingan Warriors semalam?” yang menantang bagi model offline. Secara tingkat tinggi, begitulah cara kerja LLM online kami:

  1. Manfaatkan model sumber terbuka: model PPLX kami dibangun di atas model dasar mistral-7b dan llama2-70b.
  2. Teknologi pencarian internal: infrastruktur pencarian, pengindeksan, dan perayapan internal kami memungkinkan kami menambah LLM dengan informasi yang paling relevan, mutakhir, dan berharga. Indeks pencarian kami sangat besar, diperbarui secara berkala, dan menggunakan algoritma peringkat canggih untuk memastikan situs berkualitas tinggi dan non-SEO diprioritaskan. Cuplikan situs web, yang kami sebut “sniper”, disediakan untuk model pplx-online kami guna memungkinkan respons dengan informasi paling mutakhir.
  3. Penyetelan halus: model PPLX kami telah disetel secara halus untuk menggunakan cuplikan secara efektif guna menginformasikan respons mereka. Menggunakan kontraktor data internal kami, kami mengkurasi set pelatihan berkualitas tinggi, beragam, dan besar dengan cermat untuk mencapai kinerja tinggi pada berbagai poros seperti kebermanfaatan, faktual, dan kebaruan. Model kami disetel secara rutin untuk terus meningkatkan kinerja.

Mengevaluasi LLM Online Perplexity

Misi Perplexity adalah membangun mesin jawaban terbaik di dunia - mesin yang dipercaya orang untuk menemukan dan memperluas pengetahuan mereka. Untuk mencapai hal ini, kami sangat fokus dalam menyediakan informasi yang membantu, aktual, dan mutakhir. Untuk membandingkan kinerja LLM kami pada poros ini, kami mengkurasi kumpulan data evaluasi untuk merefleksikan kasus penggunaan yang menantang namun realistis untuk mesin jawaban. Untuk setiap kueri di setiap set evaluasi, kontraktor diberi dua respons model dan diperintahkan untuk memilih respons yang kinerjanya lebih baik untuk kriteria berikut:

  • Kebermanfaatan: respons mana yang menjawab kueri dan mengikuti instruksi yang ditentukan dengan lebih baik?
  • Faktual: respons mana yang memberikan jawaban lebih akurat tanpa halusinasi, bahkan untuk pertanyaan yang memerlukan pengetahuan sangat tepat atau khusus?
  • Kebaruan (terinspirasi oleh FreshLLMs): respons mana yang berisi informasi lebih mutakhir? Suatu model unggul dalam kriteria ini jika mampu menjawab kueri dengan informasi “baru”.

Selain tiga kriteria di atas, respons model juga dievaluasi secara holistik. Untuk mengevaluasi respons secara holistik, evaluator diminta untuk memilih respons yang lebih ingin mereka terima dari asisten manusia yang membantu dengan kueri tersebut.

Mengkurasi Set Evaluasi

Untuk evaluasi ini, kami dengan cermat mengkurasi serangkaian prompt yang beragam dengan tujuan mengevaluasi kebermanfaatan, faktual, dan kebaruan secara efektif. Setiap prompt dipilih secara manual, memastikan tingkat kontrol yang tinggi terhadap kualitas dan relevansi data. Kumpulan data ini mencakup berbagai macam prompt mesin jawaban dan mencakup ikhtisar komprehensif tentang apa yang kami inginkan agar Perplexity unggul. Hal ini sangat penting bagi evaluasi kinerja model kami untuk memiliki sinyal yang tinggi.

Masing-masing dari tiga set evaluasi berisi 50 prompt. Beberapa contoh dari set ini meliputi:

  • Kebermanfaatan: Buat tabel semua pemain sepak bola AS yang bermain di final Piala Dunia dan buat kolom untuk statistik mereka seperti gol, assist, dll.
  • Faktual: Jelaskan ketangguhan baja AISI 1015 dan AISI 1040.
  • Kekinian: Perusahaan mobil otonom mana yang dilarang beroperasi di San Francisco pada tahun 2023?

Menghasilkan Respons Model

Kami mengevaluasi empat model:

pplx-7b-online: Model Perplexity, yang mencakup akses ke informasi dari internet. Model ini disetel secara halus menggunakan mistral-7b.

pplx-70b-online: Model Perplexity, yang mencakup akses ke informasi dari internet. Model ini disetel secara halus menggunakan llama2-70b.

gpt-3.5-turbo-1106: Model OpenAI, yang diakses melalui API dan tanpa penambahan tambahan. Perhatikan bahwa kami melakukan evaluasi ini menggunakan model gpt-3.5 terbaru.

llama2-70b-chat: Model Meta AI, yang diakses melalui pplx-api kami dan tanpa penambahan tambahan.

Untuk setiap prompt, hasil pencarian dan cuplikan yang sama diberikan ke model pplx-7b-online dan pplx-70b-online. Semua respons dihasilkan menggunakan hiperparameter dan prompt sistem yang sama.

Prompt Sistem

plaintext
Current date: Monday, November 20, 2023.

Memeringkat Respons Model dengan Evaluasi Manusia

Untuk setiap perbandingan berpasangan, kontraktor internal kami diberi prompt itu sendiri, kriteria evaluasi (yaitu, kebermanfaatan, faktual, atau kebaruan), dan respons model yang ditampilkan berdampingan. Urutan respons diacak pada setiap putaran, dan model sumber tidak diungkapkan kepada evaluator. Evaluator diinstruksikan untuk memilih respons yang lebih mereka sukai secara holistik, serta mana yang berkinerja lebih baik pada kriteria evaluasi tertentu, dengan hasil seri diperbolehkan untuk keduanya. Terakhir, evaluator diizinkan menggunakan pencarian internet untuk memverifikasi keakuratan respons. Kami membangun alat peringkat preferensi internal kami sendiri untuk melakukan evaluasi ini.

Hasil Evaluasi

Kami menggunakan peringkat preferensi berpasangan yang dikumpulkan dari evaluasi manusia untuk menghitung skor Elo per tugas untuk setiap model. Skor Elo umumnya digunakan untuk memeringkat populasi pemain dalam kompetisi bergaya turnamen untuk mengukur kinerja relatif para pemain. Bila diterapkan pada model bahasa besar, skor ini memberikan prediksi tentang seberapa besar kemungkinan evaluator manusia menyukai keluaran satu model dibandingkan model lainnya.

Meskipun skor Elo biasanya dihitung untuk urutan perbandingan guna memperhitungkan perubahan kemampuan pemain, kami bertujuan untuk mengukur kinerja model yang kemampuannya tidak dapat berubah. Oleh karena itu, kami mengadopsi metodologi Bootstrap Elo yang dijelaskan dalam Duan et al dan juga digunakan oleh lmsys untuk Chatbot Arena mereka, yang memerlukan penghitungan skor Elo untuk banyak permutasi acak dari perbandingan tersebut. Untuk perhitungan kami, kami menghitung skor Elo selama 5000 permutasi dan menggunakan distribusi skor Elo ini untuk menghitung interval kepercayaan 95%.

Hasilnya, yang ditunjukkan pada Gambar 1, menunjukkan bahwa model PPLX kami dapat menyamai bahkan melampaui kinerja gpt-3.5 pada kasus penggunaan terkait Perplexity. Khususnya, respons model pplx-7b-online dan pplx-70b-online lebih disukai daripada respons model gpt-3.5 dan llama2-70b oleh evaluator manusia karena jawabannya yang akurat dan mutakhir.

pplx-7b-online dan pplx-70b-online berkinerja lebih baik daripada gpt-3.5 dan llama2-70b, pada kriteria kebaruan, faktual, dan holistik.

Gambar 1. Perkiraan skor Elo dan interval kepercayaan 95% untuk pplx-7b (-online), pplx-70b (-online), llama2-70b, dan gpt-3.5 di empat set evaluasi yang berbeda. Misalnya, pada poros kebaruan, pplx-7b dan pplx-70b berkinerja lebih baik daripada gpt-3.5 dan llama2-70b, dengan perkiraan skor Elo masing-masing 1100,6 dan 1099,6 vs 879,3 dan 920,3.

Kami juga menghitung tingkat kemenangan berpasangan dari evaluasi. Hasilnya, yang ditunjukkan pada Gambar 2, menggambarkan mungkin tidak mengejutkan, respons model online pplx lebih disukai daripada yang lain pada kebaruan dan faktual.

Gambar 2. Tingkat kemenangan model pada sumbu vertikal terhadap model pada sumbu horizontal. Misalnya, respons pplx-70b (-online) dinilai secara holistik lebih unggul daripada gpt-3.5 pada 64% kueri dan respons gpt-3.5 dinilai secara holistik lebih unggul daripada pplx-70b (-online) pada 24% kueri.

Berikut adalah contoh dari kumpulan data evaluasi kebaruan kami.

Prompt: Berapa banyak orang di AS yang memiliki surat izin mengemudi?

pplx-7b-online

Pada tahun 2023, diperkirakan ada 243,4 juta pengemudi berlisensi di Amerika Serikat, yang mencakup 89% orang dewasa AS. Jumlah ini meningkat dari 238,6 juta pada tahun 2022. Persentase pengemudi berlisensi bervariasi di berbagai kelompok umur dan negara bagian. Misalnya, pada tahun 2019, 84,1% populasi AS memiliki surat izin mengemudi. Persentase pengemudi berlisensi tertinggi ada di kalangan usia 25 hingga 49 tahun, dengan 90,1% populasi memiliki surat izin mengemudi. Di California, terdapat 27 juta pengemudi berlisensi, menjadikannya negara bagian dengan jumlah pengemudi berlisensi tertinggi.

pplx-70b-online

Pada tahun 2021, sekitar 233 juta orang memegang surat izin mengemudi yang sah di Amerika Serikat. Pada tahun 2023, jumlah pengemudi berlisensi di AS diproyeksikan mencapai 243,4 juta, yang mencakup 89% orang dewasa AS. Ini merupakan peningkatan dari 238,6 juta pada tahun 2022.

gpt-3.5

Sebagai model bahasa AI, saya tidak memiliki akses ke data waktu nyata. Namun, per tahun 2021, diperkirakan sekitar 227 juta orang di Amerika Serikat memiliki surat izin mengemudi yang sah. Harap dicatat bahwa jumlah ini mungkin telah berubah sejak saat itu, jadi selalu yang terbaik adalah merujuk pada statistik resmi terbaru untuk informasi yang paling akurat.

llama2-70b

Saya tidak memiliki akses ke data waktu nyata, namun saya dapat memberikan beberapa informasi mengenai perkiraan jumlah orang di Amerika Serikat yang memiliki surat izin mengemudi. Menurut Federal Highway Administration, terdapat sekitar 227,8 juta pengemudi berlisensi di Amerika Serikat per tahun 2020. Jumlah ini mencakup pengemudi komersial maupun non-komersial. Perlu dicatat bahwa jumlah ini mungkin merupakan perkiraan yang terlalu rendah, karena tidak memperhitungkan individu yang mungkin memiliki surat izin mengemudi tetapi tidak mengemudi secara teratur atau sama sekali. Selain itu, angka ini tidak mencakup individu yang tidak memenuhi syarat untuk mendapatkan surat izin mengemudi, seperti mereka yang berusia di bawah 16 tahun atau memiliki disabilitas tertentu. Penting juga untuk dicatat bahwa jumlah pengemudi berlisensi dapat bervariasi menurut negara bagian, dengan beberapa negara bagian memiliki persentase pengemudi berlisensi yang lebih tinggi daripada yang lain.

Secara keseluruhan, hasil evaluasi menunjukkan bahwa model PPLX kami dapat menyamai dan bahkan mengungguli gpt-3.5 dan llama2-70b pada kasus penggunaan terkait Perplexity, khususnya untuk memberikan respons yang akurat dan mutakhir.

Mengakses Model Online Perplexity

Kami sangat senang mengumumkan bahwa pplx-api keluar dari fase beta menuju rilis publik umum! Ini adalah pertama kalinya model pplx-7b-online dan pplx-70b-online kami dapat diakses melalui pplx-api. Selain itu, model pplx-7b-chat dan pplx-70b-chat kami telah keluar dari fase alfa, dan sekarang dapat diakses dengan rilis umum kami.

Dengan ini, kami memperkenalkan struktur penetapan harga baru berdasarkan penggunaan. Kami sangat antusias bagi para pengguna kami untuk memanfaatkan infrastruktur mutakhir kami, yang menggunakan NVIDIA H100 untuk menyediakan inferensi super cepat. Pengguna Pro akan menerima kredit pplx-api bulanan berulang sebesar $5. Untuk semua pengguna lainnya, penetapan harga akan ditentukan berdasarkan penggunaan. Untuk mendaftar sebagai pengguna Pro, klik di sini. Hubungi api@perplexity.ai untuk pertanyaan komersial.

Dasbor llm online PPLX

Sumber Daya Tambahan:

Kontributor:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats