PPLX çevrim içi LLM'leri ile tanışın

Türünün ilk örneği olan Çevrim İçi LLM API'si

Perplexity releases first "Live" LLM

Türünün ilk örneği olan Çevrim İçi LLM API'si.

İki yeni PPLX modelini duyurmaktan heyecan duyuyoruz: pplx-7b-online ve pplx-70b-online! Çevrim içi modellerimiz; faydalı, güncel ve olgusal yanıtlar sunmaya odaklanmıştır ve türünün ilk örneği olan bir API yapılarak pplx-api üzerinden herkese açık olarak erişilebilirdir. pplx-7b-online ve pplx-70b-online modellerine ayrıca LLM deneme alanımız olan Perplexity Labs üzerinden de erişilebilir.

LLM'ler bilgi bulma biçimimizi dönüştürdü. Ancak günümüzdeki çoğu LLM'in iki sınırlaması vardır:

Güncellik: LLM'ler genellikle güncel bilgileri paylaşmakta zorlanır.

Hâlüsinasyonlar: LLM'ler yanlış ifadeler de üretebilir.

pplx-7b-online ve pplx-70b-online modellerimiz, yanıtlarında ayrıca faydalı, olgusal ve güncel bilgiler sağlayarak mevcut sınırlamaları ele alır.

PPLX Çevrim İçi LLM'leri

LLM'lerimiz pplx-7b-online ve pplx-70b-online, internetteki bilgileri kullanabildikleri ve böylece bir yanıt oluştururken en güncel bilgilerden yararlanabildikleri için çevrim içi LLM'lerdir. LLM'lerimize web'den bilgi sağlayarak modellerimiz zamana duyarlı sorgulara doğru bir şekilde yanıt verir ve eğitim derlemesinin ötesindeki bilgilerin kilidini açar. Bu, Perplexity'nin çevrim içi LLM'lerinin, çevrim dışı modeller için zorlayıcı olan “Dün geceki Warriors maç skoru neydi?” gibi sorguları yanıtlayabileceği anlamına gelir. Üst düzey bir bakış açısıyla çevrim içi LLM'imiz şu şekilde çalışır:

  1. Açık kaynaklı modellerden yararlanın: PPLX modellerimiz mistral-7b ve llama2-70b temel modelleri üzerine kuruludur.
  2. Şirket içi arama teknolojisi: Şirket içi arama, indeksleme ve tarama altyapımız, LLM'leri en ilgili, güncel ve değerli bilgiyse zenginleştirmemize olanak tanır. Arama indeksimiz büyüktür, düzenli olarak güncellenir ve yüksek kaliteli, SEO optimizasyonlu olmayan sitelere öncelik verilmesini sağlamak için gelişmiş sıralama algoritmaları kullanır. “Parçacık” olarak adlandırdığımız web sitesi alıntıları, en güncel bilgilerle yanıtları etkinleştirmek için pplx-online modellerimize sağlanır.
  3. İnce ayar: PPLX modellerimiz, yanıtlarını bilgilendirmek için parçacıkları etkili bir şekilde kullanacak şekilde ince ayardan geçirilmiştir. Şirket içi veri yüklenicilerimizi kullanarak; yardımseverlik, olgusallık ve tazelik gibi çeşitli eksenlerde yüksek performans elde etmek için yüksek kaliteli, çeşitli ve büyük eğitim setlerini dikkatle küratörlüyoruz. Modellerimiz performansını sürekli olarak iyileştirmek için düzenli olarak ince ayardan geçirilir.

Perplexity’nin Çevrim İçi LLM'lerini Değerlendirme

Perplexity'nin misyonu, dünyanın en iyi yanıt motorunu (insanların bilgi keşfetmek ve genişletmek için güvendiği bir motor) oluşturmaktır. Bunu başarmak için faydalı, olgusal ve güncel bilgiler sağlamaya son derece odaklanmış durumdayız. LLM'lerimizin bu eksenlerdeki performansını kıyaslamak için yanıt motorları için zorlu ama gerçekçi kullanım örneklerini yansıtacak değerlendirme veri kümeleri oluşturduk. Her değerlendirme setindeki her sorgu için yüklenicilere iki model yanıtı verildi ve aşağıdaki kriterler için daha iyi performans gösteren yanıtı seçmeleri talimatı verildi:

  • Yardımseverlik: Hangi yanıt sorguyu yanıtlıyor ve belirtilen talimatları daha iyi takip ediyor?
  • Olgusallık: Çok hassas veya niş bilgi gerektiren sorular için bile hangi yanıt hâlüsinasyon görmeden daha doğru yanıtlar sağlar?
  • Güncellik (FreshLLMs'den esinlenilmiştir): Hangi yanıt daha güncel bilgiler içerir? Bir model, "taze" bilgileri içeren sorguları yanıtlayabiliyorsa bu kriterde üstündür.

Yukarıdaki üç kritere ek olarak, model yanıtları bütünsel olarak da değerlendirildi. Yanıtları bütünsel olarak değerlendirmek için değerlendiricilerden, sorguda yardımcı olan bir insan asistanından almayı tercih edecekleri yanıtı seçmeleri istendi.

Değerlendirme Setinin Küratörlüğünü Yapma

Bu değerlendirme için yardımseverliği, olgusallığı ve güncelliği etkili bir şekilde değerlendirmek amacıyla çeşitli bir komut istemi setini özenle küratörledik. Her komut istemi manuel olarak seçildi ve verilerin kalitesi ve alakalılığı üzerinde yüksek düzeyde kontrol sağlandı. Veri kümesi, geniş bir yanıt motoru komut istemi yelpazesini kapsar ve Perplexity'nin başarılı olmasını istediklerimizin kapsamlı bir genel bakışını içerir. Bu, model performans değerlendirmelerimizin yüksek sinyale sahip olması bizim için çok önemlidir.

Üç değerlendirme setinin her biri 50 komut istemi içerir. Bu setlerden bazı örnekler şunlardır:

  • Yardımseverlik: Dünya Kupası finallerinde oynamış tüm ABD'li futbolcuların bir tablosunu oluşturun ve goller, asistler vb. istatistikleri için sütunlar yapın.
  • Olgusallık: AISI 1015 ve AISI 1040 çeliklerinin sertliğini açıklayın.
  • Güncellik: 2023 yılında hangi otonom araba şirketinin San Francisco'dan yasaklanması istendi?

Model Yanıtları Üretme

Dört modeli değerlendirdik:

pplx-7b-online: İnternetteki bilgilere erişimi içeren Perplexity modeli. Bu model mistral-7b kullanılarak ince ayardan geçirildi.

pplx-70b-online: İnternetteki bilgilere erişimi içeren Perplexity modeli. Bu model llama2-70b kullanılarak ince ayardan geçirildi.

gpt-3.5-turbo-1106: OpenAI'nin API aracılığıyla erişilen ve ek artırmaları olmayan modeli. Bu değerlendirmeyi en son gpt-3.5 modelini kullanarak gerçekleştirdiğimizi unutmayın.

llama2-70b-chat: Meta AI'nin pplx-api'miz aracılığıyla erişilen ve ek artırmaları olmayan modeli.

Her komut istemi için aynı arama sonuçları ve parçacıklar pplx-7b-online ve pplx-70b-online modellerine sağlandı. Tüm yanıtlar aynı hiperparametreler ve sistem komutu kullanılarak oluşturuldu.

Sistem Komutu

plaintext
Current date: Monday, November 20, 2023.

İnsan Değerlendirmesiyle Model Yanıtlarını Sıralama

Her ikili karşılaştırma için şirket içi yüklenicilerimize komut isteminin kendisi, değerlendirme kriterleri (yani yardımseverlik, olgusallık veya güncellik) ve yan yana görüntülenen model yanıtları sağlandı. Yanıtların sırası her turda rastgele belirlendi ve kaynak modeller değerlendiriciye açıklanmadı. Değerlendiricilere, bütünsel olarak tercih ettikleri yanıtı ve her ikisi için de eşitliklere izin verilerek belirli değerlendirme kriterlerinde hangisinin daha iyi performans gösterdiğini seçmeleri talimatı verildi. Son olarak, değerlendiricilerin yanıtların doğruluğunu doğrulamak için internet araması kullanmalarına izin verildi. Bu değerlendirmeyi yürütmek için kendi şirket içi tercih sıralama aracımızı oluşturduk.

Değerlendirme Sonuçları

Her model için görev başına Elo puanları hesaplamak için insan değerlendirmesinden toplanan ikili tercih sıralamalarını kullanıriz. Elo puanları, oyuncuların göreli performansını ölçmek için turnuva tarzı yarışmalarda bir oyuncu popülasyonunu sıralamak için yaygın olarak kullanılır. Büyük dil modellerine uygulandığında bu puanlar, bir insan değerlendiricinin bir modelin çıktısını diğerine tercih etme olasılığının ne kadar olduğuna dair bir tahmin sağlar.

Elo puanları genellikle oyuncuların yeteneklerindeki değişiklikleri hesaba katmak için bir karşılaştırma dizisi için hesaplanırken, yetenekleri değişemeyen modellerin performansını nicelleştirmeyi amaçlıyoruz. Buna göre, Duan ve diğerleri tarafından açıklanan ve ayrıca lmsys tarafından Chatbot Arena'ları için kullanılan ve karşılaştırmaların birçok rastgele permütasyonu için Elo puanlarının hesaplanmasını içeren Bootstrap Elo metodolojisini benimseriz. Hesaplamalarımız için 5000 permütasyon üzerinden Elo puanları hesapladık ve %95 güven aralıkları hesaplamak için bu Elo puanlarının dağılımlarını kullandık.

Şekil 1'de gösterilen sonuçlar, PPLX modellerimizin Perplexity ile ilgili kullanım durumlarında gpt-3.5 performansıyla eşleşebileceğini ve hatta bunu aşabileceğini göstermektedir. Özellikle, pplx-7b-online ve pplx-70b-online model yanıtları, doğru ve güncel yanıtları nedeniyle insan değerlendiriciler tarafından gpt-3.5 ve llama2-70b model yanıtlarına tercih edilmektedir.

pplx-7b-online ve pplx-70b-online; güncellik, olgusallık ve bütünsel kriterlerinde gpt-3.5 ve llama2-70b'den daha iyi performans gösterir.

Şekil 1. Dört farklı değerlendirme setinde pplx-7b (-online), pplx-70b (-online), llama2-70b ve gpt-3.5 için tahmini Elo puanları ve %95 güven aralıkları. Örneğin, güncellik ekseninde pplx-7b ve pplx-70b; sırasıyla 1100.6 ve 1099.6'ya karşılık 879.3 ve 920.3 tahmini Elo puanıyla gpt-3.5 ve llama2-70b'den daha iyi performans gösterir.

Ayrıca değerlendirmeden ikili kazanma oranlarını da hesapladık. Şekil 2'de gösterilen sonuçlar, şaşırtıcı olmayacak şekilde, pplx çevrim içi model yanıtlarının güncellik ve olgusallık konularında diğerlerininkine tercih edildiğini göstermektedir.

Şekil 2. Dikey eksendeki modellerin yatay eksendeki modellere karşı kazanma oranları. Örneğin, pplx-70b (-online) yanıtları, sorguların %64'ünde gpt-3.5'inkilerden bütünsel olarak üstün olarak derecelendirilmiş ve gpt-3.5'in yanıtları, sorguların %24'ünde pplx-70b (-online)'inkilerden bütünsel olarak üstün olarak derecelendirilmiştir.

İşte güncellik değerlendirme veri setimizden bir örnek.

İstem: ABD'de kaç kişinin ehliyeti var?

pplx-7b-online

2023 yılında Amerika Birleşik Devletleri'nde, ABD'li yetişkinlerin %89'unu içeren, öngörülen 243,4 milyon ehliyetli sürücü bulunmaktadır. Bu sayı 2022'deki 238,6 milyondan artmıştır. Ehliyetli sürücülerin yüzdesi farklı yaş grupları ve eyaletler arasında değişiklik göstermektedir. Örneğin 2019 yılında ABD nüfusunun %84,1'inin ehliyeti vardı. Ehliyetli sürücülerin en yüksek yüzdesi, nüfusun %90,1'inin ehliyeti olduğu 25-49 yaş arası kişiler arasındadır. Kaliforniya'da 27 milyon ehliyetli sürücü vardı ve bu da onu en yüksek sayıda ehliyetli sürücüye sahip eyalet yapıyordu.

pplx-70b-online

2021 yılında Amerika Birleşik Devletleri'nde yaklaşık 233 milyon kişinin geçerli ehliyeti vardı. 2023 yılına kadar ABD'deki ehliyetli sürücü sayısının, ABD'li yetişkinlerin %89'unu içeren 243,4 milyon kişiye ulaşması beklenmektedir. Bu, 2022'deki 238,6 milyondan bir artışı temsil etmektedir.

gpt-3.5

Bir yapay zeka dil modeli olarak gerçek zamanlı verilere erişimim yok. Ancak 2021 yılı itibarıyla Amerika Birleşik Devletleri'nde yaklaşık 227 milyon kişinin geçerli bir ehliyete sahip olduğu tahmin ediliyordu. Bu sayının o zamandan beri değişmiş olabileceğini lütfen unutmayın; bu nedenle en doğru bilgi için her zaman en son resmi istatistiklere başvurmak en iyisidir.

llama2-70b

Gerçek zamanlı verilere erişimim yok, ancak Amerika Birleşik Devletleri'nde ehliyeti olan kişilerin yaklaşık sayısı hakkında bazı bilgiler verebilirim. Federal Otoyol İdaresi'ne göre, 2020 yılı itibarıyla Amerika Birleşik Devletleri'nde yaklaşık 227,8 milyon ehliyetli sürücü vardı. Bu sayı hem ticari hem de ticari olmayan sürücüleri içermektedir. Bu sayının, ehliyeti olabilecek ancak düzenli olarak veya hiç araç kullanmayan bireyleri hesaba katmadığı için muhtemelen düşük bir tahmin olduğunu belirtmekte fayda var. Ek olarak, bu sayı 16 yaşından küçükler veya belirli engelleri olanlar gibi ehliyet almaya uygun olmayan bireyleri içermemektedir. Ehliyetli sürücü sayısının eyaletlere göre değişebileceğini ve bazı eyaletlerde ehliyetli sürücü yüzdesinin diğerlerinden daha yüksek olabileceğini unutmamak da önemlidir.

Genel olarak değerlendirme sonuçları, PPLX modellerimizin doğru ve güncel yanıtlar sağlama konusunda özellikle gpt-3.5 ve llama2-70b ile Perplexity ile ilgili kullanım durumlarında eşleşebileceğini ve hatta onları geride bırakabileceğini göstermektedir.

Perplexity’nin Çevrim İçi Modellerine Erişme

pplx-api'nin betadan çıkarak genel kullanıma sunulduğunu duyurmaktan heyecan duyuyoruz! Bu, pplx-7b-online ve pplx-70b-online modellerimizin pplx-api aracılığıyla ilk kez erişilebilir olduğu zamandır. Ek olarak, pplx-7b-chat ve pplx-70b-chat modellerimiz alfadan çıkmıştır ve artık genel sürümümüzle erişilebilirdir.

Bununla birlikte yeni bir kullanıma dayalı fiyatlandırma yapısı sunuyoruz. Kullanıcılarımızın, olağanüstü hızlı çıkarım sağlamak için NVIDIA H100'leri kullanan son teknoloji altyapımızdan yararlanmasından heyecan duyuyoruz. Pro kullanıcıları, yinelenen 5$'lık aylık pplx-api kredisi alacaktır. Diğer tüm kullanıcılar için fiyatlandırma kullanıma göre belirlenecektir. Pro kullanıcı olarak kaydolmak için buraya tıklayın. Ticari sorularınız için api@perplexity.ai adresine ulaşın.

PPLX çevrim içi llm paneli

Ek Kaynaklar:

Katkıda Bulunanlar:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats

statechange=e,c())}}}})();