ขอแนะนำ PPLX ออนไลน์ LLM

API ของ LLM ออนไลน์รูปแบบแรกที่ไม่เหมือนใคร

Perplexity releases first "Live" LLM

API ของ LLM ออนไลน์รูปแบบแรกที่ไม่เหมือนใคร

เราตื่นเต้นที่จะแบ่งปันโมเดล PPLX ใหม่สองโมเดล: pplx-7b-online และ pplx-70b-online! โมเดลออนไลน์ของเรามุ่งเน้นไปที่การให้คำตอบที่เป็นประโยชน์ เป็นปัจจุบัน และอิงตามข้อเท็จจริง และเปิดให้ใช้งาน public ผ่าน pplx-api ซึ่งทำให้เป็น API รูปแบบแรกที่ไม่เหมือนใคร pplx-7b-online และ pplx-70b-online ยังสามารถเข้าถึงได้ผ่าน Perplexity Labs ซึ่งเป็นสภาพแวดล้อมทดลอง LLM ของเรา

LLM ได้เปลี่ยนแปลงวิธีที่เราค้นหาข้อมูล อย่างไรก็ตาม มีข้อจำกัดสองประการสำหรับ LLM ส่วนใหญ่ในปัจจุบัน:

ความสดใหม่ของข้อมูล: LLM มักประสบปัญหาในการแชร์ข้อมูลที่เป็นปัจจุบัน

การกราบเรียนรู้ผิด (Hallucinations): LLM ยังสามารถแสดงข้อความที่ไม่ถูกต้องได้ด้วย

โมเดล pplx-7b-online และ pplx-70b-online ของเราช่วยแก้ปัญหาข้อจำกัดปัจจุบันด้วยการให้ข้อมูลที่เป็นประโยชน์ ตามข้อเท็จจริง และเป็นปัจจุบันเพิ่มเติมในคำตอบของตน

PPLX ออนไลน์ LLM

LLM ของเรา ได้แก่ pplx-7b-online และ pplx-70b-online เป็น LLM ออนไลน์ เนื่องจากสามารถใช้ความรู้จากอินเทอร์เน็ต และด้วยเหตุนี้จึงสามารถใช้ประโยชน์จากข้อมูลที่เป็นปัจจุบันที่สุดในการสร้างคำตอบได้ ด้วยการให้ความรู้จากเว็บแก่ LLM ของเรา โมเดลของเราจึงตอบสนองต่อคำถามที่ละเอียดอ่อนตามเวลาได้อย่างแม่นยำ ปลดล็อกความรู้ที่นอกเหนือจากคลังข้อมูลการฝึกอบรมของตน ซึ่งหมายความว่า LLM ออนไลน์ของ Perplexity สามารถตอบคำถามเช่น “คะแนนการแข่งขันของทีม Warriors เมื่อคืนนี้คือเท่าไร?” ซึ่งท้าทายสำหรับโมเดลออฟไลน์ ในระดับสูง นี่คือวิธีการทำงานของ LLM ออนไลน์ของเรา:

  1. ใช้ประโยชน์จากโมเดลโอเพนซอร์ส: โมเดล PPLX ของเราสร้างขึ้นต่อยอดจากโมเดลพื้นฐาน mistral-7b และ llama2-70b
  2. เทคโนโลยีการค้นหาภายในองค์กร: โครงสร้างพื้นฐานการค้นหา การทำดัชนี และการรวบรวมข้อมูลภายในองค์กรของเราช่วยให้เราสามารถเสริม LLM ด้วยข้อมูลที่เกี่ยวข้อง เป็นปัจจุบัน และมี قيمة มากที่สุด ดัชนีการค้นหาของเรามีขนาดใหญ่ ได้รับการอัปเดตอย่างสม่ำเสมอ และใช้อัลกอริทึมการจัดอันดับที่ซับซ้อนเพื่อให้แน่ใจว่าเว็บไซต์คุณภาพสูงที่ไม่ใช่ SEO ได้รับความสำคัญ ตัด 1 ตัด 2 เว็บไซต์ข้อความตัดตอน ซึ่งเราเรียกว่า "สnippet" จะถูกส่งไปยังโมเดล pplx-online ของเรา เพื่อเปิดใช้งานการตอบสนองด้วยข้อมูลที่เป็นปัจจุบันที่สุด
  3. การปรับแต่งอย่างละเอียด (Fine-tuning): โมเดล PPLX ของเราได้รับการปรับแต่งอย่างละเอียดเพื่อให้ใช้สnippetได้อย่างมีประสิทธิภาพเพื่อแจ้งคำตอบของตน โดยใช้ผู้รับเหมาข้อมูลภายในองค์กรของเรา เราคัดสรรชุดข้อมูลการฝึกอบรมที่มีคุณภาพสูง หลากหลาย และมีขนาดใหญ่เพื่อบรรลุประสิทธิภาพสูงในด้านต่างๆ เช่น ความเป็นประโยชน์ ความเป็นจริง และความสดใหม่ โมเดลของเราได้รับการปรับแต่งอย่างสม่ำเสมอเพื่อปรับปรุงประสิทธิภาพอย่างต่อเนื่อง

การประเมิน LLM ออนไลน์ของ Perplexity

พันธกิจของ Perplexity คือการสร้างเอ็นจิ้นคำตอบที่ดีที่สุดในโลก ซึ่งเป็นเอ็นจิ้นที่ผู้คนไว้วางใจในการค้นหาและขยายความรู้ของตน เพื่อให้บรรลุเป้าหมายนี้ เราจึงมุ่งเน้นอย่างมากในการให้ข้อมูลที่เป็นประโยชน์ ตามข้อเท็จจริง และเป็นปัจจุบัน เพื่อเปรียบเทียบประสิทธิภาพของ LLM ของเราในด้านเหล่านี้ เราได้คัดสรรชุดข้อมูลการประเมินเพื่อให้สะท้อนถึงกรณีการใช้งานที่ท้าทายแต่สมจริงสำหรับเอ็นจิ้นคำตอบ สำหรับแต่ละคำถามในชุดการประเมินแต่ละชุด ผู้รับเหมาจะได้รับคำตอบของโมเดลสองชุดและได้รับคำสั่งให้เลือกคำตอบที่มีประสิทธิภาพดีกว่าสำหรับเกณฑ์ต่อไปนี้:

  • ความเป็นประโยชน์: คำตอบใดตอบคำถามและทำตามคำสั่งที่ระบุได้ดีกว่า
  • ความเป็นจริง: คำตอบใดให้คำตอบที่ถูกต้องมากกว่าโดยไม่มีการกราบเรียนรู้ผิด แม้กระทั่งสำหรับคำถามที่ต้องการความรู้ที่แม่นยำมากหรือเฉพาะกลุ่ม
  • ความสดใหม่ (ได้รับแรงบันดาลใจจาก FreshLLMs): คำตอบใดมีข้อมูลที่เป็นปัจจุบันมากกว่า โมเดลจะโดดเด่นในเกณฑ์นี้หากสามารถตอบคำถามด้วยข้อมูลที่ "สดใหม่" ได้

นอกเหนือจากสามเกณฑ์ข้างต้นแล้ว คำตอบของโมเดลยังได้รับการประเมินในภาพรวมด้วย ในการประเมินคำตอบในภาพรวม ผู้ประเมินถูกขอให้เลือกคำตอบที่พวกเขาต้องการได้รับจากผู้ช่วยมนุษย์ที่คอยช่วยเหลือเกี่ยวกับคำถามนั้น

การคัดสรรชุดข้อมูลการประเมิน

สำหรับการประเมินนี้ เราได้คัดสรรชุดข้อความแจ้งที่หลากหลายอย่างพิถีพิถันโดยมีเป้าหมายเพื่อประเมินความเป็นประโยชน์ ความเป็นจริง และความสดใหม่ได้อย่างมีประสิทธิภาพ ข้อความแจ้งแต่ละรายการถูกเลือกด้วยมือ เพื่อให้มั่นใจได้ถึงระดับการควบคุมคุณภาพและความเกี่ยวข้องของข้อมูลที่สูง ชุดข้อมูลครอบคลุมข้อความแจ้งของเอ็นจิ้นคำตอบที่หลากหลายและครอบคลุมภาพรวมที่ครอบคลุมของสิ่งที่เราต้องการให้ Perplexity ทำได้ดีเยี่ยม สิ่งนี้มีความสำคัญอย่างยิ่งต่อการประเมินประสิทธิภาพของโมเดลของเราเพื่อให้มีสัญญาณสูง

ชุดการประเมินทั้งสามชุดประกอบด้วยชุดข้อความแจ้ง 50 รายการ ตัวอย่างบางส่วนจากชุดเหล่านี้ได้แก่:

  • ความเป็นประโยชน์: สร้างตารางของผู้เล่นฟุตบอลสหรัฐอเมริกาที่ลงเล่นในรอบชิงชนะเลิศฟุตบอลโลก และสร้างคอลัมน์สำหรับสถิติของพวกเขา เช่น ประตู การแอสซิสต์ ฯลฯ
  • ความเป็นจริง: อธิบายความเหนียวของเหล็ก AISI 1015 และ AISI 1040
  • ความเป็นปัจจุบัน: บริษัทรถยนต์ไร้คนขับใดที่ถูกแบนจากซานฟรานซิสโกในปี 2023

การสร้างคำตอบของโมเดล

เราประเมินสี่โมเดล:

pplx-7b-online: โมเดลของ Perplexity ซึ่งรวมถึงการเข้าถึงข้อมูลจากอินเทอร์เน็ต โมเดลนี้ได้รับการปรับแต่งอย่างละเอียดโดยใช้ mistral-7b

pplx-70b-online: โมเดลของ Perplexity ซึ่งรวมถึงการเข้าถึงข้อมูลจากอินเทอร์เน็ต โมเดลนี้ได้รับการปรับแต่งอย่างละเอียดโดยใช้ llama2-70b

gpt-3.5-turbo-1106: โมเดลของ OpenAI เข้าถึงผ่าน API และไม่มีการเพิ่มเสริมเพิ่มเติม โปรดทราบว่าเราดำเนินการประเมินนี้โดยใช้โมเดล gpt-3.5 ล่าสุด

llama2-70b-chat: โมเดลของ Meta AI เข้าถึงผ่าน pplx-api ของเราและไม่มีการเพิ่มเสริมเพิ่มเติม

สำหรับแต่ละข้อความแจ้ง ผลการค้นหาและข้อความสnippetเดียวกันจะถูกส่งไปยังโมเดล pplx-7b-online และ pplx-70b-online คำตอบทั้งหมดถูกสร้างขึ้นโดยใช้ไฮפרพารามิเตอร์และข้อความแจ้งของระบบเดียวกัน

ข้อความแจ้งของระบบ

plaintext
Current date: Monday, November 20, 2023.

การจัดอันดับคำตอบของโมเดลด้วยการประเมินโดยมนุษย์

สำหรับการเปรียบเทียบแบบคู่แต่ละครั้ง ผู้รับเหมาภายในของเราจะได้รับข้อความแจ้งตัวจริง เกณฑ์การประเมิน (เช่น ความเป็นประโยชน์ ความเป็นจริง หรือความสดใหม่) และคำตอบของโมเดลที่แสดงเคียงข้างกัน ลำดับของคำตอบถูกสุ่มในแต่ละรอบ และไม่ได้เปิดเผยโมเดลต้นทางให้ผู้ประเมินทราบ ผู้ประเมินได้รับคำสั่งให้เลือกคำตอบที่พวกเขาชื่นชอบในภาพรวม รวมถึงคำตอบใดที่มีประสิทธิภาพดีกว่าในเกณฑ์การประเมินเฉพาะ โดยอนุญาตให้เสมอกันได้สำหรับทั้งสองกรณี สุดท้าย ผู้ประเมินได้รับอนุญาตให้ใช้การค้นหาทางอินเทอร์เน็ตเพื่อตรวจสอบความถูกต้องของคำตอบ เราสร้างเครื่องมือจัดอันดับความชอบภายในของเราเองเพื่อดำเนินการประเมินนี้

ผลการประเมิน

เราใช้การจัดอันดับความชอบแบบคู่ที่รวบรวมจากการประเมินของมนุษย์เพื่อคำนวณคะแนน Elo ต่อภารกิจสำหรับแต่ละโมเดล คะแนน Elo มักใช้ในการจัดอันดับประชากรของผู้เล่นในการแข่งขันสไตล์ทัวร์นาเมนต์เพื่อวัดประสิทธิภาพสัมพัทธ์ของผู้เล่น เมื่อนำไปใช้กับโมเดลภาษาขนาดใหญ่ คะแนนเหล่านี้จะให้การคาดการณ์ว่าผู้ประเมินที่เป็นมนุษย์มีแนวโน้มที่จะชอบผลลัพธ์ของโมเดลหนึ่งมากกว่าอีกโมเดลหนึ่งมากเพียงใด

ในขณะที่คะแนน Elo มักจะคำนวณสำหรับลำดับการเปรียบเทียบเพื่อคำนึงถึงการเปลี่ยนแปลงความสามารถของผู้เล่น เรามุ่งหวังที่จะหาปริมาณประสิทธิภาพของโมเดลที่มีความสามารถที่ไม่สามารถเปลี่ยนแปลงได้ ดังนั้น เราจึงนำระเบียบวิธี Bootstrap Elo ที่อธิบายไว้ใน Duan และคณะ และยังใช้โดย lmsys สำหรับ Chatbot Arena ของพวกเขา ซึ่งเกี่ยวข้องกับการคำนวณคะแนน Elo สำหรับการสับเปลี่ยนแบบสุ่มจำนวนมากของการเปรียบเทียบ สำหรับการคำนวณของเรา เราคำนวณคะแนน Elo มากกว่า 5000 การสับเปลี่ยนและใช้การแจกแจงของคะแนน Elo เหล่านี้เพื่อคำนวณช่วงความเชื่อมั่น 95%

ผลลัพธ์ ดังแสดงในรูปที่ 1 แสดงให้เห็นว่า โมเดล PPLX ของเราสามารถเทียบเคียงและแม้กระทั่งเหนือกว่าประสิทธิภาพของ gpt-3.5 ในกรณีการใช้งานที่เกี่ยวข้องกับ Perplexity โดยเฉพาะอย่างยิ่ง คำตอบของโมเดล pplx-7b-online และ pplx-70b-online ได้รับความนิยมมากกว่าคำตอบของโมเดล gpt-3.5 และ llama2-70b โดยผู้ประเมินที่เป็นมนุษย์สำหรับคำตอบที่ถูกต้องและเป็นปัจจุบันของพวกเขา

pplx-7b-online และ pplx-70b-online มีประสิทธิภาพดีกว่า gpt-3.5 และ llama2-70b ในเกณฑ์ ความสดใหม่, ความเป็นจริง และ ภาพรวม

รูปที่ 1 คะแนน Elo ที่ประมาณการและช่วงความเชื่อมั่น 95% สำหรับ pplx-7b (-online), pplx-70b (-online), llama2-70b และ gpt-3.5 ในชุดการประเมินที่แตกต่างกันสี่ชุด ตัวอย่างเช่น ในแกนความสดใหม่ pplx-7b และ pplx-70b มีประสิทธิภาพดีกว่า gpt-3.5 และ llama2-70b ด้วยคะแนน Elo ที่ประมาณการไว้ที่ 1100.6 และ 1099.6 เทียบกับ 879.3 และ 920.3 ตามลำดับ

เรายังได้คำนวณอัตราการชนะแบบคู่จากการประเมินด้วย ผลลัพธ์ ดังแสดงในรูปที่ 2 แสดงให้เห็นว่า บางทีอาจไม่น่าแปลกใจเลยที่คำตอบของโมเดล pplx online จะได้รับความนิยมมากกว่าของผู้อื่นในเรื่อง ความสดใหม่ และ ความเป็นจริง

รูปที่ 2 อัตราการชนะของโมเดลบนแกนตั้งเทียบกับโมเดลบนแกนนอน ตัวอย่างเช่น คำตอบของ pplx-70b (-online) ได้รับการ評価ว่าดีกว่าในภาพรวมของ gpt-3.5 ใน 64% ของคำถาม และคำตอบของ gpt-3.5 ได้รับการ評価ว่าดีกว่าในภาพรวมของ pplx-70b (-online) ใน 24% ของคำถาม

นี่คือตัวอย่างจากชุดข้อมูลการประเมินความสดใหม่ของเรา

คำถาม: มีผู้คนจำนวนเท่าใดในสหรัฐอเมริกาที่มีใบขับขี่

pplx-7b-online

ในปี 2023 มีการคาดการณ์ว่าจะมีผู้ขับขี่ที่ได้รับใบอนุญาต 243.4 ล้านคนในสหรัฐอเมริกา ซึ่งรวมถึง 89% ของผู้ใหญ่ในสหรัฐอเมริกา ตัวเลขนี้เพิ่มขึ้นจาก 238.6 ล้านคนในปี 2022 เปอร์เซ็นต์ของผู้ขับขี่ที่ได้รับใบอนุญาตจะแตกต่างกันไปตามกลุ่มอายุและรัฐต่างๆ ตัวอย่างเช่น ในปี 2019 ประชากร 84.1% ของสหรัฐอเมริกามีใบขับขี่ เปอร์เซ็นต์สูงสุดของผู้ขับขี่ที่ได้รับใบอนุญาตคือกลุ่มอายุ 25 ถึง 49 ปี โดย 90.1% ของประชากรมีใบขับขี่ ในแคลิฟอร์เนีย มีผู้ขับขี่ที่ได้รับใบอนุญาต 27 ล้านคน ทำให้เป็นรัฐที่มีจำนวนผู้ขับขี่ที่ได้รับใบอนุญาตมากที่สุด

pplx-70b-online

ในปี 2021 มีผู้คนประมาณ 233 ล้านคนที่ถือใบขับขี่ที่ถูกต้องในสหรัฐอเมริกา ภายในปี 2023 จำนวนผู้ขับขี่ที่ได้รับใบอนุญาตในสหรัฐอเมริกาคาดว่าจะสูงถึง 243.4 ล้านคน ซึ่งรวมถึง 89% ของผู้ใหญ่ในสหรัฐอเมริกา นี่แสดงถึงการเพิ่มขึ้นจาก 238.6 ล้านคนในปี 2022

gpt-3.5

ในฐานะโมเดลภาษา AI ฉันไม่มีการเข้าถึงข้อมูลแบบเรียลไทม์ อย่างไรก็ตาม ณ ปี 2021 มีการประมาณการว่ามีผู้คนประมาณ 227 ล้านคนในสหรัฐอเมริกาที่ถือใบขับขี่ที่ถูกต้อง โปรดทราบว่าตัวเลขนี้อาจเปลี่ยนแปลงไปตั้งแต่นั้นมา ดังนั้นจึงดีที่สุดเสมอที่จะอ้างอิงถึงสถิติทางการล่าสุดสำหรับข้อมูลที่ถูกต้องที่สุด

llama2-70b

ฉันไม่มีการเข้าถึงข้อมูลแบบเรียลไทม์ แต่ฉันสามารถให้ข้อมูลเกี่ยวกับจำนวนโดยประมาณของผู้คนในสหรัฐอเมริกาที่มีใบขับขี่ได้ ตามข้อมูลจาก Federal Highway Administration มีผู้ขับขี่ที่ได้รับใบอนุญาตประมาณ 227.8 ล้านคนในสหรัฐอเมริกา ณ ปี 2020 ตัวเลขนี้รวมถึงผู้ขับขี่ทั้งเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ เป็นที่น่าสังเกตว่าตัวเลขนี้อาจเป็นการประเมินต่ำไป เนื่องจากไม่ได้คำนึงถึงบุคคลที่อาจมีใบขับขี่แต่ไม่ได้ขับรถเป็นประจำหรือไม่ขับเลย นอกจากนี้ ตัวเลขนี้ไม่รวมถึงบุคคลที่มีสิทธิ์ไม่ถึงเกณฑ์สำหรับใบขับขี่ เช่น ผู้ที่มีอายุต่ำกว่า 16 ปีหรือมีความพิการบางประการ สิ่งสำคัญคือต้องทราบว่าจำนวนผู้ขับขี่ที่ได้รับใบอนุญาตอาจแตกต่างกันไปตามรัฐ โดยบางรัฐมีเปอร์เซ็นต์ของผู้ขับขี่ที่ได้รับใบอนุญาตสูงกว่ารัฐอื่นๆ

โดยรวมแล้ว ผลการประเมินแสดงให้เห็นว่าโมเดล PPLX ของเราสามารถเทียบเคียงและแม้กระทั่งเหนือกว่า gpt-3.5 และ llama2-70b ในกรณีการใช้งานที่เกี่ยวข้องกับ Perplexity โดยเฉพาะอย่างยิ่งสำหรับการให้คำตอบที่ถูกต้องและเป็นปัจจุบัน

การเข้าถึงโมเดลออนไลน์ของ Perplexity

เรารู้สึกตื่นเต้นที่จะประกาศว่า pplx-api กำลังออกจากช่วงเบต้าสู่การเผยแพร่ทั่วไปสำหรับสาธารณชน! นี่เป็นครั้งแรกที่โมเดล pplx-7b-online และ pplx-70b-online ของเราสามารถเข้าถึงได้ผ่าน pplx-api นอกจากนี้ โมเดล pplx-7b-chat และ pplx-70b-chat ของเราได้ออกจากช่วงอัลฟาแล้ว และตอนนี้สามารถเข้าถึงได้แล้วด้วยการเผยแพร่ทั่วไปของเรา

ด้วยเหตุนี้ เราจึงแนะนำโครงสร้างการกำหนดราคาตามการใช้งานใหม่ เราตื่นเต้นให้ผู้ใช้ของเราใช้งานโครงสร้างพื้นฐานที่ล้ำสมัยของเรา ซึ่งใช้ NVIDIA H100s เพื่อให้การอนุมานที่เร็วราวกระสุน ผู้ใช้ Pro จะได้รับเครดิต pplx-api มูลค่า $5 ต่อเดือนซ้ำๆ สำหรับผู้ใช้รายอื่นๆ ทั้งหมด การกำหนดราคาจะถูกกำหนดตามการใช้งาน หากต้องการสมัครเป็นผู้ใช้ Pro คลิกที่นี่ ติดต่อ api@perplexity.ai สำหรับการสอบถามเชิงพาณิชย์

แดชบอร์ด LLM ออนไลน์ PPLX

แหล่งข้อมูลเพิ่มเติม:

  • เริ่มต้นใช้งาน pplx-api ที่นี่
  • ทดลองใช้โมเดลออนไลน์ของเราได้ฟรีด้วย Perplexity Labs
  • เรียนรู้เพิ่มเติมเกี่ยวกับ API ของเราผ่าน เอกสารประกอบ pplx-api
  • สนใจทำงานในทีมที่มีผลกระทบสูงและมีความเร็วสูงในการสร้างเอ็นจิ้นคำตอบที่ดีที่สุดหรือไม่? เข้าร่วมกับเรา!
  • เข้าร่วม ชุมชน Discord ที่กำลังเติบโตของเรา!

ผู้สนับสนุน:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats