pplx-api ஐ அறிமுகப்படுத்துகிறது
ஓப்பன் சோர்ஸ் LLM-களுக்கான Perplexity Lab இன் வேகமான மற்றும் திறமையான API

தயவுசெய்து கவனிக்கவும்: தற்போதைய மாடல்களுக்குக் கீழ்க்கண்டவை நிறுத்தப்பட்டுள்ளன. எங்கள் API-களைப் பற்றி மேலும் அறியவும்
Mistral 7B, Llama2 13B, Code Llama 34B, Llama2 70B, replit-code-v1.5-3b மாடல்களை அணுக மிக விரைவான வழிகளில் ஒன்றாக வடிவமைக்கப்பட்ட pplx-api ஐ அறிவிப்பதில் நாங்கள் மகிழ்ச்சியடைகிறோம். டெவலப்பர்கள் அதிநவீன ஓப்பன் சோர்ஸ் LLM-களைத் தங்கள் திட்டங்களில் ஒருங்கிணைப்பதை pplx-api எளிாக்குகிறது.
எங்கள் pplx-api வழங்குவது:
பயன்படுத்த எளிதானது: டெவலப்பர்கள் அதிநவீன ஓப்பன் சோர்ஸ் மாடல்களை உடனடியாகப் பயன்படுத்தலாம் மற்றும் பரிச்சயமான REST API மூலம் நிமிடங்களுக்குள் தொடங்கலாம்.
அதிவேக அனுமானம்: எங்கள் சிந்தனையுடன் வடிவமைக்கப்பட்ட அனுமான அமைப்பு திறமையானது மற்றும் Replicate ஐ விட 2.9x குறைவான தாமதத்தையும், Anyscale ஐ விட 3.1x குறைவான தாமதத்தையும் அடைகிறது.
போரில் சோதிக்கப்பட்ட உள்கட்டமைப்பு: pplx-api நம்பகமானது என நிரூபிக்கப்பட்டுள்ளது, இது எங்கள் Perplexity பதில் இயந்திரம் மற்றும் எங்கள் Labs பிளேகிரவுண்டு இரண்டிலும் தயாரிப்பு நிலை போக்குவரத்திற்கு சேவை செய்கிறது.
ஓப்பன் சோர்ஸ் LLM-களுக்கான ஒரே இடத்திலான கடை: புதிய ஓப்பன் சோர்ஸ் மாடல்கள் வரும்போது அவற்றைச் சேர்க்க எங்கள் குழு அர்ப்பணிப்புடன் உள்ளது. உதாரணமாக, முன்பதிவு அணுகல் இன்றி லாஞ்ச் செய்யப்பட்ட சில மணி நேரங்களுக்குள்ளேயே Llama மற்றும் Mistral மாடல்களைச் சேர்த்தோம்.
pplx-api ஆனது பொது பீட்டாவில் உள்ளது மற்றும் Perplexity Pro சந்தா கொண்ட பயனர்களுக்கு இலவசம்.
சாதாரண வார இறுதி ஹேக்கத்தான் அல்லது புதிய மற்றும் புதுமையான தயாரிப்புகளை உருவாக்குவதற்கான வணிக தீர்வாக pplx-api ஐப் பயன்படுத்தவும். இந்த வெளியீடு மூலம் மக்கள் எங்கள் API மூலம் கூலான மற்றும் புதுமையான தயாரிப்புகளை எவ்வாறு உருவாக்கலாம் என்பதை அறிய நாங்கள் எதிர்நோக்குகிறோம். pplx-api க்கான வணிகப் பயன்பாட்டு வழக்கு உங்களிடம் இருந்தால் api@perplexity.ai ஐத் தொடர்பு கொள்ளவும். உங்களிடமிருந்து கேட்க நாங்கள் விரும்புகிறோம்!
pplx-api இன் நன்மைகள்
பயன்படுத்த எளிதானது
LLM வரிசைப்படுத்தல் மற்றும் அனுமானத்திற்கு மாடல் வழங்குதலைச் செயல்திறன் மிக்கதாகவும் செலவு குறைந்ததாகவும் மாற்ற குறிப்பிடத்தக்க உள்கட்டமைப்பு முயற்சி தேவைப்படுகிறது. டெவலப்பர்கள் C++/CUDA பற்றிய ஆழமான அறிவு அல்லது GPU-களுக்கான அணுகல் இல்லாமலேயே எங்கள் API ஐ அவுட்-ஆஃப்-தி-பாக்ஸ் பயன்படுத்தலாம், அதே நேரத்தில் அதிநவீன செயல்திறனை அனுபவிக்கலாம். எங்கள் LLM அனுமானம் உங்கள் சொந்த வன்பொருளை நிர்வகிப்பதன் சிக்கலான தன்மையையும் அவசியத்தையும் சுருக்கிக் கூறுகிறது, இது உங்கள் பயன்பாட்டின் எளிமையை மேலும் அதிகரிக்கிறது.
அதிவேக அனுமானம்
Perplexity இன் LLM API கவனமாக வடிவமைக்கப்பட்டுள்ளது மற்றும் வேகமான அனுமானத்திற்காக உகந்ததாக்கப்பட்டுள்ளது. இதை அடைய, AWS வழங்கும் A100 GPU-களில் வழங்கப்பட்ட NVIDIA இன் TensorRT-LLM ஐச் சுற்றி நாங்கள் ஒரு தனியுரிம LLM அனுமான உள்கட்டமைப்பை உருவாக்கினோம். pplx-api உள்கட்டமைப்பின் கண்ணோட்டம் பிரிவில் மேலும் அறிக. இதன் விளைவாக, வணிக ரீதியில் கிடைக்கும் வேகமான Llama மற்றும் Mistral API-களில் pplx-api ஒன்றாகும்.
தற்போதைய தீர்வுகளுடன் ஒப்பிடுவதற்கு, pplx-api இன் தாமதத்தை மற்ற LLM அனுமான நூலகங்களுடன் ஒப்பிட்டோம். எங்கள் சோதனைகளில், டெக்ஸ்ட் ஜெனரேஷன் இன்ஃபரன்ஸ் (TGI) உடன் ஒப்பிடும்போது pplx-api ஒட்டுமொத்த தாமதத்தை 2.92x வரை வேகமாகவும், ஆரம்ப பதில் தாமதத்தை 4.35x வரை வேகமாகவும் அடைகிறது. இந்த சோதனைக்காக, Llama-2-13B-chat மாடலைப் பயன்படுத்தி 2 A100 GPU-களில் ஒற்றை-ஸ்ட்ரீம் மற்றும் சர்வர் காட்சிகளுக்கான TGI மற்றும் Perplexity இன் அனுமானத்தை ஒப்பிட்டோம். ஒற்றை-ஸ்ட்ரீம் காட்சிக்காக, சர்வர் ஒரு கோரிக்கையைத் தொடர்ந்து மற்றொரு கோரிக்கையைச் செயலாக்குகிறது. சர்வர் காட்சியில், கிளையண்ட் பல்வேறு சுமையைப் பின்பற்றுவதற்காக மாறுபட்ட கோரிக்கை விகிதங்களுடன் பாய்சன் விநியோகத்தின்படி கோரிக்கைகளை அனுப்புகிறது. கோரிக்கை விகிதத்திற்கு, TGI ஆல் பராமரிக்கப்படும் அதிகபட்ச த் The maximum throughput sustained by TGI. உண்மையான உலகத் தரவைப் பயன்படுத்தினோம்.
அதே உள்ளீடுகளைப் பயன்படுத்தி, ஒரே ஒரு கோரிக்கை ஓட்டத்தை அனுப்பி, பிற ஏற்கனவே உள்ள API-களுக்கு எதிராக செயல்திறன் அடிப்படையைக் சேகரிக்க, Replicate மற்றும் Anyscale இன் API-களின் சராசரி தாமதங்களையும் அளவிட்டோம்.


அதே சோதனை அமைப்பைப் பயன்படுத்தி, தாமதக் கட்டுப்பாடாக டிகோடிங் வேகத்துடன், TGI க்கு எதிராக pplx-api இன் அதிகபட்ச த்ரூபுட்டை ஒப்பிட்டோம். எங்கள் சோதனைகளில், pplx-api ஆனது TGI ஐ விட 1.90x-6.75x வேகத்தில டோக்கன்களைச் செயலாக்குகிறது, மேலும் 60 மற்றும் 80 டோக்கன்கள்/நொடியில் எங்கள் கடுமையான தாமதக் கட்டுப்பாடுகளை TGI முழுமையாகப் பூர்த்தி செய்யத் தவறிவிடுகிறது. pplx-api ஐ மதிப்பீடு செய்ய நாங்கள் பயன்படுத்திய அதே வன்பொருள் மற்றும் சுமை நிலைமைகளின் கீழ் TGI ஐ மதிப்பீடு செய்கிறோம். Replicate மற்றும் Anyscale இன் வன்பொருள் மற்றும் சுமை காரணிகளைக் கட்டுப்படுத்த முடியாது என்பதால் இந்த அளவீட்டை அவற்றுடன் ஒப்பிடுவது சாத்தியமில்லை.
குறிப்புக்காக, சராசரி மனித வாசிப்பு வேகம் 5 டோக்கன்கள்/நொடியாகும், அதாவது pplx-api ஒருவரால் படிக்கக்கூடிய வேகத்தை விட வேகமாகச் சேவை செய்ய முடியும்.

pplx-api உள்கட்டமைப்பின் கண்ணோட்டம்
இந்த தாமத எண்களை அடைய அதிநவீன மென்பொருள் மற்றும் வன்பொருள் கலவை தேவைப்படுகிறது.
NVIDIA A100 GPU-களால் இயக்கப்படும் AWS p4d நிகழ்வுகள் சிறந்த கிளாக் வேகத்துடன் GPU-களை அளவிடுவதற்கான மிகவும் செலவு குறைந்த மற்றும் நம்பகமான விருப்பமாக மேடையை அமைக்கின்றன.
இந்த வன்பொருளைப் பயன்படுத்திக் கொள்ள மென்பொருளுக்கு, LLM அனுமானத்தை விரைவுபடுத்தும் மற்றும் உகந்ததாக்கும் ஒரு ஓப்பன் சோர்ஸ் நூலகமான NVIDIA இன் TensorRT-LLM ஐ இயக்குகிறோம். TensorRT-LLM ஆனது TensorRT இன் ஆழமான கற்றல் கம்பைலரை மூடுகிறது மற்றும் LLM மாடல் செயலாக்கத்தின் சூழல் மற்றும் தலைமுறை கட்டங்களுக்காக FlashAttention மற்றும் masked multi-head attention (MHA) ஆகியவற்றின் அதிநவீன செயலாக்கங்களுக்காக உருவாக்கப்பட்ட சமீபத்திய உகந்த கர்னல்களை உள்ளடக்கியது.
இங்கிருந்து, AWS இன் முதுகெலும்பும் Kubernetes உடனான அதன் வலுவான ஒருங்கிணைப்பும் நூற்றுக்கணக்கான GPU-களுக்கு அப்பால் மீள் தன்மையுடன் அளவிடவும், வேலையில்லா நேரம் மற்றும் பிணைய மேலதிகச் செலவைக் குறைக்கவும் எங்களுக்கு அதிகாரம் அளிக்கிறது.
பயன்பாட்டு வழக்கு: உற்பத்தியில் எங்கள் API
Perplexity இல் pplx-api: செலவுக் குறைப்பு மற்றும் நம்பகத்தன்மை
எங்கள் API ஏற்கனவே Perplexity இன் முக்கிய தயாரிப்பு அம்சங்களில் ஒன்றை இயக்குகிறது. வெளிப்புற API இலிருந்து ஒரு ஒற்றை அம்சத்தை pplx-api க்கு மாற்றுவது வருடத்திற்கு $0.62M செலவுக் சேமிப்பை ஏற்படுத்தியது, இது செலவுகளில் தோராயமாக 4x குறைப்பு ஆகும். தரம் எந்த வகையிலும் குறையவில்லை என்பதை உறுதிப்படுத்த நாங்கள் A/B சோதனைகளை நடத்தி உள்கட்டமைப்பு அளவீடுகளைக் கண்காணித்தோம். 2 வார காலப்பகுதியில், A/B சோதனையில் புள்ளிவிவர ரீதியாக குறிப்பிடத்தக்க வேறுபாடு எதுவும் இல்லை என்பதை நாங்கள் கவனித்தோம். கூடுதலாக, pplx-api ஆனது தினசரி ஒரு மில்லியன் கோரிக்கைகளுக்கு மேல் நிலையான சுமையை பராமரிக்க முடியும், இது தினசரி கிட்டத்தட்ட ஒரு பில்லியன் செயலாக்கப்பட்ட டோக்கன்களை எட்டுகிறது.
இந்த ஆரம்ப ஆய்வின் முடிவுகள் மிகவும் ஊக்கமளிக்கின்றன, மேலும் காலப்போக்கில் எங்கள் தயாரிப்பு அம்சங்களில் பலவற்றை pplx-api இயக்கும் என்று நாங்கள் எதிர்பார்க்கிறோம்.

பல்வேறு ஓப்பன் சோர்ஸ் மாடல்களுக்கு சேவை செய்யும் எங்கள் மாடல் பிளேகிரவுண்டான Perplexity Labs ஐ இயக்கவும் pplx-api ஐப் பயன்படுத்துகிறோம்.

சமீபத்திய அதிநவீன ஓப்பன் சோர்ஸ் LLM-களுக்கான அணுகலை வழங்க எங்கள் குழு உறுதுணையாக உள்ளது. Mistral 7B, Code Llama 34b மற்றும் அனைத்து Llama 2 மாடல்களையும் அவை வெளியிடப்பட்ட சில மணி நேரங்களுக்குள் ஒருங்கிணைத்தோம், மேலும் மிகவும் திறன் வாய்ந்த ஓப்பன் சோர்ஸ் LLM-கள் கிடைக்கும்போது அவ்வாறே செய்ய திட்டமிட்டுள்ளோம்.
Perplexity இன் AI API உடன் தொடங்குங்கள்
HTTPS கோரிக்கைகளைப் பயன்படுத்தி நீங்கள் pplx-api REST API ஐ அணுகலாம். pplx-api இல் அங்கீகரிப்பது பின்வரும் படிகளை உள்ளடக்கியது:
Perplexity கணக்கு அமைப்புகள் பக்கத்தின் மூலம் API விசையை உருவாக்கவும். API விசை என்பது நீண்ட காலம் நீடிக்கும் அணுகல் டோக்கன் ஆகும், இது கைமுறையாகப் புதுப்பிக்கப்படும் வரை அல்லது நீக்கப்படும் வரை பயன்படுத்தப்படலாம்.

ஒவ்வொரு pplx-api கோரிக்கையிலும் Authorization ஹெடரில் API விசையை ஒரு பியரர் டோக்கனாக அனுப்பவும்.
பின்வரும் எடுத்துக்காட்டில், PERPLEXITY_API_KEY என்பது மேலே உள்ள வழிமுறைகளைப் பயன்படுத்தி உருவாக்கப்பட்ட விக்கியுடன் இணைக்கப்பட்ட ஒரு சூழல் மாறியாகும். அரட்டை நிறைவு கோரிக்கையை சமர்ப்பிக்க CURL பயன்படுத்தப்படுகிறது.
curl -X POST \
--url https://perplexity.coolkeypoint.com/__p/api.perplexity.ai/chat/completions \
--header 'accept: application/json' \
--header 'content-type: application/json' \
--header "Authorization: Bearer ${PERPLEXITY_API_KEY}" \
--data '{
"model": "mistral-7b-instruct",
"stream": false,
"max_tokens": 1024,
"frequency_penalty": 1,
"temperature": 0.0,
"messages": [
{
"role": "system",
"content": "Be precise and concise in your responses."
},
{
"role": "user",
"content": "How many stars are there in our galaxy?"
}
]
}'இது content-type: application/json உடன் பின்வரும் பதிலை அளிக்கிறது
{
"id": "3fbf9a47-ac23-446d-8c6b-d911e190a898",
"model": "mistral-7b-instruct",
"object": "chat.completion",
"created": 1765322,
"choices": [
{
"index": 0,
"finish_reason": "stop",
"message": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
},
"delta": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
}
}
],
"usage": {
"prompt_tokens": 40,
"completion_tokens": 22,
"total_tokens": 62
}
}Python அழைப்பின் எடுத்துக்காட்டு இங்கே:
from openai import OpenAI
YOUR_API_KEY = "INSERT API KEY HERE"
messages = [
{
"role": "system",
"content": (
"You are an artificial intelligence assistant and you need to "
"engage in a helpful, detailed, polite conversation with a user."
),
},
{
"role": "user",
"content": (
"Count to 100, with a comma between each number and no newlines. "
"E.g., 1, 2, 3, ..."
),
},
]
client = OpenAI(api_key=YOUR_API_KEY, base_url="https://perplexity.coolkeypoint.com/__p/api.perplexity.ai")
# demo chat completion without streaming
response = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
)
print(response)
# demo chat completion with streaming
response_stream = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
stream=True,
)
for response in response_stream:
print(response)நாங்கள் தற்போது Mistral 7B, Llama 13B, Code Llama 34B, Llama 70B ஆகியவற்றை ஆதரிக்கிறோம், மேலும் ஏற்கனவே உள்ள பயன்பாடுகளுடன் எளிதாக ஒருங்கிணைப்பதற்காக இந்த API வசதியாக OpenAI கிளையண்டுடன் இணக்கமானது.
더 詳しい 정보는 API 문서 및 빠른 시작 가이드를 참조하세요. (Translation will be provided in Tamil): மேலும் தகவலுக்கு, தயவுசெய்து எங்கள் API ஆவணங்கள் மற்றும் விரைவு தொடக்க வழிகாட்டியைப் பார்வையிடவும்.
அடுத்து என்ன
அதிசயமான எதிர்காலத்தில், pplx-api ஆதரவு அளிப்பது:
தனிப்பயன் Perplexity LLM-கள் மற்றும் பிற ஓப்பன் சோர்ஸ் LLM-கள்.
தனிப்பயன் Perplexity எம்பிக்கிங் மற்றும் ஓப்பன் சோர்ஸ் எம்பிக்கிங்.
பொது பீட்டா கட்டம் முடிவடைந்த பிறகு பொதுவான அணுகலுடன் கூடிய பிரத்யேக API விலை நிர்ணய கட்டமைப்பு.
உண்மைகள் மற்றும் மேற்கோள்களுக்கான கிரவுண்டிங்குடன் கூடிய Perplexity RAG-LLM API.
இந்தப் பயன்பாட்டு வழிகளில் ஏதேனும் உங்களுக்கு ஆர்வம் இருந்தால் api@perplexity.ai ஐத் தொடர்பு கொள்ளவும்.
இது எங்கள் Perplexity வலைப்பதிவு இடுகை தொடரின் தொடக்கமும் ஆகும். எங்களின் அடுத்த இடுகையில், LLM அனுமானத்திற்கான A100 மற்றும் H100 செயல்திறன் ஒப்பீடு பற்றிய ஆழமான பார்வையைப் பகிர்ந்துகொள்வோம். காத்திருங்கள்!
நாங்கள் ஆட்களுக்கு வேலை வழங்குகிறோம்! நீங்கள் ஒரு பெரிய அளவில் வரிசைப்படுத்தப்பட்ட தயாரிப்பில் வேலை செய்ய விரும்பினால் மற்றும் எங்களுடன் சிந்தனையுடன் வடிவமைக்கப்பட்ட, கவனமாக உகந்ததாக்கப்பட்ட ஜெனரேட்டிவ் மற்றும் பெரிய மொழி மாதிரி உள்கட்டமைப்பை உருவாக்க விரும்பினால், தயவுசெய்து எங்களுடன் இணையுங்கள்.
மேலும் விவாதத்திற்கு எங்களை Twitter, LinkedIn இல் பின்தொடர்ந்து எங்கள் Discord இல் இணையுங்கள்.
ஆசிரியர்கள்:
Lauren Yang, Kevin Hu, Aarash Heydari, William Zhang, Dmitry Pervukhin, Grigorii Alekseev, Alexandr Yarats
தரவு தனியுரிமை
pplx-api ஐத் தேர்ந்தெடுப்பதன் மூலம், உங்கள் பயனர்கள் மற்றும் வாடிக்கையாளர்களின் தனியுரிமை மற்றும் நம்பிக்கையைப் பாதுகாக்கும் அதே வேளையில் LLM-களின் முழு திறனையும் நீங்கள் பயன்படுத்திக் கொள்ளலாம். உங்கள் தனிப்பட்ட தகவலைப் பாதுகாப்பதன் முக்கியத்துவத்தை நாங்கள் புரிந்துகொள்கிறோம் மற்றும் எங்கள் பயனர்களின் பாதுகாப்பு மற்றும் தனியுரிமையைப் பேண உறுதிபூண்டுள்ளோம். API தரவு 30 நாட்களுக்குப் பிறகு தானாகவே நீக்கப்படும், மேலும் pplx-api வழியாக அனுப்பப்படும் எந்தத் தரவிலும் நாங்கள் பயிற்சி அளிப்பதில்லை. பயனர்கள் தங்கள் கணக்கு அமைப்புகளில் தரவு தக்கவைப்பிலிருந்து விலகும் விருப்பத்தைக் கொண்டுள்ளனர். எங்களுடைய API தனியுரிமைக் கொள்கையை இங்கே கண்டறியவும்.