pplx-api పరిచయం
ఓపెన్-సోర్స్ LLMల కోసం Perplexity Lab యొక్క వేగవంతమైన మరియు సమర్థవంతమైన API

దయచేసి గమనించండి: ప్రస్తుత మోడల్ల కోసం దిగువ పేర్కొన్నవి నిలిపివేయబడ్డాయి. మా APIల గురించి మరింత తెలుసుకోండి
Mistral 7B, Llama2 13B, Code Llama 34B, Llama2 70B, replit-code-v1.5-3b మోడల్లను యాక్సెస్ చేయడానికి వేగవంతమైన మార్గాలలో ఒకటిగా రూపొందించబడిన pplx-apiని ప్రకటించడం మాకు సంతోషంగా ఉంది. డెవలపర్లు అత్యాధునిక ఓపెన్ సోర్స్ LLMలను వారి ప్రాజెక్ట్లలో ఏకీకృతం చేయడాన్ని pplx-api సులభతరం చేస్తుంది.
మా pplx-api వీటిని అందిస్తుంది:
ఉపయోగంలో సులభతరం: డెవలపర్లు అత్యాధునిక ఓపెన్-సోర్స్ మోడల్లను నేరుగా ఉపయోగించవచ్చు మరియు సుపరిచితమైన REST APIతో నిమిషాల్లో ప్రారంభించవచ్చు.
అతి వేగవంతమైన ఇన్ఫరెన్స్: మా ఆలోచనాత్మకంగా రూపొందించப்பட்ட ఇన్ఫరెన్స్ సిస్టమ్ సమర్థవంతమైనది మరియు Replicate కంటే 2.9x మరియు Anyscale కంటే 3.1x తక్కువ లాటెన్సీని సాధిస్తుంది.
యుద్ధంలో పరీక్షించబడిన ఇన్ఫ్రాస్ట్రక్చర్: pplx-api నమ్మదగినదిగా నిరూపించబడింది, ఇది మా Perplexity సమాధాన ఇంజిన్ మరియు మా Labs ప్లేగ్రౌండ్ రెండింటిలోనూ ప్రొడక్షన్-స్థాయి ట్రాఫిక్ను అందిస్తుంది.
ఓపెన్-సోర్స్ LLMల కోసం వన్-స్టాప్ షాప్: కొత్త ఓపెన్-సోర్స్ మోడల్లు వచ్చిన వెంటనే వాటిని జోడించడానికి మా బృందం అంకితభావంతో ఉంది. ఉదాహరణకు, ముందస్తు విడుదల యాక్సెస్ లేకుండా లాంచ్ చేసిన కొద్ది గంటల్లోనే మేము Llama మరియు Mistral మోడల్లను జోడించాము.
pplx-api పబ్లిక్ బీటాలో ఉంది మరియు Perplexity Pro సబ్స్క్రిప్షన్ ఉన్న వినియోగదారులకు ఉచితం.
సాధారణ వారాంతపు హ్యాకథన్ కోసం లేదా కొత్త మరియు వినూత్నమైన ఉత్పత్తులను రూపొందించడానికి వాణిజ్య పరిష్కారంగా pplx-apiని ఉపయోగించండి. ఈ విడుదల ద్వారా ప్రజలు మా APIతో కూల్ మరియు వినూత్నమైన ఉత్పత్తులను ఎలా సృష్టించవచ్చో తెలుసుకోవాలని మేము ఆశిస్తున్నాము. మీకు pplx-api కోసం వ్యాపార ఉపయోగం ఉంటే దయచేసి api@perplexity.ai ని సంప్రదించండి. మీ నుండి వినడానికి మేము సంతోషిస్తాము!
pplx-api యొక్క ప్రయోజనాలు
ఉపయోగంలో సులభతరం
LLM డిప్లాయ్మెంట్ మరియు ఇన్ఫరెన్స్ మోడల్ సర్వ్ను పనితీరు మరియు ఖర్చు-సమర్థవంతంగా చేయడానికి గణనీయమైన ఇన్ఫ్రాస్ట్రక్చర్ ప్రయత్నం అవసరం. డెవలపర్లు C++/CUDA గురించిన లోతైన జ్ఞానం లేదా GPUలకు యాక్సెస్ లేకుండానే మా APIని నేరుగా ఉపయోగించుకోవచ్చు, అదే సమయంలో అత్యుత్తమ పనితీరును ఆస్వాదించవచ్చు. మా LLM ఇన్ఫరెన్స్ మీ స్వంత హార్డ్వేర్ను నిర్వహించే సంక్లిష్టత మరియు అవసరాన్ని కూడా తొలగిస్తుంది, ఇది మీ వినియోగ సౌలభ్యాన్ని మరింత పెంచుతుంది.
అతి వేగవంతమైన ఇన్ఫరెన్స్
Perplexity యొక్క LLM API వేగవంతమైన ఇన్ఫరెన్స్ కోసం జాగ్రత్తగా రూపొందించబడింది మరియు ఆప్టిమైజ్ చేయబడింది. దీన్ని సాధించడానికి, మేము AWS అందించిన A100 GPUలపై అందించబడే NVIDIA యొక్క TensortRT-LLM చుట్టూ యాజమాన్య LLM ఇన్ఫ్రాస్ట్రక్చర్ను రూపొందించాము. Overview of pplx-api Infrastructure విభాగంలో మరింత తెలుసుకోండి. ఫలితంగా, pplx-api వాణిజ్యపరంగా అందుబాటులో ఉన్న వేగవంతమైన Llama మరియు Mistral APIలలో ఒకటి.
ప్రస్తుత పరిష్కారాలతో బెంచ్మార్క్ చేయడానికి, మేము pplx-api యొక్క లాటెన్సీని ఇతర LLM ఇన్ఫరెన్స్ లైబ్రరీలతో పోల్చాము. మా ప్రయోగాలలో, టెక్స్ట్ జనరేషన్ ఇన్ఫరెన్స్ (TGI)తో పోలిస్తే pplx-api 2.92x వేగవంతమైన మొత్తం లాటెన్సీని మరియు 4.35x వేగవంతమైన ప్రారంభ ప్రతిస్పందన లాటెన్సీని సాధిస్తుంది. ఈ ప్రయోగం కోసం, మేము రెండు GPUలలో షార్డ్ చేయబడిన Llama-2-13B-chat మోడల్ని ఉపయోగించి 2 A100 GPUలపై একক-స్ట్రీమ్ మరియు సర్వర్ దృశ్యాల కోసం TGI మరియు Perplexity ఇన్ఫరెన్స్లను పోల్చాము. సింగిల్-స్ట్రీమ్ దృశ్యం కోసం, సర్వర్ ఒక అభ్యర్థన తర్వాత మరొకటి ప్రాసెస్ చేస్తుంది. సర్వర్ దృశ్యంలో, క్లయింట్ మారుతున్న లోడ్ను అనుకరించడానికి వివిధ అభ్యర్థన రేట్లతో పాయిసన్ పంపిణీ ప్రకారం అభ్యర్థనలను పంపుతుంది. అభ్యర్థన రేటు కోసం, TGI ద్వారా నిర్వహించப்படும் గరిష్ట థ్రూపుట్ అయిన సెకనుకు గరిష్టంగా 1 అభ్యర్థన వరకు మేము చిన్న స్వీప్ చేస్తాము. ప్రొడక్షన్ ప్రవర్తనను అనుకరించడానికి మేము వివిధ రకాల ఇన్పుట్ మరియు అవుట్పుట్ టోకెన్ పొడవులతో వాస్తవ-ప్రపంచ డేటాను ఉపయోగించాము. అభ్యర్థనలు సగటున ~700 ఇన్పుట్ టోకెన్లు మరియు ~550 అవుట్పుట్ టోకెన్లను కలిగి ఉంటాయి.
అే ఇన్పుట్లను ఉపయోగించి మరియు ఒకే స్ట్రీమ్ అభ్యర్థనలను పంపడం ద్వారా, ఇతర ఇప్పటికే ఉన్న APIలకు వ్యతిరేకంగా పనితీరు బేస్లైన్ను సేకరించడానికి మేము ఈ మోడల్ కోసం Replicate మరియు Anyscale APIల సగటు లాటెన్సీలను కూడా కొలిచాము.


అదే ప్రయోగాత్మక அமைப்பை ఉపయోగించి, లాటెన్సీ పరిమితిగా డీకోడింగ్ వేగంతో TGIకి వ్యతిరేకంగా మేము pplx-api యొక్క గరిష్ట థ్రూపుట్ను పోల్చాము. మా ప్రయోగాలలో, pplx-api TGI కంటే 1.90x-6.75x వేగంగా టోకెన్లను ప్రాసెస్ చేస్తుంది మరియు 60 మరియు 80 టోకెన్లు/సెకను వద్ద మా కఠినమైన లాటెన్సీ నిబంధనలను సంతృప్తిపరచడంలో TGI పూర్తిగా విఫలమవుతుంది. మేము pplx-apiని మూల్యాంకనం చేయడానికి ఉపయోగించిన అదే హార్డ్వేర్ మరియు లోడ్ పరిస్థితులలో TGIని మూల్యాంకనం చేస్తాము. మేము వారి హార్డ్వేర్ మరియు లోడ్ కారకాలను నియంత్రించలేనందున Replicate మరియు Anyscaleతో ఈ కొలమానాన్ని పోల్చడం సాధ్యం కాదు.
సూచన కోసం, సగటు మానవ పఠన వేగం సెకనుకు 5 టోకెన్లు, అంటే pplx-api ఎవరైనా చదవగలిగే దానికంటే వేగవంతమైన రేటుతో అందించగలదు.

pplx-api ఇన్ఫ్రాస్ట్రక్చర్ యొక్క అవలోకనం
ఈ లాటెన్సీ సంఖ్యలను సాధించడానికి అత్యాధునిక సాఫ్ట్వేర్ మరియు హార్డ్వేర్ కలయిక అవసరం.
NVIDIA A100 GPUల ద్వారా శక్తిని పొందే AWS p4d ఇన్స్టాన్స్లు అత్యుత్తమ క్లాక్ వేగంతో GPUలను స్కేల్ అవుట్ చేయడానికి అత్యంత తక్కువ ఖర్చుతో కూడిన మరియు నమ్మదగిన ఎంపికగా వేదికను సెట్ చేస్తాయి.
ఈ హార్డ్వేర్ను సద్వినియోగం చేసుకోవడానికి సాఫ్ట్వేర్ కోసం, మేము LLM ఇన్ఫరెన్స్ను వేగవంతం చేసే మరియు ఆప్టిమైజ్ చేసే ఓపెన్-సోర్స్ లైబ్రరీ అయిన NVIDIA యొక్క TensorRT-LLMని అమలు చేస్తాము. TensorRT-LLM టెన్సర్ఆర్టీ యొక్క డీప్ లెర్నింగ్ కంపైలర్ను రేప్ చేస్తుంది మరియు LLM మోడల్ ఎక్జిక్యూషన్ యొక్క సందర్భం మరియు జనరేషన్ దశల కోసం FlashAttention మరియు మాస్క్డ్ మల్టీ-హెడ్ అటెన్షన్ (MHA) యొక్క అత్యాధునిక అమలుల కోసం తయారు చేయబడిన తాజా ఆప్టిమైజ్ చేయబడిన కెర్నెల్లను కలిగి ఉంటుంది.
ఇక్కడి నుండి, AWS యొక్క బ్యాక్బోన్ మరియు Kubernetesతో దాని బలమైన ఏకీకరణ వందలాది GPUలను మించి సాగేటట్లు చేయడానికి మరియు పనికిరాని సమయాన్ని మరియు నెట్వర్క్ ఓవర్హెడ్ను తగ్గించడానికి మాకు అధికారం ఇస్తుంది.
ఉపయోగ సందర్భం: ఉత్పత్తిలో మా API
Perplexityలో pplx-api: ఖర్చు తగ్గింపు మరియు విశ్వసనీయత
మా API ఇప్పటికే Perplexity యొక్క ప్రధాన ఉత్పత్తి ఫీచర్లలో ఒకదానికి శక్తినిస్తోంది. బాహ్య API నుండి ఒకే ఫీచర్ను pplx-apiకి మార్చడం వల్ల సంవత్సరానికి $0.62M ఖర్చు ఆదా అయింది, ఇది దాదాపు 4x ఖర్చు తగ్గింపు. నాణ్యత క్షీణత లేదని నిర్ధారించడానికి మేము A/B పరీక్షలను నిర్వహించాము మరియు ఇన్ఫ్రాస్ట్రక్చర్ మెట్రిక్లను పర్యవేక్షించాము. 2 వారాల కోర్సులో, A/B పరీక్షలో గణాంకపరంగా గణనీయమైన తేడా ఏదీ కనిపించలేదు. అదనంగా, pplx-api రోజువారీ మిలియన్ కంటే ఎక్కువ అభ్యర్థనల లోడ్ను నిర్వహించగలదు, రోజువారీగా దాదాపు బిలియన్ ప్రాసెస్ చేయబడిన టోకెన్లను మొత్తం చేస్తుంది.
ఈ ప్రాథమిక అన్వేషణ ఫలితాలు చాలా ప్రోత్సాహకరంగా ఉన్నాయి, మరియు కాలక్రమేణా మా మరిన్ని ఉత్పత్తి ఫీచర్లకు pplx-api శక్తినిస్తుందని మేము ఆశిస్తున్నాము.

विవిధ ఓపెన్-సోర్స్ మోడల్లను అందించే మా మోడల్ ప్లేగ్రౌండ్ అయిన Perplexity Labsకి శక్తినివ్వడానికి మేము pplx-apiని కూడా ఉపయోగిస్తాము.

తాజా అత్యాధునిక ఓపెన్-సోర్సెడ్ LLMలకు యాక్సెస్ను అందించడానికి మా బృందం కట్టుబడి ఉంది. Mistral 7B, Code Llama 34b మరియు అన్ని Llama 2 మోడల్లు విడుదలైన కొద్ది గంటల్లోనే మేము వాటిని ఏకీకృతం చేసాము మరియు మరింత సామర్థ్యం గల మరియు ఓపెన్-సోర్స్ LLMలు అందుబాటులోకి వచ్చినప్పుడు అలా చేయాలని ప్లాన్ చేస్తున్నాము.
Perplexity యొక్క AI APIతో ప్రారంభించండి
మీరు HTTPS అభ్యర్థనలను ఉపయోగించి pplx-api REST APIని యాక్సెస్ చేయవచ్చు. pplx-apiలోకి ప్రామాణీకరించడం క్రింది దశలను కలిగి ఉంటుంది:
Perplexity ఖాతా సెట్టింగ్ల పేజీ ద్వారా API కీని రూపొందించండి. API కీ అనేది ఎక్కువ కాలం ఉండే యాక్సెస్ టోకెన్, దీన్ని మాన్యువల్గా రిఫ్రెష్ చేసే వరకు లేదా తొలగించే వరకు ఉపయోగించవచ్చు.

ప్రతి pplx-api అభ్యర్థనతో Authorization హెడర్లో బేరర్ టోకెన్గా API కీని పంపండి.
క్రింది ఉదాహరణలో, PERPLEXITY_API_KEY అనేది పై సూచనలను ఉపయోగించి రూపొందించப்பட்ட కీకి బంధించబడిన పర్యావరణ వేరియబుల్. చాట్ పూర్తి అభ్యర్థనను సమర్పించడానికి CURL ఉపయోగించబడుతుంది.
curl -X POST \
--url https://perplexity.coolkeypoint.com/__p/api.perplexity.ai/chat/completions \
--header 'accept: application/json' \
--header 'content-type: application/json' \
--header "Authorization: Bearer ${PERPLEXITY_API_KEY}" \
--data '{
"model": "mistral-7b-instruct",
"stream": false,
"max_tokens": 1024,
"frequency_penalty": 1,
"temperature": 0.0,
"messages": [
{
"role": "system",
"content": "Be precise and concise in your responses."
},
{
"role": "user",
"content": "How many stars are there in our galaxy?"
}
]
}'content-type: application/json కలిగి ఉన్న క్రింది ప్రతిస్పందనను ఇస్తుంది
{
"id": "3fbf9a47-ac23-446d-8c6b-d911e190a898",
"model": "mistral-7b-instruct",
"object": "chat.completion",
"created": 1765322,
"choices": [
{
"index": 0,
"finish_reason": "stop",
"message": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
},
"delta": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
}
}
],
"usage": {
"prompt_tokens": 40,
"completion_tokens": 22,
"total_tokens": 62
}
}ఇక్కడ పైథాన్ కాల్ ఉదాహరణ ఉంది:
from openai import OpenAI
YOUR_API_KEY = "INSERT API KEY HERE"
messages = [
{
"role": "system",
"content": (
"You are an artificial intelligence assistant and you need to "
"engage in a helpful, detailed, polite conversation with a user."
),
},
{
"role": "user",
"content": (
"Count to 100, with a comma between each number and no newlines. "
"E.g., 1, 2, 3, ..."
),
},
]
client = OpenAI(api_key=YOUR_API_KEY, base_url="https://perplexity.coolkeypoint.com/__p/api.perplexity.ai")
# demo chat completion without streaming
response = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
)
print(response)
# demo chat completion with streaming
response_stream = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
stream=True,
)
for response in response_stream:
print(response)మేము ప్రస్తుతం Mistral 7B, Llama 13B, Code Llama 34B, Llama 70Bలకు మద్దతు ఇస్తున్నాము మరియు ఇప్పటికే ఉన్న అప్లికేషన్లతో సులభంగా ఏకీకరణ కోసం API సౌకర్యవంతంగా OpenAI క్లయింట్-అనుకూలంగా ఉంది.
మరిన్ని సమాచారం కోసం, దయచేసి మా API డాక్యుమెంటేషన్ మరియు త్వరిత ప్రారంభ గైడ్ని సందర్శించండి.
తదుపరి ఏమిటి
ఇతరులలో, సమీప భవిష్యత్తులో pplx-api వీటికి మద్దతు ఇస్తుంది:
కస్టమ్ Perplexity LLMలు మరియు ఇతర ఓపెన్-సోర్స్ LLMలు.
కస్టమ్ Perplexity ఎంబెడ్డింగ్లు మరియు ఓపెన్-సోర్స్ ఎంబెడ్డింగ్లు.
పబ్లిక్ బీటా ముగిసిన తర్వాత సాధారణ యాక్సెస్తో అంకితమైన API ధర నిర్మాణం.
వాస్తవాలు మరియు ఉల్లేఖనాల కోసం గ్రౌండింగ్తో Perplexity RAG-LLM API.
ఈ ఉపయోగ సందర్భాలలో ఏదైనా మీకు ఆసక్తి ఉంటే api@perplexity.aiని సంప్రదించండి.
ఇది మా Perplexity బ్లాగ్ పోస్ట్ సిరీస్ యొక్క ప్రారంభం కూడా. మా తదుపరి పోస్ట్లో, LLM ఇన్ఫరెన్స్ కోసం A100 vs H100 పనితీరు పోలికపై లోతుగా పరిశీలిస్తాము. వేచి ఉండండి!
మేము నియామకాలు చేస్తున్నాము! మీరు భారీ స్థాయిలో మోహరించిన ఉత్పత్తిపై పని చేయాలనుకుంటే మరియు మాతో ఆలోచనాత్మకంగా రూపొందించப்பட்ட, జాగ్రత్తగా ఆప్టిమైజ్ చేయబడిన జనరేటివ్ మరియు పెద్ద భాషా మోడల్ ఇన్ఫ్రాస్ట్రక్చర్ను నిర్మించాలనుకుంటే, దయచేసి మాతో చేరండి.
మరిన్ని చర్చల కోసం Twitter, LinkedInలో మమ్మల్ని అనుసరించండి మరియు మా Discordలో చేరండి.
రచయితలు:
Lauren Yang, Kevin Hu, Aarash Heydari, William Zhang, Dmitry Pervukhin, Grigorii Alekseev, Alexandr Yarats
డేటా గోప్యత
pplx-apiని ఎంచుకోవడం ద్వారా, మీ వినియోగదారులు మరియు కస్టమర్ల గోప్యత మరియు విశ్వాసాన్ని కాపాడుకుంటూ మీరు LLMల పూర్తి సామర్థ్యాన్ని ఉపయోగించుకోవచ్చు. మీ వ్యక్తిగత సమాచారాన్ని రక్షించడం యొక్క ప్రాముఖ్యత మాకు తెలుసు మరియు మా వినియోగదారుల భద్రత మరియు గోప్యతను నిర్వహించడానికి కట్టుబడి ఉన్నాము. API డేటా 30 రోజుల తర్వాత స్వయంచాలకంగా తొలగించబడుతుంది మరియు pplx-api ద్వారా ప్రసారం చేయబడిన ఏ డేటాపై మేము ఎప్పటికీ శిక్షణ ఇవ్వము. వినియోగదారులు తమ ఖాతా సెట్టింగ్లలో డేటా నిలుపుదల నుండి నిష్క్రమించే ఎంపికను కలిగి ఉంటారు. మా API గోప్యతా విధానాన్ని ఇక్కడ కనుగొనండి.