pplx-api పరిచయం

ఓపెన్-సోర్స్ LLMల కోసం Perplexity Lab యొక్క వేగవంతమైన మరియు సమర్థవంతమైన API

Introducing pplx-api by Perplexity Labs

దయచేసి గమనించండి: ప్రస్తుత మోడల్‌ల కోసం దిగువ పేర్కొన్నవి నిలిపివేయబడ్డాయి. మా APIల గురించి మరింత తెలుసుకోండి

Mistral 7B, Llama2 13B, Code Llama 34B, Llama2 70B, replit-code-v1.5-3b మోడల్‌లను యాక్సెస్ చేయడానికి వేగవంతమైన మార్గాలలో ఒకటిగా రూపొందించబడిన pplx-apiని ప్రకటించడం మాకు సంతోషంగా ఉంది. డెవలపర్‌లు అత్యాధునిక ఓపెన్ సోర్స్ LLMలను వారి ప్రాజెక్ట్‌లలో ఏకీకృతం చేయడాన్ని pplx-api సులభతరం చేస్తుంది.

మా pplx-api వీటిని అందిస్తుంది:

ఉపయోగంలో సులభతరం: డెవలపర్‌లు అత్యాధునిక ఓపెన్-సోర్స్ మోడల్‌లను నేరుగా ఉపయోగించవచ్చు మరియు సుపరిచితమైన REST APIతో నిమిషాల్లో ప్రారంభించవచ్చు.

అతి వేగవంతమైన ఇన్‌ఫరెన్స్: మా ఆలోచనాత్మకంగా రూపొందించப்பட்ட ఇన్‌ఫరెన్స్ సిస్టమ్ సమర్థవంతమైనది మరియు Replicate కంటే 2.9x మరియు Anyscale కంటే 3.1x తక్కువ లాటెన్సీని సాధిస్తుంది.

యుద్ధంలో పరీక్షించబడిన ఇన్‌ఫ్రాస్ట్రక్చర్: pplx-api నమ్మదగినదిగా నిరూపించబడింది, ఇది మా Perplexity సమాధాన ఇంజిన్ మరియు మా Labs ప్లేగ్రౌండ్ రెండింటిలోనూ ప్రొడక్షన్-స్థాయి ట్రాఫిక్‌ను అందిస్తుంది.

ఓపెన్-సోర్స్ LLMల కోసం వన్-స్టాప్ షాప్: కొత్త ఓపెన్-సోర్స్ మోడల్‌లు వచ్చిన వెంటనే వాటిని జోడించడానికి మా బృందం అంకితభావంతో ఉంది. ఉదాహరణకు, ముందస్తు విడుదల యాక్సెస్ లేకుండా లాంచ్ చేసిన కొద్ది గంటల్లోనే మేము Llama మరియు Mistral మోడల్‌లను జోడించాము.

pplx-api పబ్లిక్ బీటాలో ఉంది మరియు Perplexity Pro సబ్‌స్క్రిప్షన్ ఉన్న వినియోగదారులకు ఉచితం.

సాధారణ వారాంతపు హ్యాకథన్ కోసం లేదా కొత్త మరియు వినూత్నమైన ఉత్పత్తులను రూపొందించడానికి వాణిజ్య పరిష్కారంగా pplx-apiని ఉపయోగించండి. ఈ విడుదల ద్వారా ప్రజలు మా APIతో కూల్ మరియు వినూత్నమైన ఉత్పత్తులను ఎలా సృష్టించవచ్చో తెలుసుకోవాలని మేము ఆశిస్తున్నాము. మీకు pplx-api కోసం వ్యాపార ఉపయోగం ఉంటే దయచేసి api@perplexity.ai ని సంప్రదించండి. మీ నుండి వినడానికి మేము సంతోషిస్తాము!

pplx-api యొక్క ప్రయోజనాలు

ఉపయోగంలో సులభతరం

LLM డిప్లాయ్‌మెంట్ మరియు ఇన్‌ఫరెన్స్ మోడల్ సర్వ్‌ను పనితీరు మరియు ఖర్చు-సమర్థవంతంగా చేయడానికి గణనీయమైన ఇన్‌ఫ్రాస్ట్రక్చర్ ప్రయత్నం అవసరం. డెవలపర్‌లు C++/CUDA గురించిన లోతైన జ్ఞానం లేదా GPUలకు యాక్సెస్ లేకుండానే మా APIని నేరుగా ఉపయోగించుకోవచ్చు, అదే సమయంలో అత్యుత్తమ పనితీరును ఆస్వాదించవచ్చు. మా LLM ఇన్‌ఫరెన్స్ మీ స్వంత హార్డ్‌వేర్‌ను నిర్వహించే సంక్లిష్టత మరియు అవసరాన్ని కూడా తొలగిస్తుంది, ఇది మీ వినియోగ సౌలభ్యాన్ని మరింత పెంచుతుంది.


అతి వేగవంతమైన ఇన్‌ఫరెన్స్

Perplexity యొక్క LLM API వేగవంతమైన ఇన్‌ఫరెన్స్ కోసం జాగ్రత్తగా రూపొందించబడింది మరియు ఆప్టిమైజ్ చేయబడింది. దీన్ని సాధించడానికి, మేము AWS అందించిన A100 GPUలపై అందించబడే NVIDIA యొక్క TensortRT-LLM చుట్టూ యాజమాన్య LLM ఇన్‌ఫ్రాస్ట్రక్చర్‌ను రూపొందించాము. Overview of pplx-api Infrastructure విభాగంలో మరింత తెలుసుకోండి. ఫలితంగా, pplx-api వాణిజ్యపరంగా అందుబాటులో ఉన్న వేగవంతమైన Llama మరియు Mistral APIలలో ఒకటి.

ప్రస్తుత పరిష్కారాలతో బెంచ్‌మార్క్ చేయడానికి, మేము pplx-api యొక్క లాటెన్సీని ఇతర LLM ఇన్‌ఫరెన్స్ లైబ్రరీలతో పోల్చాము. మా ప్రయోగాలలో, టెక్స్ట్ జనరేషన్ ఇన్‌ఫరెన్స్ (TGI)తో పోలిస్తే pplx-api 2.92x వేగవంతమైన మొత్తం లాటెన్సీని మరియు 4.35x వేగవంతమైన ప్రారంభ ప్రతిస్పందన లాటెన్సీని సాధిస్తుంది. ఈ ప్రయోగం కోసం, మేము రెండు GPUలలో షార్డ్ చేయబడిన Llama-2-13B-chat మోడల్‌ని ఉపయోగించి 2 A100 GPUలపై একক-స్ట్రీమ్ మరియు సర్వర్ దృశ్యాల కోసం TGI మరియు Perplexity ఇన్‌ఫరెన్స్‌లను పోల్చాము. సింగిల్-స్ట్రీమ్ దృశ్యం కోసం, సర్వర్ ఒక అభ్యర్థన తర్వాత మరొకటి ప్రాసెస్ చేస్తుంది. సర్వర్ దృశ్యంలో, క్లయింట్ మారుతున్న లోడ్‌ను అనుకరించడానికి వివిధ అభ్యర్థన రేట్లతో పాయిసన్ పంపిణీ ప్రకారం అభ్యర్థనలను పంపుతుంది. అభ్యర్థన రేటు కోసం, TGI ద్వారా నిర్వహించப்படும் గరిష్ట థ్రూపుట్ అయిన సెకనుకు గరిష్టంగా 1 అభ్యర్థన వరకు మేము చిన్న స్వీప్ చేస్తాము. ప్రొడక్షన్ ప్రవర్తనను అనుకరించడానికి మేము వివిధ రకాల ఇన్‌పుట్ మరియు అవుట్‌పుట్ టోకెన్ పొడవులతో వాస్తవ-ప్రపంచ డేటాను ఉపయోగించాము. అభ్యర్థనలు సగటున ~700 ఇన్‌పుట్ టోకెన్‌లు మరియు ~550 అవుట్‌పుట్ టోకెన్‌లను కలిగి ఉంటాయి.

అే ఇన్‌పుట్‌లను ఉపయోగించి మరియు ఒకే స్ట్రీమ్ అభ్యర్థనలను పంపడం ద్వారా, ఇతర ఇప్పటికే ఉన్న APIలకు వ్యతిరేకంగా పనితీరు బేస్‌లైన్‌ను సేకరించడానికి మేము ఈ మోడల్ కోసం Replicate మరియు Anyscale APIల సగటు లాటెన్సీలను కూడా కొలిచాము.

Perplexity Labs - మొదటి టోకెన్ లాటెన్సీ
Perplexity Labs - డీకోడింగ్ వేగం

అదే ప్రయోగాత్మక அமைப்பை ఉపయోగించి, లాటెన్సీ పరిమితిగా డీకోడింగ్ వేగంతో TGIకి వ్యతిరేకంగా మేము pplx-api యొక్క గరిష్ట థ్రూపుట్‌ను పోల్చాము. మా ప్రయోగాలలో, pplx-api TGI కంటే 1.90x-6.75x వేగంగా టోకెన్‌లను ప్రాసెస్ చేస్తుంది మరియు 60 మరియు 80 టోకెన్‌లు/సెకను వద్ద మా కఠినమైన లాటెన్సీ నిబంధనలను సంతృప్తిపరచడంలో TGI పూర్తిగా విఫలమవుతుంది. మేము pplx-apiని మూల్యాంకనం చేయడానికి ఉపయోగించిన అదే హార్డ్‌వేర్ మరియు లోడ్ పరిస్థితులలో TGIని మూల్యాంకనం చేస్తాము. మేము వారి హార్డ్‌వేర్ మరియు లోడ్ కారకాలను నియంత్రించలేనందున Replicate మరియు Anyscaleతో ఈ కొలమానాన్ని పోల్చడం సాధ్యం కాదు.

సూచన కోసం, సగటు మానవ పఠన వేగం సెకనుకు 5 టోకెన్‌లు, అంటే pplx-api ఎవరైనా చదవగలిగే దానికంటే వేగవంతమైన రేటుతో అందించగలదు.

Perplexity Labs - ప్రతి GPUకి టోకెన్ థ్రూపుట్

pplx-api ఇన్‌ఫ్రాస్ట్రక్చర్ యొక్క అవలోకనం

ఈ లాటెన్సీ సంఖ్యలను సాధించడానికి అత్యాధునిక సాఫ్ట్‌వేర్ మరియు హార్డ్‌వేర్ కలయిక అవసరం.

NVIDIA A100 GPUల ద్వారా శక్తిని పొందే AWS p4d ఇన్‌స్టాన్స్‌లు అత్యుత్తమ క్లాక్ వేగంతో GPUలను స్కేల్ అవుట్ చేయడానికి అత్యంత తక్కువ ఖర్చుతో కూడిన మరియు నమ్మదగిన ఎంపికగా వేదికను సెట్ చేస్తాయి.

ఈ హార్డ్‌వేర్‌ను సద్వినియోగం చేసుకోవడానికి సాఫ్ట్‌వేర్ కోసం, మేము LLM ఇన్‌ఫరెన్స్‌ను వేగవంతం చేసే మరియు ఆప్టిమైజ్ చేసే ఓపెన్-సోర్స్ లైబ్రరీ అయిన NVIDIA యొక్క TensorRT-LLMని అమలు చేస్తాము. TensorRT-LLM టెన్సర్‌ఆర్టీ యొక్క డీప్ లెర్నింగ్ కంపైలర్‌ను రేప్ చేస్తుంది మరియు LLM మోడల్ ఎక్జిక్యూషన్ యొక్క సందర్భం మరియు జనరేషన్ దశల కోసం FlashAttention మరియు మాస్క్డ్ మల్టీ-హెడ్ అటెన్షన్ (MHA) యొక్క అత్యాధునిక అమలుల కోసం తయారు చేయబడిన తాజా ఆప్టిమైజ్ చేయబడిన కెర్నెల్‌లను కలిగి ఉంటుంది.

ఇక్కడి నుండి, AWS యొక్క బ్యాక్‌బోన్ మరియు Kubernetesతో దాని బలమైన ఏకీకరణ వందలాది GPUలను మించి సాగేటట్లు చేయడానికి మరియు పనికిరాని సమయాన్ని మరియు నెట్‌వర్క్ ఓవర్‌హెడ్‌ను తగ్గించడానికి మాకు అధికారం ఇస్తుంది.

ఉపయోగ సందర్భం: ఉత్పత్తిలో మా API

Perplexityలో pplx-api: ఖర్చు తగ్గింపు మరియు విశ్వసనీయత

మా API ఇప్పటికే Perplexity యొక్క ప్రధాన ఉత్పత్తి ఫీచర్‌లలో ఒకదానికి శక్తినిస్తోంది. బాహ్య API నుండి ఒకే ఫీచర్‌ను pplx-apiకి మార్చడం వల్ల సంవత్సరానికి $0.62M ఖర్చు ఆదా అయింది, ఇది దాదాపు 4x ఖర్చు తగ్గింపు. నాణ్యత క్షీణత లేదని నిర్ధారించడానికి మేము A/B పరీక్షలను నిర్వహించాము మరియు ఇన్‌ఫ్రాస్ట్రక్చర్ మెట్రిక్‌లను పర్యవేక్షించాము. 2 వారాల కోర్సులో, A/B పరీక్షలో గణాంకపరంగా గణనీయమైన తేడా ఏదీ కనిపించలేదు. అదనంగా, pplx-api రోజువారీ మిలియన్ కంటే ఎక్కువ అభ్యర్థనల లోడ్‌ను నిర్వహించగలదు, రోజువారీగా దాదాపు బిలియన్ ప్రాసెస్ చేయబడిన టోకెన్‌లను మొత్తం చేస్తుంది.

ఈ ప్రాథమిక అన్వేషణ ఫలితాలు చాలా ప్రోత్సాహకరంగా ఉన్నాయి, మరియు కాలక్రమేణా మా మరిన్ని ఉత్పత్తి ఫీచర్‌లకు pplx-api శక్తినిస్తుందని మేము ఆశిస్తున్నాము.

Perplexity లాబ్స్‌లో pplx-api: ఓపెన్ సోర్స్ ఇన్‌ఫరెన్స్ ఎకోసిస్టమ్

विవిధ ఓపెన్-సోర్స్ మోడల్‌లను అందించే మా మోడల్ ప్లేగ్రౌండ్ అయిన Perplexity Labsకి శక్తినివ్వడానికి మేము pplx-apiని కూడా ఉపయోగిస్తాము.

ప్రతి GPUకి అందించబడిన రోజువారీ సగటు టోకెన్

తాజా అత్యాధునిక ఓపెన్-సోర్సెడ్ LLMలకు యాక్సెస్‌ను అందించడానికి మా బృందం కట్టుబడి ఉంది. Mistral 7B, Code Llama 34b మరియు అన్ని Llama 2 మోడల్‌లు విడుదలైన కొద్ది గంటల్లోనే మేము వాటిని ఏకీకృతం చేసాము మరియు మరింత సామర్థ్యం గల మరియు ఓపెన్-సోర్స్ LLMలు అందుబాటులోకి వచ్చినప్పుడు అలా చేయాలని ప్లాన్ చేస్తున్నాము.

Perplexity యొక్క AI APIతో ప్రారంభించండి

మీరు HTTPS అభ్యర్థనలను ఉపయోగించి pplx-api REST APIని యాక్సెస్ చేయవచ్చు. pplx-apiలోకి ప్రామాణీకరించడం క్రింది దశలను కలిగి ఉంటుంది:

Perplexity ఖాతా సెట్టింగ్‌ల పేజీ ద్వారా API కీని రూపొందించండి. API కీ అనేది ఎక్కువ కాలం ఉండే యాక్సెస్ టోకెన్, దీన్ని మాన్యువల్‌గా రిఫ్రెష్ చేసే వరకు లేదా తొలగించే వరకు ఉపయోగించవచ్చు.

ప్రతి pplx-api అభ్యర్థనతో Authorization హెడర్‌లో బేరర్ టోకెన్‌గా API కీని పంపండి.

క్రింది ఉదాహరణలో, PERPLEXITY_API_KEY అనేది పై సూచనలను ఉపయోగించి రూపొందించப்பட்ட కీకి బంధించబడిన పర్యావరణ వేరియబుల్. చాట్ పూర్తి అభ్యర్థనను సమర్పించడానికి CURL ఉపయోగించబడుతుంది.

bash
curl -X POST \ --url https://perplexity.coolkeypoint.com/__p/api.perplexity.ai/chat/completions \ --header 'accept: application/json' \ --header 'content-type: application/json' \ --header "Authorization: Bearer ${PERPLEXITY_API_KEY}" \ --data '{ "model": "mistral-7b-instruct", "stream": false, "max_tokens": 1024, "frequency_penalty": 1, "temperature": 0.0, "messages": [ { "role": "system", "content": "Be precise and concise in your responses." }, { "role": "user", "content": "How many stars are there in our galaxy?" } ] }'

content-type: application/json కలిగి ఉన్న క్రింది ప్రతిస్పందనను ఇస్తుంది

json
{ "id": "3fbf9a47-ac23-446d-8c6b-d911e190a898", "model": "mistral-7b-instruct", "object": "chat.completion", "created": 1765322, "choices": [ { "index": 0, "finish_reason": "stop", "message": { "role": "assistant", "content": " The Milky Way galaxy contains an estimated 200-400 billion stars.." }, "delta": { "role": "assistant", "content": " The Milky Way galaxy contains an estimated 200-400 billion stars.." } } ], "usage": { "prompt_tokens": 40, "completion_tokens": 22, "total_tokens": 62 } }

ఇక్కడ పైథాన్ కాల్ ఉదాహరణ ఉంది:

python
from openai import OpenAI YOUR_API_KEY = "INSERT API KEY HERE" messages = [ { "role": "system", "content": ( "You are an artificial intelligence assistant and you need to " "engage in a helpful, detailed, polite conversation with a user." ), }, { "role": "user", "content": ( "Count to 100, with a comma between each number and no newlines. " "E.g., 1, 2, 3, ..." ), }, ] client = OpenAI(api_key=YOUR_API_KEY, base_url="https://perplexity.coolkeypoint.com/__p/api.perplexity.ai") # demo chat completion without streaming response = client.chat.completions.create( model="mistral-7b-instruct", messages=messages, ) print(response) # demo chat completion with streaming response_stream = client.chat.completions.create( model="mistral-7b-instruct", messages=messages, stream=True, ) for response in response_stream: print(response)

మేము ప్రస్తుతం Mistral 7B, Llama 13B, Code Llama 34B, Llama 70Bలకు మద్దతు ఇస్తున్నాము మరియు ఇప్పటికే ఉన్న అప్లికేషన్‌లతో సులభంగా ఏకీకరణ కోసం API సౌకర్యవంతంగా OpenAI క్లయింట్-అనుకూలంగా ఉంది.

మరిన్ని సమాచారం కోసం, దయచేసి మా API డాక్యుమెంటేషన్ మరియు త్వరిత ప్రారంభ గైడ్ని సందర్శించండి.

తదుపరి ఏమిటి

ఇతరులలో, సమీప భవిష్యత్తులో pplx-api వీటికి మద్దతు ఇస్తుంది:

కస్టమ్ Perplexity LLMలు మరియు ఇతర ఓపెన్-సోర్స్ LLMలు.

కస్టమ్ Perplexity ఎంబెడ్డింగ్‌లు మరియు ఓపెన్-సోర్స్ ఎంబెడ్డింగ్‌లు.

పబ్లిక్ బీటా ముగిసిన తర్వాత సాధారణ యాక్సెస్‌తో అంకితమైన API ధర నిర్మాణం.

వాస్తవాలు మరియు ఉల్లేఖనాల కోసం గ్రౌండింగ్‌తో Perplexity RAG-LLM API.

ఈ ఉపయోగ సందర్భాలలో ఏదైనా మీకు ఆసక్తి ఉంటే api@perplexity.aiని సంప్రదించండి.

ఇది మా Perplexity బ్లాగ్ పోస్ట్ సిరీస్ యొక్క ప్రారంభం కూడా. మా తదుపరి పోస్ట్‌లో, LLM ఇన్‌ఫరెన్స్ కోసం A100 vs H100 పనితీరు పోలికపై లోతుగా పరిశీలిస్తాము. వేచి ఉండండి!

మేము నియామకాలు చేస్తున్నాము! మీరు భారీ స్థాయిలో మోహరించిన ఉత్పత్తిపై పని చేయాలనుకుంటే మరియు మాతో ఆలోచనాత్మకంగా రూపొందించப்பட்ட, జాగ్రత్తగా ఆప్టిమైజ్ చేయబడిన జనరేటివ్ మరియు పెద్ద భాషా మోడల్ ఇన్‌ఫ్రాస్ట్రక్చర్‌ను నిర్మించాలనుకుంటే, దయచేసి మాతో చేరండి.

మరిన్ని చర్చల కోసం Twitter, LinkedInలో మమ్మల్ని అనుసరించండి మరియు మా Discordలో చేరండి.

రచయితలు:

Lauren Yang, Kevin Hu, Aarash Heydari, William Zhang, Dmitry Pervukhin, Grigorii Alekseev, Alexandr Yarats

డేటా గోప్యత

pplx-apiని ఎంచుకోవడం ద్వారా, మీ వినియోగదారులు మరియు కస్టమర్‌ల గోప్యత మరియు విశ్వాసాన్ని కాపాడుకుంటూ మీరు LLMల పూర్తి సామర్థ్యాన్ని ఉపయోగించుకోవచ్చు. మీ వ్యక్తిగత సమాచారాన్ని రక్షించడం యొక్క ప్రాముఖ్యత మాకు తెలుసు మరియు మా వినియోగదారుల భద్రత మరియు గోప్యతను నిర్వహించడానికి కట్టుబడి ఉన్నాము. API డేటా 30 రోజుల తర్వాత స్వయంచాలకంగా తొలగించబడుతుంది మరియు pplx-api ద్వారా ప్రసారం చేయబడిన ఏ డేటాపై మేము ఎప్పటికీ శిక్షణ ఇవ్వము. వినియోగదారులు తమ ఖాతా సెట్టింగ్‌లలో డేటా నిలుపుదల నుండి నిష్క్రమించే ఎంపికను కలిగి ఉంటారు. మా API గోప్యతా విధానాన్ని ఇక్కడ కనుగొనండి.