pplx-api-এর পরিচিতি

ওপেন-সোর্স LLM-এর জন্য Perplexity Lab-এর দ্রুত এবং দক্ষ API

Introducing pplx-api by Perplexity Labs

দয়া করে মনে রাখবেন: বর্তমান মডেলগুলির জন্য নীচের বিষয়গুলি বাদ দেওয়া হয়েছে। আমাদের API সম্পর্কে আরও জানুন

আমরা pplx-api ঘোষণা করতে পেরে আনন্দিত, যা Mistral 7B, Llama2 13B, Code Llama 34B, Llama2 70B, replit-code-v1.5-3b মডেলগুলি অ্যাক্সেস করার অন্যতম দ্রুত উপায় হিসেবে তৈরি করা হয়েছে। pplx-api ডেভেলপারদের জন্য অত্যাধুনিক ওপেন-সোর্স LLM-গুলিকে তাদের প্রজেক্টে ইন্টিগ্রেট করা সহজ করে তোলে।

আমাদের pplx-api যে সুবিধাগুলি প্রদান করে:

ব্যবহারের সহজতা: ডেভেলপাররা অফ-দ্য-শেল্ফ অত্যাধুনিক ওপেন-সোর্স মডেল ব্যবহার করতে পারেন এবং একটি পরিচিত REST API-এর মাধ্যমে কয়েক মিনিটের মধ্যে শুরু করতে পারেন।

অত্যন্ত দ্রুত ইনফারেন্স: আমাদের যত্ন সহকারে ডিজাইন করা ইনফারেন্স সিস্টেমটি দক্ষ এবং Replicate-এর তুলনায় 2.9 গুণ এবং Anyscale-এর তুলনায় 3.1 গুণ কম লেটেন্সি অর্জন করে।

বাস্তব পরীক্ষায় পরীক্ষিত ইনফ্রাস্ট্রাকচার: pplx-api নির্ভরযোগ্য প্রমাণিত হয়েছে, যা আমাদের Perplexity answer engine এবং আমাদের Labs playground উভয় ক্ষেত্রেই প্রোডাকশন-স্তরের ট্রাফিক পরিবেশন করে।

ওপেন-সোর্স LLM-এর জন্য ওয়ান-স্টপ শপ: আমাদের টিম নতুন ওপেন-সোর্স মডেলগুলি আসার সাথে সাথে সেগুলি যোগ করতে প্রতিশ্রুতিবদ্ধ। উদাহরণস্বরূপ, আমরা প্রি-রিলিজ অ্যাক্সেস ছাড়া লঞ্চের মাত্র কয়েক ঘন্টার মধ্যে Llama এবং Mistral মডেল যোগ করেছি।

pplx-api বর্তমানে পাবলিক বিটাতে রয়েছে এবং Perplexity Pro সাবস্ক্রিপশন রয়েছে এমন ব্যবহারকারীদের জন্য এটি বিনামূল্যে উপলব্ধ।

সাপ্তাহিক ছুটির দিনে কোনো ক্যাজুয়াল হ্যাকাথনের জন্য কিংবা নতুন এবং উদ্ভাবনী পণ্য তৈরি করার একটি বাণিজ্যিক সমাধান হিসেবে pplx-api ব্যবহার করুন। আমরা এই রিলিজের মাধ্যমে জানতে আশা করি যে লোকেরা কীভাবে আমাদের API দিয়ে চমৎকার এবং উদ্ভাবনী পণ্য তৈরি করতে পারে। pplx-api-এর জন্য আপনার যদি কোনো ব্যবসায়িক ব্যবহারের ক্ষেত্র থাকে, তবে অনুগ্রহ করে api@perplexity.ai-এ যোগাযোগ করুন। আমরা আপনার কাছ থেকে শুনতে উন্মুখ হয়ে আছি!

pplx-api-এর সুবিধা

ব্যবহারের সহজতা

মডেল পরিবেশনকে কার্যক্ষম এবং ব্যয় সাশ্রয়ী করে তুলতে LLM ডিপ্লয়মেন্ট এবং ইনফারেন্সের জন্য উল্লেখযোগ্য ইনফ্রাস্ট্রাকচার সংক্রান্ত কাজের প্রয়োজন হয়। ডেভেলপাররা C++/CUDA সম্পর্কে গভীর জ্ঞান বা GPU-তে অ্যাক্সেস ছাড়াই, অত্যাধুনিক পারফরম্যান্স উপভোগ করার পাশাপাশি আমাদের API সরাসরি ব্যবহার করতে পারেন। আমাদের LLM ইনফারেন্স আপনার নিজস্ব হার্ডওয়্যার পরিচালনার জটিলতা এবং প্রয়োজনীয়তাও দূর করে, যা আপনার ব্যবহারের সহজতাকে আরও বাড়িয়ে তোলে।


অত্যন্ত দ্রুত ইনফারেন্স

Perplexity-এর LLM API দ্রুত ইনফারেন্সের জন্য যত্ন সহকারে ডিজাইন এবং অপ্টিমাইজ করা হয়েছে। এটি অর্জন করার জন্য, আমরা AWS দ্বারা প্রদত্ত A100 GPU-তে চালিত NVIDIA-এর TensortRT-LLM-এর আশেপাশে একটি মালিকানাধীন LLM ইনফ্রাস্ট্রাকচার তৈরি করেছি। Overview of pplx-api Infrastructure বিভাগে আরও জানুন। ফলস্বরূপ, pplx-api বাণিজ্যিকভাবে উপলব্ধ সবচেয়ে দ্রুততম Llama এবং Mistral API-গুলির মধ্যে একটি।

বিদ্যমান সমাধানগুলির সাথে বেঞ্চমার্ক করার জন্য, আমরা অন্যান্য LLM ইনফারেন্স লাইব্রেরিগুলির সাথে pplx-api-এর লেটেন্সির তুলনা করেছি। আমাদের পরীক্ষায়, Text Generation Inference (TGI)-এর তুলনায় pplx-api সামগ্রিক লেটেন্সিতে 2.92x পর্যন্ত দ্রুত এবং প্রাথমিক রেসপন্স লেটেন্সিতে 4.35x পর্যন্ত দ্রুত। এই পরীক্ষার জন্য, আমরা উভয় GPU জুড়ে শার্ড করা একটি Llama-2-13-chat মডেল ব্যবহার করে 2টি A100 GPU-তে একক-স্ট্রিম এবং সার্ভার পরিস্থিতির জন্য TGI এবং Perplexity-এর ইনফারেন্সের তুলনা করেছি। একক-স্ট্রিম পরিস্থিতির জন্য, সার্ভারটি একের পর এক অনুরোধ প্রক্রিয়া করে। সার্ভার পরিস্থিতিতে, ক্লায়েন্ট পরিবর্তিত লোড অনুকরণ করার জন্য বিভিন্ন অনুরোধ হারের সাথে পোয়াসোঁ বিতরণ (Poisson distribution) অনুসারে অনুরোধ পাঠায়। অনুরোধের হারের জন্য, আমরা TGI দ্বারা সমর্থিত সর্বোচ্চ থ্রুপুট, প্রতি সেকেন্ডে সর্বোচ্চ 1টি অনুরোধ পর্যন্ত একটি ছোট সুইপ করি। প্রোডাকশন আচরণের অনুকরণ করতে আমরা বিভিন্ন ইনপুট এবং আউটপুট টোকেন দৈর্ঘ্যের বাস্তব জীবনের ডেটা ব্যবহার করেছি। অনুরোধগুলিতে গড়ে প্রায় ~700টি ইনপুট টোকেন এবং ~550টি আউটপুট টোকেন রয়েছে।

একই ইনপুট ব্যবহার করে এবং অনুরোধের একটি একক স্ট্রিম পাঠিয়ে, আমরা অন্যান্য বিদ্যমান API-গুলির বিরুদ্ধে পারফরম্যান্স বেঞ্চমার্ক সংগ্রহ করার জন্য একই মডেলের জন্য Replicate এবং Anyscale-এর API-গুলির গড় লেটেন্সিও পরিমাপ করেছি।

Perplexity Labs - প্রথম টোকেন লেটেন্সি
Perplexity Labs - ডিকোডিং গতি

একই পরীক্ষামূলক সেটআপ ব্যবহার করে, আমরা লেটেন্সি সীমাবদ্ধতা হিসেবে ডিকোডিং গতির সাথে TGI-এর বিপরীতে pplx-api-এর সর্বোচ্চ থ্রুপুটের তুলনা করেছি। আমাদের পরীক্ষায়, pplx-api TGI-এর তুলনায় 1.90x-6.75x দ্রুত টোকেন প্রক্রিয়া করে, এবং TGI 60 এবং 80 টোকেন/সেকেন্ডে আমাদের কঠোর লেটেন্সি সীমাবদ্ধতাগুলি পূরণ করতে সম্পূর্ণভাবে ব্যর্থ হয়। আমরা যে হার্ডওয়্যার এবং লোড শর্তে pplx-api মূল্যায়ন করেছি, ঠিক একই শর্তে TGI মূল্যায়ন করি। Replicate এবং Anyscale-এর সাথে এই মেট্রিকের তুলনা করা সম্ভব নয় কারণ আমরা তাদের হার্ডওয়্যার এবং লোড ফ্যাক্টরগুলি নিয়ন্ত্রণ করতে পারি না।

রেফারেন্সের জন্য, একজন মানুষের পড়ার গড় গতি প্রতি সেকেন্ডে 5 টোকেন, যার অর্থ pplx-api একজন মানুষের পড়ার গতির চেয়ে দ্রুত হারে পরিবেশন করতে সক্ষম।

Perplexity Labs - প্রতি GPU টোকেন থ্রুপুট

pplx-api ইনফ্রাস্ট্রাকচারের ওভারভিউ

এই লেটেন্সি নম্বরগুলি অর্জনের জন্য অত্যাধুনিক সফটওয়্যার এবং হার্ডওয়্যারের সমন্বয় প্রয়োজন।

NVIDIA A100 GPU দ্বারা চালিত AWS p4d ইনস্ট্যান্স সেরা মানের ক্লক স্পিড সহ GPU স্কেল আউট করার জন্য সবচেয়ে ব্যয় সাশ্রয়ী এবং নির্ভরযোগ্য বিকল্প হিসেবে মঞ্চ তৈরি করে।

এই হার্ডওয়্যারের সুবিধা নেওয়ার জন্য সফটওয়্যারের ক্ষেত্রে, আমরা NVIDIA-এর TensorRT-LLM চালাই, যা একটি ওপেন-সোর্স লাইব্রেরি যা LLM ইনফারেন্সকে ত্বরান্বিত এবং অপ্টিমাইজ করে। TensorRT-LLM, TensorRT-এর ডিপ লার্নিং কম্পাইলারকে র‍্যাপ করে এবং LLM মডেল এক্সিকিউশনের কনটেক্সট এবং জেনারেশন ধাপগুলির জন্য FlashAttention এবং মাস্কড মাল্টি-হেড অ্যাটেনশন (MHA)-এর অত্যাধুনিক বাস্তবায়নের জন্য তৈরি সর্বশেষ অপ্টিমাইজড কার্নেলগুলি অন্তর্ভুক্ত করে।

এখান থেকে, AWS-এর ব্যাকবোন এবং Kubernetes-এর সাথে এর শক্তিশালী ইন্টিগ্রেশন আমাদের শত শত GPU-এর বাইরেও ইলাস্টিক্যালি স্কেল করার এবং ডাউনটাইম ও নেটওয়ার্ক ওভারহেড কমাতে সক্ষম করে।

ব্যবহারের ক্ষেত্র: প্রোডাকশনে আমাদের API

Perplexity-এ pplx-api: খরচ কমানো এবং নির্ভরযোগ্যতা

আমাদের API ইতিমধ্যে Perplexity-এর অন্যতম প্রধান পণ্যের বৈশিষ্ট্য পরিচালনা করছে। শুধুমাত্র একটি বাহ্যিক API থেকে একটি একক বৈশিষ্ট্য pplx-api-এ পরিবর্তন করার ফলে প্রতি বছর $0.62M খরচ সাশ্রয় হয়েছে, যা খরচে প্রায় 4x হ্রাস। কোনো মানের অবনতি ঘটছে না তা নিশ্চিত করতে আমরা A/B পরীক্ষা চালিয়েছি এবং ইনফ্রাস্ট্রাকচার মেট্রিকস মনিটর করেছি। 2 সপ্তাহ ধরে, আমরা A/B পরীক্ষায় পরিসংখ্যানগতভাবে কোনো উল্লেখযোগ্য পার্থক্য লক্ষ্য করিনি। উপরন্তু, pplx-api প্রতিদিন এক মিলিয়নেরও বেশি অনুরোধের দৈনিক লোড বজায় রাখতে পারে, যা প্রতিদিন মোট প্রায় এক বিলিয়ন প্রক্রিয়াজাত টোকেন।

এই প্রাথমিক অনুসন্ধানের ফলাফলগুলি অত্যন্ত উৎসাহব্যঞ্জক, এবং আমরা সময়ের সাথে সাথে আমাদের আরও পণ্য বৈশিষ্ট্যগুলিকে শক্তিশালী করতে pplx-api আশা করছি।

Perplexity Labs-এ pplx-api: ওপেন সোর্স ইনফারেন্স ইকোসিস্টেম

বিভিন্ন ওপেন-সোর্স মডেল পরিবেশনকারী আমাদের মডেল প্লেগ্রাউন্ড Perplexity Labs-কে শক্তিশালী করতে আমরা pplx-api ব্যবহার করি।

প্রতিদিনের গড়ে পরিবেশিত টোকেন

আমাদের টিম সর্বশেষ অত্যাধুনিক ওপেন-সোর্স LLM-গুলিতে অ্যাক্সেস প্রদান করতে প্রতিজ্ঞাবদ্ধ। আমরা প্রকাশ হওয়ার মাত্র কয়েক ঘণ্টার মধ্যে Mistral 7B, Code Llama 34b এবং সমস্ত Llama 2 মডেল ইন্টিগ্রেট করেছি, এবং আরও শক্তিশালী এবং ওপেন-সোর্স LLM উপলব্ধ হওয়ার সাথে সাথে এটি করার পরিকল্পনা করছি।

Perplexity-এর AI API দিয়ে শুরু করুন

আপনি HTTPS অনুরোধ ব্যবহার করে pplx-api REST API অ্যাক্সেস করতে পারেন। pplx-api-তে প্রমাণীকরণের মধ্যে রয়েছে নিম্নলিখিত ধাপগুলি:

Perplexity Account Settings Page-এর মাধ্যমে একটি API কি জেনারেট করুন। API কি হল একটি দীর্ঘস্থায়ী অ্যাক্সেস টোকেন যা ম্যানুয়ালি রিফ্রেশ বা ডিলিট না করা পর্যন্ত ব্যবহার করা যেতে পারে।

প্রতিটি pplx-api অনুরোধের সাথে Authorization হেডারে একটি বিয়ারার টোকেন হিসেবে API কি পাঠান।

নিম্নলিখিত উদাহরণে, PERPLEXITY_API_KEY হল একটি পরিবেশগত পরিবর্তনশীল (environment variable) যা উপরের নির্দেশাবলী ব্যবহার করে জেনারেট করা একটি কির সাথে আবদ্ধ। একটি চ্যাট সম্পূর্ণ করার অনুরোধ জমা দিতে CURL ব্যবহার করা হয়।

bash
curl -X POST \ --url https://perplexity.coolkeypoint.com/__p/api.perplexity.ai/chat/completions \ --header 'accept: application/json' \ --header 'content-type: application/json' \ --header "Authorization: Bearer ${PERPLEXITY_API_KEY}" \ --data '{ "model": "mistral-7b-instruct", "stream": false, "max_tokens": 1024, "frequency_penalty": 1, "temperature": 0.0, "messages": [ { "role": "system", "content": "Be precise and concise in your responses." }, { "role": "user", "content": "How many stars are there in our galaxy?" } ] }'

যা নিম্নলিখিত প্রতিক্রিয়া প্রদান করে, যাতে রয়েছে content-type: application/json

json
{ "id": "3fbf9a47-ac23-446d-8c6b-d911e190a898", "model": "mistral-7b-instruct", "object": "chat.completion", "created": 1765322, "choices": [ { "index": 0, "finish_reason": "stop", "message": { "role": "assistant", "content": " The Milky Way galaxy contains an estimated 200-400 billion stars.." }, "delta": { "role": "assistant", "content": " The Milky Way galaxy contains an estimated 200-400 billion stars.." } } ], "usage": { "prompt_tokens": 40, "completion_tokens": 22, "total_tokens": 62 } }

এখানে Python কল করার একটি উদাহরণ দেওয়া হলো:

python
from openai import OpenAI YOUR_API_KEY = "INSERT API KEY HERE" messages = [ { "role": "system", "content": ( "You are an artificial intelligence assistant and you need to " "engage in a helpful, detailed, polite conversation with a user." ), }, { "role": "user", "content": ( "Count to 100, with a comma between each number and no newlines. " "E.g., 1, 2, 3, ..." ), }, ] client = OpenAI(api_key=YOUR_API_KEY, base_url="https://perplexity.coolkeypoint.com/__p/api.perplexity.ai") # demo chat completion without streaming response = client.chat.completions.create( model="mistral-7b-instruct", messages=messages, ) print(response) # demo chat completion with streaming response_stream = client.chat.completions.create( model="mistral-7b-instruct", messages=messages, stream=True, ) for response in response_stream: print(response)

আমরা বর্তমানে Mistral 7B, Llama 13B, Code Llama 34B, Llama 70B সমর্থন করি, এবং বিদ্যমান অ্যাপ্লিকেশনগুলির সাথে সহজে ইন্টিগ্রেশনের জন্য APIটি সুবিধাজনকভাবে OpenAI ক্লায়েন্ট-সামঞ্জস্যপূর্ণ।

আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের API ডকুমেন্টেশন এবং কুইকস্টার্ট গাইড দেখুন।

এর পরে কী

অদূর ভবিষ্যতে, pplx-api যেগুলি সমর্থন করবে:

কাস্টম Perplexity LLM এবং অন্যান্য ওপেন-সোর্স LLM।

কাস্টম Perplexity এমবেডিং এবং ওপেন-সোর্স এমবেডিং।

পাবলিক বিটা পর্যায় শেষ হওয়ার পর সাধারণ অ্যাক্সেস সহ ডেডিকেটেড API মূল্যের কাঠামো।

তথ্য এবং সাইটেশনের জন্য গ্রাউন্ডিং সহ Perplexity RAG-LLM API।

এই ব্যবহারের ক্ষেত্রগুলির কোনোটির প্রতি আপনার আগ্রহ থাকলে api@perplexity.ai-এ যোগাযোগ করুন।

এটি আমাদের Perplexity Blog পোস্ট সিরিজেরও শুরু। আমাদের পরবর্তী পোস্টে, আমরা LLM ইনফারেন্সের জন্য A100 বনাম H100 পারফরম্যান্স তুলনার একটি গভীর বিশ্লেষণ শেয়ার করব। সাথে থাকুন!

আমরা লোক নিয়োগ করছি! আপনি যদি বিশাল পরিসরে ডিপ্লয় করা কোনো পণ্যে কাজ করতে চান এবং আমাদের সাথে চিন্তাভাবনা করে ডিজাইন করা, যত্ন সহকারে অপ্টিমাইজ করা জেনারেটিভ এবং লার্জ ল্যাঙ্গুয়েজ মডেল ইনফ্রাস্ট্রাকচার তৈরি করতে চান, তবে অনুগ্রহ করে আমাদের সাথে যোগ দিন

আরও আলোচনার জন্য Twitter, LinkedIn-এ আমাদের ফলো করুন এবং আমাদের Discord-এ যোগ দিন।

লেখকবৃন্দ:

Lauren Yang, Kevin Hu, Aarash Heydari, William Zhang, Dmitry Pervukhin, Grigorii Alekseev, Alexandr Yarats

ডেটা প্রাইভেসি

pplx-api বেছে নেওয়ার মাধ্যমে, আপনি আপনার ব্যবহারকারী এবং গ্রাহকদের গোপনীয়তা এবং বিশ্বাস রক্ষা করার পাশাপাশি LLM-গুলির সম্পূর্ণ সম্ভাবনা কাজে লাগাতে পারেন। আমরা আপনার ব্যক্তিগত তথ্য সুরক্ষার গুরুত্ব বুঝি এবং আমাদের ব্যবহারকারীদের নিরাপত্তা ও গোপনীয়তা বজায় রাখতে প্রতিশ্রুতিবদ্ধ। API ডেটা 30 দিন পর স্বয়ংক্রিয়ভাবে মুছে ফেলা হয়, এবং pplx-api-এর মাধ্যমে প্রেরित কোনো ডেটার উপর আমরা কখনই প্রশিক্ষণ দিই না। ব্যবহারকারীদের তাদের অ্যাকাউন্ট সেটিংসে ডেটা রিটেনশন থেকে অপ্ট আউট করার বিকল্প রয়েছে। আমাদের API প্রাইভেসি পলিসি এখানে দেখুন।