pplx-api ಪರಿಚಯಿಸಲಾಗುತ್ತಿದೆ
ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳಿಗಾಗಿ Perplexity Lab ನ ವೇಗದ ಮತ್ತು ಸಮರ್ಥ API

ದಯವಿಟ್ಟು ಗಮನಿಸಿ: ಪ್ರಸ್ತುತ ಮಾದರಿಗಳಿಗೆ ಕೆಳಗಿನವುಗಳನ್ನು ಸ್ಥಗಿತಗೊಳಿಸಲಾಗಿದೆ. ನಮ್ಮ APIಗಳ ಕುರಿತು ಇನ್ನಷ್ಟು ತಿಳಿಯಿರಿ
Mistral 7B, Llama2 13B, Code Llama 34B, Llama2 70B, replit-code-v1.5-3b ಮಾದರಿಗಳನ್ನು ಪ್ರವೇಶಿಸಲು ಅತ್ಯಂತ ವೇಗವಾದ ಮಾರ್ಗಗಳಲ್ಲಿ ಒಂದಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ pplx-api ಅನ್ನು ಘೋಷಿಸಲು ನಮಗೆ χαρά (ಉತ್ಸಾಹ) ಇದೆ. ಡೆವಲಪರ್ಗಳಿಗೆ ಅತ್ಯಾಧುನಿಕ ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳನ್ನು ತಮ್ಮ ಯೋಜನೆಗಳಲ್ಲಿ ಸಂಯೋಜಿಸುವುದನ್ನು pplx-api ಸುಲಭಗೊಳಿಸುತ್ತದೆ.
ನಮ್ಮ pplx-api ಒದಗಿಸುತ್ತದೆ:
ಬಳಕೆಯ ಸುಲಭತೆ: ಡೆವಲಪರ್ಗಳು ಅತ್ಯಾಧುನಿಕ ಓಪನ್-ಸೋರ್ಸ್ ಮಾದರಿಗಳನ್ನು ಆಫ್-ದಿ-ಶೆಲ್ಫ್ ಬಳಸಬಹುದು ಮತ್ತು ಪರಿಚಿತ REST API ನೊಂದಿಗೆ ನಿಮಿಷಗಳಲ್ಲಿ ಪ್ರಾರಂಭಿಸಬಹುದು.
ಅತ್ಯಂತ ವೇಗದ ಇನ್ಫೆರೆನ್ಸ್: ನಮ್ಮ ಚಿಂತನಶೀಲವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ ಇನ್ಫೆರೆನ್ಸ್ ಸಿಸ್ಟಮ್ ಸಮರ್ಥವಾಗಿದೆ ಮತ್ತು Replicate ಗಿಂತ 2.9x ವರೆಗೆ ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಮತ್ತು Anyscale ಗಿಂತ 3.1x ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ.
ಯುದ್ಧ-ಪರೀಕ್ಷಿತ ಮೂಲಸೌಕರ್ಯ: ನಮ್ಮ Perplexity ಉತ್ತರ ಎಂಜಿನ್ ಮತ್ತು ನಮ್ಮ Labs ಪ್ಲೇಗ್ರೌಂಡ್ ಎರಡರಲ್ಲೂ ಉತ್ಪಾದನಾ ಮಟ್ಟದ ದಟ್ಟಣೆಯನ್ನು ಸೇವೆ ಮಾಡುವ ಮೂಲಕ pplx-api ವಿಶ್ವಾಸಾರ್ಹವೆಂದು ಸಾ증ೀತಾಗಿದೆ.
ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳಿಗಾಗಿ ಏಕ-ನಿಲುಗಡೆ ಅಂಗಡಿ: ಹೊಸ ಓಪನ್-ಸೋರ್ಸ್ ಮಾದರಿಗಳು ಬಂದಾಗ ಅವುಗಳನ್ನು ಸೇರಿಸಲು ನಮ್ಮ ತಂಡವು ಸಮರ್ಪಿತವಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ಪೂರ್ವ-ಬಿಡುಗಡೆ ಪ್ರವೇಶವಿಲ್ಲದೆ ಲಾಂಚ್ ಮಾಡಿದ ಕೆಲವೇ ಗಂಟೆಗಳಲ್ಲಿ ನಾವು Llama ಮತ್ತು Mistral ಮಾದರಿಗಳನ್ನು ಸೇರಿಸಿದ್ದೇವೆ.
pplx-api ಸಾರ್ವಜನಿಕ ಬೀಟಾದಲ್ಲಿದೆ ಮತ್ತು Perplexity Pro ಚಂದಾದಾರಿಕೆಯನ್ನು ಹೊಂದಿರುವ ಬಳಕೆದಾರರಿಗೆ ಉಚಿತವಾಗಿದೆ.
ಸಾಮಾನ್ಯ ವೀಕೆಂಡ್ ಹ್ಯಾಕಥಾನ್ಗಾಗಿ ಅಥವಾ ಹೊಸ ಮತ್ತು ನವೀನ ಉತ್ಪನ್ನಗಳನ್ನು ನಿರ್ಮಿಸಲು ವಾಣಿಜ್ಯ ಪರಿಹಾರವಾಗಿ pplx-api ಬಳಸಿ. ಈ ಬಿಡುಗಡೆಯ ಮೂಲಕ ಜನರು ನಮ್ಮ API ನೊಂದಿಗೆ ತಂಪಾದ ಮತ್ತು ನವೀನ ಉತ್ಪನ್ನಗಳನ್ನು ಹೇಗೆ ನಿರ್ಮಿಸಬಹುದು ಎಂಬುದನ್ನು ಕಲಿಯಲು ನಾವು hoping (ಆಶಿಸುತ್ತೇವೆ). ನೀವು pplx-api ಗಾಗಿ ವ್ಯಾಪಾರ ಬಳಕೆಯ ಪ್ರಕರಣವನ್ನು ಹೊಂದಿದ್ದರೆ ದಯವಿಟ್ಟು api@perplexity.ai ಅನ್ನು ಸಂಪರ್ಕಿಸಿ. ನಿಮ್ಮಿಂದ ಕೇಳಲು ನಾವು ಇಷ್ಟಪಡುತ್ತೇವೆ!
pplx-api ನ ಪ್ರಯೋಜನಗಳು
ಬಳಕೆಯ ಸುಲಭತೆ
ಮಾದರಿ ಸೇವೆಯನ್ನು ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಮಾಡಲು LLM ನಿಯೋಜನೆ ಮತ್ತು ಇನ್ಫೆರೆನ್ಸ್ಗೆ ಗಮನಾರ್ಹ ಮೂಲಸೌಕರ್ಯ ಪ್ರಯತ್ನದ ಅಗತ್ಯವಿರುತ್ತದೆ. ಡೆವಲಪರ್ಗಳು C++/CUDA ನ ಆಳವಾದಜ್ಞಾನವಿಲ್ಲದೆ ಅಥವಾ GPUಗಳಿಗೆ ಪ್ರವೇಶವಿಲ್ಲದೆ ನಮ್ಮ API ಅನ್ನು ಔಟ್-ಆಫ್-ದಿ-ಬಾಕ್ಸ್ ಬಳಸಬಹುದು, ಅದೇ ಸಮಯದಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಆನಂದಿಸಬಹುದು. ನಮ್ಮ LLM ಇನ್ಫೆರೆನ್ಸ್ ನಿಮ್ಮ ಸ್ವಂತ ಹಾರ್ಡ್ವೇರ್ ಅನ್ನು ನಿರ್ವಹಿಸುವ ಸಂಕೀರ್ಣತೆ ಮತ್ತು ಅಗತ್ಯತೆಯನ್ನು ಅಮೂರ್ತಗೊಳಿಸುತ್ತದೆ, ಇದು ನಿಮ್ಮ ಬಳಕೆಯ ಸುಲಭತೆಗೆ ಮತ್ತಷ್ಟು ಸೇರಿಸುತ್ತದೆ.
ಅತ್ಯಂತ ವೇಗದ ಇನ್ಫೆರೆನ್ಸ್
Perplexity ನ LLM API ಅನ್ನು ವೇಗದ ಇನ್ಫೆರೆನ್ಸ್ಗಾಗಿ ಎಚ್ಚರಿಕೆಯಿಂದ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ ಮತ್ತು ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲಾಗಿದೆ. ಇದನ್ನು ಸಾಧಿಸಲು, AWS ಒದಗಿಸಿದ A100 GPUಗಳಲ್ಲಿ ಸೇವೆ ಸಲ್ಲಿಸುವ NVIDIA ರ TensorRT-LLM ಸುತ್ತಲೂ ನಾವು ಸ್ವಾಮ್ಯದ LLM ಇನ್ಫೆರೆನ್ಸ್ ಮೂಲಸೌಕರ್ಯವನ್ನು ನಿರ್ಮಿಸಿದ್ದೇವೆ. Overview of pplx-api Infrastructure ವಿಭಾಗದಲ್ಲಿ ಇನ್ನಷ್ಟು ತಿಳಿಯಿರಿ. ಇದರ ಪರಿಣಾಮವಾಗಿ, pplx-api ವಾಣಿಜ್ಯಿಕವಾಗಿ ಲಭ್ಯವಿರುವ ವೇಗವಾದ Llama ಮತ್ತು Mistral APIಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ.
ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪರಿಹಾರಗಳ ವಿರುದ್ಧ ಬೆಂಚ್ಮಾರ್ಕ್ ಮಾಡಲು, ನಾವು pplx-api ನ ಸುಪ್ತತೆಯನ್ನು ಇತರ LLM ಇನ್ಫೆರೆನ್ಸ್ ಲೈಬ್ರರಿಗಳೊಂದಿಗೆ ಹೋಲಿಸಿದ್ದೇವೆ. ನಮ್ಮ ಪ್ರಯೋಗಗಳಲ್ಲಿ, Text Generation Inference (TGI) ಗೆ ಹೋಲಿಸಿದರೆ pplx-api ಒಟ್ಟಾರೆ ಸುಪ್ತತೆಯಲ್ಲಿ 2.92x ವರೆಗೆ ವೇಗವಾಗಿರುತ್ತದೆ ಮತ್ತು ಆರಂಭಿಕ ಪ್ರತಿಕ್ರಿಯೆ ಸುಪ್ತತೆಯಲ್ಲಿ 4.35x ವರೆಗೆ ವೇಗವಾಗಿರುತ್ತದೆ. ಈ ಪ್ರಯೋಗಕ್ಕಾಗಿ, ಎರಡೂ GPUಗಳಲ್ಲಿ ಶಾರ್ಡ್ ಮಾಡಲಾದ Llama-2-13B-chat ಮಾದರಿಯನ್ನು ಬಳಸಿ 2 A100 GPUಗಳಲ್ಲಿ ಸಿಂಗಲ್-ಸ್ಟ್ರೀಮ್ ಮತ್ತು ಸರ್ವರ್ ಸನ್ನಿವೇಶಗಳಿಗಾಗಿ ನಾವು TGI ಮತ್ತು Perplexity ನ ಇನ್ಫೆರೆನ್ಸ್ ಅನ್ನು ಹೋಲಿಸಿದ್ದೇವೆ. ಸಿಂಗಲ್-ಸ್ಟ್ರೀಮ್ ಸನ್ನಿವೇಶಕ್ಕಾಗಿ, ಸರ್ವರ್ ಒಂದು ವಿನಂತಿಯ ನಂತರ ಮತ್ತೊಂದು ವಿನಂತಿಯನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ. ಸರ್ವರ್ ಸನ್ನಿವೇಶದಲ್ಲಿ, ಕ್ಲೈಂಟ್ ಬದಲಾಗುತ್ತಿರುವ ಲೋಡ್ ಅನ್ನು ಅನುಕರಿಸಲು ಬದಲಾಗುತ್ತಿರುವ ವಿನಂತಿ ದರಗಳೊಂದಿಗೆ ಪಾಯ್ಸನ್ ವಿತರಣೆಗೆ ಅನುಗುಣವಾಗಿ ವಿನಂತಿಗಳನ್ನು ಕಳುಹಿಸುತ್ತದೆ. ವಿನಂತಿ ದರಕ್ಕಾಗಿ, ನಾವು TGI ಯಿಂದ ಬೆಂಬಲಿತವಾದ ಗರಿಷ್ಠ ಥ್ರೋಪುಟ್ ಆದ ಗರಿಷ್ಠ 1 ವಿನಂತಿ / ಸೆಕೆಂಡ್ವರೆಗೆ ಸಣ್ಣ ಸ್ವೀಪ್ ಅನ್ನು ನಿರ್ವಹಿಸುತ್ತೇವೆ. ಉತ್ಪಾದನಾ ನಡವಳಿಕೆಯನ್ನು ಅನುಕರಿಸಲು ನಾವು ವಿವಿಧ ಇನ್ಪುಟ್ ಮತ್ತು ಔಟ್ಪುಟ್ ಟೋಕನ್ ಉದ್ದಗಳೊಂದಿಗೆ ನೈಜ-ಪ್ರಪಂಚದ ಡೇಟಾವನ್ನು ಬಳಸಿದ್ದೇವೆ. ವಿನಂತಿಗಳು ಸರಾಸರಿ ~700 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳು ಮತ್ತು ~550 ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಹೊಂದಿವೆ.
ಒೇ ರೀತಿಯ ಇನ್ಪುಟ್ಗಳನ್ನು ಬಳಸಿ ಮತ್ತು ಒಂದೇ ಸ್ಟ್ರೀಮ್ ವಿನಂತಿಗಳನ್ನು ಕಳುಹಿಸುವ ಮೂಲಕ, ಇತರ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ APIಗಳ ವಿರುದ್ಧ ಕಾರ್ಯಕ್ಷಮತೆಯ ಆಧಾರ ರೇಖೆಯನ್ನು ಸಂಗ್ರಹಿಸಲು ನಾವು ಈ ಅದೇ ಮಾದರಿಗಾಗಿ Replicate ಮತ್ತು Anyscale ನ APIಗಳ ಸರಾಸರಿ ಸುಪ್ತತೆಯನ್ನು ಸಹ ಅಳೆದಿದ್ದೇವೆ.


ಅದೇ ಪ್ರಾಯೋಗಿಕ ಸೆಟಪ್ ಬಳಸಿ, ಸುಪ್ತತೆConstraint ಆಗಿ ಡಿಕೋಡಿಂಗ್ ವೇಗದೊಂದಿಗೆ, TGI ವಿರುದ್ಧ pplx-api ನ ಗರಿಷ್ಠ ಥ್ರೋಪುಟ್ ಅನ್ನು ನಾವು ಹೋಲಿಸಿದ್ದೇವೆ. ನಮ್ಮ ಪ್ರಯೋಗಗಳಲ್ಲಿ, pplx-api ಟೋಕನ್ಗಳನ್ನು TGI ಗಿಂತ 1.90x-6.75x ವೇಗವಾಗಿ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುತ್ತದೆ, ಮತ್ತು TGI 60 ಮತ್ತು 80 ಟೋಕನ್ಗಳು/ಸೆಕೆಂಡ್ನಲ್ಲಿ ನಮ್ಮ ಕಟ್ಟುನಿಟ್ಟಾದ ಸುಪ್ತತೆ ನಿರ್ಬಂಧಗಳನ್ನು ಪೂರೈಸುವಲ್ಲಿ ಸಂಪೂರ್ಣವಾಗಿ ವಿಫಲಗೊಳ್ಳುತ್ತದೆ. pplx-api ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ನಾವು ಬಳಸಿದ ಅದೇ ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು ಲೋಡ್ ಪರಿಸ್ಥಿತಿಗಳಲ್ಲಿ ನಾವು TGI ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತೇವೆ. Replicate ಮತ್ತು Anyscale ನೊಂದಿಗೆ ಈ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಹೋಲಿಸುವುದು ಸಾಧ್ಯವಿಲ್ಲ ಏಕೆಂದರೆ ನಾವು ಅವರ ಹಾರ್ಡ್ವೇರ್ ಮತ್ತು ಲೋಡ್ ಅಂಶಗಳನ್ನು ನಿಯಂತ್ರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.
ಉಲ್ಲೇಖಕ್ಕಾಗಿ, ಸರಾಸರಿ ಮಾನವ ಓದುವ ವೇಗವು 5 ಟೋಕನ್ಗಳು/ಸೆಕೆಂಡುಗಳು, ಅಂದರೆ pplx-api ಒಬ್ಬರು ಓದುವುದಕ್ಕಿಂತ ವೇಗವಾದ ದರದಲ್ಲಿ ಸೇವೆ ಸಲ್ಲಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.

pplx-api ಮೂಲಸೌಕರ್ಯದ ಅವಲೋಕನ
ಈ ಸುಪ್ತತೆ ಸಂಖ್ಯೆಗಳನ್ನು ಸಾಧಿಸಲು ಅತ್ಯಾಧುನಿಕ ಸಾಫ್ಟ್ವೇರ್ ಮತ್ತು ಹಾರ್ಡ್ವೇರ್ನ ಸಂಯೋಜನೆಯ ಅಗತ್ಯವಿದೆ.
NVIDIA A100 GPUಗಳಿಂದ ನಡೆಸಲ್ಪಡುವ AWS p4d ಇನ್ಸ್ಟಾನ್ಸ್ಗಳು ಅತ್ಯುತ್ತಮ-ಮಟ್ಟದ ಕ್ಲಾಕ್ ವೇಗಗಳೊಂದಿಗೆ GPUಗಳನ್ನು ಸ್ಕೇಲ್ ಔಟ್ ಮಾಡಲು ಅತ್ಯಂತ ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹ ಆಯ್ಕೆಯಾಗಿ ವೇದಿಕೆಯನ್ನು ಸಿದ್ಧಪಡಿಸುತ್ತವೆ.
ಈ ಹಾರ್ಡ್ವೇರ್ನ ಲಾಭ ಪಡೆಯಲು ಸಾಫ್ಟ್ವೇರ್ಗಾಗಿ, ನಾವು NVIDIA ರ TensorRT-LLM ಅನ್ನು ರನ್ ಮಾಡುತ್ತೇವೆ, ಇದು LLM ಇನ್ಫೆರೆನ್ಸ್ ಅನ್ನು ವೇಗಗೊಳಿಸುವ ಮತ್ತು ಆಪ್ಟಿಮೈಸ್ ಮಾಡುವ ಓಪನ್-ಸೋರ್ಸ್ ಲೈಬ್ರರಿ ಆಗಿದೆ. TensorRT-LLM ಯು TensorRT ನ ಡೀಪ್ ಲರ್ನಿಂಗ್ ಕಂಪೈಲರ್ ಅನ್ನು ಸುತ್ತುತ್ತದೆ ಮತ್ತು LLM ಮಾದರಿ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆಯ ಸಂದರ್ಭ ಮತ್ತು ಉತ್ಪಾದನಾ ಹಂತಗಳಿಗಾಗಿ FlashAttention ಮತ್ತು masked multi-head attention (MHA) ನ ಅತ್ಯಾಧುನಿಕ ಅನುಷ್ಠಾನಗಳಿಗಾಗಿ ಮಾಡಲಾದ ಇತ್ತೀಚಿನ ಆಪ್ಟಿಮೈಸ್ಡ್ ಕರ್ನಲ್ಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.
ಇಲ್ಲಿಂದ, AWS ನ ಬೆನ್ನೆಲುಗು ಮತ್ತು Kubernetes ನೊಂದಿಗೆ ಅದರ ದೃಢವಾದ ಏಕೀಕರಣವು ನಮಗೆ ನೂರಾರು GPUಗಳನ್ನು ಮೀರಿ ელಾಸ್ಟಿಕ್ ಆಗಿ ಸ್ಕೇಲ್ ಮಾಡಲು ಮತ್ತು ಡೌನ್ಟೈಮ್ ಹಾಗೂ ನೆಟ್ವರ್ಕ್ ಓವರ್ಹೆಡ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಶಕ್ತಗೊಳಿಸುತ್ತದೆ.
ಬಳಕೆಯ ಪ್ರಕರಣ: ಉತ್ಪಾದನೆಯಲ್ಲಿ ನಮ್ಮ API
Perplexity ನಲ್ಲಿ pplx-api: ವೆಚ್ಚ ಕಡಿತ ಮತ್ತು ವಿಶ್ವಾಸಾರ್ಹತೆ
ನಮ್ಮ API ಈಗಾಗಲೇ Perplexity ಯ ಪ್ರಮುಖ ಉತ್ಪನ್ನ ವೈಶಿಷ್ಟ್ಯಗಳಲ್ಲಿ ಒಂದನ್ನು ಶಕ್ತಿಗೊಳಿಸುತ್ತಿದೆ. ಬಾಹ್ಯ API ನಿಂದ pplx-api ಗೆ ಕೇವಲ ಒಂದೇ ಒಂದು ವೈಶಿಷ್ಟ್ಯವನ್ನು ಬದಲಾಯಿಸುವುದರಿಂದ ಪ್ರತಿ ವರ್ಷ $0.62M ವೆಚ್ಚ ಉಳಿತಾಯವಾಯಿತು, ಇದು ವೆಚ್ಚದಲ್ಲಿ ಸರಿಸುಮಾರು 4x ಕಡಿತವಾಗಿದೆ. ಯಾವುದೇ ಗುಣಮಟ್ಟದ ಕ್ಷೀಣತೆ ಇಲ್ಲದಿರುವುದನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ನಾವು A/B ಪರೀಕ್ಷೆಗಳನ್ನು ನಡೆಸಿದ್ದೇವೆ ಮತ್ತು ಮೂಲಸೌಕರ್ಯ ಮೆಟ್ರಿಕ್ಗಳನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಿದ್ದೇವೆ. 2 ವಾರಗಳ ಅವಧಿಯಲ್ಲಿ, A/B ಪರೀಕ್ಷೆಯಲ್ಲಿ ಯಾವುದೇ ಸಾಂಖ್ಯಿಕವಾಗಿ ಮಹತ್ವದ ವ್ಯತ್ಯಾಸವನ್ನು ನಾವು ಗಮನಿಸಲಿಲ್ಲ. ಹೆಚ್ಚುವರಿಯಾಗಿ, pplx-api ಪ್ರತಿದಿನ ಒಂದು ಮಿಲಿಯನ್ಗಿಂತಲೂ ಹೆಚ್ಚು ವಿನಂತಿಗಳ ದೈನಂದಿನ ಲೋಡ್ ಅನ್ನು sustain (ಸ್ಥಿರವಾಗಿರಿಸಿಕೊಳ್ಳಲು) ಮಾಡಬಹುದು, ಇದು ಪ್ರತಿದಿನ ಸುಮಾರು ಒಂದು ಬಿಲಿಯನ್ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಿದ ಟೋಕನ್ಗಳನ್ನು ತಲುಪುತ್ತದೆ.
ಈ ಆರಂಭಿಕ ಪರಿಶೋಧನೆಯ ಫಲಿತಾಂಶಗಳು ಬಹಳ ಉತ್ತೇಜನಕಾರಿಯಾಗಿದೆ, ಮತ್ತು ಸಮಯದೊಂದಿಗೆ ನಮ್ಮ ಹೆಚ್ಚಿನ ಉತ್ಪನ್ನ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಶಕ್ತಿಗೊಳಿಸಲು ನಾವು pplx-api ಅನ್ನು ನಿರೀಕ್ಷಿಸುತ್ತೇವೆ.

ವಿವಿಧ ಓಪನ್-ಸೋರ್ಸ್ ಮಾದರಿಗಳನ್ನು ಪೂರೈಸುವ ನಮ್ಮ ಮಾದರಿ ಪ್ಲೇಗ್ರೌಂಡ್ ಆದ Perplexity Labs ಅನ್ನು ಶಕ್ತಿಗೊಳಿಸಲು ನಾವು pplx-api ಅನ್ನು ಸಹ ಬಳಸುತ್ತೇವೆ.

ಇತ್ತೀಚಿನ ಅತ್ಯಾಧುನಿಕ ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳಿಗೆ ಪ್ರವೇಶವನ್ನು ಒದಗಿಸಲು ನಮ್ಮ ತಂಡವು ಬದ್ಧವಾಗಿದೆ. Mistral 7B, Code Llama 34b, ಮತ್ತು ಎಲ್ಲಾ Llama 2 ಮಾದರಿಗಳನ್ನು ಬಿಡುಗಡೆಯಾದ ಕೆಲವೇ ಗಂಟೆಗಳಲ್ಲಿ ನಾವು ಸಂಯೋಜಿಸಿದ್ದೇವೆ, ಮತ್ತು ಹೆಚ್ಚು ಸಾಮರ್ಥ್ಯವಿರುವ ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳು ಲಭ್ಯವಾದಂತೆ ಹಾಗೆಯೇ ಮಾಡಲು ಯೋಜಿಸುತ್ತೇವೆ.
Perplexity ನ AI API ನೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ
ನೀವು HTTPS ವಿನಂತಿಗಳನ್ನು ಬಳಸಿ pplx-api REST API ಅನ್ನು ಪ್ರವೇಶಿಸಬಹುದು. pplx-api ಗೆ ದೃಢೀಕರಿಸುವುದು ಕೆಳಗಿನ ಹಂತಗಳನ್ನು ಒಳಗೊಂಡಿದೆ:
Perplexity ಖಾತೆ ಸೆಟ್ಟಿಂಗ್ಗಳ ಪುಟದ ಮೂಲಕ API ಕೀಲಿಯನ್ನು生成 (ಉತ್ಪಾದಿಸಿ). API ಕೀಲಿಯು ದೀರ್ಘಕಾಲ ಬಾಳಿಕೆ ಬರುವ ಪ್ರವೇಶ ಟೋಕನ್ ಆಗಿದ್ದು ಅದನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ರಿಫ್ರೆಶ್ ಮಾಡುವವರೆಗೆ ಅಥವಾ ಅಳಿಸುವವರೆಗೆ ಬಳಸಬಹುದು.

ಪ್ರತಿ pplx-api ವಿನಂತಿಯೊಂದಿಗೆ Authorization ಹೆಡರ್ನಲ್ಲಿ ಬೇರರ್ ಟೋಕನ್ ಆಗಿ API ಕೀಲಿಯನ್ನು ಕಳುಹಿಸಿ.
ಕೆಳಗಿನ ಉದಾಹರಣೆಯಲ್ಲಿ, PERPLEXITY_API_KEY ಎನ್ನುವುದು ಮೇಲಿನ ಸೂಚನೆಗಳನ್ನು ಬಳಸಿ ಉತ್ಪಾದಿಸಲಾದ ಕೀಗೆ ಬದ್ಧವಾಗಿರುವ ಪರಿಸರ ವೇರಿಯೇಬಲ್ ಆಗಿದೆ. ಚಾಟ್ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆ ವಿನಂತಿಯನ್ನು ಸಲ್ಲಿಸಲು CURL ಅನ್ನು ಬಳಸಲಾಗುತ್ತದೆ.
curl -X POST \
--url https://perplexity.coolkeypoint.com/__p/api.perplexity.ai/chat/completions \
--header 'accept: application/json' \
--header 'content-type: application/json' \
--header "Authorization: Bearer ${PERPLEXITY_API_KEY}" \
--data '{
"model": "mistral-7b-instruct",
"stream": false,
"max_tokens": 1024,
"frequency_penalty": 1,
"temperature": 0.0,
"messages": [
{
"role": "system",
"content": "Be precise and concise in your responses."
},
{
"role": "user",
"content": "How many stars are there in our galaxy?"
}
]
}'content-type: application/json ಅನ್ನು ಹೊಂದಿರುವ ಕೆಳಗಿನ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಇದು ನೀಡುತ್ತದೆ
{
"id": "3fbf9a47-ac23-446d-8c6b-d911e190a898",
"model": "mistral-7b-instruct",
"object": "chat.completion",
"created": 1765322,
"choices": [
{
"index": 0,
"finish_reason": "stop",
"message": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
},
"delta": {
"role": "assistant",
"content": " The Milky Way galaxy contains an estimated 200-400 billion stars.."
}
}
],
"usage": {
"prompt_tokens": 40,
"completion_tokens": 22,
"total_tokens": 62
}
}ಉದಾಹರಣೆ Python ಕರೆ ಇಲ್ಲಿದೆ:
from openai import OpenAI
YOUR_API_KEY = "INSERT API KEY HERE"
messages = [
{
"role": "system",
"content": (
"You are an artificial intelligence assistant and you need to "
"engage in a helpful, detailed, polite conversation with a user."
),
},
{
"role": "user",
"content": (
"Count to 100, with a comma between each number and no newlines. "
"E.g., 1, 2, 3, ..."
),
},
]
client = OpenAI(api_key=YOUR_API_KEY, base_url="https://perplexity.coolkeypoint.com/__p/api.perplexity.ai")
# demo chat completion without streaming
response = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
)
print(response)
# demo chat completion with streaming
response_stream = client.chat.completions.create(
model="mistral-7b-instruct",
messages=messages,
stream=True,
)
for response in response_stream:
print(response)ನಾವು ಪ್ರಸ್ತುತ Mistral 7B, Llama 13B, Code Llama 34B, Llama 70B ಅನ್ನು ಬೆಂಬಲಿಸುತ್ತೇವೆ, ಮತ್ತು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಅಪ್ಲಿಕೇಶನ್ಗಳೊಂದಿಗೆ ಸುಲಭವಾಗಿ ಸಂಯೋಜನೆಗಾಗಿ API ಅನುಕೂಲಕರವಾಗಿ OpenAI ಕ್ಲೈಂಟ್-ಹೊಂದಾಣಿಕೆಯಾಗಿದೆ.
더 많은 정보를 원하시면 (ಹೆಚ್ಚಿನ ಮಾಹಿತಿಗಾಗಿ), ದಯವಿಟ್ಟು ನಮ್ಮ API ಡಾಕ್ಯುಮೆಂಟೇಶನ್ ಮತ್ತು Quickstart Guide ಗೆ ಭೇಟಿ ನೀಡಿ.
ಮುಂದೆ ಏನು
ನುಗ್ಗುವ ಭವಿಷ್ಯದಲ್ಲಿ, pplx-api ಇದನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ:
ಕಸ್ಟಮ್ Perplexity LLMಗಳು ಮತ್ತು ಇತರ ಓಪನ್-ಸೋರ್ಸ್ LLMಗಳು.
ಕಸ್ಟಮ್ Perplexity ಎಂಬೆಡಿಂಗ್ಗಳು ಮತ್ತು ಓಪನ್-ಸೋರ್ಸ್ ಎಂಬೆಡಿಂಗ್ಗಳು.
ಸಾರ್ವಜನಿಕ ಬೀಟಾ ಮುಕ್ತಾಯಗೊಂಡ ನಂತರ ಸಾಮಾನ್ಯ ಪ್ರವೇಶದೊಂದಿಗೆ ಸಮರ್ಪಿತ API ಬೆಲೆ ರಚನೆ.
ವಾಸ್ತವಗಳು ಮತ್ತು ಉಲ್ಲೇಖಗಳಿಗಾಗಿ ಗ್ರೌಂಡಿಂಗ್ನೊಂದಿಗೆ Perplexity RAG-LLM API.
ಈ ಬಳಕೆಯ ಪ್ರಕರಣಗಳಲ್ಲಿ ಯಾವುದಾದರೂ ನಿಮಗೆ ಆಸಕ್ತಿ ಇದ್ದರೆ api@perplexity.ai ಅನ್ನು ಸಂಪರ್ಕಿಸಿ.
ಇದು ನಮ್ಮ Perplexity ಬ್ಲಾಗ್ ಪೋಸ್ಟ್ ಸರಣಿಯ ಆರಂಭವಾಗಿದೆ. ನಮ್ಮ ಮುಂದಿನ ಪೋಸ್ಟ್ನಲ್ಲಿ, LLM ಇನ್ಫೆರೆನ್ಸ್ಗಾಗಿ A100 vs H100 ಕಾರ್ಯಕ್ಷಮತೆಯ ಹೋಲಿಕೆಯ ಕುರಿತು ಆಳವಾದ ಡೈವ್ ಅನ್ನು ನಾವು ಹಂಚಿಕೊಳ್ಳುತ್ತೇವೆ. ಟ್ಯೂನ್ ಆಗಿರಿ!
ನಾವು ನೇಮಕಾತಿ ಮಾಡುತ್ತಿದ್ದೇವೆ! ನೀವು ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ ನಿಯೋಜಿಸಲಾದ ಉತ್ಪನ್ನದಲ್ಲಿ ಕೆಲಸ ಮಾಡಲು ಮತ್ತು ನಮ್ಮೊಂದಿಗೆ ಚಿಂತನಶೀಲವಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾದ, ಎಚ್ಚರಿಕೆಯಿಂದ ಆಪ್ಟಿಮೈಸ್ ಮಾಡಲಾದ ಜನರೇಟಿವ್ ಮತ್ತು ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿ ಮೂಲಸೌಕರ್ಯವನ್ನು ನಿರ್ಮಿಸಲು ಬಯಸಿದರೆ, ದಯವಿಟ್ಟು ನಮ್ಮೊಂದಿಗೆ ಸೇರಿಕೊಳ್ಳಿ.
ಹೆಚ್ಚಿನ ಚರ್ಚೆಗಾಗಿ Twitter, LinkedIn ನಲ್ಲಿ ನಮ್ಮನ್ನು ಅನುಸರಿಸಿ ಮತ್ತು ನಮ್ಮ Discord ಗೆ ಸೇರಿಕೊಳ್ಳಿ.
ಲೇಖಕರು:
Lauren Yang, Kevin Hu, Aarash Heydari, William Zhang, Dmitry Pervukhin, Grigorii Alekseev, Alexandr Yarats
ಡೇಟಾ ಗೌಪ್ಯತೆ
pplx-api ಅನ್ನು ಆಯ್ಕೆ ಮಾಡುವ ಮೂಲಕ, ನಿಮ್ಮ ಬಳಕೆದಾರರು ಮತ್ತು ಗ್ರಾಹಕರ ಗೌಪ್ಯತೆ ಮತ್ತು ನಂಬಿಕೆಯನ್ನು ರಕ್ಷಿಸುವಾಗ ನೀವು LLMಗಳ ಸಂಪೂರ್ಣ ಸಾಮರ್ಥ್ಯವನ್ನು ಬಳಸಿಕೊಳ್ಳಬಹುದು. ನಿಮ್ಮ ವೈಯಕ್ತಿಕ ಮಾಹಿತಿಯನ್ನು ರಕ್ಷಿಸುವ ಪ್ರಾಮುಖ್ಯತೆಯನ್ನು ನಾವು ಅರ್ಥಮಾಡಿಕೊಂಡಿದ್ದೇವೆ ಮತ್ತು ನಮ್ಮ ಬಳಕೆದಾರರ ಭದ್ರತೆ ಮತ್ತು ಗೌಪ್ಯತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಲು ಬದ್ಧರಾಗಿದ್ದೇವೆ. API ಡೇಟಾವನ್ನು 30 ದಿನಗಳ ನಂತರ ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಅಳಿಸಲಾಗುತ್ತದೆ, ಮತ್ತು pplx-api ಮೂಲಕ ರವಾನಿಸಲಾದ ಯಾವುದೇ ಡೇಟಾದ ಮೇಲೆ ನಾವು ಎಂದಿಗೂ ತರಬೇತಿ ನೀಡುವುದಿಲ್ಲ. ಬಳಕೆದಾರರು ತಮ್ಮ ಖಾತೆ ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ ಡೇಟಾ ಧಾರಣದಿಂದ ಹೊರಗುಳಿಯುವ ಆಯ್ಕೆಯನ್ನು ಹೊಂದಿರುತ್ತಾರೆ. ನಮ್ಮ API ಗೌಪ್ಯತಾ ನೀತಿಯನ್ನು ಇಲ್ಲಿFindAsync.