PPLX 온라인 LLM 소개

업계 최초의 온라인 LLM API

Perplexity releases first "Live" LLM

업계 최초의 온라인 LLM API.

두 가지 새로운 PPLX 모델인 pplx-7b-onlinepplx-70b-online을 공개하게 되어 기쁩니다! 당사의 온라인 모델은 유용하고 최신 정보에 기반한 사실적 답변을 제공하는 데 중점을 두고 있으며, pplx-api를 통해 공개적으로 이용 가능하여 업계 최초의 API로 자리매김했습니다. 또한 pplx-7b-onlinepplx-70b-online은 당사의 LLM 플레이그라운드인 Perplexity Labs를 통해서도 이용하실 수 있습니다.

LLM은 우리가 정보를 찾는 방식을 변화시켰습니다. 하지만 현재 대부분의 LLM에는 두 가지 한계가 있습니다.

최신성: LLM은 종종 최신 정보를 공유하는 데 어려움을 겪습니다.

환각 현상: LLM은 부정확한 진술을 출력할 수 있습니다.

당사의 pplx-7b-onlinepplx-70b-online 모델은 응답에 유용하고 사실에 입각한 최신 정보를 추가로 제공함으로써 현재의 한계를 해결합니다.

PPLX 온라인 LLM

당사의 LLM인 pplx-7b-onlinepplx-70b-online은 인터넷의 지식을 활용할 수 있어 응답 생성 시 최신 정보를 이용할 수 있는 온라인 LLM입니다. 당사의 LLM에 웹상의 지식을 제공함으로써, 모델은 시간에 민감한 질의에 정확하게 응답하고 학습 코퍼스를 넘어선 지식을 확보합니다. 즉, Perplexity의 온라인 LLM은 “어젯밤 워리어스 경기 점수가 어떻게 되지?”와 같이 오프라인 모델이 답변하기 어려운 질의에 답할 수 있습니다. 개괄적으로 당사의 온라인 LLM은 다음과 같이 작동합니다.

  1. 오픈 소스 모델 활용: 당사의 PPLX 모델은 mistral-7bllama2-70b 기본 모델을 기반으로 구축되었습니다.
  2. 사내 검색 기술: 당사의 자체 검색, 인덱싱 및 크롤링 인프라를 통해 가장 관련성 높고 최신의 가치 있는 정보로 LLM을 강화할 수 있습니다. 당사의 검색 인덱스는 규모가 크며 주기적으로 업데이트되고, 정교한 순위 알고리즘을 사용하여 고품질의 비-SEO 사이트가 우선순위를 갖도록 합니다. pplx-online 모델이 최신 정보가 포함된 응답을 할 수 있도록 웹사이트 발췌문인 “스니펫”이 제공됩니다.
  3. 파인튜닝: 당사의 PPLX 모델은 스니펫을 효과적으로 사용하여 응답의 정확성을 높이도록 파인튜닝되었습니다. 당사는 내부 데이터 계약자를 활용하여 유용성, 사실성, 최신성과 같은 다양한 측면에서 높은 성능을 달성하기 위해 고품질의 다양하고 방대한 학습 세트를 신중하게 큐레이션합니다. 당사의 모델은 성능을 지속적으로 향상하기 위해 정기적으로 파인튜닝됩니다.

Perplexity의 온라인 LLM 평가

Perplexity의 사명은 사람들이 신뢰하며 지식을 발견하고 확장할 수 있는 세계 최고의 답변 엔진을 구축하는 것입니다. 이를 달성하기 위해 당사는 유용하고 사실에 입각한 최신 정보를 제공하는 데 깊이 집중하고 있습니다. 이러한 측면에서 LLM의 성능을 벤치마킹하기 위해 답변 엔진의 까다로우면서도 현실적인 사용 사례를 반영하는 평가 데이터 세트를 큐레이션했습니다. 각 평가 세트의 모든 질의에 대해 계약자는 두 가지 모델 응답을 제공받고 다음 기준에 따라 더 나은 성능을 보인 응답을 선택하도록 지시받았습니다.

  • 유용성: 질의에 답변하고 명시된 지침을 더 잘 따르는 응답은 무엇인가?
  • 사실성: 매우 정밀하거나 틈새 지식이 필요한 질문에 대해서도 환각 없이 더 정확한 답변을 제공하는 응답은 무엇인가?
  • 최신성 (참고: FreshLLMs): 더 최신의 정보가 포함된 응답은 무엇인가? “최신” 정보로 질의에 답할 수 있는 경우 해당 기준에서 뛰어난 성능을 보입니다.

위의 세 가지 기준 외에도 모델 응답을 전체적으로 평가했습니다. 전체적인 평가를 위해 평가자는 질의를 지원하는 인간 비서로부터 받고 싶은 응답을 선택하도록 요청받았습니다.

평가 세트 큐레이션

이번 평가를 위해 유용성, 사실성, 최신성을 효과적으로 평가한다는 목표하에 다양한 프롬프트 세트를 신중하게 큐레이션했습니다. 각 프롬프트는 데이터의 품질과 관련성에 대해 높은 수준의 통제력을 보장하기 위해 수동으로 선택되었습니다. 데이터 세트는 답변 엔진 프롬프트의 광범위한 범위를 포괄하며 Perplexity가 탁월해야 하는 모든 영역을 종합적으로 아우릅니다. 이는 모델 성능 평가에서 높은 신호를 얻기 위해 매우 중요합니다.

세 가지 평가 세트 각각에는 50개의 프롬프트가 포함되어 있습니다. 다음은 이러한 세트의 몇 가지 예시입니다.

  • 유용성: 월드컵 결승전에 출전한 모든 미국 축구 선수들의 표를 만들고 득점, 어시스트 등과 같은 통계를 위한 열을 추가하십시오.
  • 사실성: AISI 1015 및 AISI 1040 강철의 인성을 설명하십시오.
  • 최신성: 2023년 샌프란시스코에서 운행이 금지된 자율주행 자동차 회사는 어디인가?

모델 응답 생성

당사는 다음 네 가지 모델을 평가했습니다.

pplx-7b-online: 인터넷 정보에 접근할 수 있는 Perplexity의 모델. 이 모델은 mistral-7b를 사용하여 파인튜닝되었습니다.

pplx-70b-online: 인터넷 정보에 접근할 수 있는 Perplexity의 모델. 이 모델은 llama2-70b를 사용하여 파인튜닝되었습니다.

gpt-3.5-turbo-1106: API를 통해 접근하는 OpenAI의 모델로, 추가적인 보강은 없습니다. 이 평가는 최신 gpt-3.5 모델을 사용하여 수행되었음을 유의하십시오.

llama2-70b-chat: pplx-api를 통해 접근하는 Meta AI의 모델로, 추가적인 보강은 없습니다.

각 프롬프트에 대해 동일한 검색 결과와 스니펫이 pplx-7b-onlinepplx-70b-online 모델에 제공되었습니다. 모든 응답은 동일한 하이퍼파라미터와 시스템 프롬프트를 사용하여 생성되었습니다.

시스템 프롬프트

plaintext
Current date: Monday, November 20, 2023.

인간 평가를 통한 모델 응답 순위 지정

각 쌍별 비교를 위해 사내 계약자에게 프롬프트 자체, 평가 기준(예: 유용성, 사실성 또는 최신성), 나란히 표시된 모델 응답이 제공되었습니다. 응답의 순서는 각 회차마다 무작위로 지정되었으며 평가자에게 소스 모델은 공개되지 않았습니다. 평가자는 전체적으로 선호하는 응답과 특정 평가 기준에서 더 나은 성능을 보이는 응답을 선택하도록 지시받았으며, 두 경우 모두 동점 처리가 허용되었습니다. 마지막으로, 평가자는 응답의 정확성을 확인하기 위해 인터넷 검색을 사용할 수 있었습니다. 당사는 이 평가를 수행하기 위해 자체적인 내부 선호도 순위 지정 도구를 구축했습니다.

평가 결과

당사는 인간 평가에서 수집된 쌍별 선호도 순위를 사용하여 각 모델에 대한 작업별 Elo 점수를 계산합니다. Elo 점수는 일반적으로 토너먼트 스타일의 대회에서 참가자의 상대적 성능을 측정하기 위해 순위를 매기는 데 사용됩니다. 이를 거대 언어 모델에 적용하면 인간 평가자가 한 모델의 출력을 다른 모델보다 선호할 가능성을 예측할 수 있습니다.

Elo 점수는 일반적으로 참가자 능력 변화를 설명하기 위해 일련의 비교에 대해 계산되지만, 당사는 능력이 변할 수 없는 모델의 성능을 정량화하고자 합니다. 이에 따라 당사는 Duan et al에 기술되고 lmsysChatbot Arena를 위해 활용한 Bootstrap Elo 방법론을 채택했으며, 이는 비교의 많은 무작위 순열에 대해 Elo 점수를 계산하는 것입니다. 당사의 계산을 위해 5000개의 순열에 대해 Elo 점수를 산출하고 이러한 Elo 점수의 분포를 사용하여 95% 신뢰 구간을 계산했습니다.

그림 1에 표시된 결과는 당사의 PPLX 모델이 Perplexity 관련 사용 사례에서 gpt-3.5 성능과 일치하거나 심지어 능가할 수 있음을 보여줍니다. 특히 pplx-7b-onlinepplx-70b-online 모델 응답은 정확하고 최신 답변을 제공한다는 이유로 인간 평가자로부터 gpt-3.5llama2-70b 모델 응답보다 선호되었습니다.

pplx-7b-onlinepplx-70b-online최신성, 사실성전체적 기준에서 gpt-3.5llama2-70b보다 더 나은 성능을 보입니다.

그림 1. 네 가지 평가 세트에 걸친 pplx-7b(-online), pplx-70b(-online), llama2-70b, gpt-3.5에 대한 추정 Elo 점수 및 95% 신뢰 구간. 예를 들어 최신성 측면에서 pplx-7b와 pplx-70b는 각각 1100.6점과 1099.6점의 추정 Elo 점수로 gpt-3.5와 llama2-70b의 879.3점과 920.3점보다 더 나은 성능을 보입니다.

또한 평가에서 쌍별 승률을 계산했습니다. 그림 2에 표시된 결과는 예상대로 pplx 온라인 모델 응답이 최신성사실성 측면에서 다른 모델보다 선호된다는 점을 보여줍니다.

그림 2. 가로축 모델 대비 세로축 모델의 승률. 예를 들어 pplx-70b(-online) 응답은 전체적으로 gpt-3.5보다 64%의 질의에서 우수한 것으로 평가되었으며, gpt-3.5 응답은 24%의 질의에서 pplx-70b(-online)보다 우수한 것으로 평가되었습니다.

다음은 당사의 최신성 평가 데이터 세트의 예시입니다.

프롬프트: 미국에서 운전면허를 소지한 사람은 몇 명인가?

pplx-7b-online

2023년 미국 내 면허 소지 운전자는 미국 성인의 89%를 포함하여 약 2억 4,340만 명으로 예상됩니다. 이 수치는 2022년 2억 3,860만 명에서 증가한 것입니다. 면허 소지 운전자의 비율은 연령대와 주에 따라 다릅니다. 예를 들어 2019년 미국 인구의 84.1%가 운전면허를 소지했습니다. 면허 소지 비율이 가장 높은 연령대는 25세~49세로, 인구의 90.1%가 운전면허를 소지하고 있습니다. 캘리포니아주에는 2,700만 명의 면허 소지 운전자가 있어 면허 소지자가 가장 많은 주입니다.

pplx-70b-online

2021년 기준 약 2억 3,300만 명이 미국에서 유효한 운전면허를 소지하고 있었습니다. 2023년까지 미국 내 면허 소지 운전자 수는 미국 성인의 89%를 포함하여 2억 4,340만 명에 이를 것으로 예상됩니다. 이는 2022년 2억 3,860만 명에서 증가한 것입니다.

gpt-3.5

AI 언어 모델로서 실시간 데이터에 접근할 수 없습니다. 그러나 2021년 기준으로 미국에서 약 2억 2,700만 명이 유효한 운전면허를 소지한 것으로 추정되었습니다. 이 수치는 그 이후 변경되었을 수 있으므로 가장 정확한 정보를 확인하려면 최신 공식 통계를 참조하는 것이 좋습니다.

llama2-70b

실시간 데이터에는 접근할 수 없으나 미국에서 운전면허를 소지한 대략적인 인구 수에 대한 정보를 제공할 수 있습니다. 연방 고속도로 관리국(Federal Highway Administration)에 따르면 2020년 기준 미국 내 면허 소지 운전자는 약 2억 2,780만 명이었습니다. 이 수치에는 상업용 및 비상업용 운전자가 모두 포함됩니다. 이 수치는 정기적으로 운전하지 않거나 전혀 운전하지 않는 면허 소지자를 고려하지 않았기 때문에 과소평가되었을 가능성이 큽니다. 또한 이 수치에는 16세 미만이거나 특정 장애가 있어 운전면허 취득 자격이 없는 사람은 포함되지 않습니다. 또한 면허 소지자 수는 주마다 다르며 일부 주는 다른 주보다 면허 소지자 비율이 더 높다는 점을 유의해야 합니다.

전반적으로 평가 결과는 당사의 PPLX 모델이 Perplexity 관련 사용 사례에서 gpt-3.5llama2-70b와 일치하거나 능가할 수 있음을 보여주며, 특히 정확하고 최신 정보가 포함된 응답을 제공하는 데 강점이 있습니다.

Perplexity의 온라인 모델 이용

pplx-api가 베타 버전을 종료하고 일반 공개 릴리스로 전환된다는 소식을 전하게 되어 기쁩니다! 당사의 pplx-7b-onlinepplx-70b-online 모델을 pplx-api를 통해 이용할 수 있는 것은 이번이 처음입니다. 또한 pplx-7b-chatpplx-70b-chat 모델이 알파 단계를 종료하고 일반 릴리스와 함께 이용 가능하게 되었습니다.

이와 함께 새로운 사용량 기반 요금제를 도입합니다. 사용자가 NVIDIA H100을 활용하여 초고속 추론을 제공하는 최첨단 인프라를 이용하시게 되어 매우 기쁩니다. Pro 사용자는 매월 5달러의 pplx-api 크레딧을 반복적으로 받게 됩니다. 기타 모든 사용자의 경우 요금은 사용량에 따라 결정됩니다. Pro 사용자로 가입하려면 여기를 클릭하십시오. 상업적 문의는 api@perplexity.ai로 연락해 주십시오.

PPLX-온라인 LLM 대시보드

추가 리소스:

  • pplx-api 시작하기 여기.
  • Perplexity Labs에서 온라인 모델을 무료로 체험해 보세요.
  • pplx-api 문서를 통해 API에 대해 자세히 알아보세요.
  • 최고의 답변 엔진을 구축하는 영향력 있고 속도감 있는 팀에서 일하고 싶으신가요? 함께해요!
  • 성장 중인 Discord 커뮤니티에 참여하세요!

기여자:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats