Apresentando LLMs online PPLX
A primeira API de LLM online do seu tipo

A primeira API de LLM online do seu tipo.
Estamos entusiasmados em compartilhar dois novos modelos PPLX: pplx-7b-online e pplx-70b-online! Nossos modelos online estão focados em fornecer respostas úteis, atualizadas e factuais, e estão publicamente disponíveis via pplx-api, tornando-a a primeira API do seu tipo. pplx-7b-online e pplx-70b-online também são acessíveis via Perplexity Labs, nosso playground de LLM.
Os LLMs transformaram a maneira como encontramos informações. No entanto, existem duas limitações com a maioria dos LLMs hoje:
Atualidade: Os LLMs frequentemente têm dificuldade em compartilhar informações atualizadas.
Alucinações: Os LLMs também podem gerar afirmações imprecisas.
Nossos modelos pplx-7b-online e pplx-70b-online abordam as limitações atuais fornecendo, adicionalmente, informações úteis, factuais e atualizadas em suas respostas.
LLMs Online PPLX
Nossos LLMs, pplx-7b-online e pplx-70b-online, são LLMs online porque podem usar conhecimento da internet e, portanto, podem aproveitar as informações mais atualizadas ao formular uma resposta. Ao fornecer aos nossos LLMs conhecimento da web, nossos modelos respondem com precisão a consultas sensíveis ao tempo, desbloqueando conhecimento além do seu corpus de treinamento. Isso significa que os LLMs online da Perplexity podem responder a consultas como “Qual foi o placar do jogo do Warriors ontem à noite?”, que são desafiadoras para modelos offline. Em um nível elevado, é assim que nosso LLM online funciona:
- Aproveitamento de modelos de código aberto: nossos modelos PPLX baseiam-se nos modelos base
mistral-7bellama2-70b. - Tecnologia de busca interna: nossa infraestrutura interna de busca, indexação e rastreamento nos permite aumentar os LLMs com as informações mais relevantes, atualizadas e valiosas. Nosso índice de busca é grande, atualizado em intervalos regulares e utiliza algoritmos de classificação sofisticados para garantir que sites de alta qualidade, não voltados apenas para SEO, sejam priorizados. Trechos de sites, que chamamos de “snippets”, são fornecidos aos nossos modelos
pplx-onlinepara permitir respostas com as informações mais atualizadas. - Ajuste fino (Fine-tuning): nossos modelos PPLX foram ajustados para utilizar efetivamente snippets para informar suas respostas. Usando nossos contratados de dados internos, curamos cuidadosamente conjuntos de treinamento diversificados, de alta qualidade e extensos para alcançar alto desempenho em vários eixos, como utilidade, factualidade e atualidade. Nossos modelos são regularmente ajustados para melhorar continuamente o desempenho.
Avaliando os LLMs Online da Perplexity
A missão da Perplexity é construir o melhor motor de respostas do mundo - um em que as pessoas confiam para descobrir e expandir seu conhecimento. Para alcançar isso, estamos profundamente focados em fornecer informações úteis, factuais e atualizadas. Para avaliar o desempenho dos nossos LLMs nestes eixos, curamos conjuntos de dados de avaliação para refletir casos de uso desafiadores, porém realistas, para motores de respostas. Para cada consulta em cada conjunto de avaliação, os contratados receberam duas respostas do modelo e foram instruídos a selecionar a resposta que teve um desempenho melhor de acordo com os seguintes critérios:
- Utilidade: qual resposta responde à consulta e segue melhor as instruções especificadas?
- Factualidade: qual resposta fornece respostas mais precisas sem alucinações, mesmo para perguntas que exigem conhecimento muito preciso ou específico?
- Atualidade (inspirado em FreshLLMs): qual resposta contém informações mais atualizadas? Um modelo se destaca neste critério se for capaz de responder a consultas com informações “frescas”.
Além dos três critérios acima, as respostas do modelo também foram avaliadas de forma holística. Para avaliar as respostas holisticamente, os avaliadores foram convidados a escolher a resposta que prefeririam receber de um assistente humano que esteja ajudando com a consulta.
Curadoria do Conjunto de Avaliação
Para esta avaliação, curamos cuidadosamente um conjunto diversificado de prompts com o objetivo de avaliar efetivamente a utilidade, a factualidade e a atualidade. Cada prompt foi selecionado manualmente, garantindo um alto nível de controle sobre a qualidade e relevância dos dados. O conjunto de dados abrange uma ampla gama de prompts de motores de respostas e abrange uma visão abrangente do que queremos que a Perplexity se destaque. Isso é crítico para que nossas avaliações de desempenho do modelo tenham um alto sinal.
Cada um dos três conjuntos de avaliação contém 50 prompts. Alguns exemplos desses conjuntos incluem:
- Utilidade: Crie uma tabela de todos os jogadores de futebol dos EUA que jogaram nas finais da Copa do Mundo e crie colunas para suas estatísticas, como gols, assistências, etc.
- Factualidade: Explique a tenacidade dos aços AISI 1015 e AISI 1040.
- Atualidade: Qual empresa de carros autônomos foi banida de São Francisco em 2023?
Gerando Respostas do Modelo
Avaliamos quatro modelos:
pplx-7b-online: Modelo da Perplexity, que inclui acesso a informações da internet. Este modelo foi ajustado usando mistral-7b.
pplx-70b-online: Modelo da Perplexity, que inclui acesso a informações da internet. Este modelo foi ajustado usando llama2-70b.
gpt-3.5-turbo-1106: Modelo da OpenAI, acessado via API e sem aumentos adicionais. Note que conduzimos esta avaliação usando o modelo gpt-3.5 mais recente.
llama2-70b-chat: Modelo da Meta AI, acessado via nossa pplx-api e sem aumentos adicionais.
Para cada prompt, os mesmos resultados de busca e snippets foram fornecidos aos modelos pplx-7b-online e pplx-70b-online. Todas as respostas foram geradas usando os mesmos hiperparâmetros e prompt de sistema.
Prompt do Sistema
Current date: Monday, November 20, 2023.Classificando Respostas do Modelo com Avaliação Humana
Para cada comparação pareada, nossos contratados internos receberam o próprio prompt, os critérios de avaliação (ou seja, utilidade, factualidade ou atualidade) e as respostas do modelo exibidas lado a lado. A ordem das respostas foi randomizada em cada turno, e os modelos de origem não foram revelados ao avaliador. Os avaliadores foram instruídos a selecionar a resposta que preferem holisticamente, bem como qual tem um desempenho melhor no critério de avaliação específico, com empates permitidos para ambos. Finalmente, os avaliadores foram autorizados a usar a busca na internet para verificar a precisão das respostas. Construímos nossa própria ferramenta interna de classificação de preferência para conduzir esta avaliação.
Resultados da Avaliação
Usamos as classificações de preferência pareadas coletadas da avaliação humana para calcular pontuações Elo por tarefa para cada modelo. Pontuações Elo são comumente usadas para classificar uma população de jogadores em competições estilo torneio para medir o desempenho relativo dos jogadores. Quando aplicadas a grandes modelos de linguagem, essas pontuações fornecem uma previsão de quão provável um avaliador humano poderia favorecer a saída de um modelo em relação a outro.
Embora as pontuações Elo sejam tipicamente calculadas para uma sequência de comparações para levar em conta mudanças nas habilidades dos jogadores, visamos quantificar o desempenho de modelos cujas habilidades não podem mudar. Consequentemente, adotamos a metodologia Bootstrap Elo descrita em Duan et al e também utilizada por lmsys para seu Chatbot Arena, o que implica calcular pontuações Elo para muitas permutações aleatórias das comparações. Para nossos cálculos, calculamos pontuações Elo ao longo de 5000 permutações e usamos as distribuições dessas pontuações Elo para calcular intervalos de confiança de 95%.
Os resultados, mostrados na Figura 1, demonstram que nossos modelos PPLX podem igualar e até superar o desempenho do gpt-3.5 em casos de uso relacionados à Perplexity. Em particular, as respostas dos modelos pplx-7b-online e pplx-70b-online são preferidas em relação às respostas dos modelos gpt-3.5 e llama2-70b por avaliadores humanos devido às suas respostas precisas e atualizadas.
Os pplx-7b-online e pplx-70b-online têm um desempenho melhor que gpt-3.5 e llama2-70b, nos critérios de atualidade, factualidade e holístico.

Também calculamos as taxas de vitória pareadas da avaliação. Os resultados, mostrados na Figura 2, ilustram, talvez sem surpresa, que as respostas dos modelos online pplx são preferidas às de outros em atualidade e em factualidade.

Aqui está um exemplo do nosso conjunto de dados de avaliação de atualidade.
Prompt: Quantas pessoas nos EUA têm carteira de motorista?
pplx-7b-online
Em 2023, há uma projeção de 243,4 milhões de motoristas licenciados nos Estados Unidos, o que inclui 89% dos adultos americanos. Este número aumentou de 238,6 milhões em 2022. A porcentagem de motoristas licenciados varia entre diferentes faixas etárias e estados. Por exemplo, em 2019, 84,1% da população dos EUA possuía carteira de motorista. A maior porcentagem de motoristas licenciados está entre pessoas de 25 a 49 anos, com 90,1% da população possuindo carteira de motorista. Na Califórnia, havia 27 milhões de motoristas licenciados, tornando-o o estado com o maior número de motoristas licenciados.
pplx-70b-online
Em 2021, cerca de 233 milhões de pessoas possuíam carteira de motorista válida nos Estados Unidos. Em 2023, o número de motoristas licenciados nos EUA deve chegar a 243,4 milhões, o que inclui 89% dos adultos americanos. Isso representa um aumento em relação aos 238,6 milhões em 2022.
gpt-3.5
Como um modelo de linguagem de IA, não tenho acesso a dados em tempo real. No entanto, em 2021, estimava-se que cerca de 227 milhões de pessoas nos Estados Unidos possuíam uma carteira de motorista válida. Observe que esse número pode ter mudado desde então, portanto, é sempre melhor consultar as estatísticas oficiais mais recentes para obter as informações mais precisas.
llama2-70b
Não tenho acesso a dados em tempo real, mas posso fornecer algumas informações sobre o número aproximado de pessoas nos Estados Unidos que possuem carteira de motorista. De acordo com a Federal Highway Administration, havia aproximadamente 227,8 milhões de motoristas licenciados nos Estados Unidos em 2020. Esse número inclui motoristas comerciais e não comerciais. Vale notar que esse número provavelmente é uma subestimativa, pois não leva em conta indivíduos que podem ter carteira de motorista, mas não dirigem regularmente ou de forma alguma. Além disso, esse número não inclui indivíduos que não são elegíveis para uma carteira de motorista, como aqueles com menos de 16 anos ou com certas deficiências. Também é importante observar que o número de motoristas licenciados pode variar por estado, com alguns estados tendo uma porcentagem maior de motoristas licenciados do que outros.
No geral, os resultados da avaliação demonstram que nossos modelos PPLX podem igualar e até superar o gpt-3.5 e o llama2-70b em casos de uso relacionados à Perplexity, particularmente para fornecer respostas precisas e atualizadas.
Acessando os Modelos Online da Perplexity
Estamos entusiasmados em anunciar que a pplx-api está saindo da versão beta para lançamento público geral! Esta é a primeira vez que nossos modelos pplx-7b-online e pplx-70b-online estão acessíveis via pplx-api. Além disso, nossos modelos pplx-7b-chat e pplx-70b-chat saíram da versão alfa e agora estão acessíveis com nosso lançamento geral.
Com isso, estamos introduzindo uma nova estrutura de preços baseada no uso. Estamos empolgados para que nossos usuários utilizem nossa infraestrutura de ponta, que utiliza NVIDIA H100s para fornecer inferência extremamente rápida. Usuários Pro receberão um crédito recorrente de US$ 5 mensais na pplx-api. Para todos os outros usuários, os preços serão determinados com base no uso. Para se inscrever como usuário Pro, clique aqui. Entre em contato com api@perplexity.ai para consultas comerciais.

Recursos Adicionais:
- Comece com a pplx-api aqui.
- Experimente nossos modelos online gratuitamente com o Perplexity Labs.
- Saiba mais sobre nossa API através da documentação da pplx-api.
- Interessado em trabalhar em uma equipe de alto impacto e alta velocidade construindo o melhor motor de respostas? Junte-se a nós!
- Junte-se à nossa crescente Comunidade no Discord!
Colaboradores:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats