Apresentando os LLMs online PPLX

A primeira API de LLM online do gênero.

Perplexity releases first "Live" LLM

A primeira API de LLM online do gênero.

Temos o prazer de compartilhar dois novos modelos PPLX: pplx-7b-online e pplx-70b-online! Nossos modelos online concentram-se em fornecer respostas úteis, atualizadas e factuais, e estão publicamente disponíveis por meio da pplx-api, tornando-a uma API única em seu gênero. O pplx-7b-online e o pplx-70b-online também são acessíveis via Perplexity Labs, nosso playground de LLM.

Os LLMs transformaram a maneira como encontramos informações. No entanto, existem duas limitações na maioria dos LLMs atualmente:

Atualização: os LLMs frequentemente têm dificuldade em compartilhar informações atualizadas.

Alucinações: os LLMs também podem produzir declarações imprecisas.

Nossos modelos pplx-7b-online e pplx-70b-online abordam as limitações atuais fornecendo adicionalmente informações úteis, factuais e atualizadas em suas respostas.

LLMs Online PPLX

Nossos LLMs, pplx-7b-online e pplx-70b-online, são LLMs online porque podem usar conhecimento da internet e, portanto, podem aproveitar as informações mais atualizadas ao formular uma resposta. Ao fornecer aos nossos LLMs conhecimento da web, nossos modelos respondem com precisão a consultas sensíveis ao tempo, desbloqueando conhecimento além de seu corpus de treinamento. Isso significa que os LLMs online da Perplexity podem responder a consultas como “Qual foi o placar do jogo dos Warriors ontem à noite?”, que são desafiadoras para modelos offline. Em um nível alto, é assim que nosso LLM online funciona:

  1. Aproveitar modelos de código aberto: nossos modelos PPLX são construídos sobre os modelos base mistral-7b e llama2-70b.
  2. Tecnologia de busca interna: nossa infraestrutura interna de busca, indexação e rastreamento nos permite enriquecer os LLMs com as informações mais relevantes, atualizadas e valiosas. Nosso índice de busca é grande, atualizado regularmente e usa algoritmos de ranqueamento sofisticados para garantir que sites de alta qualidade e não otimizados para SEO sejam priorizados. Trechos de sites, que chamamos de "snippets", são fornecidos aos nossos modelos pplx-online para permitir respostas com as informações mais atualizadas.
  3. Fine-tuning: nossos modelos PPLX foram ajustados para usar efetivamente snippets para informar suas respostas. Usando nossos contratados de dados internos, curamos cuidadosamente conjuntos de dados de treinamento grandes, diversos e de alta qualidade para alcançar alto desempenho em vários eixos, como utilidade, factualidade e frescor. Nossos modelos são ajustados regularmente para melhorar continuamente o desempenho.

Avaliando os LLMs Online da Perplexity

A missão da Perplexity é construir o melhor mecanismo de respostas do mundo - um em que as pessoas confiantes descubram e expandam seu conhecimento. Para alcançar isso, estamos profundamente focados em fornecer informações úteis, factuais e atualizadas. Para comparar o desempenho de nossos LLMs nesses eixos, curamos conjuntos de dados de avaliação para refletir casos de uso desafiadores, mas realistas, para mecanismos de respostas. Para cada consulta em cada conjunto de avaliação, os contratados receberam duas respostas de modelos e foram instruídos a selecionar a resposta que teve melhor desempenho para os seguintes critérios:

  • Utilidade: qual resposta atende à consulta e segue as instruções especificadas melhor?
  • Factualidade: qual resposta fornece respostas mais precisas sem alucinações, mesmo para perguntas que exigem conhecimento muito preciso ou de nicho?
  • Frescor (inspirado por FreshLLMs): qual resposta contém informações mais atualizadas? Um modelo se destaca neste critério se for capaz de responder a consultas com informações "frescas".

Além dos três critérios acima, as respostas dos modelos também foram avaliadas de forma holística. Para avaliar as respostas de forma holística, os avaliadores foram convidados a escolher a resposta que prefeririam receber de um assistente humano que está ajudando com a consulta.

Curando o Conjunto de Avaliação

Para esta avaliação, curamos cuidadosamente um conjunto diverso de prompts com o objetivo de avaliar efetivamente a utilidade, a factualidade e o frescor. Cada prompt foi selecionado manualmente, garantindo um alto nível de controle sobre a qualidade e a relevância dos dados. O conjunto de dados abrange uma ampla gama de prompts de mecanismos de respostas e engloba uma visão geral abrangente do que queremos que a Perplexity se destaque. Isso é fundamental para que nossas avaliações de desempenho do modelo tenham alto sinal.

Cada um dos três conjuntos de avaliação contém 50 prompts. Alguns exemplos desses conjuntos incluem:

  • Utilidade: Crie uma tabela de todos os jogadores de futebol dos EUA que jogaram nas finais da Copa do Mundo e crie colunas para suas estatísticas, como gols, assistências, etc.
  • Factualidade: Explique a tenacidade dos aços AISI 1015 e AISI 1040.
  • Atualização: Qual empresa de carros autônomos foi banida de São Francisco em 2023?

Gerando Respostas de Modelos

Avaliamos quatro modelos:

pplx-7b-online: O modelo da Perplexity, que inclui acesso a informações da internet. Este modelo foi ajustado usando mistral-7b.

pplx-70b-online: O modelo da Perplexity, que inclui acesso a informações da internet. Este modelo foi ajustado usando llama2-70b.

gpt-3.5-turbo-1106: O modelo da OpenAI, acessado via API e sem augments adicionais. Observe que conduzimos esta avaliação usando o modelo gpt-3.5 mais recente.

llama2-70b-chat: O modelo da Meta AI, acessado via nossa pplx-api e sem augments adicionais.

Para cada prompt, os mesmos resultados de pesquisa e snippets foram fornecidos aos modelos pplx-7b-online e pplx-70b-online. Todas as respostas foram geradas usando os mesmos hiperparâmetros e prompt de sistema.

Prompt de Sistema

plaintext
Current date: Monday, November 20, 2023.

Ranqueando Respostas de Modelos com Avaliação Humana

Para cada comparação em pares, nossos contratados internos receberam o próprio prompt, os critérios de avaliação (ou seja, utilidade, factualidade ou frescor) e as respostas do modelo exibidas lado a lado. A ordem das respostas foi randomizada a cada turno, e os modelos de origem não foram revelados ao avaliador. Os avaliadores foram instruídos a selecionar a resposta que preferem holisticamente, bem como qual tem melhor desempenho no critério de avaliação específico, com empates permitidos para ambos. Finalmente, os avaliadores tiveram permissão para usar a pesquisa na internet para verificar a precisão das respostas. Construímos nossa própria ferramenta de ranqueamento de preferências interna para conduzir esta avaliação.

Resultados da Avaliação

Usamos os ranqueamentos de preferência em pares coletados da avaliação humana para calcular pontuações Elo por tarefa para cada modelo. As pontuações Elo são comumente usadas para ranquear uma população de jogadores em competições estilo torneio para medir o desempenho relativo dos jogadores. Quando aplicadas a grandes modelos de linguagem, essas pontuações fornecem uma previsão de quão provável um avaliador humano pode favorecer a saída de um modelo em detrimento de outro.

Embora as pontuações Elo sejam tipicamente calculadas para uma sequência de comparações para contabilizar mudanças nas habilidades dos jogadores, nosso objetivo é quantificar o desempenho de modelos cujas habilidades não podem mudar. Consequentemente, adotamos a metodologia Bootstrap Elo descrita em Duan et al e também utilizada por lmsys para seu Chatbot Arena, o que envolve o cálculo de pontuações Elo para muitas permutações aleatórias das comparações. Para nossos cálculos, calculamos pontuações Elo em mais de 5000 permutações e usamos as distribuições dessas pontuações Elo para calcular intervalos de confiança de 95%.

Os resultados, mostrados na Figura 1, demonstram que nossos modelos PPLX podem igualar e até superar o desempenho do gpt-3.5 em casos de uso relacionados ao Perplexity. Em particular, as respostas dos modelos pplx-7b-online e pplx-70b-online são preferidas às respostas dos modelos gpt-3.5 e llama2-70b por avaliadores humanos por suas respostas precisas e atualizadas.

O pplx-7b-online e o pplx-70b-online têm desempenho melhor do que o gpt-3.5 e o llama2-70b, nos critérios de frescor, factualidade e holístico.

Figura 1. Pontuações Elo estimadas e intervalos de confiança de 95% para pplx-7b (-online), pplx-70b (-online), llama2-70b e gpt-3.5 em quatro conjuntos de avaliação diferentes. Por exemplo, no eixo de frescor, pplx-7b e pplx-70b têm desempenho melhor do que gpt-3.5 e llama2-70b, com uma pontuação Elo estimada de 1100,6 e 1099,6 vs 879,3 e 920,3, respectivamente.

Também calculamos as taxas de vitória em pares da avaliação. Os resultados, mostrados na Figura 2, ilustram, talvez sem surpresa, que as respostas do modelo online pplx são preferidas às de outros em frescor e factualidade.

Figura 2. Taxas de vitória de modelos no eixo vertical em relação aos modelos no eixo horizontal. Por exemplo, as respostas do pplx-70b (-online) foram avaliadas como holisticamente superiores às do gpt-3.5 em 64% das consultas, e as respostas do gpt-3.5 foram avaliadas como holisticamente superiores às do pplx-70b (-online) em 24% das consultas.

Aqui está um exemplo do nosso conjunto de dados de avaliação de frescor.

Prompt: Quantas pessoas nos EUA têm carteira de motorista?

pplx-7b-online

Em 2023, há uma projeção de 243,4 milhões de motoristas licenciados nos Estados Unidos, o que inclui 89% dos adultos dos EUA. Esse número aumentou em relação aos 238,6 milhões em 2022. A porcentagem de motoristas licenciados varia entre diferentes faixas etárias e estados. Por exemplo, em 2019, 84,1% da população dos EUA tinha carteira de motorista. A maior porcentagem de motoristas licenciados está entre os jovens de 25 a 49 anos, com 90,1% da população possuindo carteira de motorista. Na Califórnia, havia 27 milhões de motoristas licenciados, tornando-o o estado com o maior número de motoristas licenciados.

pplx-70b-online

Em 2021, cerca de 233 milhões de pessoas possuíam carteira de motorista válida nos Estados Unidos. Até 2023, o número de motoristas licenciados nos EUA está projetado para atingir 243,4 milhões, o que inclui 89% dos adultos dos EUA. Isso representa um aumento em relação aos 238,6 milhões em 2022.

gpt-3.5

Como um modelo de linguagem de IA, não tenho acesso a dados em tempo real. No entanto, a partir de 2021, estimou-se que cerca de 227 milhões de pessoas nos Estados Unidos possuíam uma carteira de motorista válida. Observe que esse número pode ter mudado desde então, por isso é sempre melhor consultar as estatísticas oficiais mais recentes para obter as informações mais precisas.

llama2-70b

Não tenho acesso a dados em tempo real, mas posso fornecer algumas informações sobre o número aproximado de pessoas nos Estados Unidos que possuem carteira de motorista. De acordo com a Federal Highway Administration, havia aproximadamente 227,8 milhões de motoristas licenciados nos Estados Unidos a partir de 2020. Esse número inclui motoristas comerciais e não comerciais. Vale ressaltar que esse número provavelmente é uma subestimação, pois não contabiliza indivíduos que podem ter carteira de motorista, mas não dirigem regularmente ou de forma alguma. Além disso, esse número não inclui indivíduos que não são elegíveis para uma carteira de motorista, como aqueles com menos de 16 anos ou com certas deficiências. Também é importante notar que o número de motoristas licenciados pode variar por estado, com alguns estados tendo uma porcentagem maior de motoristas licenciados do que outros.

No geral, os resultados da avaliação demonstram que nossos modelos PPLX podem igualar e até superar o gpt-3.5 e o llama2-70b em casos de uso relacionados ao Perplexity, particularmente no fornecimento de respostas precisas e atualizadas.

Acessando os Modelos Online da Perplexity

Estamos extremamente felizes em anunciar que a pplx-api está saindo da fase beta para o lançamento público geral! Esta é a primeira vez que nossos modelos pplx-7b-online e pplx-70b-online estão acessíveis por meio da pplx-api. Além disso, nossos modelos pplx-7b-chat e pplx-70b-chat saíram da fase alfa e agora estão acessíveis com nosso lançamento geral.

Com isso, estamos introduzindo uma nova estrutura de preços baseada no uso. Estamos empolgados para que nossos usuários utilizem nossa infraestrutura de ponta, que utiliza NVIDIA H100s para fornecer inferência extremamente rápida. Os usuários Pro receberão um crédito de $5 recorrente mensal para a pplx-api. Para todos os outros usuários, os preços serão determinados com base no uso. Para se inscrever como usuário Pro, clique aqui. Entre em contato com api@perplexity.ai para consultas comerciais.

Painel de LLM online PPLX

Recursos Adicionais:

Colaboradores:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats