Presentación dos LLM en liña PPLX

A primeira API de LLM en liña do seu tipo

Perplexity releases first "Live" LLM

A primeira API de LLM en liña do seu tipo.

Estamos encantados de presentar dous novos modelos PPLX: pplx-7b-online e pplx-70b-online! Os nosos modelos en liña céntranse en ofrecer respostas útiles, actualizadas e baseadas en feitos, e están dispoñibles publicamente a través de pplx-api, o que o converte nunha API pioneira no seu tipo. pplx-7b-online e pplx-70b-online tamén son accesibles a través de Perplexity Labs, o noso contorno de probas para LLM.

Os LLM transformaron a forma en que atopamos información. Con todo, hai dúas limitacións na maioría dos LLM actuais:

Actualización: Os LLM a miúdo teñen dificultades para compartir información actualizada.

Alucinacións: Os LLM tamén poden xerar afirmacións inexactas.

Os nosos modelos pplx-7b-online e pplx-70b-online abordan as limitacións actuais proporcionando ademais información útil, baseada en feitos e actualizada nas súas respostas.

LLM en liña PPLX

Os nosos LLM, pplx-7b-online e pplx-70b-online, son LLM en liña porque poden utilizar coñecemento de internet e, polo tanto, aproveitar a información máis actualizada ao elaborar unha resposta. Ao proporcionar aos nosos LLM coñecemento da web, os nosos modelos responden con precisión a consultas sensibles ao tempo, desbloqueando coñecemento máis aló do seu corpus de adestramento. Isto significa que os LLM en liña de Perplexity poden responder a consultas como "Cal foi o resultado do partido dos Warriors onte á noite?" que resultan complexas para os modelos fóra de liña. A grandes trazos, así é como funciona o noso LLM en liña:

  1. Aproveitar modelos de código aberto: os nosos modelos PPLX baséanse nos modelos base mistral-7b e llama2-70b.
  2. Tecnoloxía de busca propia: a nosa infraestrutura propia de busca, indexación e rastrexo permítennos enriquecer os LLM coa información máis relevante, actualizada e valiosa. O noso índice de busca é grande, actualízase de forma regular e utiliza algoritmos de ranking sofisticados para garantir que se prioricen os sitios de alta calidade e sen prácticas SEO abusivas. Os extractos de sitios web, aos que chamamos "fragmentos", proporciónanse aos nosos modelos pplx-online para permitir respostas coa información máis actualizada.
  3. Axuste fino: os nosos modelos PPLX fixéronse cun axuste fino para utilizar eficazmente os fragmentos e informar as súas respostas. Mediante os nosos contratistas de datos internos, seleccionamos coidadosamente conxuntos de adestramento grandes, diversos e de alta calidade para acadar un alto rendemento en varios eixos como a utilidade, a veracidade e a frescura. Os nosos modelos son obxecto dun axuste fino de maneira regular para mellorar continuamente o seu rendemento.

Avaliación dos LLM en liña de Perplexity

A misión de Perplexity é construír o mellor motor de respostas do mundo, un no que a xente confíe para descubrir e ampliar o seu coñecemento. Para acadar isto, centrámonos profundamente en proporcionar información útil, baseada en feitos e actualizada. Para avaliar o rendemento dos nosos LLM nestes eixos, creamos conxuntos de datos de avaliación para reflectir casos de uso complexos pero realistas para os motores de respostas. Para cada consulta en cada conxunto de avaliación, aos contratistas fóronlles dadas dúas respostas de modelos e instruídos para seleccionar a resposta que funcionase mellor segundo os seguintes criterios:

  • Utilidade: que resposta responde á consulta e segue as instrucións especificadas dun xeito mellor?
  • Veracidade: que resposta proporciona respostas máis precisas sen alucinacións, mesmo para preguntas que requiren coñecementos moi precisos ou especializados?
  • Actualización (inspirado en FreshLLMs): que resposta contén información máis actualizada? Un modelo destaca neste criterio se é quen de responder a consultas con información "fresca".

Ademais dos tres criterios anteriores, as respostas dos modelos tamén se avaliaron de forma holística. Para avaliar as respostas de xeito holístico, pediuse aos evaluadores que elixisen a resposta que preferirían recibir dun asistente humano que axudase coa consulta.

Selección do conxunto de avaliación

Para esta avaliación, seleccionamos coidadosamente un conxunto diverso de indicacións co obxectivo de avaliar eficazmente a utilidade, a veracidade e a actualización. Cada indicación foi seleccionada manualmente, garantindo un alto nivel de control sobre a calidade e a relevancia dos datos. O conxunto de datos abarca unha ampla gama de indicacións de motores de respostas e inclúe unha visión xeneral completa do que queremos que Perplexity destaque. Isto é fundamental para que as nosas avaliacións do rendemento do modelo teñan un sinal elevado.

Cada un dos tres conxuntos de avaliación contén 50 indicacións. Algúns exemplos destes conxuntos inclúen:

  • Utilidade: Crea unha táboa de todos os xogadores de fútbol dos EE. UU. que xogaron nas finais da Copa do Mundo e crea columnas para as súas estatísticas como goles, asistencias, etc.
  • Veracidade: Explica a tenacidade dos aceiros AISI 1015 e AISI 1040.
  • Actualización: Que empresa de vehículos autónomos foi prohibida en San Francisco en 2023?

Xeración de respostas de modelos

Avaliamos catro modelos:

pplx-7b-online: O modelo de Perplexity, que inclúe acceso a información de internet. Este modelo foi axustado mediante mistral-7b.

pplx-70b-online: O modelo de Perplexity, que inclúe acceso a información de internet. Este modelo foi axustado mediante llama2-70b.

gpt-3.5-turbo-1106: O modelo de OpenAI, accesible a través da API e sen enriquecementos adicionais. Ten en conta que realizamos esta avaliación utilizando o modelo máis recente gpt-3.5.

llama2-70b-chat: O modelo de Meta AI, accesible a través da nosa api pplx e sen enriquecementos adicionais.

Para cada indicación, os mesmos resultados de busca e fragmentos fixéronse chegar aos modelos pplx-7b-online e pplx-70b-online. Todas as respostas xeráronse utilizando os mesmos hiperparámetros e indicación do sistema.

Indicación do sistema

plaintext
Current date: Monday, November 20, 2023.

Clasificación de respostas de modelos mediante avaliación humana

Para cada comparación por pares, aos nosos contratistas internos proporcionóuselles a propia indicación, os criterios de avaliación (é dicir, utilidade, veracidade ou actualización) e as respostas dos modelos amosadas carón a carón. A orde das respostas aleatorizouse en cada turno, e os modelos de orixe non se revelaron ao evaluador. Instruíuse aos evaluadores para que seleccionasen a resposta que prefiren holisticamente, así como cal rende mellor no criterio de avaliación específico, permitindo empates para ambos. Finalmente, os evaluadores puideron utilizar a busca en internet para verificar a exactitude das respostas. Construímos a nosa propia ferramenta de clasificación de preferencias interna para realizar esta avaliación.

Resultados da avaliación

Utilizamos as clasificacións de preferencias por pares recollidas da avaliación humana para calcular as puntuacións Elo por tarefa para cada modelo. As puntuacións Elo utilízanse habitualmente para clasificar unha poboación de xogadores en competicións de estilo torneo para medir o rendemento relativo dos xogadores. Cando se aplican a grandes modelos de linguaxe, estas puntuacións proporcionan unha predición de como de probable é que un evaluador humano favoreza a saída dun modelo fronte a outro.

Aínda que as puntuacións Elo adoitan calcularse para unha secuencia de comparacións para ter en conta os cambios nas capacidades dos xogadores, o noso obxectivo é cuantificar o rendemento de modelos cuxas capacidades non poden cambiar. En consecuencia, adoptamos a metodoloxía Bootstrap Elo descrita en Duan et al e tamén utilizada por lmsys para o seu Chatbot Arena, o que supón calcular as puntuacións Elo para moitas permutacións aleatorias das comparacións. Para os nosos cálculos, calculamos as puntuacións Elo en máis de 5000 permutacións e utilizamos as distribucións destas puntuacións Elo para calcular intervalos de confianza do 95%.

Os resultados, amosados na Figura 1, demostran que os nosos modelos PPLX poden igualar e mesmo superar o rendemento de gpt-3.5 en casos de uso relacionados con Perplexity. En particular, os evaluadores humanos prefiren as respostas dos modelos pplx-7b-online e pplx-70b-online fronte ás respostas dos modelos gpt-3.5 e llama2-70b polas súas respostas precisas e actualizadas.

Os modelos pplx-7b-online e pplx-70b-online funcionan mellor que gpt-3.5 e llama2-70b, nos criterios de actualización, veracidade e holístico.

Figura 1. Puntuacións Elo estimadas e intervalos de confianza do 95% para pplx-7b (-online), pplx-70b (-online), llama2-70b e gpt-3.5 en catro conxuntos de avaliación diferentes. Por exemplo, no eixe de actualización, pplx-7b e pplx-70b funcionan mellor que gpt-3.5 e llama2-70b, cunha puntuación Elo estimada de 1100,6 e 1099,6 fronte a 879,3 e 920,3, respectivamente.

Tamén calculamos as taxas de vitoria por pares a partir da avaliación. Os resultados, amosados na Figura 2, ilustran, quizais sen sorpresa, que as respostas do modelo en liña pplx son preferidas ás doutros en canto a actualización e veracidade.

Figura 2. Taxas de vitoria dos modelos no eixe vertical fronte aos modelos no eixe horizontal. Por exemplo, as respostas de pplx-70b (-online) foron cualificadas como holísticamente superiores ás de gpt-3.5 no 64% das consultas e as respostas de gpt-3.5 foron cualificadas como holísticamente superiores ás de pplx-70b (-online) no 24% das consultas.

Aquí tes un exemplo do noso conxunto de datos de avaliación de actualización.

Indicación: Cantas persoas en EUA teñen un permitu de conducir?

pplx-7b-online

En 2023, proxéctase que hai 243,4 millóns de condutores con licenza nos Estados Unidos, o que inclúe o 89% dos adultos estadounidenses. Este número aumentou desde os 238,6 millóns en 2022. A porcentaxe de condutores con licenza varía entre os diferentes grupos de idade e estados. Por exemplo, en 2019, o 84,1% da poboación estadounidense tiña un permiso de conducir. A porcentaxe máis alta de condutores con licenza atópase entre os mozos de 25 a 49 anos, co 90,1% da poboación cun permiso de conducir. En California, había 27 millóns de condutores con licenza, o que o converte no estado co maior número de condutores con licenza.

pplx-70b-online

En 2021, arredor de 233 millóns de persoas tiñan permisos de conducir válidos nos Estados Unidos. Para 2023, proxéctase que o número de condutores con licenza nos EE. UU. alcance os 243,4 millóns, o que inclúe o 89% dos adultos estadounidenses. Isto representa un aumento desde os 238,6 millóns en 2022.

gpt-3.5

Como modelo de linguaxe de intelixencia artificial, non teño acceso a datos en tempo real. Con todo, a partir de 2021, estimábase que arredor de 227 millóns de persoas nos Estados Unidos tiñan un permiso de conducir válido. Ten en conta que este número puido cambiar desde entón, polo que sempre é mellor consultar as últimas estatísticas oficiais para obter a información máis precisa.

llama2-70b

Non teño acceso a datos en tempo real, pero podo proporcionar algunha información sobre o número aproximado de persoas nos Estados Unidos que teñen un permiso de conducir. Segundo a Administración Federal de Estradas, había aproximadamente 227,8 millóns de condutores con licenza nos Estados Unidos a partir de 2020. Este número inclúe tanto a condutores comerciais como non comerciais. Cómpre salientar que este número é probablemente unha subestimación, xa que non ten en conta aos individuos que poden ter un permiso de conducir pero non conducen regularmente ou en absoluto. Ademais, este número non inclúe aos individuos que non son elixibles para un permiso de conducir, como os que son menores de 16 anos ou teñen certas discapacidades. Tamén é importante ter en conta que o número de condutores con licenza pode variar segundo o estado, cunha porcentaxe maior de condutores con licenza nuns estados ca noutros.

En xeral, os resultados da avaliación demostran que os nosos modelos PPLX poden igualar e mesmo superar a gpt-3.5 e llama2-70b en casos de uso relacionados con Perplexity, en particular para proporcionar respostas precisas e actualizadas.

Acceso aos modelos en liña de Perplexity

Estamos encantados de anunciar que pplx-api deixa atrás a fase beta para lanzarse ao público xeral! Esta é a primeira vez que os nosos modelos pplx-7b-online e pplx-70b-online son accesibles a través de pplx-api. Ademais, os nosos modelos pplx-7b-chat e pplx-70b-chat saíron da fase alfa e xa son accesibles co noso lanzamento xeral.

Con isto, introducimos unha nova estrutura de prezos baseada no uso. Estamos entusiasmados de que os nosos usuarios utilicen a nosa infraestrutura de vangarda, que emprega NVIDIA H100s para ofrecer inferencias ultrarrápidas. Os usuarios Pro recibirán un crédito mensual recorrente de 5 $ para pplx-api. Para todos os demais usuarios, os prezos determinaranse en función do uso. Para rexistrarte como usuario Pro, preme aquí. Póñase en contacto con api@perplexity.ai para consultas comerciais.

Panel de control do LLM en liña PPLX

Recursos adicionais:

Colaboradores:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats