Presentación de los LLM en línea PPLX
La primera API de LLM en línea de su tipo

La primera API de LLM en línea de su tipo.
¡Nos entusiasma compartir dos nuevos modelos PPLX: pplx-7b-online y pplx-70b-online! Nuestros modelos en línea se enfocan en ofrecer respuestas útiles, actualizadas y basadas en hechos, y están disponibles públicamente a través de pplx-api, lo que la convierte en una API pionera en su clase. pplx-7b-online y pplx-70b-online también son accesibles a través de Perplexity Labs, nuestro entorno de pruebas de LLM.
Los LLM han transformado la forma en que encontramos información. Sin embargo, la mayoría de los LLM actuales presentan dos limitaciones:
Actualización: los LLM a menudo tienen dificultades para compartir información actualizada.
Alucinaciones: los LLM también pueden generar afirmaciones inexactas.
Nuestros modelos pplx-7b-online y pplx-70b-online abordan las limitaciones actuales al proporcionar además información útil, basada en hechos y actualizada en sus respuestas.
LLM en línea PPLX
Nuestros LLM, pplx-7b-online y pplx-70b-online, son LLM en línea porque pueden utilizar el conocimiento de internet y, por lo tanto, aprovechar la información más actualizada al elaborar una respuesta. Al proporcionar a nuestros LLM conocimiento de la web, nuestros modelos responden con precisión a consultas sensibles al tiempo, desbloqueando información más allá de su corpus de entrenamiento. Esto significa que los LLM en línea de Perplexity pueden responder consultas como “¿Cuál fue el marcador del juego de los Warriors anoche?”, las cuales representan un desafío para los modelos fuera de línea. A grandes rasgos, así es como funciona nuestro LLM en línea:
- Aprovechar los modelos de código abierto: nuestros modelos PPLX se basan en los modelos base
mistral-7byllama2-70b. - Tecnología de búsqueda interna: nuestra infraestructura interna de búsqueda, indexación y rastreo nos permite enriquecer los LLM con la información más relevante, actualizada y valiosa. Nuestro índice de búsqueda es grande, se actualiza periódicamente y utiliza algoritmos de clasificación sofisticados para garantizar que se dé prioridad a los sitios de alta calidad que no son de SEO. Se proporcionan fragmentos de sitios web, a los que llamamos "fragmentos" (snippets), a nuestros modelos
pplx-onlinepara permitir respuestas con la información más actualizada. - Ajuste fino: nuestros modelos PPLX han sido ajustados para utilizar eficazmente los fragmentos con el fin de fundamentar sus respuestas. Mediante el uso de nuestros contratistas de datos internos, curamos cuidadosamente conjuntos de datos de entrenamiento grandes, diversos y de alta calidad para lograr un alto rendimiento en varios ejes, como la utilidad, la veracidad y la actualidad. Nuestros modelos se ajustan periódicamente para mejorar continuamente su rendimiento.
Evaluación de los LLM en línea de Perplexity
La misión de Perplexity es construir el mejor motor de respuestas del mundo, uno en el que las personas confíen para descubrir y ampliar sus conocimientos. Para lograrlo, nos enfocamos profundamente en proporcionar información útil, basada en hechos y actualizada. Para comparar el rendimiento de nuestros LLM en estos ejes, creamos conjuntos de datos de evaluación que reflejan casos de uso desafiantes pero realistas para los motores de respuestas. Para cada consulta en cada conjunto de evaluación, se entregaron a los contratistas dos respuestas de modelos con la instrucción de seleccionar la respuesta que tuviera un mejor rendimiento según los siguientes criterios:
- Utilidad: ¿qué respuesta responde mejor a la consulta y sigue las instrucciones especificadas?
- Veracidad: ¿qué respuesta proporciona respuestas más precisas sin alucinaciones, incluso para preguntas que requieren un conocimiento muy preciso o especializado?
- Actualidad (inspirado en FreshLLMs): ¿qué respuesta contiene información más actualizada? Un modelo destaca en este criterio si es capaz de responder consultas con información "fresca".
Además de los tres criterios anteriores, las respuestas de los modelos también se evaluaron de forma holística. Para evaluar las respuestas de manera holística, se pidió a los evaluadores que eligieran la respuesta que preferirían recibir de un asistente humano que ayuda con la consulta.
Curación del conjunto de evaluación
Para esta evaluación, seleccionamos cuidadosamente un conjunto diverso de indicaciones con el objetivo de evaluar eficazmente la utilidad, la veracidad y la actualidad. Cada indicación se seleccionó manualmente, lo que garantiza un alto nivel de control sobre la calidad y la relevancia de los datos. El conjunto de datos abarca una amplia gama de indicaciones de motores de respuestas y ofrece una visión general integral de aquello en lo que queremos que Perplexity sobresalga. Esto es fundamental para que nuestras evaluaciones de rendimiento del modelo tengan una alta señal.
Cada uno de los tres conjuntos de evaluación contiene 50 indicaciones. Algunos ejemplos de estos conjuntos incluyen:
- Utilidad: Crea una tabla de todos los jugadores de fútbol de EE. UU. que jugaron en las finales de la Copa Mundial y haz columnas para sus estadísticas como goles, asistencias, etc.
- Veracidad: Explica la tenacidad de los aceros AISI 1015 y AISI 1040.
- Actualidad: ¿Qué empresa de automóviles autónomos fue prohibida en San Francisco en 2023?
Generación de respuestas del modelo
Evaluamos cuatro modelos:
pplx-7b-online: El modelo de Perplexity, que incluye acceso a información de internet. Este modelo se ajustó mediante mistral-7b.
pplx-70b-online: El modelo de Perplexity, que incluye acceso a información de internet. Este modelo se ajustó mediante llama2-70b.
gpt-3.5-turbo-1106: El modelo de OpenAI, al que se accede a través de la API y sin aumentos adicionales. Tenga en cuenta que realizamos esta evaluación utilizando el modelo gpt-3.5 más reciente.
llama2-70b-chat: El modelo de Meta AI, al que se accede a través de nuestra pplx-api y sin aumentos adicionales.
Para cada indicación, se proporcionaron los mismos resultados de búsqueda y fragmentos a los modelos pplx-7b-online y pplx-70b-online. Todas las respuestas se generaron utilizando los mismos hiperparámetros e indicación de sistema.
Indicación del sistema
Current date: Monday, November 20, 2023.Clasificación de las respuestas de los modelos mediante evaluación humana
Para cada comparación por pares, a nuestros contratistas internos se les proporcionó la indicación en sí, los criterios de evaluación (es decir, utilidad, veracidad o actualidad) y las respuestas del modelo mostradas una al lado de la otra. El orden de las respuestas se aleatorizó en cada turno y los modelos de origen no se revelaron al evaluador. Se instruyó a los evaluadores para que seleccionaran la respuesta que preferían holísticamente, así como cuál tenía un mejor rendimiento en el criterio de evaluación específico, permitiendo empates en ambos casos. Finalmente, los evaluadores pudieron utilizar la búsqueda en internet para verificar la precisión de las respuestas. Construimos nuestra propia herramienta interna de clasificación de preferencias para realizar esta evaluación.
Resultados de la evaluación
Utilizamos las clasificaciones de preferencias por pares recopiladas de la evaluación humana para calcular las puntuaciones de Elo por tarea para cada modelo. Las puntuaciones de Elo se utilizan comúnmente para clasificar a una población de jugadores en competencias estilo torneo para medir el rendimiento relativo de los jugadores. Cuando se aplican a grandes modelos de lenguaje, estas puntuaciones proporcionan una predicción de la probabilidad de que un evaluador humano favorezca la salida de un modelo sobre otro.
Si bien las puntuaciones de Elo se calculan típicamente para una secuencia de comparaciones para dar cuenta de los cambios en las habilidades de los jugadores, nuestro objetivo es cuantificar el rendimiento de los modelos cuyas habilidades no pueden cambiar. En consecuencia, adoptamos la metodología Bootstrap Elo descrita en Duan et al y también utilizada por lmsys para su Chatbot Arena, lo que implica calcular las puntuaciones de Elo para muchas permutaciones aleatorias de las comparaciones. Para nuestros cálculos, calculamos las puntuaciones de Elo en más de 5000 permutaciones y utilizamos las distribuciones de estas puntuaciones de Elo para calcular intervalos de confianza del 95%.
Los resultados, que se muestran en la Figura 1, demuestran que nuestros modelos PPLX pueden igualar e incluso superar el rendimiento de gpt-3.5 en casos de uso relacionados con Perplexity. En particular, las respuestas de los modelos pplx-7b-online y pplx-70b-online son preferidas sobre las respuestas de los modelos gpt-3.5 y llama2-70b por los evaluadores humanos debido a sus respuestas precisas y actualizadas.
pplx-7b-online y pplx-70b-online tienen un mejor rendimiento que gpt-3.5 y llama2-70b en los criterios de actualidad, veracidad y holístico.

También calculamos las tasas de victorias por pares a partir de la evaluación. Los resultados, que se muestran en la Figura 2, ilustran, quizás sin sorpresa, que las respuestas del modelo en línea de pplx se prefieren a las de otros en cuanto a actualidad y veracidad.

Aquí hay un ejemplo de nuestro conjunto de datos de evaluación de actualidad.
Indicación: ¿Cuántas personas en EE. UU. tienen licencia de conducir?
pplx-7b-online
En 2023, se proyecta que hay 243.4 millones de conductores con licencia en los Estados Unidos, lo que incluye al 89% de los adultos estadounidenses. Este número ha aumentado desde los 238.6 millones en 2022. El porcentaje de conductores con licencia varía según los diferentes grupos de edad y estados. Por ejemplo, en 2019, el 84.1% de la población de EE. UU. tenía licencia de conducir. El porcentaje más alto de conductores con licencia se encuentra entre las personas de 25 a 49 años, con un 90.1% de la población con licencia de conducir. En California, hubo 27 millones de conductores con licencia, lo que lo convierte en el estado con el mayor número de conductores con licencia.
pplx-70b-online
En 2021, alrededor de 233 millones de personas tenían licencias de conducir válidas en los Estados Unidos. Para 2023, se proyecta que el número de conductores con licencia en EE. UU. alcance los 243.4 millones, lo que incluye al 89% de los adultos estadounidenses. Esto representa un aumento desde los 238.6 millones en 2022.
gpt-3.5
Como modelo de lenguaje de IA, no tengo acceso a datos en tiempo real. Sin embargo, a partir de 2021, se estimó que alrededor de 227 millones de personas en los Estados Unidos tenían una licencia de conducir válida. Tenga en cuenta que este número puede haber cambiado desde entonces, por lo que siempre es mejor consultar las estadísticas oficiales más recientes para obtener la información más precisa.
llama2-70b
No tengo acceso a datos en tiempo real, pero puedo proporcionar cierta información sobre el número aproximado de personas en los Estados Unidos que tienen licencia de conducir. Según la Administración Federal de Carreteras, había aproximadamente 227.8 millones de conductores con licencia en los Estados Unidos a partir de 2020. Este número incluye tanto a conductores comerciales como no comerciales. Vale la pena señalar que este número probablemente sea una subestimación, ya que no toma en cuenta a las personas que pueden tener una licencia de conducir pero que no conducen regularmente o no conducen en absoluto. Además, este número no incluye a las personas que no son elegibles para una licencia de conducir, como aquellos que son menores de 16 años o tienen ciertas discapacidades. También es importante señalar que el número de conductores con licencia puede variar según el estado, y algunos estados tienen un porcentaje mayor de conductores con licencia que otros.
En general, los resultados de la evaluación demuestran que nuestros modelos PPLX pueden igualar e incluso superar a gpt-3.5 y llama2-70b en casos de uso relacionados con Perplexity, en particular al proporcionar respuestas precisas y actualizadas.
Acceso a los modelos en línea de Perplexity
¡Nos complace anunciar que pplx-api está saliendo de la fase beta hacia su lanzamiento general al público! Esta es la primera vez que nuestros modelos pplx-7b-online y pplx-70b-online son accesibles a través de pplx-api. Además, nuestros modelos pplx-7b-chat y pplx-70b-chat han salido de la fase alfa y ahora son accesibles con nuestro lanzamiento general.
Con esto, estamos introduciendo una nueva estructura de precios basada en el uso. Nos emociona que nuestros usuarios utilicen nuestra infraestructura de vanguardia, que emplea NVIDIA H100s para proporcionar una inferencia increíblemente rápida. Los usuarios Pro recibirán un crédito mensual recurrente de $5 para pplx-api. Para todos los demás usuarios, los precios se determinarán en función del uso. Para registrarse como usuario Pro, haga clic aquí. Comuníquese a api@perplexity.ai para consultas comerciales.

Recursos adicionales:
- Comience con pplx-api aquí.
- Pruebe nuestros modelos en línea de forma gratuita con Perplexity Labs.
- Obtenga más información sobre nuestra API a través de la documentación de pplx-api.
- ¿Le interesa trabajar en un equipo de alto impacto y alta velocidad que construye el mejor motor de respuestas? ¡Únase a nosotros!
- ¡Únase a nuestra creciente comunidad de Discord!
Colaboradores:
Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats