介绍 PPLX 在线大语言模型

首款同类在线大语言模型 (LLM) API

Perplexity releases first "Live" LLM

首款同类在线大语言模型 (LLM) API。

我们很高兴与大家分享两款全新的 PPLX 模型:pplx-7b-onlinepplx-70b-online!我们的在线模型专注于提供有益、最新且符合事实的回复,并已通过 pplx-api 公开,成为首款此类 API。pplx-7b-onlinepplx-70b-online 也可通过我们的 LLM 试验场 Perplexity Labs 进行访问。

大语言模型 (LLM) 改变了我们寻找信息的方式。然而,当今大多数 LLM 存在两个局限性:

时效性:LLM 在共享最新信息时往往力不从心。

幻觉:LLM 可能会输出不准确的陈述。

我们的 pplx-7b-onlinepplx-70b-online 模型通过在回复中额外提供有益、真实且最新的信息,解决了当前的局限性。

PPLX 在线大语言模型

我们的 LLM,即 pplx-7b-onlinepplx-70b-online,之所以被称为在线大语言模型,是因为它们能够利用互联网上的知识,从而在生成回复时运用最新信息。通过为我们的 LLM 提供来自网络的信息,我们的模型能够准确响应时间敏感型查询,解锁训练语料之外的知识。这意味着 Perplexity 的在线 LLM 可以回答诸如“昨晚勇士队的比赛比分是多少?”这类离线模型难以处理的查询。总体而言,我们的在线 LLM 工作原理如下:

  1. 利用开源模型: 我们的 PPLX 模型建立在 mistral-7bllama2-70b 基础模型之上。
  2. 内部搜索技术: 我们内部的搜索、索引和抓取基础设施使我们能够利用最相关、最新和有价值的信息来增强 LLM。我们的搜索索引规模庞大,定期更新,并使用先进的排名算法来确保优先展示高质量、非 SEO 优化的网站。我们称之为“片段”的网站摘录被提供给我们的 pplx-online 模型,以使回复能够包含最新信息。
  3. 微调: 我们的 PPLX 模型经过微调,能够有效利用片段来提供回复信息。通过我们内部的数据承包商,我们精心策划高质量、多样化且庞大的训练集,以在有用性、事实性和时效性等各个维度上实现高性能。我们的模型会定期进行微调,以持续提升性能。

评估 Perplexity 的在线大语言模型

Perplexity 的使命是构建世界上最好的答案引擎,一个人们信任并可用于探索和扩展知识的引擎。为实现这一目标,我们深耕于提供有益、真实且最新的信息。为了在这些维度上对我们的 LLM 性能进行基准测试,我们策划了评估数据集,以反映答案引擎面临的挑战性但切合实际的用例。对于评估集中的每个查询,承包商会收到两个模型回复,并被要求根据以下标准选择表现更好的一个:

  • 有用性: 哪个回复能更好地回答查询并遵循指定的指令?
  • 事实性: 哪个回复能提供更准确且无幻觉的答案,即使是对于需要极其精确或特定领域知识的问题?
  • 时效性:(灵感来自 FreshLLMs):哪个回复包含更多最新信息?如果一个模型能够用“新鲜”的信息回答查询,那么它在这一标准上表现优异。

除了上述三个标准外,我们还对模型回复进行了整体评估。为了全面评估回复,评估人员被要求挑选如果他们作为人类助手协助查询时更愿意收到的那个回复。

策划评估集

为了进行此次评估,我们精心挑选了一组多样化的提示词,旨在有效评估有用性、事实性和时效性。每个提示词均经人工精选,确保对数据的质量和相关性具有高度控制。数据集涵盖了广泛的答案引擎提示词,并全面概括了我们希望 Perplexity 擅长的领域。这对于我们模型性能评估获取高信号至关重要。

三个评估集中的每一个都包含 50 个提示词。这些集合中的一些示例包括:

  • 有用性: 创建一个表格,列出所有参加世界杯决赛的美国足球运动员,并为他们的统计数据(如进球数、助攻数等)设置列。
  • 事实性: 解释 AISI 1015 和 AISI 1040 钢的韧性。
  • 最新性: 哪家自动驾驶汽车公司在 2023 年被旧金山禁止运营?

生成模型回复

我们评估了四个模型:

pplx-7b-online:Perplexity 的模型,包含对互联网信息的访问权限。该模型使用 mistral-7b 进行微调。

pplx-70b-online:Perplexity 的模型,包含对互联网信息的访问权限。该模型使用 llama2-70b 进行微调。

gpt-3.5-turbo-1106:OpenAI 的模型,通过 API 访问且无额外增强。请注意,我们使用最新的 gpt-3.5 模型进行了此次评估。

llama2-70b-chat:Meta AI 的模型,通过我们的 pplx-api 访问且无额外增强。

对于每个提示词,向 pplx-7b-onlinepplx-70b-online 模型提供了相同的搜索结果和片段。所有回复均使用相同的超参数和系统提示词生成。

系统提示词

plaintext
Current date: Monday, November 20, 2023.

通过人工评估对模型回复进行排名

对于每一次配对比较,我们内部的承包商会收到提示词本身、评估标准(即有用性、事实性或时效性)以及并排展示的模型回复。回复的顺序在每一轮中都是随机的,且评估人员不知道源模型。评估人员被要求选择他们整体上更喜欢的回复,以及在特定评估标准上表现更好的回复,两者均允许平局。最后,评估人员可以使用互联网搜索来验证回复的准确性。我们构建了自己的内部偏好排名工具来执行此评估。

评估结果

我们使用通过人工评估收集的配对偏好排名来计算每个模型的每项任务 Elo 分数。Elo 分数通常用于在锦标赛式的比赛中对选手群体进行排名,以衡量选手的相对表现。当应用于大语言模型时,这些分数可以预测人类评估者偏好某个模型输出而非另一个模型的可能性。

虽然 Elo 分数通常通过一系列比较来计算以反映选手能力的变化,但我们的目标是量化能力不变的模型性能。因此,我们采用了 Duan et al 描述并被 lmsys 用于其 Chatbot Arena 的 Bootstrap Elo 方法,该方法涉及对大量随机排列的比较计算 Elo 分数。在我们的计算中,我们对 5000 次排列进行了 Elo 分数计算,并利用这些 Elo 分数的分布来计算 95% 的置信区间。

如图 1 所示,结果表明我们的 PPLX 模型在 Perplexity 相关用例中能够匹配甚至超越 gpt-3.5 的性能。特别是在回答的准确性和时效性方面,人类评估者更倾向于 pplx-7b-onlinepplx-70b-online 的模型回复,而非 gpt-3.5llama2-70b 的回复。

时效性事实性整体性标准上,pplx-7b-onlinepplx-70b-online 的表现优于 gpt-3.5llama2-70b

图 1. pplx-7b (-online)、pplx-70b (-online)、llama2-70b 和 gpt-3.5 在四个不同评估集上的估计 Elo 分数及 95% 置信区间。例如,在时效性维度上,pplx-7b 和 pplx-70b 的表现优于 gpt-3.5 和 llama2-70b,其估计 Elo 分数分别为 1100.6 和 1099.6,而后者分别为 879.3 和 920.3。

我们还计算了评估中的配对胜率。如图 2 所示的结果或许不出所料地说明,pplx 在线模型在时效性事实性方面的回复更受青睐。

图 2. 模型在纵轴上对阵横轴模型的胜率。例如,pplx-70b (-online) 的回复在 64% 的查询中被评为整体上优于 gpt-3.5,而 gpt-3.5 的回复在 24% 的查询中被评为整体上优于 pplx-70b (-online)。

以下是我们时效性评估数据集中的一个示例。

提示词:美国有多少人拥有驾照?

pplx-7b-online

2023 年,美国预计有 2.434 亿持证驾驶员,占美国成年人的 89%。这一数字较 2022 年的 2.386 亿有所增加。持证驾驶员的比例在不同年龄组和各州之间存在差异。例如,2019 年,84.1% 的美国人口拥有驾照。25 至 49 岁人群的持证比例最高,90.1% 的人口拥有驾照。在加利福尼亚州,有 2700 万持证驾驶员,是持证驾驶员人数最多的州。

pplx-70b-online

2021 年,美国约有 2.33 亿人持有有效驾照。到 2023 年,美国持证驾驶员人数预计将达到 2.434 亿,占美国成年人的 89%。这较 2022 年的 2.386 亿有所增加。

gpt-3.5

作为 AI 语言模型,我无法访问实时数据。然而,据估计,截至 2021 年,美国约有 2.27 亿人持有有效驾照。请注意,此数字自那时起可能已发生变化,因此最好参考最新的官方统计数据以获取最准确的信息。

llama2-70b

我无法访问实时数据,但我可以提供一些关于美国拥有驾照人数的大致信息。根据联邦公路管理局的数据,截至 2020 年,美国约有 2.278 亿持证驾驶员。该数字包括商业和非商业驾驶员。值得注意的是,该数字可能被低估了,因为它未计入那些可能拥有驾照但不经常开车或完全不开车的人。此外,该数字不包括那些没有资格获得驾照的人,例如 16 岁以下或患有某些残疾的人。同样重要的是要注意,持证驾驶员的数量因州而异,一些州的持证比例高于其他州。

总体而言,评估结果表明我们的 PPLX 模型在 Perplexity 相关用例中能够匹配甚至超越 gpt-3.5llama2-70b 的性能,尤其是在提供准确和最新的回复方面。

访问 Perplexity 的在线模型

我们很高兴宣布 pplx-api 即将结束 Beta 测试,正式全面公开发布!这是我们的 pplx-7b-onlinepplx-70b-online 模型首次可以通过 pplx-api 访问。此外,我们的 pplx-7b-chatpplx-70b-chat 模型已结束 Alpha 测试,现可通过我们的全面发布进行访问。

随之而来,我们引入了基于用量的定价结构。我们很高兴用户能够利用我们的一流基础设施,该基础设施利用 NVIDIA H100s 来提供极速推理。Pro 用户将获得每月 5 美元的循环 pplx-api 积分。对于所有其他用户,定价将根据使用量确定。如需注册成为 Pro 用户,请点击此处。商业咨询请通过 api@perplexity.ai 联系。

PPLX 在线大语言模型仪表板

其他资源:

贡献者:

Lauren Yang, Kevin Hu, Aarash Heydari, Gradey Wang, Dmitry Pervukhin, Nikhil Thota, Alexandr Yarats, Max Morozov, Denis Yarats