Perplexity 如何将准确性融入顶尖 AI

我们的核心工作始终专注于将准确性融入顶尖 AI。我们首次分享了实现这一目标背后的部分技术。

我们的使命是激发好奇心,为那些想要深入了解并利用世界知识实现更多目标的人提供支持。为此,我们的核心工作始终专注于提升顶尖 AI 模型在 Perplexity 上的准确性。

我们首次分享了实现这一目标背后的部分技术。今天,我们的研究团队发布了一篇关于搜索增强型大语言模型(LLMs)的技术探索报告。

我们采用了多种流程来提升准确性,这是其中一个流程的罕见深度解析:通过训练后的顶尖 AI 模型,使其在 Perplexity 产品(如 Search、Comet 和 Computer)的准确性标准测试中发挥最佳水平。

我们先训练行为,再进行搜索

答案引擎不仅要求底层模型能生成流畅的文本。它们还必须能够寻找证据、遵循用户指令、正确使用工具,并将这些工作转化为精准的回答。

我们分两个阶段进行训练后的优化。首先,我们教导模型如何在产品内表现,包括如何遵循指令、保持一致性以及正确使用工具。随后,我们在更复杂的搜索任务上对其进行训练,以提升其寻找证据、有效利用证据并更高效地回答问题的能力。

这种分阶段的方法是 Perplexity 与传统的“模型+网页访问”封装模式之间的简单区别之一。这就是为什么同一个模型在不同产品中会产生不同的结果,以及为什么它在 Perplexity 中的表现优于简单的部署方式。

需要综合处理的问题

有些问题是简单的查询。其他问题则需要模型连接跨来源的证据。

我们针对那些需要模型连接跨来源证据的问题进行训练。对于事实性问题,我们使用的任务会迫使模型进行搜索、推理和验证,而不是仅依据明显的线索直接得出答案。许多问题需要连接多个来源的信息,这要求模型从一个证据移动到另一个证据,并由此链条构建出答案。

我们还针对不同的回复格式进行训练,以确保无论用户需要段落、列表、表格还是其他结构,模型都能保持准确。其结果是实现更好的综合能力,即答案能连接跨来源的证据,而不仅仅是检索孤立的事实。

开放式任务需要标准

Perplexity 不仅用于事实查询。大量工作是开放式的,包括改写、编辑、总结、解释和规划。

这些任务没有唯一的标准答案,但仍然需要评估标准。对于开放式工作,我们使用评估量表(rubrics),即通过结构化的检查来判断回复是否真正完成了任务。它是否遵循了指令?是否保留了含义?是否解决了用户的问题?

这让我们能够以明确的标准来训练开放式任务,而不是将其视为自由形式的写作。

准确性优先于偏好

对于事实性任务,答案必须先准确无误,才能获得更有帮助或文笔更好的评价。对于开放式任务,回复必须满足评估量表的要求,然后其他质量维度才会发挥作用。

这使系统保持对实质内容的关注,而非拘泥于形式。它有助于防止一种常见的失败模式:答案听起来不错,但实际上并不准确。其回报是减少了那些经不起仔细推敲的华丽辞藻答案。

效率有助于提升答案质量

我们还训练模型以严谨的态度使用搜索。

任何额外的搜索步骤都应提升答案的质量,更长的回复应体现其价值。当额外的搜索或辞藻无助于改善答案时,系统应当停止。

这能产出更易于使用的答案,并在模型处理较长的操作链时保持专注,防止因小错误累积而造成偏差。

更好的答案需要持续的努力

搜索质量源于产品如何训练模型去收集证据、严谨地回答问题、处理开放式任务,并在获得足够支持时停止。

随着 AI 系统承担更长期、更自主的工作,这种训练决定了个别答案以及建立在其之上的所有工作的质量。我们从未声称 Perplexity 是 100% 准确的,但我们确实声称是对此最关切并不断致力于提升的 AI 公司。我们鼓励所有用户对 Perplexity 的答案提供反馈,因为我们一直在不断迭代和改进。