Perplexityが最先端AIに精度を組み込む方法
当社の中心的な焦点は、常に最先端AIに精度を組み込むことでした。今回初めて、その実現を支える技術の一部を共有します。

当社の使命は、世界の知識を活用して、より多くのことを知り、より多くのことを成し遂げたいと願う人々の好奇心を促進することです。その実現のため、当社は常に、最高の最先端AIモデルの精度をPerplexity上で高めることに注力してきました。
今回初めて、その実現を支える技術の一つを公開します。本日、当社の研究チームは、検索拡張LLMに関する技術的探求を公開しました。
私たちが精度を向上させるために用いるプロセスは多数存在しますが、その中の一つ、すなわちPerplexityのSearch、Comet、Computerといった製品の精度基準に対して最良のパフォーマンスを発揮させるための最先端AIモデルのポストトレーニングについて、その舞台裏を特別にご紹介します。
私たちは検索に先立ち、挙動をトレーニングします
回答エンジンには、単に流暢な文章を生成する以上の能力が基盤モデルに求められます。モデルは証拠を見つけ、ユーザーの要求に従い、ツールを正しく使用し、その作業を要点を絞った回答へと変換しなければなりません。
当社では、そのために2段階のポストトレーニングを実施しています。まず、指示に従う、一貫性を保つ、適切な方法でツールを使用するなど、製品内での挙動をモデルに教え込みます。次に、より困難な検索タスクを用いたトレーニングを行い、証拠の発見能力やその活用能力を向上させ、より効率的に回答できるようにします。
この段階的なアプローチこそが、Perplexityと、モデルとWebアクセスを組み合わせた従来のラッパー構成とのシンプルな違いです。これが、同一のモデルであっても製品によって異なる結果が生じる理由であり、また、より単純なデプロイメントよりもPerplexityにおいてより優れたパフォーマンスを発揮できる理由です。
統合を必要とする質問
簡単に検索できる質問もあれば、複数のソースにまたがる証拠を関連付ける必要がある質問もあります。
当社では、複数のソースにまたがる証拠をモデルに関連付けることを必要とする質問を用いてトレーニングを行っています。事実に関する質問に対しては、単一の明白な手がかりから回答を導き出すのではなく、検索、推論、検証を強いるようなタスクを使用します。多くの質問は、複数の情報源にまたがる情報を関連付けることを必要とします。質問はモデルに対し、ある証拠から別の証拠へと移行し、その連鎖から回答を構築することを求めます。
また、当社では異なる回答フォーマットを横断してトレーニングを行うことで、ユーザーが段落、リスト、表、その他の構造のいずれを求めている場合でも、モデルが精度を維持できるようにしています。その結果、単に孤立した事実を抽出するのではなく、ソース全体にわたる証拠を結びつける回答からなる、より優れた統合が実現されます。
オープンエンドなタスクには基準が必要
Perplexityは、事実の検索以外にも利用されています。その業務の多くは、リライト、編集、要約、説明、計画など、オープンエンドなものです。
これらのタスクには唯一の正解は存在しませんが、それでも基準は必要です。オープンエンドな作業については、回答が実際にその役割を果たしたかどうかを判断するための構造化されたチェックリストであるルーブリックを使用しています。指示に従っているか?意味を保持しているか?ユーザーの問題を解決しているか?
これにより、自由形式のライティングとして扱うのではなく、明確な基準を持ってオープンエンドなタスクをトレーニングできるようになります。
精度は好みよりも優先される
事実に基づくタスクにおいては、回答はより役に立つ、あるいはよりよく書かれていると評価される前に、正当でなければなりません。オープンエンドなタスクについては、他の特性が評価される前に、回答がルーブリックを満たしている必要があります。
これにより、システムはスタイルよりも内容に集中することができます。これは、実際には優れていないにもかかわらず、聞こえが良い回答という一般的な失敗モードを防ぐのに役立ちます。その見返りとして、精査に耐えうる、磨き上げられた回答が得られるのです。
効率性は回答の質に寄与する
また、当社はモデルが規律を持って検索を使用するようにトレーニングしています。
追加の検索ステップは回答を改善するものでなければならず、長い回答はその長さに応じた価値を持つべきです。余分な検索や過剰な言葉が役に立たない場合、システムは停止すべきです。
これにより、使いやすい回答が生成されるとともに、小さな誤りが積み重なるような長い一連の処理においても、モデルの焦点を維持することができます。
より良い回答には絶え間ない努力が必要
検索の質は、製品がいかにしてモデルをトレーニングし、証拠を収集させ、規律を持って回答させ、オープンエンドな作業を処理させ、十分な裏付けが得られた時点で停止させるかによって決まります。
AIシステムがより長く、より自律的な作業を担うようになるにつれ、そのトレーニングが個々の回答の質、そしてその上に構築されるすべてを形作ることになります。当社はPerplexityが100%正確であるとは主張していませんが、それを最も重視し、絶え間なく改善に取り組むAI企業であると自負しています。当社は、常に改善を繰り返しているため、すべてのユーザーにPerplexityの回答に対するフィードバックを提供するよう推奨しています。