Perplexity 如何將準確性融入前沿 AI

我們的核心重點始終是將準確性融入前沿 AI。我們首次分享我們實現這一目標背後的部分技術。

我們的使命是激發好奇心,為那些希望了解更多並利用世界知識完成更多事情的人們提供助力。為此,我們的核心重點始終是讓最好的前沿 AI 模型在 Perplexity 上更加精確。

我們首次分享我們實現這一目標背後的技術之一。今天,我們的研究團隊發表了一篇關於搜尋增強型大型語言模型 (LLMs)的技術探索。

我們採用了數十種流程來提升準確性,以下是其中一種流程的罕見內部視角:對前沿 AI 模型進行後續訓練,使其針對 Search、Comet 和 Computer 等 Perplexity 產品的準確性標準達到最佳表現。

我們在搜尋之前訓練行為

答案引擎要求基礎模型不僅僅是生成流暢的文本。它們必須找到證據、遵循使用者的請求、正確使用工具,並將這些工作轉化為重點明確的答案。

我們分為兩個階段進行後續訓練。首先,我們教導模型如何在產品內運作,包括如何遵循指示、保持一致性以及正確使用工具。然後,我們在更艱難的搜尋任務上對其進行訓練,使其在尋找證據、有效利用證據以及更高效地回答問題方面有所改進。

這種分階段方法是 Perplexity 與具有模型和網絡存取權限的傳統封裝設置之間的簡單區別之一。這就是為什麼同一個模型在不同產品中會產生不同結果的原因,也是它在 Perplexity 中比在更簡單的部署中表現更好的原因。

需要綜合的問題

有些問題屬於簡單查詢。其他問題則需要模型跨來源連接證據。

我們針對需要模型跨來源連接證據的問題進行訓練。對於事實性問題,我們使用強制模型進行搜尋、推理和驗證的任務,而不是僅從一個明顯的線索就跳到答案。許多問題需要連接多個來源的資訊。它們要求模型從一項證據轉移到另一項證據,並由此鏈條構建答案。

我們還針對不同的回應格式進行訓練,確保模型無論使用者需要段落、列表、表格還是其他結構,都能保持準確。其結果是更好的綜合能力,即由連接跨來源證據的答案組成,而不是僅僅檢索孤立的事實。

開放式任務需要標準

Perplexity 的用途不僅限於事實查詢。許多工作是開放式的,包括重寫、編輯、總結、解釋和規劃。

這些任務沒有一個確切的正確答案,但它們仍然需要標準。對於開放式工作,我們使用量規,這是對回應是否真正完成工作的結構化檢查。它是否遵循了指示?它是否保留了意義?它是否解決了使用者的問題?

這使我們能夠以明確的標準訓練開放式任務,而不是將其視為自由形式的寫作。

準確性優先於偏好

對於事實性任務,答案必須正確,才能獲得更有幫助或寫得更好的點數。對於開放式任務,回應必須滿足量規要求,其他品質才會發揮作用。

這使系統保持關注實質而非形式。它有助於防止一種常見的失敗模式,即聽起來更好但實際上並未更好的答案。其回報是減少了在審查下無法經受考驗的華而不實的答案。

效率有助於提高答案品質

我們還訓練模型有紀律地使用搜尋。

任何額外的搜尋步驟都應改進答案,而更長的回應應證明其長度的必要性。當額外的搜尋或額外的文字沒有幫助時,系統應該停止。

這產生的答案更易於使用,並在模型處理較長的行動鏈(小錯誤會累積)時保持其專注力。

更好的答案需要持續的努力

搜尋品質源於產品如何訓練模型來收集證據、有紀律地回答、處理開放式工作,以及在獲得足夠支持時停止。

隨著 AI 系統承擔更長、更自主的工作,這種訓練塑造了個別答案的品質以及建立在其之上的所有內容。我們從未聲稱 Perplexity 是 100% 準確的,但我們確實聲稱我們是這家最關心準確性並堅持不懈地對其進行改進的 AI 公司。我們鼓勵所有使用者對他們的 Perplexity 答案提供反饋,因為我們正在不斷迭代和改進。