Perplexity 如何將準確度內建於頂尖 AI 中

我們一直以來的核心重點是將準確度內建於頂尖 AI 中。我們首次分享實現此目標背後的部分技術。

我們的使命是激發好奇心,為那些希望了解更多並利用世界知識完成更多任務的人提供支援。為此,我們一直以來的核心重點是提升頂尖 AI 模型在 Perplexity 上的準確度。

我們首次分享實現此目標背後的一項技術。今天,我們的研究團隊公佈了一份關於搜尋增強型 LLM 的技術探索報告。

我們採用了數十種流程來提升準確度,這是其中一項流程的難得內幕:對頂尖 AI 模型進行後訓練,使其在 Search、Comet 和 Computer 等 Perplexity 產品的準確度標準上發揮最佳表現。

我們在搜尋之前先訓練行為

答案引擎要求底層模型不僅要生成流暢的文字,還要能尋找證據、遵循使用者請求、正確使用工具,並將這些工作轉化為重點突出的答案。

我們為此進行兩個階段的後訓練。首先,我們教導模型如何在產品內部表現,包括如何遵循指示、保持一致性以及正確使用工具。然後,我們對其進行更艱難的搜尋任務訓練,使其更擅長尋找證據、善用證據並更有效率地回答問題。

這種分階段的方法是 Perplexity 與配備模型和網路存取權限的傳統封裝設定之間的一個簡單區別。這就是為什麼同一個模型可以在不同的產品中產生不同的結果,以及為什麼它在 Perplexity 中的運作效果會比在較簡單的部署中更好。

需要綜合整理的問題

有些問題很容易查到。有些則需要模型跨來源連結證據。

我們針對需要模型跨來源連結證據的問題進行訓練。對於事實性問題,我們使用強制模型搜尋、推理和驗證的任務,而不是從一個明顯的線索直接得出答案。許多問題需要跨多個來源連結資訊。它們要求模型從一個證據移動到另一個證據,並從該鏈條中建構答案。

我們也針對不同的回覆格式進行訓練,確保無論使用者想要段落、清單、表格還是其他結構,模型都能保持準確。其結果是更好的綜合整理,包含跨來源連結證據的答案,而不是僅僅檢索孤立的事實。

開放式任務需要標準

Perplexity 的用途不限於事實查詢。許多工作都是開放式的,包括改寫、編輯、總結、解釋和規劃。

這些任務沒有一個確切的正確答案,但它們仍然需要標準。對於開放式工作,我們使用評分標準(rubrics),即結構化檢查,以確認回覆是否真的完成了任務。它是否遵循了指示?它是否保留了語意?它是否解決了使用者的問題?

這使我們能夠以明確的標準來訓練開放式任務,而不是將它們視為自由格式的書寫。

準確度高於偏好

對於事實性任務,答案必須正確,然後才能因更有幫助或寫得更好而獲得點數。對於開放式任務,回覆必須符合評分標準,其他品質才會發揮作用。

這有助於系統專注於實質內容而非外在形式。有助於防止常見的失敗模式:答案聽起來更好,但實際上並未更好。這樣做的好處是減少了經得起檢驗卻不堪一擊的光鮮答案。

效率有助於提升答案品質

我們也訓練模型以嚴謹的態度使用搜尋。

任何額外的搜尋步驟都應該改善答案,較長的回覆也應該符合其長度。當額外的搜尋或額外的字詞沒有幫助時,系統就應該停止。

這會產生更容易使用的答案,並在模型處理較長的動作鏈條(此時小錯誤會累積)時保持專注。

更佳的答案需要持續的努力

搜尋品質源於產品如何訓練模型來收集證據、以嚴謹態度回答、處理開放式工作,以及在獲得足夠支援時停止。

隨著 AI 系統承擔更長、更自主的工作,這種訓練塑造了個別答案的品質以及建立在其之上的所有內容。我們從未聲稱 Perplexity 100% 準確,但我們確實聲稱自己是最關心此事且不懈努力的 AI 公司。我們鼓勵所有使用者對他們的 Perplexity 答案提供意見回饋,因為我們正在不斷迭代和改進。