Q2D-Web:大規模評估第一階段檢索器

具備 7 萬個代理程式查詢、1.9 億個網頁文檔以及三組相關性判斷的基準與排行榜。

作者Perplexity Engineering

今天,我們隆重推出 Q2D-Web (Query2Doc-Web),這是一個用於評估具備代理能力的 RAG 系統中檢索功能的私有基準與公開排行榜。Q2D-Web 將我們原本的 Q2D 基準擴展至大規模語料庫、更大的查詢集以及更深層的判斷標註。

Q2D-Web 旨在評估大規模網絡搜尋中的嵌入模型。它由 1.9 億個網頁文檔和 69,721 個十種語言的經代理程式重新表述的查詢組成,這些查詢是透過九個月的無 PII 生產搜尋流量採樣而來的。

在此規模下,查詢-文檔層級的相關性訊號難免稀疏。我們不將單一來源視為黃金標準,而是提供三個相關性判斷集,分別衍生自代理程式引用、生產網絡排名,以及針對先前未判斷對侶的額外 LLM 判斷。多個來源限制了任何單一標記管線帶來的偏差,而更深入的標註則減少了假陰性。

我們的排行榜 報告了公開發布的檢索模型的結果,這些模型使用一致的索引、檢索和評分管線直接針對基準進行評估。評估可以透過我們的 要求表單提交。

實際檢索評估的挑戰

對於每個查詢,生產規模的檢索系統會搜尋包含數十億個網頁的語料庫,並傳回數千個候選文檔。這些候選文檔決定了下游系統可以看到哪些來源,直接影響代理程式可用的證據。

因此,對這個第一階段進行實際評估需要符合三個維度規模的基準:語料庫中的文檔數量、已判斷的查詢數量,以及每個查詢的相關性判斷數量。

較大的語料庫可以透過引入困難的干擾項(在語意上與查詢相似但未提供所請求資訊的文檔)來使基準更具鑑別力。檢索器必須將這些合理的匹配項與相關文檔區分開來。正如我們下面的子採樣實驗所示,在保留已知相關文檔的同時縮減語料庫可能會移除這些干擾項並誇大召回率。

更多經過判斷的查詢能使效能估算更具可靠性。在查詢集較小的情況下,基準結果會極大地取決於所採樣的查詢,這使得我們更難以精確估算出每個模型的效能,也更難以確切區分各個模型。

更深入的判斷可減少評估中的假陰性。在標籤稀疏的情況下,檢索器可能會浮現未經判斷的相關文檔,因而被錯誤地計為不相關。這會降低評估的可靠性。MS MARCO 是資訊檢索中的主要大規模開放資料集,並塑造了神經檢索模型的發展。其中,70% 經人工檢查、頂部檢索但未標記的段落實際上是相關的。

現有基準往往僅在其中一或兩個維度上擴展:網絡規模的集合通常只有相對較少的已判斷查詢,而包含許多查詢的基準通常使用小得多的語料庫和稀疏的標籤。此外,大多數基準都使用人工編寫的查詢,而具備代理能力的 RAG 系統則使用經代理程式重新表述的查詢進行搜尋,這些查詢在措辭、結構和具體性上可能有所不同。

Q2D-Web 在所有三個維度上進行了擴展。在其組合判斷集中,它包含 1.9 億個網頁文檔、69,721 個經代理程式重新表述的查詢,以及每個查詢平均 99.6 個正向相關性判斷。最接近的公開比較是 MS MARCO Web Search,即 MS MARCO 的網絡規模版本。它擁有 1.009 億個文檔、9,374 個測試查詢,以及每個查詢一個衍生自點擊的正向標籤。

我們是如何建立 Q2D-Web 的

Q2D-Web 的四個建構階段:查詢採樣、語料庫組合、相關性判斷和子語料庫採樣。
Q2D-Web 建構:隱私過濾查詢抽樣、語料庫組裝與去重複、相關性標註以及子語料庫抽樣。

查詢

Q2D-Web 建立在九個月期間收集的 23,000 個無 PII 生產搜尋的基礎上,涵蓋十種語言和數十個領域。

一項搜尋包含代理程式為回應使用者訊息而執行的所有網絡搜尋工具呼叫。每個工具呼叫都包含一個或多個查詢。每個查詢均根據使用者要求、先前對話,以及適用的情況下從同一搜尋中較早擷取的文檔進行重新表述。每個生產搜尋包含一個主要查詢(重述使用者的資訊需求)以及零個或多個支援查詢(探索替代措辭、背景資訊或相關實體)。儘管它們處理的是更廣泛的相同要求,但它們可能需要不同的文檔,因此 Q2D-Web 會透過自身的相關性判斷獨立評估每個查詢。

Q2D-Web 查詢長度和語言分佈。
Q2D-Web 69,721 個查詢的長度與語言分佈。長度以字元為單位計算;長條圖顯示每個類別中查詢的比例。
Q2D-Web 查詢在各領域的分佈。
Q2D-Web 查詢在各個主題領域的分佈。長條圖顯示各領域佔查詢集的比例;「其他」群組包含十五個額外領域。


我們對所有包含的查詢套用嚴格的隱私過濾。查詢必須來自允許使用其資料的使用者,並且使用 perplexity-ai/pplx-pii-masking 進行 PII 偵測,以排除包含個人資訊的查詢。我們也會移除確切的重複項、極短的查詢以及包含諸如 site: 或引號片語等搜尋運算子的查詢。

該基準涵蓋十種語言。英語佔查詢的 65.8%,其次是西班牙語、俄語、德語、法語、葡萄牙語、義大利語、韓語、日語和中文。查詢分佈還橫跨了廣泛的領域組合,包括消費品、程式設計、法律、健康、商業、科學、教育、技術、金融、旅遊、娛樂、政治、本地資訊和新聞。

語料庫

對於每個查詢,我們使用生產檢索系統檢索前 5,000 個文檔,並取這些結果集的聯集。然後,我們使用 MinHash–LSH 對語料庫進行去重複處理,將 Token 5-gram 集的 Jaccard 相似度至少達到 0.975 的文檔進行分群。

該集合故意不採用隨機網絡樣本。每個文檔都被認為是至少一個基準查詢的合理結果。這會產生一組密集且困難的干擾項:與查詢的主題或語言相符,但可能缺少所需的日期、實體、版本、數量或面向的頁面。

Q2D-Web 語料庫中的文檔長度和語言分佈。
大約 1.9 億篇文件語料庫中的文件長度與語言分佈。長度以字元為單位計算;長條圖顯示每個類別中文件的比例。

判斷集

在大規模下,相關性標籤本質上是不完整的。對所有可能的查詢-文檔對進行標註是不可行的,且每個判斷來源都帶有不同的偏差。

Q2D-Web 使用三個相關性集,而不是將單一來源視為黃金標準,藉此提高標註深度,同時避免遭受單一偏差的影響。

引用將文檔標記為相關,條件是代理程式在回覆中引用了它。這是最接近下游使用的信號:代理程式將該文檔選為某個聲明的證據。但就其建構方式而言,引用具有高精確率和低召回率的特點。一旦代理程式有了足夠的支援,它就沒有什麼理由去引用其他每個相關網頁。

網絡排名包含每個查詢最多 50 個文檔(平均 43.1 個),這些文檔是由內部檢索堆疊在第一階段使用 BM25 和密集檢索識別出來的,隨後進行交叉編碼器重排。這擷取了有用但未被引用的文檔。

組合 + LLM 判斷取引用和網絡排名的聯集,然後為先前未判斷的候選文檔新增 LLM 判斷,其目標是減少假陰性數量。我們將來自 BM25ColBERTv2 以及 2025 年 1 月 1 日之前發布的七個密集檢索器的結果進行池化,使用互惠排名融合(RRF)合併其排名,選擇前 500 個未判斷的文檔,並使用 DeepSeek-V4-Flash 套用嚴格的二元相關性判斷器。

這三組數據讓我們能夠探討模型效能是否取決於相關性的定義方式。它們還減少了對單一標記堆疊的依賴,否則該堆疊可能會偏向類似於用於生成標籤的系統的檢索器。

引用、網絡排名、LLM 判斷和組合相關性集的每個查詢相關文檔分佈。
以對數尺度表示每個查詢的相關文件分佈。綜合標籤結合了引用、網絡排名和額外的 LLM 判定。

子採樣:在大規模下進行高效評估

完整語料庫的評估既昂貴又緩慢。使用 pplx-embed-v1-4b 在 Q2D-Web 上進行單次評估需要 4,608 個 H200 GPU 小時,而即使是像 EmbeddingGemma-300M 這樣的小型模型,也需要將近 200 個 H200 GPU 小時。

為了保持評估的實用性,我們建立了語料庫的子採樣版本。

我們對採樣策略進行了廣泛的消融實驗,以建立一個反映完整語料庫行為的小型子語料庫。每種策略都保留所有被判定為正向的文檔,並且僅在如何選擇未判斷的干擾項方面有所不同。重要的干擾項是檢索器很可能會排在相關文檔之上的干擾項,因為這些干擾項會改變模型的得分及其在排名中的位置。

我們比較了均勻隨機採樣、在建構檢索器中池化至固定深度,以及在不同深度上進行每查詢 RRF。基於 RRF 的採樣僅使用了完整語料庫中 31.7% 的文檔。它保留了完整語料庫的模型排名,同時貼近絕對分數,與相同大小的隨機採樣的 11.1 個點相比,平均 Recall@1000 僅膨脹了 4.5 個點。

跨語料庫採樣策略比較檢索召回率與模型排名相關性的子採樣消融實驗。
跨抽樣策略的平均 Recall@1000 與完整語料庫模型排名的吻合度。倒數排名融合(RRF)利用 31.7% 的語料庫保留了被評估模型的排名,且比隨機抽樣具有更少的召回膨脹。

這將評估成本降低至完整語料庫成本的大約三分之一。使用基於 RRF 的子語料庫時,pplx-embed-v1-4b 大約需要 1,500 個 H200 GPU 小時,而 EmbeddingGemma-300M 則需要少於 70 小時。

每個提交都會先在採樣的子語料庫版本上進行評估。提交內容按總參數計數分為兩組:1B 以下和 1B 以上。在採樣子語料庫上達到其組別前十名的模型,隨後將在完整語料庫上進行評估。在其組別中排名在前 10 名之外的模型將僅發布在採樣子語料庫排行榜上。

評估結果

在評估的模型中,Q2D-Web 透過其 3 個不同的相關性集,提供了網絡規模下檢索效能的一致視角。排行榜將這些互補的視角並排呈現,讓使用者能夠檢視模型在較窄的基於引用的標籤和較廣泛的相關性判斷下的效能表現。

我們將 Recall@1000 作為主要指標,因為第一階段檢索器只需要將相關文檔放入候選池中,而後續的重排則決定其最終順序。

針對十三個檢索器(按模型家族分組)的水平軸 Combined nDCG@10 與垂直軸 Combined Recall@1000 散佈圖。
十三個檢索器(按模型家族分組)的 Combined Recall@1000 對比 Combined nDCG@10。最高分模型因兩種指標而異。

表 1. 十三個檢索器在引用、網絡排名和綜合相關性集上的 Recall@1000 與 nDCG@10。分數越高越好。

模型

Recall@1000:引用

Recall@1000:網絡排名

Recall@1000:組合

nDCG@10:引用

nDCG@10:網絡排名

nDCG@10:組合

BM25-tantivy

43.92

42.50

44.77

5.74

11.45

30.30

EmbeddingGemma-300M

58.17

58.93

65.45

9.20

17.30

43.56

mDenseOn

51.78

52.56

59.31

7.63

15.06

40.20

Nemotron-3-Embed-1B

54.40

54.37

61.68

7.54

14.83

40.21

Nemotron-3-Embed-8B

61.68

61.73

68.58

10.16

18.69

47.44

pplx-embed-v1-0.6b

58.35

62.15

67.02

9.37

19.76

44.36

pplx-embed-v1-4b

61.22

65.73

69.11

10.33

21.29

45.84

Qwen3-Embedding-0.6B

50.10

51.82

57.89

6.58

14.11

37.38

Qwen3-Embedding-4B

54.95

55.60

62.01

7.67

14.97

40.21

Qwen3-Embedding-8B

57.38

58.34

64.53

8.30

16.27

42.69

voyage-4-nano

49.38

50.14

56.67

5.41

11.77

31.63

mLateOn

52.85

53.12

60.98

8.44

15.51

43.11

pplx-embed-v1-late-0.6b

56.56

58.14

63.40

9.13

17.25

43.39

沒有模型能在所有三個判斷集上都領先。在 Recall@1000 上,pplx-embed-v1-4b 在網絡排名(65.73)和組合(69.11)上最高,而 Nemotron-3-Embed-8B 在引用(61.68)上最高。在組合 Recall@100 和 nDCG@10 上,順序有所改變,Nemotron-3-Embed-8B(30.03 和 47.44)高於 pplx-embed-v1-4b(29.82 和 45.84)。

在同一個系列中,較大的模型在組合 Recall@1000 上的得分更高。Qwen3-Embedding 從 57.89 (0.6B) 上升至 64.53 (8B),Nemotron-3-Embed 從 61.68 (1B) 上升至 68.58 (8B),而 pplx-embed-v1 從 67.02 (0.6B) 上升至 69.11 (4B)。

Perplexity 模型使用與所有其他提交模型相同的管線進行評估。然而,由於 Q2D-Web 源自 Perplexity 生產流量,這些模型可能會受益於分佈內優勢。儘管基準的評估查詢和語料庫已從模型訓練中排除,但在解讀結果時仍應考慮這項潛在優勢。

如何提交至排行榜

如需要求評估,請透過我們的評估要求表單提交公開可用的 Hugging Face 模型。

我們遵循提交儲存庫中的模型卡來設定特定於模型的推論設定,包括建議的查詢和文檔指示或前綴、池化、正規化以及相似性函數。所有查詢和文檔都使用模型自身的標記器截斷至 512 個 Token,包含指示、前綴和特殊標記,因此較長的支援上下文不會帶來任何優勢。請確保模型卡提供完整且明確的指示,以重現預期的檢索設定。

合資格的模型必須透過標準的 transformerssentence-transformers API 載入。無法在 trust_remote_code=False 情況下執行的模型,在評估前需要對自訂程式碼和提交者進行人工審查,這會花費相當多的時間。私有或受閘道保護的儲存庫不具備資格。

閱讀我們的技術報告以深入了解方法論與研究結果。