Q2D-Web: Procjena pretraživača prve faze u obimu

Mjerna tačka i rang-lista sa 70 hiljada upita agenata, 190 miliona veb dokumenata i tri skupa ocjena relevantnosti.

АуториPerplexity Engineering

Danas predstavljamo Q2D-Web (Query2Doc-Web), privatnu mjernu tačku i javnu rang-listu za procjenu preuzimanja u agentskim RAG sistemima. Q2D-Web proširuje našu originalnu Q2D mjernu tačku na korpus velikog obima, veći skup upita i dublje anotacije ocjena.

Q2D-Web je napravljen za procjenu modela ugrađivanja na veb pretrazi velikog obima. Sastoji se od 190 miliona veb dokumenata i 69.721 upita koje su preoblikovali agenti na deset jezika, uzorkovanih tokom devet mjeseci produkcijskog saobraćaja pretrage bez PII-a.

U ovom obimu, signal relevantnosti na nivou upita i dokumenta je neizbježno rijedak. Umjesto da jedan izvor tretiramo kao osnovnu istinu, mi obezbjeđujemo tri skupa ocjena relevantnosti, izvedena iz citata agenata, rangiranja produkcijskog veba i dodatnih ocjena LLM-a za prethodno neocijenjene parove. Više izvora ograničava pristrasnost iz bilo kog pojedinačnog cjevovoda označavanja, dok dublja anotacija smanjuje lažne negative.

Naša rang-lista izvještava o rezultatima za javno objavljene modele preuzimanja, procijenjene direktno u odnosu na mjernu tačku korišćenjem dosljednog cjevovoda za indeksiranje, preuzimanje i bodovanje. Procjena se može poslati putem našeg obrasca zahtjeva.

Izazov realistične procjene preuzimanja

Za svaki upit, sistem preuzimanja u produkcijskom obimu pretražuje korpus od milijardi veb stranica i vraća hiljade dokumenata kandidata. Ovi kandidati određuju koje izvore sistemi nizvodno mogu da vide, direktno oblikujući dokaze dostupne agentu.

Realistična procjena ove prve faze stoga zahtijeva mjerne tačke koje se skaliraju duž tri dimenzije: broja dokumenata u korpusu, broja ocijenjenih upita i broja ocjena relevantnosti po upitu.

Veći korpusi mogu učiniti mjernu tačku diskriminativnijom uvođenjem teških negativnih primjera – dokumenata koji su semantički slični upitu, ali ne pružaju tražene informacije. Pretraživači moraju razlikovati ova plauzibilna podudaranja od relevantnih dokumenata. Skupljanje korpusa uz zadržavanje poznatih relevantnih dokumenata može ukloniti ove distraktore i naduvati prisjećanje (recall), kao što pokazuju naši eksperimenti sa poduzorkovanjem u nastavku.

Više ocijenjenih upita čini procjene performansi pouzdanijim. Sa malim skupom upita, rezultati mjerne tačke u velikoj mjeri zavise od toga koji su upiti uzorkovani, što otežava preciznu procjenu performansi svakog modela i pouzdano razlikovanje među modelima.

Dublje ocjene smanjuju lažne negative u procjeni. Sa rijetkim oznakama, pretraživač može izvući relevantne dokumente koji su neocijenjeni i stoga se pogrešno računaju kao nerelevantni. Ovo čini procjenu manje pouzdanom. MS MARCO je glavni skup podataka velikog obima otvorenog koda u pretraživanju informacija i oblikovao je razvoj modela neuronskog preuzimanja. Tamo je 70% ručno pregledanih vrhunskih preuzetih, ali neoznačenih odlomaka zapravo bilo relevantno.

Postojeće mjerne tačke obično se skaliraju u samo jednoj ili dvije od ovih dimenzija: kolekcije u obimu veba često imaju relativno malo ocijenjenih upita, dok mjerne tačke sa mnogo upita uglavnom koriste mnogo manje korpuse i rijetke oznake. Štaviše, većina mjernih tačaka koristi upite koje su napisali ljudi, dok agentski RAG sistemi pretražuju sa upitima koje su preoblikovali agenti i koji se mogu razlikovati po formulaciji, strukturi i specifičnosti.

Q2D-Web se skalira kroz sve tri dimenzije. Sadrži 190 miliona veb dokumenata, 69.721 upit koji su preoblikovali agenti i prosječno 99,6 pozitivnih ocjena relevantnosti po upitu u svom kombinovanom skupu ocjena. Najbliže javno poređenje je MS MARCO Web Search, verzija MS MARCO-a u obimu veba. Ima 100,9 miliona dokumenata, 9.374 testna upita i jednu pozitivnu oznaku po upitu izvedenu klikom.

Kako smo kreirali Q2D-Web

Izgradnja Q2D-Web u četiri faze: uzorkovanje upita, sastavljanje korpusa, ocjene relevantnosti i uzorkovanje podkorpusa.
Изградња Q2D-Web-а: узорковање упита филтрирано по приватности, састављање и дедупликација корпуса, означавање релевантности и узорковање подкорпуса.

Upiti

Q2D-Web je izgrađen na 23.000 produkcijskih pretraga bez PII-a na deset jezika i desetinama domena prikupljenih tokom perioda od devet mjeseci.

Pretraga se sastoji od svih poziva alata za veb pretragu koje agent izvršava kao odgovor na poruku korisnika. Svaki poziv alata sadrži jedan ili više upita. Svaki upit se preoblikuje iz korisničkog zahtjeva, prethodnog razgovora i, gdje je primjenjivo, dokumenata preuzetih ranije u istoj pretrazi. Svaka produkcijska pretraga sadrži jedan primarni upit, koji ponovo definiše informacione potrebe korisnika, i nula ili više podržavajućih upita koji istražuju alternativne formulacije, pozadinske informacije ili srodne entitete. Iako se bave istim širim zahtjevom, oni mogu zahtijevati različite dokumente, tako da Q2D-Web procjenjuje svaki upit nezavisno sa sopstvenim ocjenama relevantnosti.

Dužina upita Q2D-Web i distribucije jezika.
Дистрибуција дужине и језика за 69.721 упит из Q2D-Web-а. Дужина се мјери у знаковима; ступци приказују удио упита у свакој категорији.
Distribucija upita Q2D-Web po domenima.
Дистрибуција упита Q2D-Web-а по предметним домену. Ступци приказују удио сваког домена у скупу упита; „Остало“ групише петнаест додатних домена.


Primjenjujemo strogo filtriranje privatnosti za sve uključene upite. Upiti moraju dolaziti od korisnika koji su dozvolili korišćenje njihovih podataka, a detekcija PII-a korišćenjem perplexity-ai/pplx-pii-masking isključuje upite koji sadrže lične podatke. Takođe uklanjamo tačne duplikate, veoma kratke upite i upite koji sadrže operatore pretrage poput site: ili citirane fraze.

Mjerna tačka pokriva deset jezika. Engleski čini 65,8% upita, a slijede španski, ruski, njemački, francuski, portugalski, italijanski, korejski, japanski i kineski. Distribucija upita također obuhvata široku mješavinu domena, uključujući potrošačku robu, programiranje, pravo, zdravstvo, poslovanje, nauku, obrazovanje, tehnologiju, finansije, putovanja, zabavu, politiku, lokalne informacije i vijesti.

Korpus

Za svaki upit preuzimamo 5.000 najboljih dokumenata pomoću produkcijskog sistema za preuzimanje i uzimamo uniju ovih skupova rezultata. Zatim uklanjamo duplikate iz korpusa koristeći MinHash–LSH, grupisanjem dokumenata čiji skupovi tokena od 5 grama imaju Jaccardovu sličnost od najmanje 0,975.

Kolekcija namjerno nije slučajan uzorak sa veba. Svaki dokument se smatrao plauzibilnim rezultatom za najmanje jedan referentni upit. Ovo stvara gust skup teških distraktora: stranica koje odgovaraju temi ili jeziku upita, ali možda propuštaju traženi datum, entitet, verziju, količinu ili aspekt.

Dužina dokumenata i jezičke distribucije u korpusu Q2D-Web.
Дистрибуција дужине и језика докумената у корпусу од приближно 190 милиона докумената. Дужина се мјери у знаковима; ступци приказују удио докумената у свакој категорији.

Ocjene

Oznake relevantnosti su po prirodi nepotpune u velikom obimu. Označavanje svakog mogućeg para upit-dokument je neizvodljivo, i svaki izvor ocjena nosi drugačiju pristrasnost.

Q2D-Web koristi tri skupa relevantnosti umjesto da jedan izvor tretira kao osnovnu istinu, kako bi se povećala dubina anotacije bez trpljenja od jedne pristrasnosti.

Citati označavaju dokument kao relevantan kada ga je agent citirao u odgovoru. Ovo je signal koji je najbliži nizvodnoj upotrebi: agent je odabrao dokument kao dokaz za tvrdnju. Ali citat je po konstrukciji visoke preciznosti i niskog prisjećanja. Jednom kada agent ima dovoljno podrške, ima malo razloga da citira svaku drugu relevantnu stranicu.

Veb rangiranje se sastoji od do 50 dokumenata po upitu (u prosjeku 43,1), identifikovanih pomoću internog cjevovoda za preuzimanje koji koristi BM25 i gusto preuzimanje u prvoj fazi, praćenog re-rangiranjem ukrštenim koderom. Ovo hvata dokumente koji su korisni, ali nisu citirani.

Kombinovano + LLM ocjene uzima uniju Citata i Veb rangiranja, zatim dodaje LLM ocjene za prethodno neocijenjene kandidate, sa ciljem da se smanji broj lažnih negativa. Sakupljamo rezultate iz BM25, ColBERTv2 i sedam gustih pretraživača objavljenih prije 1. januara 2025., spajamo njihova rangiranja koristeći fuziju recipročnog ranga (RRF), biramo 500 najboljih neocijenjenih dokumenata i primjenjujemo strogu binarnu ocjenu relevantnosti koristeći DeepSeek-V4-Flash.

Tri skupa nam omogućavaju da postavimo pitanje da li performanse modela zavise od toga kako je definisana relevantnost. Oni takođe smanjuju oslanjanje na jedan sistem označavanja, što bi inače moglo da pogoduje pretraživačima sličnim sistemu koji se koristi za generisanje oznaka.

Distribucije relevantnih dokumenata po upitu za skupove relevantnosti Citati, Veb rangiranje, LLM ocjene i Kombinovani.
Дистрибуција релевантних докумената по упиту на логаритамској скали. Комбиноване ознаке спајају цитате, веб рангирања и додатне процјене ЛЛМ-а.

Poduzorkovanje: efikasna procjena u velikom obimu

Procjena punog korpusa je skupa i spora. Jedna procjena na Q2D-Web sa pplx-embed-v1-4b zahtijeva 4.608 časova H200 GPU-a, dok čak i mali model poput EmbeddingGemma-300M zahtijeva skoro 200 časova H200 GPU-a.

Da bi procjena bila praktična, gradimo verziju korpusa sa uzorkovanjem.

Pokrenuli smo opsežnu ablaciju kroz strategije uzorkovanja kako bismo izgradili manji podkorpus koji odražava ponašanje punog korpusa. Svaka strategija zadržava sve pozitivno ocijenjene dokumente i razlikuje se samo u načinu na koji se biraju neocijenjeni distraktor. Distraktori koji su važni su oni koje će pretraživač vjerovatno rangirati iznad relevantnog dokumenta, jer oni mijenjaju rezultat modela i njegov položaj u rangiranju.

Uporedili smo uniformno slučajno uzorkovanje, sakupljanje na fiksnu dubinu u pretraživačima konstrukcije i RRF po upitu preko različitih dubina. Uzorkovanje zasnovano na RRF-u koristi samo 31,7% dokumenata u punom korpusu. Ono čuva rangiranje modela punog korpusa, istovremeno ostajući blizu apsolutnih rezultata, naduvavajući srednju vrijednost Recall@1000 za samo 4,5 poena u odnosu na 11,1 poena za slučajno uzorkovanje iste veličine.

Ablacija poduzorkovanja koja upoređuje prisjećanje preuzimanja i korelaciju rangiranja modela u različitim strategijama uzorkovanja korpusa.
Средњи Recall@1000 и поклапање са рангирањем модела цијелог корпуса кроз стратегије узорковања. Фузија реципрочног ранга (RRF) чува рангирање оцијењених модела користећи 31,7% корпуса, са мањом инфлацијом опозива него насумично узорковање.

Ovo smanjuje troškove procjene na oko jednu trećinu troškova punog korpusa. Korišćenjem podkorpusa zasnovanog na RRF-u, pplx-embed-v1-4b zahtijeva otprilike 1.500 časova H200 GPU-a, a EmbeddingGemma-300M zahtijeva manje od 70.

Svaka prijava se prvo procjenjuje na verziji uzorkovanog podkorpusa. Prijave se dijele u dvije grupe prema ukupnom broju parametara: do 1B i iznad 1B. Model koji dospije u prvih deset svoje grupe na uzorkovanom podkorpusu se zatim procjenjuje na punom korpusu. Modeli rangirani izvan prvih 10 u svojoj grupi biće objavljeni samo na rang-listi uzorkovanog podkorpusa.

Rezultati procjene

U svim ocijenjenim modelima, Q2D-Web pruža dosljedan pregled performansi preuzimanja u obimu veba kroz svoja 3 različita skupa relevantnosti. Rang-lista čini ove komplementarne prikaze dostupnim jedne pored drugih, omogućavajući korisnicima da provjere kako modeli rade pod užim oznakama zasnovanim na citatima i širim ocjenama relevantnosti.

Fokusiramo se na Recall@1000 kao naš primarni metrički pokazatelj jer pretraživač prve faze treba samo da postavi relevantne dokumente u bazen kandidata, dok naknadno re-rangiranje utvrđuje njihov konačni redoslijed.

Расипни дијаграм комбинованог nDCG@10 на хоризонталној оси и комбинованог Recall@1000 на вертикалној оси за тринаест претраживача, груписаних по породици модела.
Комбиновани Recall@1000 насупрот комбинованог nDCG@10 за тринаест претраживача, груписаних по породици модела. Модел са највишим резултатом се разликује између ове двије метрике.

Табела 1. Recall@1000 и nDCG@10 за тринаест претраживача кроз скупове релевантности Цитата, Веб Рангирања и Комбиноване. Виши резултати су бољи.

Model

Recall@1000: Citati

Recall@1000: Veb rangiranje

Recall@1000: Kombinovano

nDCG@10: Citati

nDCG@10: Veb rangiranje

nDCG@10: Kombinovano

BM25-tantivy

43.92

42.50

44.77

5.74

11.45

30.30

EmbeddingGemma-300M

58.17

58.93

65.45

9.20

17.30

43.56

mDenseOn

51.78

52.56

59.31

7.63

15.06

40.20

Nemotron-3-Embed-1B

54.40

54.37

61.68

7.54

14.83

40.21

Nemotron-3-Embed-8B

61.68

61.73

68.58

10.16

18.69

47.44

pplx-embed-v1-0.6b

58.35

62.15

67.02

9.37

19.76

44.36

pplx-embed-v1-4b

61.22

65.73

69.11

10.33

21.29

45.84

Qwen3-Embedding-0.6B

50.10

51.82

57.89

6.58

14.11

37.38

Qwen3-Embedding-4B

54.95

55.60

62.01

7.67

14.97

40.21

Qwen3-Embedding-8B

57.38

58.34

64.53

8.30

16.27

42.69

voyage-4-nano

49.38

50.14

56.67

5.41

11.77

31.63

mLateOn

52.85

53.12

60.98

8.44

15.51

43.11

pplx-embed-v1-late-0.6b

56.56

58.14

63.40

9.13

17.25

43.39

Nijedan model ne prednjači u sva tri skupa ocjena. Na Recall@1000, pplx-embed-v1-4b je najviši na Veb rangiranju (65.73) i Kombinovanom (69.11), a Nemotron-3-Embed-8B na Citatima (61.68). Na Kombinovanom Recall@100 i nDCG@10 redoslijed se mijenja, pri čemu je Nemotron-3-Embed-8B (30.03 i 47.44) iznad pplx-embed-v1-4b (29.82 i 45.84).

Unutar porodice, veći modeli ostvaruju veći broj bodova na Kombinovanom Recall@1000. Qwen3-Embedding raste sa 57,89 (0,6B) na 64,53 (8B), Nemotron-3-Embed sa 61,68 (1B) na 68,58 (8B), a pplx-embed-v1 sa 67,02 (0,6B) na 69,11 (4B).

Perplexity modeli se procjenjuju korišćenjem istog cjevovoda kao i svi drugi poslati modeli. Međutim, pošto je Q2D-Web izveden iz produkcijskog saobraćaja Perplexity-ja, ovi modeli mogu imati koristi od prednosti unutar distribucije. Iako su upiti za procjenu i korpus s mjerne tačke bili izuzeti iz obuke modela, rezultate treba tumačiti imajući u vidu ovu potencijalnu prednost.

Kako poslati prijave za rang-listu

Da biste zatražili procjenu, pošaljite javno dostupan Hugging Face model putem našeg obrasca zahtjeva za procjenu.

Pratimo karticu modela u poslatom spremištu za postavke zaključivanja specifične za model, uključujući preporučeni upit i uputstva za dokument ili prefikse, sakupljanje, normalizaciju i funkciju sličnosti. Svi upiti i dokumenti se skraćuju na 512 tokena sa sopstvenim tokenizatorom modela, uključujući uputstva, prefikse i specijalne tokene, tako da duži podržani kontekst ne donosi nikakvu prednost. Osigurajte da kartica modela pruža potpuna, nedvosmislena uputstva za reprodukciju namjeravane postavke preuzimanja.

Prihvatljivi modeli se moraju učitati preko standardnih transformers ili sentence-transformers API-ja. Modeli koji se ne pokreću sa trust_remote_code=False zahtijevaju ručnu recenziju prilagođenog koda i podnosioca prije procjene, što traje znatno duže. Privatna ili zaštićena spremišta ne ispunjavaju uslove.

Pročitajte naš tehnički izvještaj da biste saznali više o metodologiji i nalazima.