Kaip „Perplexity“ diegia tikslumą į pažangųjį DI

Mūsų pagrindinis dėmesys visada buvo kurti tikslumą į pažangųjį DI. Pirmą kartą dalijamės dalimi technologijos, slypinčios už to, kaip tai darome.

Mūsų misija – skatinti smalsumą žmonių, kurie nori sužinoti daugiau ir pasiekti daugiau naudodamiesi pasaulio žiniomis. Siekiant to, mūsų pagrindinis dėmesys visada buvo skiriamas tam, kad pažangiausi dirbtinio intelekto modeliai „Perplexity“ platformoje taptų tikslesni.

Pirmą kartą dalijamės viena iš technologijų, kurios dėka tai pasiekiame. Šiandien mūsų tyrimų komanda paskelbė techninę paieška papildytų didelių kalbos modelių (LLM) apžvalgą.

Naudojame daugybę procesų tikslumui didinti, ir tai yra reta proga pažvelgti į vieną iš jų: pažangiausių DI modelių mokymą po pirminio mokymo (angl. post-training), kad jie kuo geriau atitiktų „Perplexity“ produktų, tokių kaip „Search“, „Comet“ ir „Computer“, tikslumo standartus.

Elgseną treniruojame prieš atlikdami paiešką

Atsakymų varikliui reikia, kad pagrindiniai modeliai darytų daugiau nei vien generuotų sklandų tekstą. Jie turi rasti įrodymų, vykdyti vartotojo užklausą, tinkamai naudoti įrankius ir paversti šį darbą tikslingu atsakymu.

Tam taikome dviejų etapų mokymą po pirminio mokymo. Pirmiausia išmokome modelį, kaip elgtis produkto viduje, įskaitant tai, kaip vykdyti nurodymus, išlaikyti nuoseklumą ir tinkamai naudoti įrankius. Tada treniruojame jį atlikti sudėtingesnes paieškos užduotis, kad jam geriau sektųsi rasti įrodymus, jais naudotis ir efektyviau atsakinėti.

Šis etapinis požiūris yra vienas iš paprastų skirtumų tarp „Perplexity“ ir tradicinės apvalkalo (angl. wrapper) sąrankos su modelio ir interneto prieiga. Štai kodėl tas pats modelis skirtinguose produktuose gali duoti skirtingus rezultatus ir kodėl „Perplexity“ platformoje jis gali veikti geriau nei paprastesnės diegties atveju.

Klausimai, reikalaujantys sintezės

Kai kurie klausimai yra paprastos paieškos. Kiti reikalauja, kad modelis susietų įrodymus iš įvairių šaltinių.

Mokome modelį spręsti klausimus, reikalaujančius susieti įrodymus iš kelių šaltinių. Faktiniams klausimams naudojame užduotis, kurios verčia modelį ieškoti, mąstyti ir tikrinti, o ne iškart pereiti prie atsakymo remiantis viena akivaizgia užuomina. Daugelis klausimų reikalauja sujungti informaciją iš kelių šaltinių. Jie reikalauja, kad modelis pereitų nuo vieno įrodymo prie kito ir iš tos grandinės suformuotų atsakymą.

Taip pat treniruojame modelį dirbti su įvairiais atsakymų formatais, kad jis išlaikytų tikslumą nesvarbu, ar vartotojas pageidauja pastraipos, sąrašo, lentelės ar kitos struktūros. Rezultatas – geresnė sintezė, susidedanti iš atsakymų, kurie sujungia įrodymus iš įvairių šaltinių, o ne tik atgauna pavienius faktus.

Atviro pobūdžio užduotims reikia standartų

„Perplexity“ naudojama ne tik faktų paieškai. Daug darbo yra atviro pobūdžio, įskaitant perrašymą, redagavimą, apibendrinimą, aiškinimą ir planavimą.

Šios užduotys neturi vieno vienintelio teisingo atsakymo, tačiau joms vis tiek reikia standartų. Atviro pobūdžio darbui naudojame vertinimo gaires (angl. rubrics), kurios yra struktūrizuoti patikrinimai, ar atsakymas tikrai atliko darbą. Ar jis vykdė nurodymus? Ar išsaugojo prasmę? Ar išsprendė vartotojo problemą?

Tai leidžia mums treniruoti atviro pobūdžio užduotis remiantis aiškiais standartais, o ne traktuoti jas kaip laisvo stiliaus rašymą.

Tikslumas yra svarbesnis už pageidavimą

Faktinėms užduotims atsakymas turi būti teisingas prieš gaunant pripažinimą už tai, kad jis yra naudingesnis ar geriau parašytas. Atviro pobūdžio užduotims atsakymas turi atitikti vertinimo gaires, kad įsigaliotų kitos savybės.

Tai padeda sistemai sutelkti dėmesį į esmę, o ne į stilių. Tai padeda išvengti dažnos nesėkmės formos, kai atsakymai skamba geriau, bet iš tikrųjų nėra geresni. Rezultatas – mažiau nugludintų atsakymų, kurie subyra atidžiau juos patikrinus.

Efektyvumas prisideda prie atsakymo kokybės

Taip pat mokome modelį drausmingai naudotis paieška.

Bet kuris papildomas paieškos žingsnis turėtų pagerinti atsakymą, o ilgesnis atsakymas turi pateisinti savo ilgį. Kai papildoma paieška ar papildomi žodžiai nepadeda, sistema turi sustoti.

Tai duoda atsakymus, kuriais lengviau naudotis, ir išlaiko modelio dėmesį, kai jis dirba su ilgesnėmis veiksmų grandinėmis, kuriose smulkios klaidos kaupiasi.

Geresni atsakymai reikalauja nuolatinio darbo

Paieškos kokybė priklauso nuo to, kaip produktas išmoko modelį rinkti įrodymus, drausmingai atsakinėti, tvarkytis su atviro pobūdžio darbu ir sustoti, kai jis turi pakankamai pagrindo.

Kai DI sistemos imasi ilgesnių ir savarankiškesnių užduočių, šis mokymas lemia individualių atsakymų ir visko, kas pastatyta ant jų, kokybę. Niekada neteigėme, kad „Perplexity“ yra 100% tiksli, tačiau tvirtiname esantys ta DI įmonė, kuriai tai rūpi labiausiai ir kuri ties tuo nenutrūkstamai dirba. Raginame visus vartotojus teikti atsiliepimus apie savo „Perplexity“ atsakymus, nes mes nuolat tobulėjame ir geriname veiklą.