Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

perplexita

Anglický výraz perplexity

pokročiléheslo č. 4905 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená perplexita?

Perplexita jazykového modelu je exponenciála priemernej negatívnej log-pravdepodobnosti tokenov; možno ju chápať ako efektívny počet rovnako pravdepodobných volieb na krok. Nižšia hodnota na rovnakých dátach a s rovnakou tokenizáciou znamená lepšiu predikciu. Medzi rôznymi slovníkmi alebo jednotkami nie je bez úpravy priamo porovnateľná.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Používa sa na sledovanie predtrénovania, výber checkpointu a meranie doménového posunu. Eval korpus sa nesmie objaviť v tréningu, strata sa váži konzistentne podľa tokenov a osobitne sa reportujú jazyky či žánre. Pre chatovací produkt sa perplexita dopĺňa úlohovými, faktickými a bezpečnostnými evalmi.

Overiteľnosť

Odborné zdroje

  1. Speech and Language Processing - language modelsweb.stanford.edu
  2. Language Models are Few-Shot Learnersarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje perplexita?

Z krížovej entropie H=-(1/N)Σlog p(x_t|context) sa vypočíta exp(H); pri prirodzenom logaritme je základom e.

Kedy má perplexita praktický význam?

Používa sa na sledovanie predtrénovania, výber checkpointu a meranie doménového posunu.

S čím si pojem nezamieňať?

Presnosť ďalšieho tokenu hodnotí iba najvyššiu voľbu, kým perplexita využíva celú pravdepodobnosť pridelenú skutočnému tokenu.

Ako sa výsledok kontroluje?

Kontroluje sa čistota eval dát, maskovanie paddingu, základ logaritmu, váženie tokenov a intervaly neistoty medzi dokumentmi.

Na čo si dať pozor?

Nízka perplexita nezaručuje pravdivosť ani užitočnosť a môže zvýhodniť memorovanie; zmena tokenizéra mení menovateľ aj hodnotu.