Slovník výrazov AI/Veľké jazykové modely

Veľké jazykové modely

kauzálny jazykový model

Anglický výraz causal language model

základnéheslo č. 4555 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená kauzálny jazykový model?

Kauzálny jazykový model odhaduje každý token iba z tokenov, ktoré mu v zvolenom poradí predchádzajú. Transformer používa kauzálnu masku pozornosti, aby pozícia počas tréningu nevidela budúce tokeny. Táto faktorizácia umožňuje prirodzené pokračovanie textu a presnú sekvenčnú vierohodnosť, no generovanie zostáva krokové.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Je základom chatovacích a dokončovacích modelov. Pri tréningu možno predikovať všetky pozície paralelne vďaka maske, pri inferencii sa tokeny pridávajú postupne a využíva sa cache kľúčov a hodnôt. Evaly sledujú dlhé závislosti, citlivosť na poradie a správanie po prekročení známej dĺžky kontextu.

Overiteľnosť

Odborné zdroje

  1. Language Models are Few-Shot Learnersarxiv.org
  2. Attention Is All You Needarxiv.org

Praktické odpovede

Často kladené otázky

Ako funguje kauzálny jazykový model?

Pozornosť na pozícii t je obmedzená na 1…t; výstupné logity určujú p(x_{t+1}|x_{≤t}).

Kedy má kauzálny jazykový model praktický význam?

Je základom chatovacích a dokončovacích modelov.

S čím si pojem nezamieňať?

Maskovaný jazykový model môže pri rekonštrukcii použiť ľavý aj pravý kontext, preto nie je priamo nastavený na postupné generovanie zľava doprava.

Ako sa výsledok kontroluje?

Meria sa perplexita, presnosť ďalšieho tokenu, kvalita dlhého pokračovania, latencia tokenu a správnosť kauzálnej masky.

Na čo si dať pozor?

Chyba alebo nepravdivý predpoklad v skorom kontexte sa propaguje ďalej; sekvenčné dekódovanie zvyšuje latenciu pri dlhom výstupe.