Presná definícia
Čo znamená kauzálny jazykový model?
Kauzálny jazykový model odhaduje každý token iba z tokenov, ktoré mu v zvolenom poradí predchádzajú. Transformer používa kauzálnu masku pozornosti, aby pozícia počas tréningu nevidela budúce tokeny. Táto faktorizácia umožňuje prirodzené pokračovanie textu a presnú sekvenčnú vierohodnosť, no generovanie zostáva krokové.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Je základom chatovacích a dokončovacích modelov. Pri tréningu možno predikovať všetky pozície paralelne vďaka maske, pri inferencii sa tokeny pridávajú postupne a využíva sa cache kľúčov a hodnôt. Evaly sledujú dlhé závislosti, citlivosť na poradie a správanie po prekročení známej dĺžky kontextu.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Ako funguje kauzálny jazykový model?
Pozornosť na pozícii t je obmedzená na 1…t; výstupné logity určujú p(x_{t+1}|x_{≤t}).
Kedy má kauzálny jazykový model praktický význam?
Je základom chatovacích a dokončovacích modelov.
S čím si pojem nezamieňať?
Maskovaný jazykový model môže pri rekonštrukcii použiť ľavý aj pravý kontext, preto nie je priamo nastavený na postupné generovanie zľava doprava.
Ako sa výsledok kontroluje?
Meria sa perplexita, presnosť ďalšieho tokenu, kvalita dlhého pokračovania, latencia tokenu a správnosť kauzálnej masky.
Na čo si dať pozor?
Chyba alebo nepravdivý predpoklad v skorom kontexte sa propaguje ďalej; sekvenčné dekódovanie zvyšuje latenciu pri dlhom výstupe.
Prihlásiť / registrovať