Presná definícia
Čo znamená transformátor?
Transformátor je neurónová architektúra, ktorá modeluje vzťahy medzi prvkami najmä pomocou viac-hlavovej pozornosti, pozičnej informácie, dopredných blokov, reziduálnych spojení a normalizácie. Pôvodný model mal enkóder aj autoregresívny dekóder; označenie dnes zahŕňa aj encoder-only a decoder-only varianty. Pozornosť umožňuje paralelne spracovať tréningové pozície, no plná verzia je pamäťovo náročná pri dlhom kontexte.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Transformátory tvoria základ pre jazykové, obrazové a viacmodalitné modely. Projekt musí vybrať typ masky, tokenizáciu, pozičné kódovanie a dĺžku kontextu podľa úlohy. Pri generovaní sa využíva cache kľúčov a hodnôt, aby sa minulé tokeny neprepočítavali. Hodnotenie zahŕňa kvalitu pri rôznych dĺžkach, pamäť, latenciu prvého aj ďalších tokenov a odolnosť voči vstupom mimo tréningového rozdelenia.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo obsahuje základný blok?
Pozornosť, pozíciovú doprednú sieť, reziduálne spojenia a normalizáciu.
Aký je rozdiel encoder-only a decoder-only?
Prvý spracúva celý vstup, druhý používa kauzálnu masku na generovanie.
Ako model pozná pozície?
Pridaným alebo rotačným pozičným kódovaním či iným relačným mechanizmom.
Je okno kontextu to isté ako pamäť faktov?
Nie; určuje dostupné vstupné pozície, nie spoľahlivé uloženie znalostí.
Prečo sa dobre paralelizuje pri tréningu?
Vrstvy nemusia prechádzať tokeny striktne po jednom ako RNN.
Prihlásiť / registrovať