Slovník výrazov AI/Architektúry hlbokého učenia

Architektúry hlbokého učenia

transformátor

Anglický výraz transformer

základnéheslo č. 3135 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená transformátor?

Transformátor je neurónová architektúra, ktorá modeluje vzťahy medzi prvkami najmä pomocou viac-hlavovej pozornosti, pozičnej informácie, dopredných blokov, reziduálnych spojení a normalizácie. Pôvodný model mal enkóder aj autoregresívny dekóder; označenie dnes zahŕňa aj encoder-only a decoder-only varianty. Pozornosť umožňuje paralelne spracovať tréningové pozície, no plná verzia je pamäťovo náročná pri dlhom kontexte.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Transformátory tvoria základ pre jazykové, obrazové a viacmodalitné modely. Projekt musí vybrať typ masky, tokenizáciu, pozičné kódovanie a dĺžku kontextu podľa úlohy. Pri generovaní sa využíva cache kľúčov a hodnôt, aby sa minulé tokeny neprepočítavali. Hodnotenie zahŕňa kvalitu pri rôznych dĺžkach, pamäť, latenciu prvého aj ďalších tokenov a odolnosť voči vstupom mimo tréningového rozdelenia.

Overiteľnosť

Odborné zdroje

  1. Vaswani et al. · Attention Is All You Needproceedings.neurips.cc
  2. PyTorch · MultiheadAttentiondocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo obsahuje základný blok?

Pozornosť, pozíciovú doprednú sieť, reziduálne spojenia a normalizáciu.

Aký je rozdiel encoder-only a decoder-only?

Prvý spracúva celý vstup, druhý používa kauzálnu masku na generovanie.

Ako model pozná pozície?

Pridaným alebo rotačným pozičným kódovaním či iným relačným mechanizmom.

Je okno kontextu to isté ako pamäť faktov?

Nie; určuje dostupné vstupné pozície, nie spoľahlivé uloženie znalostí.

Prečo sa dobre paralelizuje pri tréningu?

Vrstvy nemusia prechádzať tokeny striktne po jednom ako RNN.