Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

optimalizátor Adam

Anglický výraz Adam optimizer

základnéheslo č. 3595 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená optimalizátor Adam?

Adam kombinuje exponenciálne priemery prvého momentu gradientu a jeho druhého surového momentu, opravuje ich počiatočné vychýlenie k nule a tvorí adaptívny krok pre každý parameter. Menovateľ škáluje aktualizáciu podľa nedávnej veľkosti gradientov a čitateľ nesie momentum. Adam je prakticky robustný, ale jeho hyperparametre a regularizácia stále ovplyvňujú generalizáciu aj stabilitu.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Adam je častá prvá voľba pre transformátory, generatívne modely a riedke či rozdielne škálované gradienty. Tím volí learning rate, bety a epsilon a sleduje normu aktualizácie, nie iba gradientu. Pri obnove sa musia načítať oba momentové stavy a počítadlo krokov, inak sa znovu skreslí bias correction. Ak sa požaduje weight decay, treba rozlíšiť L2 člen pridaný do gradientu od decoupled variantu AdamW.

Overiteľnosť

Odborné zdroje

  1. Kingma & Ba · Adamarxiv.org
  2. PyTorch · Adamdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo sú m a v?

Exponenciálny priemer gradientu a jeho druhej mocniny.

Prečo bias correction?

Priemery začínajú nulou a v prvých krokoch sú systematicky podhodnotené.

Ako sa mení krok parametra?

Delí sa odmocninou z odhadu druhého momentu plus epsilon.

Čo obsahuje checkpoint optimalizátora?

m, v, počet krokov a konfiguráciu skupín parametrov.

Je Adam s L2 to isté ako AdamW?

Vo všeobecnosti nie; AdamW oddeľuje rozpad váh od adaptívneho gradientu.