Presná definícia
Čo znamená optimalizátor Adam?
Adam kombinuje exponenciálne priemery prvého momentu gradientu a jeho druhého surového momentu, opravuje ich počiatočné vychýlenie k nule a tvorí adaptívny krok pre každý parameter. Menovateľ škáluje aktualizáciu podľa nedávnej veľkosti gradientov a čitateľ nesie momentum. Adam je prakticky robustný, ale jeho hyperparametre a regularizácia stále ovplyvňujú generalizáciu aj stabilitu.
Skúsenosť a kontext
Ako sa pojem používa v praxi
Adam je častá prvá voľba pre transformátory, generatívne modely a riedke či rozdielne škálované gradienty. Tím volí learning rate, bety a epsilon a sleduje normu aktualizácie, nie iba gradientu. Pri obnove sa musia načítať oba momentové stavy a počítadlo krokov, inak sa znovu skreslí bias correction. Ak sa požaduje weight decay, treba rozlíšiť L2 člen pridaný do gradientu od decoupled variantu AdamW.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo sú m a v?
Exponenciálny priemer gradientu a jeho druhej mocniny.
Prečo bias correction?
Priemery začínajú nulou a v prvých krokoch sú systematicky podhodnotené.
Ako sa mení krok parametra?
Delí sa odmocninou z odhadu druhého momentu plus epsilon.
Čo obsahuje checkpoint optimalizátora?
m, v, počet krokov a konfiguráciu skupín parametrov.
Je Adam s L2 to isté ako AdamW?
Vo všeobecnosti nie; AdamW oddeľuje rozpad váh od adaptívneho gradientu.
Prihlásiť / registrovať