Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

AdamW

Anglický výraz AdamW

základnéheslo č. 3605 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená AdamW?

AdamW je Adam s oddeleným rozpadom váh: po adaptívnej gradientovej aktualizácii zmenší parametre priamo úmerne ich hodnote, namiesto pridania L2 gradientu do straty. Pri adaptívnom škálovaní tieto dve operácie nie sú ekvivalentné, lebo L2 zložku by Adam preškáloval druhým momentom. Decoupling umožňuje ladiť regularizačnú silu nezávislejšie od gradientovej normalizácie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

AdamW sa bežne používa pri transformátoroch a vizuálnych modeloch. Parametre sa rozdelia do skupín: weight decay sa často vypína pre biasy a normalizačné škály, ale pravidlo treba experimentálne a reprodukovateľne uviesť. Tím ladí learning rate spolu s decay a overí, že scheduler mení správnu skupinu. Pri checkpointovaní sa ukladá stav Adamových momentov aj definícia skupín; iné zoskupenie po obnove môže potichu zmeniť tréning.

Overiteľnosť

Odborné zdroje

  1. Loshchilov & Hutter · Decoupled Weight Decayopenreview.net
  2. PyTorch · AdamWdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Čo sa oddeľuje?

Zmenšenie parametrov od gradientu dátovej stratovej funkcie.

Prečo nie je v Adamovi ekvivalentná?

Adaptívny menovateľ by L2 gradient škáloval po parametroch.

Ktoré váhy sa často vylúčia?

Biasy a parametre normalizácie, podľa zdokumentovaného pravidla.

S čím ladiť weight decay?

Spolu s learning rate, plánom a dĺžkou tréningu.

Čo môže zmeniť výsledok?

Iné rozdelenie parametrov do skupín aj pri rovnakých váhach modelu.