Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

AdaDelta

Anglický výraz AdaDelta

základnéheslo č. 3615 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená AdaDelta?

AdaDelta je adaptívny optimalizátor, ktorý používa exponenciálny priemer štvorcov gradientov a exponenciálny priemer štvorcov minulých aktualizácií. Pomer ich odmocnín určuje mierku nového kroku, takže metóda obmedzuje potrebu ručne voliť globálnu počiatočnú mieru učenia. Parameter rho určuje pamäť oboch priemerov a epsilon stabilizuje pomer pri malých hodnotách.

Skúsenosť a kontext

Ako sa pojem používa v praxi

AdaDelta možno skúsiť pri úlohách, kde AdaGrad príliš rýchlo znižuje efektívne kroky. Tím sleduje priemery gradientov aj aktualizácií a porovnáva s RMSProp pri rovnakom tréningovom rozpočte. Knižničná voľba lr stále môže násobiť výsledný krok, hoci pôvodná motivácia bola jednotkovo konzistentná aktualizácia bez citlivej globálnej miery. Pri obnove treba načítať oba akumulátory; iba váhy modelu zmenia pokračovanie tréningu.

Overiteľnosť

Odborné zdroje

  1. Zeiler · ADADELTAarxiv.org
  2. PyTorch · Adadeltadocs.pytorch.org

Praktické odpovede

Často kladené otázky

Ktoré dva používa?

Priemer štvorcov gradientov a priemer štvorcov minulých aktualizácií.

Čo určuje veľkosť kroku?

RMS minulých aktualizácií delené RMS nedávnych gradientov.

Na čo slúži?

Určuje exponenciálne zabúdanie oboch štatistík.

Je vždy presne nepotrebný?

Pôvodná formulácia ho minimalizuje, ale knižnice môžu mať násobný parameter lr.

Čo sa musí zachovať?

Oba stavové priemery pre každý parameter.