Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

dávkový gradientný zostup

Anglický výraz batch gradient descent

základnéheslo č. 3545 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená dávkový gradientný zostup?

Dávkový gradientný zostup vypočíta každý krok z celej tréningovej množiny. Pre fixné parametre tak používa presný gradient empirickej straty bez vzorkovacieho šumu, ale jeden krok vyžaduje úplný priechod dátami a veľkú pamäť alebo akumuláciu. Termín „batch“ tu znamená full-batch a nemá sa zamieňať s bežným minibatche v knižniciach.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Full-batch postup je použiteľný pri malých dátach, pri niektorých metódach druhého rádu alebo pri experimentoch, kde sa študuje deterministická optimalizácia. Gradient možno akumulovať po častiach bez aktualizácie parametrov, pričom sa strata správne váži podľa počtu vzoriek. Tím kontroluje, že medzi časťami nevolá optimizer.step a že BatchNorm či augmentácie nemenia interpretáciu „celého“ gradientu. Náklad sa porovnáva podľa času do cieľovej metriky, nie počtu krokov.

Overiteľnosť

Odborné zdroje

  1. Deep Learning Book · Optimizationdeeplearningbook.org
  2. PyTorch · SGDdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Z akých dát vznikne jeden gradient?

Zo všetkých príkladov tréningovej množiny.

Má vzorkovací rozptyl?

Nie vzhľadom na fixnú konečnú množinu, hoci výpočet môže mať numerickú nedeterministiku.

Musí sa celý dataset zmestiť naraz?

Nie, gradient sa dá presne sčítať po menších blokoch.

Koľko aktualizácií je v epoche?

Pri presnom full-batch postupe jedna.

Prečo môže byť pomalý?

Každá zmena parametrov čaká na spracovanie celej množiny.