Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

gradientný zostup

Anglický výraz gradient descent

základnéheslo č. 3515 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená gradientný zostup?

Gradientný zostup je iteratívna optimalizácia, ktorá mení parametre v opačnom smere gradientu cieľovej funkcie. Gradient určuje lokálny smer najrýchlejšieho rastu pre zvolenú metriku priestoru; krok -η∇L preto pri dostatočne malej miere učenia typicky znižuje stratu. Pri nekonvexnej neurónovej sieti negarantuje globálne minimum a výsledok závisí od škálovania, inicializácie a trajektórie.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri tréningu sa vypočíta strata dávky, automatická diferenciácia vytvorí gradienty, optimalizátor aktualizuje parametre a gradienty sa pred ďalším krokom vymažú. Tím sleduje tréningovú aj validačnú krivku, normu gradientu a veľkosť aktualizácie voči norme váh. Ak strata diverguje, najprv sa overia dáta, znamienko, redukcia loss a miera učenia. Plochá krivka môže znamenať malý krok, saturáciu, chybný graf alebo nulové gradienty.

Overiteľnosť

Odborné zdroje

  1. Deep Learning Book · Optimizationdeeplearningbook.org
  2. PyTorch · torch.optimdocs.pytorch.org

Praktické odpovede

Často kladené otázky

Prečo mínus gradient?

Gradient ukazuje lokálne najrýchlejší rast, takže opačný smer znižuje funkciu.

Čo určuje η?

Veľkosť zmeny parametrov pri jednej aktualizácii.

Nájde vždy globálne minimum?

Iba pri špecifických podmienkach; hlboké siete sú nekonvexné.

Prečo záleží na škálovaní?

Rôzne zakrivenie osí môže spôsobiť cikcakovú a pomalú trajektóriu.

Čo sledovať okrem loss?

Normy gradientov, aktualizácií, váh a výkon na validácii.