Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

optimalizácia druhého rádu

Anglický výraz second-order optimization

základnéheslo č. 3645 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená optimalizácia druhého rádu?

Optimalizácia druhého rádu využíva okrem gradientu aj informáciu o lokálnom zakrivení cieľovej funkcie, reprezentovanú Hessovou maticou alebo jej aproximáciou. Newtonov krok rieši sústavu HΔ=-g; v hlbokých sieťach sa často používajú Hessian-vector produkty, Gaussova-Newtonova matica alebo kvázi-Newtonove aproximácie. Vyšší rád môže zlepšiť smer kroku, ale zvyšuje výpočtové a numerické nároky.

Skúsenosť a kontext

Ako sa pojem používa v praxi

Pri veľmi hladkej malej úlohe môže Newtonova či L-BFGS metóda konvergovať v menšom počte krokov. Pri veľkej sieti sa skôr používa Hessian-free postup s iteratívnym riešením a tlmením. Tím reportuje počet forward/backward ekvivalentov, pamäť a čas, pretože porovnanie podľa iterácií zvýhodňuje drahý krok. Negatívne zakrivenie a zle podmienené smery vyžadujú trust region alebo damping; presný Hessian nie je automaticky stabilný.

Overiteľnosť

Odborné zdroje

  1. Martens · Deep learning via Hessian-free optimizationproceedings.mlr.press
  2. Deep Learning Book · Optimizationdeeplearningbook.org

Praktické odpovede

Často kladené otázky

Čo obsahuje?

Druhé parciálne derivácie straty podľa dvojíc parametrov.

Ako vzniká krok?

Riešením lineárnej sústavy s gradientom a zakrivením.

Prečo sa používa?

Plná Hessova matica je pri miliónoch parametrov neúnosná.

Na čo slúži?

Stabilizuje inverziu a obmedzuje krok pri nepresnom lokálnom modeli.

Prečo nestačí počet iterácií?

Jeden druhorádový krok môže stáť mnoho gradientových vyhodnotení.