Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

politika jedného cyklu

Anglický výraz one-cycle policy

pokročiléheslo č. 3715 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená politika jedného cyklu?

Politika jedného cyklu je tréningový plán, ktorý počas jedného hlavného cyklu zvýši learning rate z nízkej na vysokú hodnotu a potom ju zníži hlboko pod počiatočnú; momentum sa často mení opačne. Super-konvergenčná formulácia používa veľké maximálne lr aj ako regularizačný účinok. Presný tvar, podiel rastovej fázy a konečný deliaci faktor sa medzi implementáciami líšia.

Skúsenosť a kontext

Ako sa pojem používa v praxi

One-cycle sa nastavuje z maximálneho lr a presného počtu optimizer krokov za celý tréning. Tím zohľadní akumuláciu gradientov, drop_last aj počet epoch a scheduler volá po každej aktualizácii parametrov. LR range test pomôže nájsť hornú hranicu ešte pred dlhým behom. Keď sa zmení dataset alebo world size, plán sa musí prepočítať. Pri obnove sa načíta fáza schedulera, inak môže lr nečakane vyskočiť.

Overiteľnosť

Odborné zdroje

  1. Smith & Topin · Super-convergencearxiv.org
  2. Smith · Cyclical learning ratesarxiv.org

Praktické odpovede

Často kladené otázky

Ako vyzerajú?

Úvodný rast k max_lr a následný dlhší pokles k veľmi malej hodnote.

Ako sa často mení?

Inverzne k learning rate: klesá pri raste lr a potom rastie.

Čo musí byť známe vopred?

Celkový počet skutočných aktualizácií parametrov.

Ako ho odhadnúť?

Krátkym range testom a overením stability na celej konfigurácii.

Prečo načítať scheduler?

Musí pokračovať v správnom bode jediného cyklu.