Slovník výrazov AI/Optimalizácia a trénovanie

Optimalizácia a trénovanie

regularizácia L2

Anglický výraz L2 regularization

pokročiléheslo č. 3775 otázok a odpovedí2 odborné zdroje

Presná definícia

Čo znamená regularizácia L2?

Regularizácia L2 pridáva k strate λ-násobok súčtu štvorcov vybraných parametrov. Gradient penalizácie je plynulý a úmerný veľkosti parametra, takže veľké váhy tlmí silnejšie, no spravidla ich nenastaví presne na nulu. V SGD súvisí s weight decay, ale pri adaptívnom optimalizátore pridanie L2 do gradientu nie je totožné s oddeleným rozpadom váh.

Skúsenosť a kontext

Ako sa pojem používa v praxi

L2 sa používa na obmedzenie veľkých koeficientov a zlepšenie stability pri kolinearite. Tím zjednotí konvenciu faktora 1/2, lebo knižnice môžu λ interpretovať rozdielne, a rozhodne, ktoré parametre penalizuje. Pri neurónových sieťach sa porovná L2 v loss s AdamW decay iba ako odlišné algoritmy. Účinok sa hodnotí validačným výkonom a normami váh; nízka tréningová strata sama neukazuje vhodnú silu regularizácie.

Overiteľnosť

Odborné zdroje

  1. Deep Learning Book · Regularizationdeeplearningbook.org
  2. Loshchilov & Hutter · Decoupled Weight Decayopenreview.net

Praktické odpovede

Často kladené otázky

Čo sa pridáva do straty?

Koeficient krát súčet druhých mocnín vybraných parametrov.

Ako pôsobí?

Pridá zložku úmernú aktuálnej hodnote parametra.

Vytvára riedky model?

Zvyčajne nie, váhy skôr plynulo zmenšuje.

Prečo pozor na faktor 1/2?

Mení gradient aj číselný význam zadaného λ.

Je L2 rovnaké ako AdamW?

Nie, adaptívne škálovanie mení penalizačný gradient, AdamW decay oddeľuje.