Presná definícia
Čo znamená regularizácia L2?
Regularizácia L2 pridáva k strate λ-násobok súčtu štvorcov vybraných parametrov. Gradient penalizácie je plynulý a úmerný veľkosti parametra, takže veľké váhy tlmí silnejšie, no spravidla ich nenastaví presne na nulu. V SGD súvisí s weight decay, ale pri adaptívnom optimalizátore pridanie L2 do gradientu nie je totožné s oddeleným rozpadom váh.
Skúsenosť a kontext
Ako sa pojem používa v praxi
L2 sa používa na obmedzenie veľkých koeficientov a zlepšenie stability pri kolinearite. Tím zjednotí konvenciu faktora 1/2, lebo knižnice môžu λ interpretovať rozdielne, a rozhodne, ktoré parametre penalizuje. Pri neurónových sieťach sa porovná L2 v loss s AdamW decay iba ako odlišné algoritmy. Účinok sa hodnotí validačným výkonom a normami váh; nízka tréningová strata sama neukazuje vhodnú silu regularizácie.
Overiteľnosť
Odborné zdroje
Praktické odpovede
Často kladené otázky
Čo sa pridáva do straty?
Koeficient krát súčet druhých mocnín vybraných parametrov.
Ako pôsobí?
Pridá zložku úmernú aktuálnej hodnote parametra.
Vytvára riedky model?
Zvyčajne nie, váhy skôr plynulo zmenšuje.
Prečo pozor na faktor 1/2?
Mení gradient aj číselný význam zadaného λ.
Je L2 rovnaké ako AdamW?
Nie, adaptívne škálovanie mení penalizačný gradient, AdamW decay oddeľuje.
Prihlásiť / registrovať