Regularizácia a stabilizácia modelov

L2 regularization

L2 regularizácia

L2 regularization rozširuje optimalizačný cieľ o penalizáciu založenú na súčte druhých mocnín parametrov. Veľké koeficienty sú postihované výraznejšie než malé, preto sa váhy plynulo zmenšujú, no spravidla nezanikajú presne. V lineárnej regresii ide o Ridge alebo Tichonovovu regularizáciu. L2 znižuje citlivosť modelu na náhodné výkyvy, pomáha pri kolinearite a môže zlepšiť numerickú stabilitu. Jej účinok závisí od škálovania vstupov a od regularizačného koeficientu.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-02

Odborná definícia

Odborná definícia

L2 regularization rozširuje optimalizačný cieľ o penalizáciu založenú na súčte druhých mocnín parametrov. Veľké koeficienty sú postihované výraznejšie než malé, preto sa váhy plynulo zmenšujú, no spravidla nezanikajú presne. V lineárnej regresii ide o Ridge alebo Tichonovovu regularizáciu. L2 znižuje citlivosť modelu na náhodné výkyvy, pomáha pri kolinearite a môže zlepšiť numerickú stabilitu. Jej účinok závisí od škálovania vstupov a od regularizačného koeficientu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

L2 funguje ako pružina pripojená ku každému koeficientu. Čím viac sa váha vzdiali od nuly, tým silnejšie ju penalizácia ťahá späť. Model tak môže používať veľa príznakov súčasne, ale bráni sa tomu, aby jeden z nich získal extrémnu váhu iba kvôli náhode v tréningovej vzorke. Pri dvoch podobných vstupoch skôr rozdelí vplyv medzi oba, než aby jeden úplne vyradil. Výsledné koeficienty bývajú stabilnejšie, ich veľkosť však zostáva závislá od jednotiek a škály dát.

Časté otázky

Časté otázky

V čom sa L2 líši od L1?

L2 zmenšuje všetky koeficienty plynulo a obyčajne zachováva hustý model. L1 podporuje riedkosť a môže niektoré váhy nastaviť presne na nulu.

Prečo L2 pomáha pri kolinearite?

Keď viac vstupov nesie podobnú informáciu, nepenalizované odhady môžu byť nestabilné. Kvadratická penalizácia obmedzí extrémne kompenzujúce sa koeficienty.

Je weight decay vždy totožný s L2?

Pri obyčajnom stochastickom gradientnom zostupe sú úzko previazané. Pri adaptívnych optimalizátoroch môže oddelený weight decay, napríklad AdamW, viesť k inému priebehu aktualizácií.

Ako L2 ovplyvňuje predikčné rozptyly?

Zvyčajne znižuje rozptyl odhadu za cenu malého systematického skreslenia. Tento kompromis môže zlepšiť výkon na nových dátach.

Treba penalizovať aj intercept?

Často nie, pretože intercept vyjadruje základnú úroveň a jeho penalizácia môže neželane posúvať priemer predikcií. Konkrétne správanie závisí od implementácie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • scikit-learn, Ridge

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.