Regularizace a stabilizace modelů

L2 regularizace

L2 regularization rozširuje optimalizační cíl o penalizaci založenou na súčte druhých mocnín parametrů. Velké koeficienty jsou postihované výraznejšie než malé, proto se váhy plynulo zmenšují, ale zpravidla nezanikají přesně. V lineární regresii jde o Ridge nebo Tichonovovu regularizaci. L2 snižuje citlivost modelu na náhodné výkyvy, pomáhá při kolinearite a může zlepšit numerickou stabilitu. Její účinek závisí na škálování vstupů a od regularizačného koeficientu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-02

Odborná definice

Odborná definice

L2 regularization rozširuje optimalizační cíl o penalizaci založenou na súčte druhých mocnín parametrů. Velké koeficienty jsou postihované výraznejšie než malé, proto se váhy plynulo zmenšují, ale zpravidla nezanikají přesně. V lineární regresii jde o Ridge nebo Tichonovovu regularizaci. L2 snižuje citlivost modelu na náhodné výkyvy, pomáhá při kolinearite a může zlepšit numerickou stabilitu. Její účinek závisí na škálování vstupů a od regularizačného koeficientu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

L2 funguje jako pružina pripojená ku každému koeficientu. Čím více se váha vzdiali od nuly, tím silnější ji penalizace ťahá zpět. Model tak může používat mnoho příznaků současně, ale bráni se tomu, aby jeden z nich získal extrémnu váhu pouze kvůli náhode v tréninkové vzorku. Při dvou podobných vstupech dříve rozdělí vliv mezi oba, než aby jeden zcela vyradil. Výsledné koeficienty bývají stabilnejšie, jejich velikost však zůstává závislá od jednotek a škály dat.

Časté otázky

Časté otázky

V čem se L2 liší od L1?

L2 zmenšuje všechny koeficienty plynulo a obyčajne zachovává hustý model. L1 podporuje řídkost a může některé váhy nastavit přesně na nulu.

Proč L2 pomáhá při kolinearite?

Když více vstupů nese podobnou informaci, nepenalizované odhady mohou být nestabilní. Kvadratická penalizace omezí extrémně kompenzujúce se koeficienty.

Je weight decay vždy totožný s L2?

Při obyčajnom stochastickom gradientnom zostupe jsou úzko previazané. Při adaptívnych optimalizátoroch může oddělený weight decay, například Adamw, vést k jinému průběhu aktualizací.

Jako L2 ovlivňuje predikčné rozptyly?

Obvykle snižuje rozptyl odhadu za cenu malého systematického zkreslení. Tento kompromis může zlepšit výkon na nových datech.

Je třeba penalizovat i intercept?

Často ne, protože intercept vyjadřuje základnou úroveň a jeho penalizace může neželane posúvat průměr predikcí. Konkrétně chování závisí na implementace.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • scikit-learn, Ridge

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.