Regularizace a optimalizátory

útlm váh během optimalizace

Weight decay je mechanismus, který při každém optimalizačnom kroku zmenšuje vybrané parametry směrem k nule. Při klasickém SGD je často algebraicky ekvivalentný L2 penalizaci pridanej k strate, ale při adaptívnych optimalizátoroch se tyto formulace mohou správat rozdílně. Adamw oddeluje útlm parametrů od gradientovej aktualizace. Cílem je omezit nekontrolovaný rast váh a podporit jednodušší řešení, ne automaticky vytvořit riedky model. Koeficient je třeba volit spolu s learning rate, plánom tréninku a výnimkami pro zkreslení nebo normalizačné parametry.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-12

Odborná definice

Odborná definice

Weight decay je mechanismus, který při každém optimalizačnom kroku zmenšuje vybrané parametry směrem k nule. Při klasickém SGD je často algebraicky ekvivalentný L2 penalizaci pridanej k strate, ale při adaptívnych optimalizátoroch se tyto formulace mohou správat rozdílně. Adamw oddeluje útlm parametrů od gradientovej aktualizace. Cílem je omezit nekontrolovaný rast váh a podporit jednodušší řešení, ne automaticky vytvořit riedky model. Koeficient je třeba volit spolu s learning rate, plánom tréninku a výnimkami pro zkreslení nebo normalizačné parametry.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Trénink může některé regulátory modelu postupně vytočit na vysoké hodnoty, protože tak rychle sníží chybu na dostupných datech. Weight decay při každém kroku jemne stiahne vybrané váhy zpět. Model musí opakovaně dokazovat, že velká hodnota je užitečná, jinak se oslabí. Při Adamw se toto zmenšení provede odděleně od adaptivní škálovaného gradientu, takže parameter dostane čitatelnejší útlm. Příliš silný decay vede k podučení, příliš slabý nemusí omezit přeučení ani numerické problémy.

Časté otázky

Časté otázky

Je weight decay vždy stejný jako L2 regularization?

Při jednoduchom SGD bez dalších úprav mohou být ekvivalentné. Při Adam, Rmsprop a podobných optimalizátoroch adaptivní škálování gradientu mění účinek L2 člena, proto se používá decoupled weight decay.

Proč se často nepoužívá na bias a normalizaci?

Zkreslení a škálovace parametry mají jinou úlohu a jejich zmenšování může zhoršit optimalizaci bez stejného regularizačného přínosu. Proto se vytvářejí samostatné skupiny parametrů.

Zvyšuje weight decay řídkost váh?

Ne systematicky. Zmenšuje velikosti parametrů, ale večšina hodnot nezostane přesně nulová. Na štrukturálnu nebo neštrukturálnu řídkost se používá pruning nebo L1 penalizace.

Jako souvisí koeficient s learning rate?

Efektivní útlm závisí na implementace i velikosti kroku. Při změně learning rate nebo počtu kroků je třeba decay znovu ladiť, ne slepo přenést z jiného tréninku.

Jak se vybere vhodná hodnota?

Pomocí validačního experimentu s stejným rozpočtom tréninku. Sleduje se generalizace, kalibrace, stabilita a rozdíl mezi tréninkovou a validační ztrátou.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Decoupled Weight Decay Regularization
  • PyTorch, AdamW

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.