Optimalizace modelů

Rychlost učení

Learning rate je hyperparameter, který určuje měřítko aktualizace parametrů při optimalizaci. V najjednoduchšom gradientnom kroku násobí odhad gradientu před odčítáním od aktuálnych váh. Příliš vysoká hodnota může preskakovat minimum, rozkmitat ztrátu nebo způsobit divergenci, příliš nízká vede k pomalému postupu a může uviaznuť v nevhodnej oblasti. Efektivní velikost kroku závisí i od optimalizátora, batch size, normalizace, precision, gradient clippingu a škálování ztráty.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-15

Odborná definice

Odborná definice

Learning rate je hyperparameter, který určuje měřítko aktualizace parametrů při optimalizaci. V najjednoduchšom gradientnom kroku násobí odhad gradientu před odčítáním od aktuálnych váh. Příliš vysoká hodnota může preskakovat minimum, rozkmitat ztrátu nebo způsobit divergenci, příliš nízká vede k pomalému postupu a může uviaznuť v nevhodnej oblasti. Efektivní velikost kroku závisí i od optimalizátora, batch size, normalizace, precision, gradient clippingu a škálování ztráty.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Learning rate je délka kroku, kterým se model po každém výpočtu chyby posune. Velké kroky rychle prejdou plochou oblasťou, ale mohou opakovaně preskočit přes dobré řešení. Malé kroky jsou opatrné, ale trénink může trvat nepřiměřeně dlho. Stejné číslo navíc neznamená stejný pohyb při SGD a Adam, protože optimalizátory gradienty upravují. Hodnota se proto sleduje spolu s priebehom loss, normami gradientů, stabilitou validace a plánom, který ji během tréninku mění.

Časté otázky

Časté otázky

Jak se hledá vhodný learning rate?

Používá se menší sweep, learning-rate range test nebo ladění na validačním cílí. Sleduje se rychlost poklesu loss i vznik nestability.

Proč se při večšom batchi často mění learning rate?

Gradient má jinou míru šumu a aktualizace prichádzají méně často. Lineární škálování je pouze heuristika a vyžaduje warmup i empirické ověření.

Je learning rate stejný pro všechny vrstvy?

Nemusí být. Při fine-tuningu se často používají menší kroky pro časné vrstvy nebo osobitné hodnoty pro hlavu, adaptery a embeddingy.

Co signalizuje náhly Nan v loss?

Může jít o příliš velký krok, overflow při mixed precision, chybnou operaci nebo nekonečné vstupy. Learning rate je první, ne jediná kontrola.

Jako souvisí learning rate s Adamw?

Adamw přizpůsobuje krok podle momentů gradientu a odděleně aplikuje weight decay. Základní learning rate však stále řídí globálnu měřítko aktualizace.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, torch.optim

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.