Trénovanie a optimalizácia · Optimalizácia modelov

Rýchlosť učenia

Learning rate

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-15

Odborná definícia

Význam a odborné vymedzenie pojmu

Learning rate je hyperparameter, ktorý určuje mierku aktualizácie parametrov pri optimalizácii. V najjednoduchšom gradientnom kroku násobí odhad gradientu pred odčítaním od aktuálnych váh. Príliš vysoká hodnota môže preskakovať minimum, rozkmitať stratu alebo spôsobiť divergenciu, príliš nízka vedie k pomalému postupu a môže uviaznuť v nevhodnej oblasti. Efektívna veľkosť kroku závisí aj od optimalizátora, batch size, normalizácie, precision, gradient clippingu a škálovania straty.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Learning rate je dĺžka kroku, ktorým sa model po každom výpočte chyby posunie. Veľké kroky rýchlo prejdú plochou oblasťou, ale môžu opakovane preskočiť cez dobré riešenie. Malé kroky sú opatrné, no tréning môže trvať neprimerane dlho. Rovnaké číslo navyše neznamená rovnaký pohyb pri SGD a Adam, pretože optimalizátory gradienty upravujú. Hodnota sa preto sleduje spolu s priebehom loss, normami gradientov, stabilitou validácie a plánom, ktorý ju počas tréningu mení.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa hľadá vhodný learning rate?

Používa sa menší sweep, learning-rate range test alebo ladenie na validačnom cieli. Sleduje sa rýchlosť poklesu loss aj vznik nestability.

Prečo sa pri väčšom batchi často mení learning rate?

Gradient má inú mieru šumu a aktualizácie prichádzajú menej často. Lineárne škálovanie je iba heuristika a vyžaduje warmup aj empirické overenie.

Je learning rate rovnaký pre všetky vrstvy?

Nemusí byť. Pri fine-tuningu sa často používajú menšie kroky pre skoré vrstvy alebo osobitné hodnoty pre hlavu, adaptery a embeddingy.

Čo signalizuje náhly NaN v loss?

Môže ísť o príliš veľký krok, overflow pri mixed precision, chybnú operáciu alebo nekonečné vstupy. Learning rate je prvá, nie jediná kontrola.

Ako súvisí learning rate s AdamW?

AdamW prispôsobuje krok podľa momentov gradientu a oddelene aplikuje weight decay. Základný learning rate však stále riadi globálnu mierku aktualizácie.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • PyTorch, torch.optim

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.