Riadenie optimalizácie

Learning rate schedule

Plán rýchlosti učenia

Learning rate schedule je pravidlo, ktoré mení learning rate podľa kroku, epochy alebo validačného signálu. Môže používať warmup, stupňovité zníženie, exponenciálny pokles, cosine annealing, cyklický priebeh alebo reakciu na plateau. Cieľom je spojiť rýchly počiatočný pohyb s jemnejším dolaďovaním v neskoršej fáze. Harmonogram nemožno hodnotiť oddelene od počtu krokov, batch size, optimalizátora a checkpointovania, pretože zmena dĺžky tréningu mení aj význam časových bodov plánu.

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-16

Odborná definícia

Odborná definícia

Learning rate schedule je pravidlo, ktoré mení learning rate podľa kroku, epochy alebo validačného signálu. Môže používať warmup, stupňovité zníženie, exponenciálny pokles, cosine annealing, cyklický priebeh alebo reakciu na plateau. Cieľom je spojiť rýchly počiatočný pohyb s jemnejším dolaďovaním v neskoršej fáze. Harmonogram nemožno hodnotiť oddelene od počtu krokov, batch size, optimalizátora a checkpointovania, pretože zmena dĺžky tréningu mení aj význam časových bodov plánu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Na začiatku môže model potrebovať opatrný rozbeh, aby sa veľké náhodné gradienty nestali deštruktívnymi. Neskôr môže používať väčšie kroky a ku koncu ich zmenšovať, aby doladil riešenie. Schedule je kalendár týchto zmien. Ak sa tréning predĺži z desaťtisíc na stotisíc krokov bez úpravy kalendára, cosine minimum alebo decay príde v nesprávnom čase. Pri obnovení checkpointu treba obnoviť aj stav scheduleru, inak model pokračuje s inou rýchlosťou, než predpokladal experiment.

Časté otázky

Časté otázky

Načo slúži warmup?

Postupne zvyšuje learning rate počas úvodných krokov. Pomáha stabilizovať tréning veľkých sietí, najmä pri veľkých batchoch a transformeroch.

Čo robí cosine annealing?

Znižuje learning rate podľa časti kosínusovej krivky. Poskytuje plynulý pokles, ktorého koniec musí byť zosúladený s plánovaným počtom krokov.

Kedy použiť ReduceLROnPlateau?

Keď je vhodné reagovať na stagnáciu validačnej metriky. Výsledok závisí od patience, prahu zmeny a šumu danej metriky.

Musí scheduler volať pred alebo po optimizer step?

Závisí od implementácie. V PyTorch má väčšina schedulerov očakávané poradie; nesprávne volanie môže posunúť celý priebeh o jeden krok.

Čo sa musí uložiť do checkpointu?

Váhy modelu, stav optimalizátora, stav scheduleru, globálny krok a pri mixed precision aj scaler. Inak obnovený tréning nie je reprodukovateľný.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • PyTorch, learning rate schedulers

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.