Optimalizace modelů

stochastický gradientní sestup

Stochastic gradient descent je iteratívna optimalizačná metoda, která aktualizuje parametry pomocí gradientu ztráty vypočítaného z jednoho příkladu nebo malé náhodné dávky místo celého datasetu. Odhad gradientu je šumový, ale lacný a umožňuje škálovat učení na velké data. Rychlost učení, pořadí příkladů, velikost dávky, momentum a plánování kroku ovlivňují konvergenci. V hlbokom učení se název SGD často používá i pro mini-batch variant. Reprodukovatelnost vyžaduje zaznamenat seed, pořadí dávek, paralelizaci a přesnost výpočtu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-22

Odborná definice

Odborná definice

Stochastic gradient descent je iteratívna optimalizačná metoda, která aktualizuje parametry pomocí gradientu ztráty vypočítaného z jednoho příkladu nebo malé náhodné dávky místo celého datasetu. Odhad gradientu je šumový, ale lacný a umožňuje škálovat učení na velké data. Rychlost učení, pořadí příkladů, velikost dávky, momentum a plánování kroku ovlivňují konvergenci. V hlbokom učení se název SGD často používá i pro mini-batch variant. Reprodukovatelnost vyžaduje zaznamenat seed, pořadí dávek, paralelizaci a přesnost výpočtu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si, že chcete upravit recept podle hodnocení milionu lidí. Plný gradient by před každou změnou prečítal všechny hodnocení. SGD vezme malou náhodnou skupinu, odhadne směr zlepšení a recept hned upraví. Jednotlivé kroky kolíšu, ale za ovela nižší cenu se mohou približovat k dobrému řešení. Pokud je krok příliš velký, parametry preskakují; pokud je příliš malý, učení stagnuje. Miešání dat zabraňuje tomu, aby pořadí systematicky tlačilo model jedním směrem. Dva tréningy s rovnakými hyperparametrami se mohou rozísť, protože časné šumové kroky vedou do jiných oblastí krajiny ztráty.

Časté otázky

Časté otázky

Proč se metoda nazýva stochastická?

Gradient se odhaduje z náhodně vybraných příkladů nebo dávek, takže obsahuje varianci. Tato náhodnost snižuje cenu kroku a může pomoci uniknout niektorým plochým oblastiam.

Jaký je rozdíl mezi batch, mini-batch a online gradientem?

Batch používá celý dataset, mini-batch malou skupinu a online variant jeden příklad. Moderný trénink obvykle používá mini-batch kvůli efektívnosti akcelerátorů.

Co dělá momentum?

Akumuluje část předchozích smerů aktualizace. Tlmí oscilace v prudkých smeroch a zrýchluje pohyb v stabilním smere gradientu.

Proč se learning rate během tréninku mění?

Větší krok pomáhá rychle napredovat na začátku, menší umožní jemné doladení později. Nevhodný plán může vést k divergencii nebo predčasnému zamrznutiu.

Je Adam stochastic gradient descent?

Je to adaptivní optimalizátor založený na stochastických gradientoch, ale v praxi se názvem SGD často myslí jednodušší aktualizace s globálnym learning rate a prípadným momentom.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Stochastic Gradient Descent Tricks
  • scikit-learn Stochastic Gradient Descent

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.