Trénování a optimalizace · Optimalizace modelů

Stochastický gradientní sestup

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-22

Odborná definice

Význam a odborné vymezení pojmu

Stochastic gradient descent je iteratívna optimalizačná metoda, která aktualizuje parametry pomocí gradientu ztráty vypočítaného z jednoho příkladu nebo malé náhodné dávky místo celého datasetu. Odhad gradientu je šumový, ale lacný a umožňuje škálovat učení na velké data. Rychlost učení, pořadí příkladů, velikost dávky, momentum a plánování kroku ovlivňují konvergenci. V hlbokom učení se název SGD často používá i pro mini-batch variant. Reprodukovatelnost vyžaduje zaznamenat seed, pořadí dávek, paralelizaci a přesnost výpočtu.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Představte si, že chcete upravit recept podle hodnocení milionu lidí. Plný gradient by před každou změnou prečítal všechny hodnocení. SGD vezme malou náhodnou skupinu, odhadne směr zlepšení a recept hned upraví. Jednotlivé kroky kolíšu, ale za ovela nižší cenu se mohou približovat k dobrému řešení. Pokud je krok příliš velký, parametry preskakují; pokud je příliš malý, učení stagnuje. Miešání dat zabraňuje tomu, aby pořadí systematicky tlačilo model jedním směrem. Dva tréningy s rovnakými hyperparametrami se mohou rozísť, protože časné šumové kroky vedou do jiných oblastí krajiny ztráty.

Časté otázky

Otázky, které upřesňují význam

Proč se metoda nazýva stochastická?

Gradient se odhaduje z náhodně vybraných příkladů nebo dávek, takže obsahuje varianci. Tato náhodnost snižuje cenu kroku a může pomoci uniknout niektorým plochým oblastiam.

Jaký je rozdíl mezi batch, mini-batch a online gradientem?

Batch používá celý dataset, mini-batch malou skupinu a online variant jeden příklad. Moderný trénink obvykle používá mini-batch kvůli efektívnosti akcelerátorů.

Co dělá momentum?

Akumuluje část předchozích smerů aktualizace. Tlmí oscilace v prudkých smeroch a zrýchluje pohyb v stabilním smere gradientu.

Proč se learning rate během tréninku mění?

Větší krok pomáhá rychle napredovat na začátku, menší umožní jemné doladení později. Nevhodný plán může vést k divergencii nebo predčasnému zamrznutiu.

Je Adam stochastic gradient descent?

Je to adaptivní optimalizátor založený na stochastických gradientoch, ale v praxi se názvem SGD často myslí jednodušší aktualizace s globálnym learning rate a prípadným momentom.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Stochastic Gradient Descent Tricks
  • scikit-learn Stochastic Gradient Descent

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.