Odborná definice
Význam a odborné vymezení pojmu
Stochastic gradient descent je iteratívna optimalizačná metoda, která aktualizuje parametry pomocí gradientu ztráty vypočítaného z jednoho příkladu nebo malé náhodné dávky místo celého datasetu. Odhad gradientu je šumový, ale lacný a umožňuje škálovat učení na velké data. Rychlost učení, pořadí příkladů, velikost dávky, momentum a plánování kroku ovlivňují konvergenci. V hlbokom učení se název SGD často používá i pro mini-batch variant. Reprodukovatelnost vyžaduje zaznamenat seed, pořadí dávek, paralelizaci a přesnost výpočtu.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Představte si, že chcete upravit recept podle hodnocení milionu lidí. Plný gradient by před každou změnou prečítal všechny hodnocení. SGD vezme malou náhodnou skupinu, odhadne směr zlepšení a recept hned upraví. Jednotlivé kroky kolíšu, ale za ovela nižší cenu se mohou približovat k dobrému řešení. Pokud je krok příliš velký, parametry preskakují; pokud je příliš malý, učení stagnuje. Miešání dat zabraňuje tomu, aby pořadí systematicky tlačilo model jedním směrem. Dva tréningy s rovnakými hyperparametrami se mohou rozísť, protože časné šumové kroky vedou do jiných oblastí krajiny ztráty.
Časté otázky
Otázky, které upřesňují význam
Proč se metoda nazýva stochastická?
Gradient se odhaduje z náhodně vybraných příkladů nebo dávek, takže obsahuje varianci. Tato náhodnost snižuje cenu kroku a může pomoci uniknout niektorým plochým oblastiam.
Jaký je rozdíl mezi batch, mini-batch a online gradientem?
Batch používá celý dataset, mini-batch malou skupinu a online variant jeden příklad. Moderný trénink obvykle používá mini-batch kvůli efektívnosti akcelerátorů.
Co dělá momentum?
Akumuluje část předchozích smerů aktualizace. Tlmí oscilace v prudkých smeroch a zrýchluje pohyb v stabilním smere gradientu.
Proč se learning rate během tréninku mění?
Větší krok pomáhá rychle napredovat na začátku, menší umožní jemné doladení později. Nevhodný plán může vést k divergencii nebo predčasnému zamrznutiu.
Je Adam stochastic gradient descent?
Je to adaptivní optimalizátor založený na stochastických gradientoch, ale v praxi se názvem SGD často myslí jednodušší aktualizace s globálnym learning rate a prípadným momentom.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- Stochastic Gradient Descent Tricks
- scikit-learn Stochastic Gradient Descent
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
