Trénovanie a optimalizácia · Optimalizácia modelov

Stochastický gradientný zostup

Stochastic gradient descent

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-22

Odborná definícia

Význam a odborné vymedzenie pojmu

Stochastic gradient descent je iteratívna optimalizačná metóda, ktorá aktualizuje parametre pomocou gradientu straty vypočítaného z jedného príkladu alebo malej náhodnej dávky namiesto celého datasetu. Odhad gradientu je šumový, no lacný a umožňuje škálovať učenie na veľké dáta. Rýchlosť učenia, poradie príkladov, veľkosť dávky, momentum a plánovanie kroku ovplyvňujú konvergenciu. V hlbokom učení sa názov SGD často používa aj pre mini-batch variant. Reprodukovateľnosť vyžaduje zaznamenať seed, poradie dávok, paralelizáciu a presnosť výpočtu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Predstavte si, že chcete upraviť recept podľa hodnotenia milióna ľudí. Plný gradient by pred každou zmenou prečítal všetky hodnotenia. SGD vezme malú náhodnú skupinu, odhadne smer zlepšenia a recept hneď upraví. Jednotlivé kroky kolíšu, ale za oveľa nižšiu cenu sa môžu približovať k dobrému riešeniu. Ak je krok príliš veľký, parametre preskakujú; ak je príliš malý, učenie stagnuje. Miešanie dát zabraňuje tomu, aby poradie systematicky tlačilo model jedným smerom. Dva tréningy s rovnakými hyperparametrami sa môžu rozísť, pretože skoré šumové kroky vedú do iných oblastí krajiny straty.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo sa metóda nazýva stochastická?

Gradient sa odhaduje z náhodne vybraných príkladov alebo dávok, takže obsahuje varianciu. Táto náhodnosť znižuje cenu kroku a môže pomôcť uniknúť niektorým plochým oblastiam.

Aký je rozdiel medzi batch, mini-batch a online gradientom?

Batch používa celý dataset, mini-batch malú skupinu a online variant jeden príklad. Moderný tréning zvyčajne používa mini-batch kvôli efektívnosti akcelerátorov.

Čo robí momentum?

Akumuluje časť predchádzajúcich smerov aktualizácie. Tlmí oscilácie v prudkých smeroch a zrýchľuje pohyb v stabilnom smere gradientu.

Prečo sa learning rate počas tréningu mení?

Väčší krok pomáha rýchlo napredovať na začiatku, menší umožní jemné doladenie neskôr. Nevhodný plán môže viesť k divergencii alebo predčasnému zamrznutiu.

Je Adam stochastic gradient descent?

Je to adaptívny optimalizátor založený na stochastických gradientoch, ale v praxi sa názvom SGD často myslí jednoduchšia aktualizácia s globálnym learning rate a prípadným momentom.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Stochastic Gradient Descent Tricks
  • scikit-learn Stochastic Gradient Descent

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.