Odborná definícia
Význam a odborné vymedzenie pojmu
Stochastic gradient descent je iteratívna optimalizačná metóda, ktorá aktualizuje parametre pomocou gradientu straty vypočítaného z jedného príkladu alebo malej náhodnej dávky namiesto celého datasetu. Odhad gradientu je šumový, no lacný a umožňuje škálovať učenie na veľké dáta. Rýchlosť učenia, poradie príkladov, veľkosť dávky, momentum a plánovanie kroku ovplyvňujú konvergenciu. V hlbokom učení sa názov SGD často používa aj pre mini-batch variant. Reprodukovateľnosť vyžaduje zaznamenať seed, poradie dávok, paralelizáciu a presnosť výpočtu.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Predstavte si, že chcete upraviť recept podľa hodnotenia milióna ľudí. Plný gradient by pred každou zmenou prečítal všetky hodnotenia. SGD vezme malú náhodnú skupinu, odhadne smer zlepšenia a recept hneď upraví. Jednotlivé kroky kolíšu, ale za oveľa nižšiu cenu sa môžu približovať k dobrému riešeniu. Ak je krok príliš veľký, parametre preskakujú; ak je príliš malý, učenie stagnuje. Miešanie dát zabraňuje tomu, aby poradie systematicky tlačilo model jedným smerom. Dva tréningy s rovnakými hyperparametrami sa môžu rozísť, pretože skoré šumové kroky vedú do iných oblastí krajiny straty.
Časté otázky
Otázky, ktoré spresňujú význam
Prečo sa metóda nazýva stochastická?
Gradient sa odhaduje z náhodne vybraných príkladov alebo dávok, takže obsahuje varianciu. Táto náhodnosť znižuje cenu kroku a môže pomôcť uniknúť niektorým plochým oblastiam.
Aký je rozdiel medzi batch, mini-batch a online gradientom?
Batch používa celý dataset, mini-batch malú skupinu a online variant jeden príklad. Moderný tréning zvyčajne používa mini-batch kvôli efektívnosti akcelerátorov.
Čo robí momentum?
Akumuluje časť predchádzajúcich smerov aktualizácie. Tlmí oscilácie v prudkých smeroch a zrýchľuje pohyb v stabilnom smere gradientu.
Prečo sa learning rate počas tréningu mení?
Väčší krok pomáha rýchlo napredovať na začiatku, menší umožní jemné doladenie neskôr. Nevhodný plán môže viesť k divergencii alebo predčasnému zamrznutiu.
Je Adam stochastic gradient descent?
Je to adaptívny optimalizátor založený na stochastických gradientoch, ale v praxi sa názvom SGD často myslí jednoduchšia aktualizácia s globálnym learning rate a prípadným momentom.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Stochastic Gradient Descent Tricks
- scikit-learn Stochastic Gradient Descent
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
