Odborná definícia
Odborná definícia
Gradientný zostup je iteratívna optimalizačná metóda, ktorá mení parametre modelu v smere opačnom k gradientu stratovej funkcie. Gradient udáva lokálny smer najrýchlejšieho rastu, preto jeho záporný smer pri dostatočne malom kroku stratu znižuje. Batch variant používa všetky dáta, stochastic jeden príklad a minibatch ich menšiu vzorku. Learning rate určuje veľkosť kroku a zásadne ovplyvňuje stabilitu aj rýchlosť. V nekonvexných neurónových sieťach metóda negarantuje globálne optimum a môže spomaľovať v sedlových bodoch alebo pri zle škálovaných smeroch.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Predstavte si zostup z kopca v hmle. V každom bode zmeriate lokálny sklon a urobíte krok smerom nadol. Veľmi malý krok je bezpečný, ale cesta trvá dlho. Príliš veľký krok môže preskočiť údolie a rozkolísať sa. Pri minibatch tréningu je meranie sklonu trochu hlučné, pretože vychádza iba z časti dát, no výpočet je rýchlejší a šum môže pomôcť opustiť niektoré ploché oblasti. Moderné optimalizátory pridávajú momentum alebo adaptívne škálovanie, stále však používajú gradient ako základnú informáciu o zmene straty.
Časté otázky
Časté otázky
Čo presne vyjadruje gradient?
Vektor parciálnych derivácií ukazuje citlivosť straty na malú zmenu každého parametra. Jeho veľkosť závisí aj od mierky parametrov a dát, preto sa nedá interpretovať bez kontextu.
Ako learning rate ovplyvňuje tréning?
Nízka hodnota vedie k pomalému postupu a môže uviaznuť na plató. Vysoká hodnota spôsobuje oscilácie alebo divergenciu, preto sa používajú plány, warmup a adaptívne optimalizátory.
Čím sa stochastic gradient descent líši od batch variantu?
SGD odhaduje gradient z jedného príkladu, minibatch z malej skupiny a batch zo všetkých dát. Menšie vzorky znižujú cenu kroku, ale pridávajú štatistický šum.
Zaručuje gradientný zostup najlepšie možné riešenie?
Pri konvexnej hladkej úlohe a vhodnom kroku môže konvergovať ku globálnemu minimu. Hlboké siete sú nekonvexné, preto výsledok závisí od inicializácie, trajektórie a optimalizačných detailov.
Prečo sa vstupy a vlastnosti často škálujú?
Veľmi odlišné mierky vytvárajú úzke a predĺžené povrchy straty, po ktorých optimalizátor kľučkuje. Normalizácia môže zlepšiť podmienenosť a umožniť účinnejší spoločný learning rate.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
