Optimalizácia modelov

Gradient descent

Gradientný zostup

Gradientný zostup je iteratívna optimalizačná metóda, ktorá mení parametre modelu v smere opačnom k gradientu stratovej funkcie. Gradient udáva lokálny smer najrýchlejšieho rastu, preto jeho záporný smer pri dostatočne malom kroku stratu znižuje. Batch variant používa všetky dáta, stochastic jeden príklad a minibatch ich menšiu vzorku. Learning rate určuje veľkosť kroku a zásadne ovplyvňuje stabilitu aj rýchlosť. V nekonvexných neurónových sieťach metóda negarantuje globálne optimum a môže spomaľovať v sedlových bodoch alebo pri zle škálovaných smeroch.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-18

Odborná definícia

Odborná definícia

Gradientný zostup je iteratívna optimalizačná metóda, ktorá mení parametre modelu v smere opačnom k gradientu stratovej funkcie. Gradient udáva lokálny smer najrýchlejšieho rastu, preto jeho záporný smer pri dostatočne malom kroku stratu znižuje. Batch variant používa všetky dáta, stochastic jeden príklad a minibatch ich menšiu vzorku. Learning rate určuje veľkosť kroku a zásadne ovplyvňuje stabilitu aj rýchlosť. V nekonvexných neurónových sieťach metóda negarantuje globálne optimum a môže spomaľovať v sedlových bodoch alebo pri zle škálovaných smeroch.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Predstavte si zostup z kopca v hmle. V každom bode zmeriate lokálny sklon a urobíte krok smerom nadol. Veľmi malý krok je bezpečný, ale cesta trvá dlho. Príliš veľký krok môže preskočiť údolie a rozkolísať sa. Pri minibatch tréningu je meranie sklonu trochu hlučné, pretože vychádza iba z časti dát, no výpočet je rýchlejší a šum môže pomôcť opustiť niektoré ploché oblasti. Moderné optimalizátory pridávajú momentum alebo adaptívne škálovanie, stále však používajú gradient ako základnú informáciu o zmene straty.

Časté otázky

Časté otázky

Čo presne vyjadruje gradient?

Vektor parciálnych derivácií ukazuje citlivosť straty na malú zmenu každého parametra. Jeho veľkosť závisí aj od mierky parametrov a dát, preto sa nedá interpretovať bez kontextu.

Ako learning rate ovplyvňuje tréning?

Nízka hodnota vedie k pomalému postupu a môže uviaznuť na plató. Vysoká hodnota spôsobuje oscilácie alebo divergenciu, preto sa používajú plány, warmup a adaptívne optimalizátory.

Čím sa stochastic gradient descent líši od batch variantu?

SGD odhaduje gradient z jedného príkladu, minibatch z malej skupiny a batch zo všetkých dát. Menšie vzorky znižujú cenu kroku, ale pridávajú štatistický šum.

Zaručuje gradientný zostup najlepšie možné riešenie?

Pri konvexnej hladkej úlohe a vhodnom kroku môže konvergovať ku globálnemu minimu. Hlboké siete sú nekonvexné, preto výsledok závisí od inicializácie, trajektórie a optimalizačných detailov.

Prečo sa vstupy a vlastnosti často škálujú?

Veľmi odlišné mierky vytvárajú úzke a predĺžené povrchy straty, po ktorých optimalizátor kľučkuje. Normalizácia môže zlepšiť podmienenosť a umožniť účinnejší spoločný learning rate.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.