Optimalizace modelů

Gradientní sestup

Gradientní sestup je iteratívna optimalizačná metoda, která mění parametry modelu v smere opačnom k gradientu ztrátové funkce. Gradient udáva lokální směr najrýchlejšieho rastu, proto jeho záporný směr při dostatečně malém kroku ztrátu snižuje. Batch variant používá všechny data, stochastic jeden příklad a minibatch jejich menší vzorek. Learning rate určuje velikost kroku a zásadne ovlivňuje stabilitu i rychlost. V nekonvexných neuronových sítích metoda negarantuje globálně optimum a může spomalovat v sedlových bodech nebo při špatně škálovaných smeroch.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-18

Odborná definice

Odborná definice

Gradientní sestup je iteratívna optimalizačná metoda, která mění parametry modelu v smere opačnom k gradientu ztrátové funkce. Gradient udáva lokální směr najrýchlejšieho rastu, proto jeho záporný směr při dostatečně malém kroku ztrátu snižuje. Batch variant používá všechny data, stochastic jeden příklad a minibatch jejich menší vzorek. Learning rate určuje velikost kroku a zásadne ovlivňuje stabilitu i rychlost. V nekonvexných neuronových sítích metoda negarantuje globálně optimum a může spomalovat v sedlových bodech nebo při špatně škálovaných smeroch.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si sestup z kopca v hmle. V každém bodě zmeriate lokální sklon a urobíte krok směrem nadol. Velmi malý krok je bezpečný, ale cesta trvá dlho. Příliš velký krok může preskočit údolie a rozkolísat se. Při minibatch tréninku je měření sklonu trochu hlučné, protože vychází pouze z části dat, ale výpočet je rychlejší a šum může pomoci opustit některé ploché oblasti. Moderní optimalizátory přidávají momentum nebo adaptivní škálování, stále však používají gradient jako základnou informaci o změně ztráty.

Časté otázky

Časté otázky

Co přesně vyjadřuje gradient?

Vektor parciálnych derivací ukazuje citlivost ztráty na malou změnu každého parametru. Jeho velikost závisí i od měřítka parametrů a dat, proto se nedá interpretovat bez kontextu.

Jako learning rate ovlivňuje trénink?

Nízká hodnota vede k pomalému postupu a může uviaznuť na plató. Vysoká hodnota způsobuje oscilace nebo divergenci, proto se používají plány, warmup a adaptivní optimalizátory.

Čím se stochastic gradient descent liší od batch variantu?

SGD odhaduje gradient z jednoho příkladu, minibatch z malé skupiny a batch ze všech dat. Menší vzorku snižují cenu kroku, ale přidávají statistický šum.

Zaručuje gradientní sestup nejlépe možné řešení?

Při konvexnej hladkej úloze a vhodnom kroku může konvergovat ku globálnemu minimu. Hluboké sítě jsou nekonvexné, proto výsledek závisí na inicializace, trajektorie a optimalizačných detailů.

Proč se vstupy a vlastnosti často škálují?

Velmi odlišné měřítka vytvářejí úzké a predlžené povrchy ztráty, po kterých optimalizátor klučkuje. Normalizace může zlepšit podmienenost a umožnit účinnejší společný learning rate.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.