Odborná definice
Odborná definice
Gradientní sestup je iteratívna optimalizačná metoda, která mění parametry modelu v smere opačnom k gradientu ztrátové funkce. Gradient udáva lokální směr najrýchlejšieho rastu, proto jeho záporný směr při dostatečně malém kroku ztrátu snižuje. Batch variant používá všechny data, stochastic jeden příklad a minibatch jejich menší vzorek. Learning rate určuje velikost kroku a zásadne ovlivňuje stabilitu i rychlost. V nekonvexných neuronových sítích metoda negarantuje globálně optimum a může spomalovat v sedlových bodech nebo při špatně škálovaných smeroch.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si sestup z kopca v hmle. V každém bodě zmeriate lokální sklon a urobíte krok směrem nadol. Velmi malý krok je bezpečný, ale cesta trvá dlho. Příliš velký krok může preskočit údolie a rozkolísat se. Při minibatch tréninku je měření sklonu trochu hlučné, protože vychází pouze z části dat, ale výpočet je rychlejší a šum může pomoci opustit některé ploché oblasti. Moderní optimalizátory přidávají momentum nebo adaptivní škálování, stále však používají gradient jako základnou informaci o změně ztráty.
Časté otázky
Časté otázky
Co přesně vyjadřuje gradient?
Vektor parciálnych derivací ukazuje citlivost ztráty na malou změnu každého parametru. Jeho velikost závisí i od měřítka parametrů a dat, proto se nedá interpretovat bez kontextu.
Jako learning rate ovlivňuje trénink?
Nízká hodnota vede k pomalému postupu a může uviaznuť na plató. Vysoká hodnota způsobuje oscilace nebo divergenci, proto se používají plány, warmup a adaptivní optimalizátory.
Čím se stochastic gradient descent liší od batch variantu?
SGD odhaduje gradient z jednoho příkladu, minibatch z malé skupiny a batch ze všech dat. Menší vzorku snižují cenu kroku, ale přidávají statistický šum.
Zaručuje gradientní sestup nejlépe možné řešení?
Při konvexnej hladkej úloze a vhodnom kroku může konvergovat ku globálnemu minimu. Hluboké sítě jsou nekonvexné, proto výsledek závisí na inicializace, trajektorie a optimalizačných detailů.
Proč se vstupy a vlastnosti často škálují?
Velmi odlišné měřítka vytvářejí úzké a predlžené povrchy ztráty, po kterých optimalizátor klučkuje. Normalizace může zlepšit podmienenost a umožnit účinnejší společný learning rate.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
