Diagnostika neuronových sítí

Explóze gradientu

Explóze gradientu je jev, při kterém se derivace při spetnom šírení přes mnoho vrstev nebo časových kroků násobia tak, že jejich norma prudko roste. Výsledkem jsou neprimerané změny parametrů, oscilujúca ztráta, pretečení numerických hodnot nebo Nan. Častá je v rekurentních sítích a hlubokých kompozíciách s nevhodnou inicializací či spektrálnymi vlastnostmi Jacobianů. Diagnostika sleduje normy podle vrstev a kroků. Zmiernení zahrnuje gradient clipping, stabilnejšiu inicializaci, normalizaci, reziduální spojení a úpravu learning rate.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-19

Odborná definice

Odborná definice

Explóze gradientu je jev, při kterém se derivace při spetnom šírení přes mnoho vrstev nebo časových kroků násobia tak, že jejich norma prudko roste. Výsledkem jsou neprimerané změny parametrů, oscilujúca ztráta, pretečení numerických hodnot nebo Nan. Častá je v rekurentních sítích a hlubokých kompozíciách s nevhodnou inicializací či spektrálnymi vlastnostmi Jacobianů. Diagnostika sleduje normy podle vrstev a kroků. Zmiernení zahrnuje gradient clipping, stabilnejšiu inicializaci, normalizaci, reziduální spojení a úpravu learning rate.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při spetnom šírení prochází signál chyby reťazou násobení. Pokud večšina článků tento signál mírně zvečšuje, po desiatkach kroků může z původní hodnoty vzniknout obrovské číslo. Model potom místo jemnej opravy prudko změní parametry a další výpočet se rozpadne. Je to podobné mikrofónu při reproduktore, kde se malý zvuk opakovaně zosilňuje až do pískání. Orezání gradientu omezí největší výbuch, ale stabilní trénink často vyžaduje upravit i inicializaci, architekturu, normalizaci nebo velikost kroku.

Časté otázky

Časté otázky

Jaké příznaky ukazují na explózi gradientu?

Náhle špičky ztráty, obrovské gradientové normy, parametry meniace se o několik rádů, hodnoty inf nebo Nan a trénink, který po stabilním období skolabuje.

Proč se problém často spojuje s rekurentnými sieťami?

Stejná transformačná matice se uplatňuje napříč mnohými časovými krokmi. Pokud její dynamika opakovaně zvečšuje citlivost, gradient roste exponenciálne s délkou zpětného přenosu.

Je vysoká hodnota ztráty to jisté jako explóze gradientu?

Ne. Model může mít vysokou ztrátu a přitom normálně gradienty, například na začátku učení. Explóze popisuje velikost a numerickou dynamiku derivací, ne pouze kvalitu predikce.

Které opatření je třeba skúsit jako první?

Nejprve zmerat normy a lokalizovat vrstvu nebo čas. Potom lze snížit learning rate, přidat normový clipping, skontrolovat inicializaci a ověřit, či ztráta nebo data nevytvárají extrémně hodnoty.

Může explóze nastat i v Transformeri?

Ano. Reziduální větve, pozornost, normalizace a velká hloubka mohou vytvořit nestabilitu, zejména při nevhodném škálování nebo precision. Moderní recepty používají warmup, clipping a kontrolu numeriky.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.