Diagnostika neurónových sietí

Gradient explosion

Explózia gradientu

Explózia gradientu je jav, pri ktorom sa derivácie pri spätnom šírení cez mnoho vrstiev alebo časových krokov násobia tak, že ich norma prudko rastie. Výsledkom sú neprimerané zmeny parametrov, oscilujúca strata, pretečenie numerických hodnôt alebo NaN. Častá je v rekurentných sieťach a hlbokých kompozíciách s nevhodnou inicializáciou či spektrálnymi vlastnosťami Jacobianov. Diagnostika sleduje normy podľa vrstiev a krokov. Zmiernenie zahŕňa gradient clipping, stabilnejšiu inicializáciu, normalizáciu, reziduálne spojenia a úpravu learning rate.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-19

Odborná definícia

Odborná definícia

Explózia gradientu je jav, pri ktorom sa derivácie pri spätnom šírení cez mnoho vrstiev alebo časových krokov násobia tak, že ich norma prudko rastie. Výsledkom sú neprimerané zmeny parametrov, oscilujúca strata, pretečenie numerických hodnôt alebo NaN. Častá je v rekurentných sieťach a hlbokých kompozíciách s nevhodnou inicializáciou či spektrálnymi vlastnosťami Jacobianov. Diagnostika sleduje normy podľa vrstiev a krokov. Zmiernenie zahŕňa gradient clipping, stabilnejšiu inicializáciu, normalizáciu, reziduálne spojenia a úpravu learning rate.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Pri spätnom šírení prechádza signál chyby reťazou násobení. Ak väčšina článkov tento signál mierne zväčšuje, po desiatkach krokov môže z pôvodnej hodnoty vzniknúť obrovské číslo. Model potom namiesto jemnej opravy prudko zmení parametre a ďalší výpočet sa rozpadne. Je to podobné mikrofónu pri reproduktore, kde sa malý zvuk opakovane zosilňuje až do pískania. Orezanie gradientu obmedzí najväčší výbuch, ale stabilný tréning často vyžaduje upraviť aj inicializáciu, architektúru, normalizáciu alebo veľkosť kroku.

Časté otázky

Časté otázky

Aké príznaky ukazujú na explóziu gradientu?

Náhle špičky straty, obrovské gradientové normy, parametre meniace sa o niekoľko rádov, hodnoty inf alebo NaN a tréning, ktorý po stabilnom období skolabuje.

Prečo sa problém často spája s rekurentnými sieťami?

Rovnaká transformačná matica sa uplatňuje naprieč mnohými časovými krokmi. Ak jej dynamika opakovane zväčšuje citlivosť, gradient rastie exponenciálne s dĺžkou spätného prenosu.

Je vysoká hodnota straty to isté ako explózia gradientu?

Nie. Model môže mať vysokú stratu a pritom normálne gradienty, napríklad na začiatku učenia. Explózia opisuje veľkosť a numerickú dynamiku derivácií, nie iba kvalitu predikcie.

Ktoré opatrenie treba skúsiť ako prvé?

Najprv zmerať normy a lokalizovať vrstvu alebo čas. Potom možno znížiť learning rate, pridať normový clipping, skontrolovať inicializáciu a overiť, či strata alebo dáta nevytvárajú extrémne hodnoty.

Môže explózia nastať aj v Transformeri?

Áno. Reziduálne vetvy, pozornosť, normalizácia a veľká hĺbka môžu vytvoriť nestabilitu, najmä pri nevhodnom škálovaní alebo precision. Moderné recepty používajú warmup, clipping a kontrolu numeriky.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.