Diagnostika neuronových sítí

Gradient vanishing

Miznutie gradientu je jev, při kterém se derivace prenášané do skorších vrstev nebo vzdialených časových kroků zmenšují k nule. Vzniká při opakovaném násobení Jacobianmi s malými hodnotami a při saturujúcich aktivacích, jako jsou sigmoid nebo tanh mimo citlivej oblasti. Časné parametry potom dostávají zanedbatelný učebný signál, takže model se učí pomalu a nedokáže zachytit dlouhé závislosti. Problém zmierňují vhodné inicializace, Relu rodina, reziduální spojení, normalizace a hradlové bunky. Gradient clipping ho nerieši, protože omezuje velké, ne malé gradienty.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-G-20

Odborná definice

Odborná definice

Miznutie gradientu je jev, při kterém se derivace prenášané do skorších vrstev nebo vzdialených časových kroků zmenšují k nule. Vzniká při opakovaném násobení Jacobianmi s malými hodnotami a při saturujúcich aktivacích, jako jsou sigmoid nebo tanh mimo citlivej oblasti. Časné parametry potom dostávají zanedbatelný učebný signál, takže model se učí pomalu a nedokáže zachytit dlouhé závislosti. Problém zmierňují vhodné inicializace, Relu rodina, reziduální spojení, normalizace a hradlové bunky. Gradient clipping ho nerieši, protože omezuje velké, ne malé gradienty.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si pokyn odovzdávaný přes dlouhý rad lidí, přičemž každý ho řekne o polovicu tichšie. Na začiatok radu se vrátí téměř nepočutelná správa a první vrstvy nevědí, co mají změnit. V rekurentnej síti to znamená, že chyba na konci věty sotva ovlivní zpracování slova na začátku. Hradlá GRU a LSTM vytvářejí cesty, po kterých se informace a gradient udržia déle, reziduální spojení zas skracují efektívnu cestu v hlubokých sítích. Pokud jsou však aktivace neustále saturované, trénink může zůstat pomalý i při správné architektúre.

Časté otázky

Časté otázky

Jak se miznutie gradientu diagnostikuje?

Porovnají se normy gradientů napříč vrstvami nebo časem a sleduje se, či časné části zůstávají téměř bez aktualizace. Pomáhá i test citlivosti výstupu na vzdálené vstupy.

Je miznutie gradientu to jisté jako dead Relu?

Ne. Dead Relu má nulový gradient v konkrétní jednotke, protože její vstup zůstává v zápornej oblasti. Miznutie gradientu je reťazový efekt napříč mnohými transformacemi.

Jako GRU a LSTM problém zmierňují?

Brány vytvářejí aditívnejšie cesty pro přenos stavu a regulují zapomínání. Gradient se nemusí při každém kroku násobit pouze malou derivací, ačkoli úplná ochrana při lubovolnej dlžke neexistuje.

Proč reziduální spojení pomáhají v hlubokých sítích?

Identitná skratka umožňuje signálu i gradientu obejít část nelineárnych transformací. Optimalizátor se potom může učit reziduálnu změnu místo celé mapy od začátku.

Pomůže gradient clipping při miznúcich gradientoch?

Ne přímo. Clipping zmenšuje nadmerné hodnoty, ale malé gradienty nezvečší. Potřebná je změna aktivace, inicializace, normalizace, architektury nebo délky zpětného přenosu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.