Odborná definice
Odborná definice
Xavier initialization, známa i jako Glorot initialization, nastavuje počiatočnou měřítko váh podle počtu vstupních a výstupných spojení vrstvy. Uniformná nebo normálna verze volí rozptyl tak, aby se při dopředném i spetnom prechode přibližně zachovala velikost signálu. Metoda byla navržená zejména pro symetrické saturujúce aktivace, například tanh, a lineární vrstvy. Při Relu se často upřednostňuje He inicializace. Xavier neodstraňuje potřebu normalizace, vhodného learning rate ani kontroly reziduálnych vetiev. Nesprávný gain může stále vést k miznúcim nebo explodujúcim gradientem.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Na začátku tréninku ještě váhy nic nevědí, ale jejich velikost rozhoduje, či signál projde sítí v použitelnom rozsahu. Xavier vypočítá měřítko z počtu vstupů a výstupů vrstvy. Úzká vrstva a široká vrstva tedy nedostanou slepo stejné náhodné čísla. Cílem je, aby aktivace ani gradienty po každé vrstvě prudko nerástli nebo nezanikali. Při Relu se však část hodnot vynuluje, proto se obvykle používá jiné škálování. Kontrola histogramů aktivací po prvních dávkách dokáže rychle odhalit nevhodne zvolenou měřítko.
Časté otázky
Časté otázky
Co znamenají fan-in a fan-out?
Fan-in je počet vstupních spojení neuronu nebo vrstvy, fan-out počet výstupných spojení. Xavier používá obě hodnoty při výpočtu rozptylu.
Je Xavier vhodný pro Relu?
Může fungovat, ale He initialization lépe zohladňuje nulování záporných aktivací. Volba se ověřuje podle stability a architektury.
Jaký je rozdíl mezi uniformnou a normálnou verzí?
Obě cielia podobný rozptyl, jedna vzorkuje z ohraničeného rovnomerného rozdělení a druhá z normálneho. Chvosty a maximálne hodnoty se liší.
Proč se při některých aktivacích používá gain?
Gain upravuje měřítko podle změny rozptylu spůsobenej aktivačnou funkcí. Nesprávná hodnota může zhoršit tok signálu navzdory správnemu fan-in a fan-out.
Týká se Xavier i předtrénovaného modelu?
Načítané vrstvy už mají naučené váhy. Xavier se používá pro novo pridané hlavy, nahradené projekce nebo model trénovaný od začátku.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Understanding the Difficulty of Training Deep Feedforward Neural Networks
- PyTorch, Xavier initialization
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
