Odborná definice
Odborná definice
Weight initialization je volba počátečního rozdělení parametrů před začiatkom tréninku. Inicializace má rozbit symetrii mezi neurónmi a udržat rozptyl aktivací i gradientů v použitelnom rozsahu při prechode vrstvami. Xavierova inicializace škáluje váhy podle fan-in a fan-out, He inicializace zohladňuje zejména Relu rodinu a ortogonálne schémata zachovávají vybrané geometrické vlastnosti. Správná volba závisí na aktivačnej funkce, tvaru vrstvy, reziduálnych vetiev a normalizace. Při predtrénovanom modeli inicializace řeší zejména nové nebo nahradené komponenty.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Před tréninkem jsou všechny nastavitelné spojení modelu ještě bez naučeného významu. Keby měli stejnou hodnotu, neuróny v té určité vrstvě by dostávali stejné signály a učili by se totožne. Náhodnost jejich odlíši, ale její rozsah musí být primeraný. Příliš velké váhy mohou zosilnit aktivace a gradienty, příliš malé jejich utopia. Xavier nebo He proto nastavují měřítko podle počtu vstupů a výstupů vrstvy. Inicializace neurčuje konečný model, ale výrazně ovlivňuje, zda se optimalizace vůbec rozbehne stabilne.
Časté otázky
Časté otázky
Proč nelze inicializovat všechny váhy nulou?
Neuróny v stejné vrstvě by zostali symetrické, dostávali by stejné gradienty a učili by se stejnou funkci. Nulové zkreslení jsou běžné, nulové matice váh ne.
Kdy se používá Xavier initialization?
Zejména při vrstvách s přibližně symetrickými aktivacemi, například tanh nebo lineárnymi transformacemi. Měřítko vychází ze vstupní i výstupní šířky.
Proč se He initialization spojuje s Relu?
Relu vynuluje část distribuce aktivací. He škálování používá fan-in tak, aby kompenzovalo tuto ztrátu rozptylu a podporilo tok signálu.
Je stejný random seed zárukou stejného tréninku?
Ne vždy. Seed reprodukuje inicializaci pouze v rámci podporovaného prostředí. Nedeterministické GPU operace, pořadí dat a distribuovaný trénink mohou výsledek změnit.
Jak se inicializují nové vrstvy při fine-tuningu?
Nová hlava se inicializuje podle svojej aktivace a tvaru, zatímco předtrénované váhy se načítají z checkpointu. Často potřebuje odlišný learning rate nebo warmup.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- PyTorch, torch.nn.init Understanding the difficulty of training deep feedforward neural networks
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
