Návrh a trénink neuronových sítí

počáteční nastavení váh

Weight initialization je volba počátečního rozdělení parametrů před začiatkom tréninku. Inicializace má rozbit symetrii mezi neurónmi a udržat rozptyl aktivací i gradientů v použitelnom rozsahu při prechode vrstvami. Xavierova inicializace škáluje váhy podle fan-in a fan-out, He inicializace zohladňuje zejména Relu rodinu a ortogonálne schémata zachovávají vybrané geometrické vlastnosti. Správná volba závisí na aktivačnej funkce, tvaru vrstvy, reziduálnych vetiev a normalizace. Při predtrénovanom modeli inicializace řeší zejména nové nebo nahradené komponenty.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-13

Odborná definice

Odborná definice

Weight initialization je volba počátečního rozdělení parametrů před začiatkom tréninku. Inicializace má rozbit symetrii mezi neurónmi a udržat rozptyl aktivací i gradientů v použitelnom rozsahu při prechode vrstvami. Xavierova inicializace škáluje váhy podle fan-in a fan-out, He inicializace zohladňuje zejména Relu rodinu a ortogonálne schémata zachovávají vybrané geometrické vlastnosti. Správná volba závisí na aktivačnej funkce, tvaru vrstvy, reziduálnych vetiev a normalizace. Při predtrénovanom modeli inicializace řeší zejména nové nebo nahradené komponenty.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Před tréninkem jsou všechny nastavitelné spojení modelu ještě bez naučeného významu. Keby měli stejnou hodnotu, neuróny v té určité vrstvě by dostávali stejné signály a učili by se totožne. Náhodnost jejich odlíši, ale její rozsah musí být primeraný. Příliš velké váhy mohou zosilnit aktivace a gradienty, příliš malé jejich utopia. Xavier nebo He proto nastavují měřítko podle počtu vstupů a výstupů vrstvy. Inicializace neurčuje konečný model, ale výrazně ovlivňuje, zda se optimalizace vůbec rozbehne stabilne.

Časté otázky

Časté otázky

Proč nelze inicializovat všechny váhy nulou?

Neuróny v stejné vrstvě by zostali symetrické, dostávali by stejné gradienty a učili by se stejnou funkci. Nulové zkreslení jsou běžné, nulové matice váh ne.

Kdy se používá Xavier initialization?

Zejména při vrstvách s přibližně symetrickými aktivacemi, například tanh nebo lineárnymi transformacemi. Měřítko vychází ze vstupní i výstupní šířky.

Proč se He initialization spojuje s Relu?

Relu vynuluje část distribuce aktivací. He škálování používá fan-in tak, aby kompenzovalo tuto ztrátu rozptylu a podporilo tok signálu.

Je stejný random seed zárukou stejného tréninku?

Ne vždy. Seed reprodukuje inicializaci pouze v rámci podporovaného prostředí. Nedeterministické GPU operace, pořadí dat a distribuovaný trénink mohou výsledek změnit.

Jak se inicializují nové vrstvy při fine-tuningu?

Nová hlava se inicializuje podle svojej aktivace a tvaru, zatímco předtrénované váhy se načítají z checkpointu. Často potřebuje odlišný learning rate nebo warmup.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, torch.nn.init Understanding the difficulty of training deep feedforward neural networks

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.