Modely a architektúry · Návrh a tréning neurónových sietí

Počiatočné nastavenie váh

Weight initialization

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-13

Odborná definícia

Význam a odborné vymedzenie pojmu

Weight initialization je voľba počiatočného rozdelenia parametrov pred začiatkom tréningu. Inicializácia má rozbiť symetriu medzi neurónmi a udržať rozptyl aktivácií aj gradientov v použiteľnom rozsahu pri prechode vrstvami. Xavierova inicializácia škáluje váhy podľa fan-in a fan-out, He inicializácia zohľadňuje najmä ReLU rodinu a ortogonálne schémy zachovávajú vybrané geometrické vlastnosti. Správna voľba závisí od aktivačnej funkcie, tvaru vrstvy, reziduálnych vetiev a normalizácie. Pri predtrénovanom modeli inicializácia rieši najmä nové alebo nahradené komponenty.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Pred tréningom sú všetky nastaviteľné spojenia modelu ešte bez naučeného významu. Keby mali rovnakú hodnotu, neuróny v tej istej vrstve by dostávali rovnaké signály a učili by sa totožne. Náhodnosť ich odlíši, no jej rozsah musí byť primeraný. Príliš veľké váhy môžu zosilniť aktivácie a gradienty, príliš malé ich utopia. Xavier alebo He preto nastavujú mierku podľa počtu vstupov a výstupov vrstvy. Inicializácia neurčuje konečný model, ale výrazne ovplyvňuje, či sa optimalizácia vôbec rozbehne stabilne.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo nemožno inicializovať všetky váhy nulou?

Neuróny v rovnakej vrstve by zostali symetrické, dostávali by rovnaké gradienty a učili by sa rovnakú funkciu. Nulové biasy sú bežné, nulové matice váh nie.

Kedy sa používa Xavier initialization?

Najmä pri vrstvách s približne symetrickými aktiváciami, napríklad tanh alebo lineárnymi transformáciami. Mierka vychádza zo vstupnej aj výstupnej šírky.

Prečo sa He initialization spája s ReLU?

ReLU vynuluje časť distribúcie aktivácií. He škálovanie používa fan-in tak, aby kompenzovalo túto stratu rozptylu a podporilo tok signálu.

Je rovnaký random seed zárukou rovnakého tréningu?

Nie vždy. Seed reprodukuje inicializáciu iba v rámci podporovaného prostredia. Nedeterministické GPU operácie, poradie dát a distribuovaný tréning môžu výsledok zmeniť.

Ako sa inicializujú nové vrstvy pri fine-tuningu?

Nová hlava sa inicializuje podľa svojej aktivácie a tvaru, zatiaľ čo predtrénované váhy sa načítajú z checkpointu. Často potrebuje odlišný learning rate alebo warmup.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • PyTorch, torch.nn.init Understanding the difficulty of training deep feedforward neural networks

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.