Odborná definícia
Význam a odborné vymedzenie pojmu
Weight initialization je voľba počiatočného rozdelenia parametrov pred začiatkom tréningu. Inicializácia má rozbiť symetriu medzi neurónmi a udržať rozptyl aktivácií aj gradientov v použiteľnom rozsahu pri prechode vrstvami. Xavierova inicializácia škáluje váhy podľa fan-in a fan-out, He inicializácia zohľadňuje najmä ReLU rodinu a ortogonálne schémy zachovávajú vybrané geometrické vlastnosti. Správna voľba závisí od aktivačnej funkcie, tvaru vrstvy, reziduálnych vetiev a normalizácie. Pri predtrénovanom modeli inicializácia rieši najmä nové alebo nahradené komponenty.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Pred tréningom sú všetky nastaviteľné spojenia modelu ešte bez naučeného významu. Keby mali rovnakú hodnotu, neuróny v tej istej vrstve by dostávali rovnaké signály a učili by sa totožne. Náhodnosť ich odlíši, no jej rozsah musí byť primeraný. Príliš veľké váhy môžu zosilniť aktivácie a gradienty, príliš malé ich utopia. Xavier alebo He preto nastavujú mierku podľa počtu vstupov a výstupov vrstvy. Inicializácia neurčuje konečný model, ale výrazne ovplyvňuje, či sa optimalizácia vôbec rozbehne stabilne.
Časté otázky
Otázky, ktoré spresňujú význam
Prečo nemožno inicializovať všetky váhy nulou?
Neuróny v rovnakej vrstve by zostali symetrické, dostávali by rovnaké gradienty a učili by sa rovnakú funkciu. Nulové biasy sú bežné, nulové matice váh nie.
Kedy sa používa Xavier initialization?
Najmä pri vrstvách s približne symetrickými aktiváciami, napríklad tanh alebo lineárnymi transformáciami. Mierka vychádza zo vstupnej aj výstupnej šírky.
Prečo sa He initialization spája s ReLU?
ReLU vynuluje časť distribúcie aktivácií. He škálovanie používa fan-in tak, aby kompenzovalo túto stratu rozptylu a podporilo tok signálu.
Je rovnaký random seed zárukou rovnakého tréningu?
Nie vždy. Seed reprodukuje inicializáciu iba v rámci podporovaného prostredia. Nedeterministické GPU operácie, poradie dát a distribuovaný tréning môžu výsledok zmeniť.
Ako sa inicializujú nové vrstvy pri fine-tuningu?
Nová hlava sa inicializuje podľa svojej aktivácie a tvaru, zatiaľ čo predtrénované váhy sa načítajú z checkpointu. Často potrebuje odlišný learning rate alebo warmup.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- PyTorch, torch.nn.init Understanding the difficulty of training deep feedforward neural networks
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
