Trénink neuronových sítí

Inicializace parametrů nulami

Zero initialization je nastavení váh nebo jiných parametrů modelu na nulovou hodnotu před optimalizací. Při viacneurónovej vrstvě se nulová inicializace všech váh zpravidla nepoužívá, protože neuróny dostanou stejné gradienty a zůstanou symetrické, takže se nenaučia rozdílně příznaky. Nulou se však běžně inicializují zkreslení, některé reziduální škály, stavové buffery nebo výstupní vrstvy, když návrh záměrně vyžaduje počiatočnou nulovou funkci. Vhodnost závisí na parametru a toku gradientu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Z-11

Odborná definice

Odborná definice

Zero initialization je nastavení váh nebo jiných parametrů modelu na nulovou hodnotu před optimalizací. Při viacneurónovej vrstvě se nulová inicializace všech váh zpravidla nepoužívá, protože neuróny dostanou stejné gradienty a zůstanou symetrické, takže se nenaučia rozdílně příznaky. Nulou se však běžně inicializují zkreslení, některé reziduální škály, stavové buffery nebo výstupní vrstvy, když návrh záměrně vyžaduje počiatočnou nulovou funkci. Vhodnost závisí na parametru a toku gradientu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud všem neurónom v jedné vrstvě dáte stejné nulové váhy, každý uvidí stejný vstup, vypočítá stejný výstup a dostane stejnou opravu. Ani po mnoha krocích se nerozdelia na špecialistů. Náhodná inicializace tuto symetrii rozbije. Nula však není obecně zakázaná, bias může začínat nulou a některé adaptérne nebo reziduální větve se záměrně spúšťají bez vlivu na základní model. Rozhodující je, či nulový štart zablokuje učení požadované struktury.

Časté otázky

Časté otázky

Proč nulové váhy porušují učení skrytej vrstvy?

Všechny neuróny mají identické aktivace i gradienty. Optimalizátor jejich proto aktualizuje stejně a vrstva se správa jako jeden opakovaný neuron.

Mohou zkreslení začínat nulou?

Ve večšine vrstev ano, protože rozdílně náhodné váhy už symetrii neuronů rozbili. Existují však úlohy s účelovým nenulovým biasom.

Kdy je nulový výstup žiaduci?

Při reziduálnej vetve nebo adaptéri, který má na začátku zachovat původní funkci a pridávat vliv až během učení.

Týká se problém i lineární regrese?

Ne stejným způsobem. Konvexný lineární model může z nulových parametrů normálně optimalizovat, protože nemá skupinu symetrických skrytých neuronů.

Jak se volí alternatíva?

Používá se Xavierova nebo He inicializace podle aktivačnej funkce, fan-in, fan-out a požadované stability variance signálu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, nn.init

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.