Architektura neuronových sítí

Normalizace vrstvy

Layer normalization normalizuje aktivace jedné vzorku přes určené rozměry příznaků pomocí jejich průměru a rozptylu, potom aplikuje naučitelnou škálu a posun. Na rozdíl od batch normalization nepotřebuje statistiky napříč batchom a správa se konzistentne i při batch size jeden. Používá se v transformerech, rekurentních sítích a dalších architektúrach. Umístění před nebo za reziduálny blok, hodnota epsilon a rozsah normalized_shape významne ovlivňují stabilitu tréninku.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-L-14

Odborná definice

Odborná definice

Layer normalization normalizuje aktivace jedné vzorku přes určené rozměry příznaků pomocí jejich průměru a rozptylu, potom aplikuje naučitelnou škálu a posun. Na rozdíl od batch normalization nepotřebuje statistiky napříč batchom a správa se konzistentne i při batch size jeden. Používá se v transformerech, rekurentních sítích a dalších architektúrach. Umístění před nebo za reziduálny blok, hodnota epsilon a rozsah normalized_shape významne ovlivňují stabilitu tréninku.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Vektor aktivací může mít v každé vrstvě jinou průměrnou úroveň a rozptyl. Layer normalization ho pro konkrétní příklad přepočítá na kontrolovanejšiu škálu a potom dovolí síti naučit si vhodné zosilnení a posun. Keďže neporovnáva různé položky v batchi, výsledek jedné věty nezávisí na toho, jaké další věty byly spracované současně. To je praktické při sekvenciách různé délky a při inferenci. Nesprávně zvolený normalizovaný rozměr však může měnit jinou os, než architekt zamýšlal.

Časté otázky

Časté otázky

Přes které rozměry Layernorm počítá statistiky?

Přes posledné rozměry určené parametrem normalized_shape. Při transformeri je to často hidden dimension každého tokenu.

Používá při inferenci bežiaci průměr?

Ne. Průměr a rozptyl počítá z aktuálního vstupu, proto nepotřebuje running statistics nazbierané během tréninku.

Co znamená pro-norm a post-norm transformer?

Pro-norm aplikuje normalizaci před attention nebo feed-forward blokom. Post-norm ji umiestňuje po reziduálnom súčte, co mění tok gradientů a stabilitu.

K čemu slouží epsilon?

Malá konštanta v menovateli zabraňuje delení velmi malým rozptylom a zlepšuje numerickou stabilitu, zejména při nižšej přesnosti.

Je Layernorm bez naučitelných parametrů?

Může být, ale běžně má elementwise affine parametry gamma a beta. Ty umožňují síti po normalizaci obnovit vhodnou škálu a posun.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, LayerNorm

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.