Architektury hlubokého učení

transformerová neuronová architektura

Transformer je neuronová architektura založená na attention mechanizmoch, pozičnej informaci, dopredných blokoch, reziduálnych spojeniach a normalizaci. Zpracovává vztahy mezi pozicemi bez rekurence a umožňuje paralelní trénink sekvencí. Může mít encoder, decoder nebo obě části a používá se pro text, obraz, zvuk i multimodální data. Štandardná self-attention má kvadratické nároky podle délky sekvence, proto dlouhý kontext vyžaduje velkou paměť nebo upravené attention metody. Konkrétní transformer se popisuje počtem vrstev, skrytým rozmerom, typem attention, pozičným kódováním a kontextem.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-25

Odborná definice

Odborná definice

Transformer je neuronová architektura založená na attention mechanizmoch, pozičnej informaci, dopredných blokoch, reziduálnych spojeniach a normalizaci. Zpracovává vztahy mezi pozicemi bez rekurence a umožňuje paralelní trénink sekvencí. Může mít encoder, decoder nebo obě části a používá se pro text, obraz, zvuk i multimodální data. Štandardná self-attention má kvadratické nároky podle délky sekvence, proto dlouhý kontext vyžaduje velkou paměť nebo upravené attention metody. Konkrétní transformer se popisuje počtem vrstev, skrytým rozmerom, typem attention, pozičným kódováním a kontextem.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Transformer při každém tokene vypočítá, kterým jiným tokenom má venovat pozornost. Tak dokáže spojit zámeno s jménem nebo otázku s relevantní částí dokumentu i na větší vzdálenost. Více vrstev postupně vytváří složitější reprezentace. Encoder se hodí na porozumění vstupu, decoder na postupné generování a encoder-decoder na transformaci jedné sekvence na jinou. Architektura je velmi škálovatelná, ale výpočet attention roste rychle s délkou textu a samotná velikost nezaručuje pravdivost. Slovo transformer označuje rodinu architektúr, ne jednu pevnou síť s rovnakými schopnostmi a nákladmi.

Časté otázky

Časté otázky

Co je self-attention v transformeri?

Každá pozíce vytvoří query, key a value vektory. Skóre query vůči keys určí váhy, kterými se skombinují values do nové reprezentace dané pozice.

Proč transformer potřebuje pozičnou informaci?

Attention bez ní nerozlišuje pořadí tokenů. Pozíce se přidává absolútnym, relatívnym nebo rotačným kódováním podle konkrétní architektury.

Jaký je rozdíl mezi encoderem a decoderom?

Encoder obvykle používá obojsmernou self-attention nad celým vstupem. Decoder používá kauzálnu masku, aby při generování neviděl budoucí tokeny.

Je každý velký jazykový model transformer?

Večšina súčasných LLM používá transformerové nebo blízko příbuzné bloky, ale jazykový model může být vytvořený i rekurentnou nebo state space architekturou.

Proč je dlouhý kontext drahý?

Při štandardnej attention se porovnávají páry pozic, takže počet skóre roste přibližně se štvorcom délky. Optimalizace mění paměť, sparsitu nebo způsob výpočtu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Attention Is All You Need
  • Google Machine Learning Crash Course, Transformers

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.