Odborná definice
Odborná definice
Transformer je neuronová architektura založená na attention mechanizmoch, pozičnej informaci, dopredných blokoch, reziduálnych spojeniach a normalizaci. Zpracovává vztahy mezi pozicemi bez rekurence a umožňuje paralelní trénink sekvencí. Může mít encoder, decoder nebo obě části a používá se pro text, obraz, zvuk i multimodální data. Štandardná self-attention má kvadratické nároky podle délky sekvence, proto dlouhý kontext vyžaduje velkou paměť nebo upravené attention metody. Konkrétní transformer se popisuje počtem vrstev, skrytým rozmerom, typem attention, pozičným kódováním a kontextem.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Transformer při každém tokene vypočítá, kterým jiným tokenom má venovat pozornost. Tak dokáže spojit zámeno s jménem nebo otázku s relevantní částí dokumentu i na větší vzdálenost. Více vrstev postupně vytváří složitější reprezentace. Encoder se hodí na porozumění vstupu, decoder na postupné generování a encoder-decoder na transformaci jedné sekvence na jinou. Architektura je velmi škálovatelná, ale výpočet attention roste rychle s délkou textu a samotná velikost nezaručuje pravdivost. Slovo transformer označuje rodinu architektúr, ne jednu pevnou síť s rovnakými schopnostmi a nákladmi.
Časté otázky
Časté otázky
Co je self-attention v transformeri?
Každá pozíce vytvoří query, key a value vektory. Skóre query vůči keys určí váhy, kterými se skombinují values do nové reprezentace dané pozice.
Proč transformer potřebuje pozičnou informaci?
Attention bez ní nerozlišuje pořadí tokenů. Pozíce se přidává absolútnym, relatívnym nebo rotačným kódováním podle konkrétní architektury.
Jaký je rozdíl mezi encoderem a decoderom?
Encoder obvykle používá obojsmernou self-attention nad celým vstupem. Decoder používá kauzálnu masku, aby při generování neviděl budoucí tokeny.
Je každý velký jazykový model transformer?
Večšina súčasných LLM používá transformerové nebo blízko příbuzné bloky, ale jazykový model může být vytvořený i rekurentnou nebo state space architekturou.
Proč je dlouhý kontext drahý?
Při štandardnej attention se porovnávají páry pozic, takže počet skóre roste přibližně se štvorcom délky. Optimalizace mění paměť, sparsitu nebo způsob výpočtu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Attention Is All You Need
- Google Machine Learning Crash Course, Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
