Odborná definícia
Význam a odborné vymedzenie pojmu
Transformer je neurónová architektúra založená na attention mechanizmoch, pozičnej informácii, dopredných blokoch, reziduálnych spojeniach a normalizácii. Spracúva vzťahy medzi pozíciami bez rekurencie a umožňuje paralelný tréning sekvencií. Môže mať encoder, decoder alebo obe časti a používa sa pre text, obraz, zvuk aj multimodálne dáta. Štandardná self-attention má kvadratické nároky podľa dĺžky sekvencie, preto dlhý kontext vyžaduje veľkú pamäť alebo upravené attention metódy. Konkrétny transformer sa opisuje počtom vrstiev, skrytým rozmerom, typom attention, pozičným kódovaním a kontextom.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Transformer pri každom tokene vypočíta, ktorým iným tokenom má venovať pozornosť. Tak dokáže spojiť zámeno s menom alebo otázku s relevantnou časťou dokumentu aj na väčšiu vzdialenosť. Viac vrstiev postupne vytvára zložitejšie reprezentácie. Encoder sa hodí na porozumenie vstupu, decoder na postupné generovanie a encoder-decoder na transformáciu jednej sekvencie na inú. Architektúra je veľmi škálovateľná, no výpočet attention rastie rýchlo s dĺžkou textu a samotná veľkosť nezaručuje pravdivosť. Slovo transformer označuje rodinu architektúr, nie jednu pevnú sieť s rovnakými schopnosťami a nákladmi.
Časté otázky
Otázky, ktoré spresňujú význam
Čo je self-attention v transformeri?
Každá pozícia vytvorí query, key a value vektory. Skóre query voči keys určí váhy, ktorými sa skombinujú values do novej reprezentácie danej pozície.
Prečo transformer potrebuje pozičnú informáciu?
Attention bez nej nerozlišuje poradie tokenov. Pozícia sa pridáva absolútnym, relatívnym alebo rotačným kódovaním podľa konkrétnej architektúry.
Aký je rozdiel medzi encoderom a decoderom?
Encoder zvyčajne používa obojsmernú self-attention nad celým vstupom. Decoder používa kauzálnu masku, aby pri generovaní nevidel budúce tokeny.
Je každý veľký jazykový model transformer?
Väčšina súčasných LLM používa transformerové alebo blízko príbuzné bloky, ale jazykový model môže byť vytvorený aj rekurentnou alebo state space architektúrou.
Prečo je dlhý kontext drahý?
Pri štandardnej attention sa porovnávajú páry pozícií, takže počet skóre rastie približne so štvorcom dĺžky. Optimalizácie menia pamäť, sparsitu alebo spôsob výpočtu.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Attention Is All You Need
- Google Machine Learning Crash Course, Transformers
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
