Odborná definícia
Význam a odborné vymedzenie pojmu
Attention mechanism, mechanizmus pozornosti, je výpočtový postup, ktorý pri spracovaní prvku vytvára váženú kombináciu iných reprezentácií podľa ich odhadovanej relevantnosti. V transformeroch sa váhy odvodzujú z podobnosti medzi vektormi query a key a aplikujú sa na vektory value. Self-attention prepája prvky tej istej sekvencie, cross-attention prepája dve rôzne sady reprezentácií. Mechanizmus umožňuje modelovať vzdialené závislosti, no jeho základná forma rastie kvadraticky s dĺžkou sekvencie.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Pri preklade slova potrebuje model venovať väčšiu pozornosť niektorým slovám v pôvodnej vete než iným. Attention vypočíta, ktoré časti kontextu sú pre aktuálny krok najdôležitejšie, a zmieša ich informáciu s rôznymi váhami. V jazykovom modeli sa tak slovo na konci odseku môže oprieť o meno uvedené oveľa skôr. Váhy pozornosti však nie sú automaticky ľudským vysvetlením rozhodnutia. Sú internou súčasťou výpočtu, ktorá môže byť rozdelená medzi mnoho hláv a vrstiev.
Časté otázky
Otázky, ktoré spresňujú význam
Čo znamenajú query, key a value?
Query reprezentuje informáciu, pre ktorú sa hľadá relevantný kontext. Key opisuje, podľa čoho sa jednotlivé položky porovnávajú, a value nesie obsah, ktorý sa po výpočte váh kombinuje. Skalárne súčiny query a key sa normalizujú pomocou softmaxu. Výsledná vážená suma value vektorov vytvorí kontextovú reprezentáciu pre danú pozíciu.
Aký je rozdiel medzi self-attention a cross-attention?
Self-attention používa query, key a value odvodené z tej istej sekvencie, takže každý token môže čerpať z ostatných tokenov. Cross-attention používa query z jednej reprezentácie a key s value z druhej, napríklad decoder sa pozerá na výstupy encodera alebo textový model na obrazové prvky. Cross-attention je dôležitý v multimodálnych a encoder-decoder systémoch.
Prečo transformery používajú viac attention heads?
Každá hlava má vlastné projekcie query, key a value a môže zachytiť odlišný typ vzťahu, napríklad syntaktickú väzbu, pozíciu alebo tematickú podobnosť. Výstupy hláv sa spoja a ďalej transformujú. Nie je zaručené, že každá hlava má ľahko pomenovateľnú funkciu. Niektoré môžu byť redundantné, čo sa dá skúmať ablačnými štúdiami.
Prečo je dlhý kontext výpočtovo náročný?
Pri plnej self-attention sa porovnáva každá pozícia s každou ďalšou, takže počet párov rastie približne so štvorcom dĺžky sekvencie. Dvojnásobný počet tokenov môže priniesť približne štvornásobný počet attention skóre. Efektívnejšie varianty používajú riedku pozornosť, lokálne okná, kompresiu alebo iné aproximácie, no môžu meniť dostupnosť vzdialeného kontextu.
Sú attention váhy vysvetlením rozhodnutia modelu?
Nie nevyhnutne. Ukazujú, ako konkrétna vrstva miešala reprezentácie, ale výsledok závisí aj od ostatných hláv, reziduálnych spojení, MLP blokov a ďalších vrstiev. Vysoká váha nemusí znamenať kauzálny vplyv na výstup. Pre interpretáciu sa kombinujú zásahy do modelu, gradientové metódy, ablačné testy a analýza správania.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Google Machine Learning Glossary
- Google ML Crash Course, Activation functions
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
