Modely a architektúry · Architektúra neurónových sietí

Attention mechanism

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-21

Odborná definícia

Význam a odborné vymedzenie pojmu

Attention mechanism, mechanizmus pozornosti, je výpočtový postup, ktorý pri spracovaní prvku vytvára váženú kombináciu iných reprezentácií podľa ich odhadovanej relevantnosti. V transformeroch sa váhy odvodzujú z podobnosti medzi vektormi query a key a aplikujú sa na vektory value. Self-attention prepája prvky tej istej sekvencie, cross-attention prepája dve rôzne sady reprezentácií. Mechanizmus umožňuje modelovať vzdialené závislosti, no jeho základná forma rastie kvadraticky s dĺžkou sekvencie.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Pri preklade slova potrebuje model venovať väčšiu pozornosť niektorým slovám v pôvodnej vete než iným. Attention vypočíta, ktoré časti kontextu sú pre aktuálny krok najdôležitejšie, a zmieša ich informáciu s rôznymi váhami. V jazykovom modeli sa tak slovo na konci odseku môže oprieť o meno uvedené oveľa skôr. Váhy pozornosti však nie sú automaticky ľudským vysvetlením rozhodnutia. Sú internou súčasťou výpočtu, ktorá môže byť rozdelená medzi mnoho hláv a vrstiev.

Časté otázky

Otázky, ktoré spresňujú význam

Čo znamenajú query, key a value?

Query reprezentuje informáciu, pre ktorú sa hľadá relevantný kontext. Key opisuje, podľa čoho sa jednotlivé položky porovnávajú, a value nesie obsah, ktorý sa po výpočte váh kombinuje. Skalárne súčiny query a key sa normalizujú pomocou softmaxu. Výsledná vážená suma value vektorov vytvorí kontextovú reprezentáciu pre danú pozíciu.

Aký je rozdiel medzi self-attention a cross-attention?

Self-attention používa query, key a value odvodené z tej istej sekvencie, takže každý token môže čerpať z ostatných tokenov. Cross-attention používa query z jednej reprezentácie a key s value z druhej, napríklad decoder sa pozerá na výstupy encodera alebo textový model na obrazové prvky. Cross-attention je dôležitý v multimodálnych a encoder-decoder systémoch.

Prečo transformery používajú viac attention heads?

Každá hlava má vlastné projekcie query, key a value a môže zachytiť odlišný typ vzťahu, napríklad syntaktickú väzbu, pozíciu alebo tematickú podobnosť. Výstupy hláv sa spoja a ďalej transformujú. Nie je zaručené, že každá hlava má ľahko pomenovateľnú funkciu. Niektoré môžu byť redundantné, čo sa dá skúmať ablačnými štúdiami.

Prečo je dlhý kontext výpočtovo náročný?

Pri plnej self-attention sa porovnáva každá pozícia s každou ďalšou, takže počet párov rastie približne so štvorcom dĺžky sekvencie. Dvojnásobný počet tokenov môže priniesť približne štvornásobný počet attention skóre. Efektívnejšie varianty používajú riedku pozornosť, lokálne okná, kompresiu alebo iné aproximácie, no môžu meniť dostupnosť vzdialeného kontextu.

Sú attention váhy vysvetlením rozhodnutia modelu?

Nie nevyhnutne. Ukazujú, ako konkrétna vrstva miešala reprezentácie, ale výsledok závisí aj od ostatných hláv, reziduálnych spojení, MLP blokov a ďalších vrstiev. Vysoká váha nemusí znamenať kauzálny vplyv na výstup. Pre interpretáciu sa kombinujú zásahy do modelu, gradientové metódy, ablačné testy a analýza správania.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Google Machine Learning Glossary
  • Google ML Crash Course, Activation functions

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.