Generatívna a jazyková AI · Transformer a kontextové reprezentácie

Sebapozornosť

Self-attention

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-06

Odborná definícia

Význam a odborné vymedzenie pojmu

Self-attention je mechanizmus, pri ktorom sa každá pozícia sekvencie porovnáva s ostatnými pozíciami tej istej sekvencie a vytvára reprezentáciu váženú podľa ich relevantnosti. Dopyty, kľúče a hodnoty vznikajú z rovnakého vstupu, hoci používajú odlišné naučené projekcie. Mechanizmus zachytáva závislosti bez rekurentného prechodu token po tokene. Samotná attention vrstva však nepozná poradie, preto transformery pridávajú pozičnú informáciu. Reziduálne spojenia a následné vrstvy ďalej menia informáciu, ktorú pozornosť vytvorila.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Vo vete môže zámeno odkazovať na podstatné meno vzdialené o mnoho slov. Self-attention umožní, aby si pozícia zámena priamo vypočítala, ktoré predchádzajúce alebo nasledujúce tokeny sú pre jej význam dôležité. Každé slovo tak dostane nový opis ovplyvnený celou dostupnou sekvenciou. Viac hláv môže paralelne sledovať odlišné vzťahy, napríklad gramatickú väzbu, tému alebo formát. Výsledná váha však nie je automatickým vysvetlením rozhodnutia modelu. Preto sa pri interpretácii nesmie jedna pekná attention mapa zameniť za úplný dôvod výsledku.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa self-attention líši od cross-attention?

Self-attention používa Q, K a V z jednej sekvencie. Cross-attention používa dopyty z jednej časti modelu a kľúče s hodnotami z iného zdroja, napríklad z enkódera.

Načo slúži multi-head attention?

Rozdelí reprezentáciu do viacerých hláv s vlastnými projekciami. Každá hlava môže zachytiť iný typ vzťahu, potom sa ich výstupy spoja.

Pozná self-attention poradie slov?

Nie z vlastného výpočtu. Poradie sa pridáva pozičnými embeddingmi, rotačnými kódmi alebo iným mechanizmom, ktorý odlíši pozície.

Sú attention weights vysvetlením modelu?

Nie nevyhnutne. Ukazujú váhy v konkrétnej vrstve, ale výsledok ovplyvňujú ďalšie hlavy, vrstvy, reziduálne spojenia a nelinearity.

Prečo sa používa kauzálna maska?

Pri generovaní zakáže pozícii čerpať z budúcich tokenov. Model sa tak učí predpovedať pokračovanie iba z už dostupného prefixu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.