Transformer a mechanizmy pozornosti

Scaled dot-product attention

škálovaná pozornosť skalárnym súčinom

Scaled dot-product attention počíta zhodu medzi dopytmi Q a kľúčmi K pomocou skalárnych súčinov, výsledky delí odmocninou rozmeru kľúča a po aplikácii softmaxu nimi váži hodnoty V. Škálovanie obmedzuje príliš veľké skóre pri vysokom rozmere, ktoré by nasýtilo softmax a zhoršilo gradienty. Mechanizmus môže používať masku, napríklad na zákaz pohľadu na budúce tokeny. Je základným výpočtom mnohých transformerových architektúr. Pri multi-head variante sa tento výpočet opakuje v niekoľkých projekčných podpriestoroch.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-05

Odborná definícia

Odborná definícia

Scaled dot-product attention počíta zhodu medzi dopytmi Q a kľúčmi K pomocou skalárnych súčinov, výsledky delí odmocninou rozmeru kľúča a po aplikácii softmaxu nimi váži hodnoty V. Škálovanie obmedzuje príliš veľké skóre pri vysokom rozmere, ktoré by nasýtilo softmax a zhoršilo gradienty. Mechanizmus môže používať masku, napríklad na zákaz pohľadu na budúce tokeny. Je základným výpočtom mnohých transformerových architektúr. Pri multi-head variante sa tento výpočet opakuje v niekoľkých projekčných podpriestoroch.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Každý token vytvorí otázku, teda query, a zároveň ponúkne štítok key a obsah value. Model porovná otázku so všetkými štítkami, zistí, ku ktorým častiam vstupu sa má prikloniť, a z ich obsahov zostaví nový kontextový vektor. Delenie odmocninou rozmeru udržiava skóre v rozsahu, v ktorom softmax ešte rozumne rozlišuje kandidátov. Maska môže odstrániť zakázané spojenia, napríklad prístup k slovám, ktoré sa ešte len majú vygenerovať. Jedna hlava môže zdôrazniť názov entity, iná časový vzťah a ďalšia väzbu medzi otázkou a odpoveďou.

Časté otázky

Časté otázky

Prečo sa skóre delí odmocninou d_k?

S rastúcim rozmerom má skalárny súčin väčší rozptyl. Bez škálovania by softmax často vytváral takmer jednotkové a nulové váhy, čo vedie k slabým gradientom.

Akú úlohu majú Q, K a V?

Q vyjadruje, čo pozícia hľadá, K opisuje, podľa čoho sa má obsah nájsť, a V nesie informáciu, ktorá sa po výpočte váh agreguje.

Je scaled dot-product attention vždy self-attention?

Nie. Pri self-attention pochádzajú Q, K a V z tej istej sekvencie. Pri cross-attention pochádzajú dopyty z jednej reprezentácie a kľúče s hodnotami z druhej.

Čo robí attention mask?

Pred softmaxom nastaví zakázaným párom veľmi nízke skóre. Takto možno ignorovať padding alebo v autoregresii zabrániť tokenu vidieť budúce pozície.

Prečo je dlhý kontext výpočtovo náročný?

Plná pozornosť vytvára skóre pre každú dvojicu pozícií, takže počet interakcií rastie približne kvadraticky s dĺžkou sekvencie.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.