Transformer a mechanizmy pozornosti

škálovaná pozornost skalárním součinem

Scaled dot-product attention počítá shodu mezi dotazy Q a klúčmi K pomocí skalárnych súčinů, výsledky dělí odmocninou rozmeru klúča a po aplikaci softmaxu nimi váží hodnoty V. Škálování omezuje příliš velké skóre při vysokém rozmere, které by nasýtilo softmax a zhoršilo gradienty. Mechanismus může používat masku, například na zákaz pohledu na budoucí tokeny. Je základným výpočtom mnoha transformerových architektúr. Při multi-head variantě se tento výpočet opakuje v několika projekčných podpriestoroch.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-05

Odborná definice

Odborná definice

Scaled dot-product attention počítá shodu mezi dotazy Q a klúčmi K pomocí skalárnych súčinů, výsledky dělí odmocninou rozmeru klúča a po aplikaci softmaxu nimi váží hodnoty V. Škálování omezuje příliš velké skóre při vysokém rozmere, které by nasýtilo softmax a zhoršilo gradienty. Mechanismus může používat masku, například na zákaz pohledu na budoucí tokeny. Je základným výpočtom mnoha transformerových architektúr. Při multi-head variantě se tento výpočet opakuje v několika projekčných podpriestoroch.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Každý token vytvoří otázku, tedy query, a zároveň ponúkne štítek key a obsah value. Model porovná otázku se všemi štítkami, zistí, ku kterým častiam vstupu se má priklonit, a z jejich obsahů zostaví nový kontextový vektor. Dělení odmocninou rozmeru udržuje skóre v rozsahu, ve kterém softmax ještě rozumne rozlišuje kandidátů. Maska může odstranit zakázané spojení, například přístup k slovám, které se ještě jen mají vygenerovat. Jedna hlava může zdůraznit název entity, jiná časový vztah a další vezbu mezi otázkou a odpovědí.

Časté otázky

Časté otázky

Proč se skóre dělí odmocninou d_k?

S rastúcim rozmerom má skalárny součin větší rozptyl. Bez škálování by softmax často vytváral téměř jednotkové a nulové váhy, co vede k slabým gradientem.

Jakou úlohu mají Q, K a V?

Q vyjadřuje, co pozíce hledá, K popisuje, podle čeho se má obsah najít, a V nese informaci, která se po výpočtu váh agreguje.

Je scaled dot-product attention vždy self-attention?

Ne. Při self-attention pochádzají Q, K a V z té určité sekvence. Při cross-attention pochádzají dopyty z jedné reprezentace a klúče s hodnotami z druhé.

Co dělá attention mask?

Před softmaxom nastaví zakázaným párom velmi nízké skóre. Takto lze ignorovat padding nebo v autoregresii zabránit tokenu vidět budoucí pozice.

Proč je dlouhý kontext výpočetně náročný?

Plná pozornost vytváří skóre pro každou dvojicu pozic, takže počet interakcí roste přibližně kvadraticky s délkou sekvence.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.