Transformer a kontextové reprezentace

sebapozornost

Self-attention je mechanismus, při kterém se každá pozíce sekvence porovnává s ostatnými pozicemi té určité sekvence a vytváří reprezentaci váženou podle jejich relevantnosti. Dopyty, klúče a hodnoty vznikají z stejného vstupu, ačkoli používají odlišné naučené projekce. Mechanismus zachycuje závislosti bez rekurentného prechodu token po tokene. Samotná attention vrstva však nepozná pořadí, proto transformery přidávají pozičnou informaci. Reziduální spojení a následné vrstvy dále mění informaci, kterou pozornost vytvořila.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-06

Odborná definice

Odborná definice

Self-attention je mechanismus, při kterém se každá pozíce sekvence porovnává s ostatnými pozicemi té určité sekvence a vytváří reprezentaci váženou podle jejich relevantnosti. Dopyty, klúče a hodnoty vznikají z stejného vstupu, ačkoli používají odlišné naučené projekce. Mechanismus zachycuje závislosti bez rekurentného prechodu token po tokene. Samotná attention vrstva však nepozná pořadí, proto transformery přidávají pozičnou informaci. Reziduální spojení a následné vrstvy dále mění informaci, kterou pozornost vytvořila.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Ve vete může zámeno odkazovat na podstatné jméno vzdálené o mnoho slov. Self-attention umožní, aby si pozíce zámena přímo vypočítala, které předchozí nebo nasledujúce tokeny jsou pro její význam důležité. Každé slovo tak dostane nový popis ovplyvnený celou dostupnou sekvencí. Více hláv může paralelně sledovat odlišné vztahy, například gramatickou vezbu, tému nebo formát. Výsledná váha však není automatickým vysvětlením rozhodnutí modelu. Proto se při interpretaci nesmí jedna pekná attention mapa zaměnit za úplný důvod výsledku.

Časté otázky

Časté otázky

Jak se self-attention liší od cross-attention?

Self-attention používá Q, K a V z jedné sekvence. Cross-attention používá dopyty z jedné části modelu a klúče s hodnotami z jiného zdroje, například z enkódera.

K čemu slouží multi-head attention?

Rozdělí reprezentaci do více hláv s vlastnými projekciami. Každá hlava může zachytit jiný typ vztahu, potom se jejich výstupy spoja.

Pozná self-attention pořadí slov?

Ne z vlastného výpočtu. Pořadí se přidává pozičnými embeddingmi, rotačnými kódmi nebo jiným mechanizmom, který odlíši pozice.

Jsou attention weights vysvětlením modelu?

Ne nevyhnutelně. Ukazují váhy v konkrétní vrstvě, ale výsledek ovlivňují další hlavy, vrstvy, reziduální spojení a nelinearity.

Proč se používá kauzální maska?

Při generování zakáže pozici čerpat z budoucích tokenů. Model se tak učí predpovedat pokračování pouze z už dostupného prefixu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.