Odborná definice
Odborná definice
Query-key-value attention vytváří pro každý prvek vektory query, key a value. Podobnost query s keys určuje váhy, po normalizaci se nimi skombinují values. Při scaled dot-product attention se skalárne součiny dělí odmocninou z rozmeru klúča, aby logits při velké dimenzii neboli příliš extrémně. V self-attention pochádzají Q, K a V z stejné sekvence, při cross-attention z různých zdrojů. Query v tomto mechanizme není uživatelský dotaz do vyhladávača.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Každý token si vytvoří otázku, co potřebuje najít. Keys ostatních tokenů opisují, na jaké otázky vedia odpovídat, a values nesou informaci, která se má přenést. Token „ona“ může dať vysokou váhu menu osoby v předchozí vete. Výsledkem je zmes value vektorů. Pokud maska dovolí vidět budoucí tokeny při autoregresivním tréninku, model získá zakázanou informaci a evaluace bude klamlivá.
Časté otázky
Časté otázky
Proč se součin dělí odmocninou dimenze?
Bez škálování roste rozptyl logits a softmax může saturovat, co snižuje použitelné gradienty.
Čím se self-attention odlišuje od cross-attention?
Self-attention používá stejný zdroj pro Q, K a V. Cross-attention berie queries z jedné reprezentace a keys s values z druhé.
Jakou funkci má maska v attention?
Zakazuje nebo oslabuje vybrané spojení, například budoucí pozice, padding nebo neprípustné modality.
Na co slouží KV cache?
Při autoregresivním generování uchovává už vypočítané keys a values, aby se při každém novém tokene nepočítali znova.
Je vysoká attention weight vysvětlením rozhodnutí?
Ne automaticky. Váha popisuje vnitřní přenos informace, ale nemusí odpovídat kauzálnemu příspěvku k finálnemu výstupu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Vaswani et al., Attention Is All You Need, 2017
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
