Odborná definice
Odborná definice
Attention mechanism, mechanismus pozornosti, je výpočetní postup, který při spracování prvku vytváří váženou kombinaci jiných reprezentací podle jejich odhadovanej relevantnosti. V transformerech se váhy odvodzují z podobnosti mezi vektory query a key a aplikují se na vektory value. Self-attention propojuje prvky té určité sekvence, cross-attention propojuje dvě různé sady reprezentací. Mechanismus umožňuje modelovat vzdálené závislosti, ale jeho základní forma roste kvadraticky s délkou sekvence.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Při preklade slova potřebuje model venovat větší pozornost niektorým slovám v původní vete než jiným. Attention vypočítá, které části kontextu jsou pro aktuální krok nejdůležitější, a zmieša jejich informaci s různými váhami. V jazykovém modeli se tak slovo na konci odseku může oprieť o jméno uvedené ovela dříve. Váhy pozornosti však nejsou automaticky ludským vysvětlením rozhodnutí. Jsou internou součástí výpočtu, která může být rozdělená mezi mnoho hláv a vrstev.
Časté otázky
Časté otázky
Co znamenají query, key a value?
Query reprezentuje informaci, pro kterou se hledá relevantní kontext. Key popisuje, podle čeho se jednotlivé položky porovnávají, a value nese obsah, který se po výpočtu váh kombinuje. Skalárne součiny query a key se normalizují pomocí softmaxu. Výsledná vážená suma value vektorů vytvoří kontextovou reprezentaci pro danou pozici.
Jaký je rozdíl mezi self-attention a cross-attention?
Self-attention používá query, key a value odvozené z té určité sekvence, takže každý token může čerpat z ostatních tokenů. Cross-attention používá query z jedné reprezentace a key s value z druhé, například decoder se pozerá na výstupy encodera nebo textový model na obrazové prvky. Cross-attention je důležitý v multimodálnych a encoder-decoder systémech.
Proč transformery používají více attention heads?
Každá hlava má vlastní projekce query, key a value a může zachytit odlišný typ vztahu, například syntaktickou vezbu, pozici nebo tematickou podobnost. Výstupy hláv se spoja a dále transformují. Není zaručené, že každá hlava má lahko pomenovatelnou funkci. Některé mohou být redundantné, co se dá skúmat ablačnými štúdiami.
Proč je dlouhý kontext výpočetně náročný?
Při plnej self-attention se porovnává každá pozíce s každou ďalšou, takže počet párů roste přibližně se štvorcom délky sekvence. Dvojnásobný počet tokenů může přinést přibližně štvornásobný počet attention skóre. Efektivněji varianty používají riedku pozornost, lokálně okna, kompresi nebo jiné aproximace, ale mohou měnit dostupnost vzdialeného kontextu.
Jsou attention váhy vysvětlením rozhodnutí modelu?
Ne nevyhnutelně. Ukazují, jako konkrétní vrstva miešala reprezentace, ale výsledek závisí i od ostatních hláv, reziduálnych spojení, MLP bloků a dalších vrstev. Vysoká váha nemusí znamenat kauzální vliv na výstup. Pro interpretaci se kombinují zásahy do modelu, gradientové metody, ablačné testy a analýza chování.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary
- Google ML Crash Course, Activation functions
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
