Mechanizmy pozornosti a sekvenční rozhodování

Tvrdá pozornost

Hard attention je mechanismus, který z množiny možných částí vstupu vybere jednu položku nebo malý diskrétní podmnožinový výrez a další výpočet provede pouze nad ním. Na rozdíl od mekkej pozornosti nevytváří vážený průměr všech prvků. Diskrétní výběr může snížit výpočetní náklady a přinést zrozumitelnou stopu zamerání, ale operace výběru zpravidla není přímo diferencovatelná. Trénink proto používá odhady gradientu, reinforcement learning, Gumbel-Softmax nebo jinou relaxaci. Zvolená oblast nemusí představovat úplné kauzální vysvětlení predikce.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-H-05

Odborná definice

Odborná definice

Hard attention je mechanismus, který z množiny možných částí vstupu vybere jednu položku nebo malý diskrétní podmnožinový výrez a další výpočet provede pouze nad ním. Na rozdíl od mekkej pozornosti nevytváří vážený průměr všech prvků. Diskrétní výběr může snížit výpočetní náklady a přinést zrozumitelnou stopu zamerání, ale operace výběru zpravidla není přímo diferencovatelná. Trénink proto používá odhady gradientu, reinforcement learning, Gumbel-Softmax nebo jinou relaxaci. Zvolená oblast nemusí představovat úplné kauzální vysvětlení predikce.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při rozpoznávání obrázku může mekká pozornost trochu zohladnit každý region, zatímco hard attention udělá rozhodnutí podobné pohybu oka, pozrie se například pouze na evidenčné číslo vozidla a zbytek scény v daném kroku ignoruje. Ušetrí výpočet, ale pokud vybere nesprávně místo, pozdější vrstvy už nemají informaci, kterou zahodila. Keďže volba regiónu je skokové rozhodnutí, trénink nemůže vždy jednoduše spetne šíriť gradient. Model se proto učí i politiku, kam se podívat, a musí se hodnotit nejen konečný výsledek, ale i stabilita výběru.

Časté otázky

Časté otázky

Jak se hard attention liší od soft attention?

Soft attention přiřazuje spojité váhy viacerým prvkem a vytváří jejich kombinaci. Hard attention vzorkuje nebo vybírá konkrétní pozici, proto může být úspornejšia, ale její diskrétní krok komplikuje optimalizaci gradientem.

Proč se u ní používá reinforcement learning?

Výběr pozice lze chápat jako akci a kvalitu konečnej predikce jako odměnu. Metody typu REINFORCE odhadnou, jako měnit pravděpodobnost výberů, ačkoli odhad může mít vysoký rozptyl a vyžaduje stabilizačné techniky.

Je vybraný region vysvětlením rozhodnutí?

Ukazuje, jaké data model sprístupnil ďalšiemu výpočtu, co je užitečná stopa. Nevylučuje však vliv předchozích stavů, parametrů nebo korelací, proto se výběr nemá automaticky interpretovat jako príčina.

Kdy přináší hard attention výpočtovou úsporu?

Zejména tehdy, když je vstup velký a další drahé vrstvy spracují pouze vybrané tokeny, regiony nebo snímky. Pokud samotné rozhodování o výběru vyžaduje projít celý vstup, očekávaná úspora se může zmenšit.

Jaké selhání je pro hard attention typické?

Model může predčasne zamerat irelevantnou oblast a stratit klíčový kontext. Při distribučnej změně se naučená politika pohledu může držet starého vizuálního vzoru, ačkoli predmet záujmu se presunul.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Xu a kol., Show, Attend and Tell (proceedings.mlr.press) Mnih a kol., Recurrent Models of Visual Attention (proceedings.neurips.cc)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.