Odborná definícia
Odborná definícia
Hard attention je mechanizmus, ktorý z množiny možných častí vstupu vyberie jednu položku alebo malý diskrétny podmnožinový výrez a ďalší výpočet vykoná iba nad ním. Na rozdiel od mäkkej pozornosti nevytvára vážený priemer všetkých prvkov. Diskrétny výber môže znížiť výpočtové náklady a priniesť zrozumiteľnú stopu zamerania, no operácia výberu spravidla nie je priamo diferencovateľná. Tréning preto používa odhady gradientu, reinforcement learning, Gumbel-Softmax alebo inú relaxáciu. Zvolená oblasť nemusí predstavovať úplné kauzálne vysvetlenie predikcie.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Pri rozpoznávaní obrázka môže mäkká pozornosť trochu zohľadniť každý región, zatiaľ čo hard attention urobí rozhodnutie podobné pohybu oka, pozrie sa napríklad iba na evidenčné číslo vozidla a zvyšok scény v danom kroku ignoruje. Ušetrí výpočet, ale ak vyberie nesprávne miesto, neskoršie vrstvy už nemajú informáciu, ktorú zahodila. Keďže voľba regiónu je skokové rozhodnutie, tréning nemôže vždy jednoducho spätne šíriť gradient. Model sa preto učí aj politiku, kam sa pozrieť, a musí sa hodnotiť nielen konečný výsledok, ale aj stabilita výberu.
Časté otázky
Časté otázky
Ako sa hard attention líši od soft attention?
Soft attention priraďuje spojité váhy viacerým prvkom a vytvára ich kombináciu. Hard attention vzorkuje alebo vyberá konkrétnu pozíciu, preto môže byť úspornejšia, ale jej diskrétny krok komplikuje optimalizáciu gradientom.
Prečo sa pri nej používa reinforcement learning?
Výber pozície možno chápať ako akciu a kvalitu konečnej predikcie ako odmenu. Metódy typu REINFORCE odhadnú, ako meniť pravdepodobnosť výberov, hoci odhad môže mať vysoký rozptyl a vyžaduje stabilizačné techniky.
Je vybraný región vysvetlením rozhodnutia?
Ukazuje, aké dáta model sprístupnil ďalšiemu výpočtu, čo je užitočná stopa. Nevylučuje však vplyv predchádzajúcich stavov, parametrov alebo korelácií, preto sa výber nemá automaticky interpretovať ako príčina.
Kedy prináša hard attention výpočtovú úsporu?
Najmä vtedy, keď je vstup veľký a ďalšie drahé vrstvy spracujú iba vybrané tokeny, regióny alebo snímky. Ak samotné rozhodovanie o výbere vyžaduje prejsť celý vstup, očakávaná úspora sa môže zmenšiť.
Aké zlyhanie je pre hard attention typické?
Model môže predčasne zamerať irelevantnú oblasť a stratiť kľúčový kontext. Pri distribučnej zmene sa naučená politika pohľadu môže držať starého vizuálneho vzoru, hoci predmet záujmu sa presunul.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Xu a kol., Show, Attend and Tell (proceedings.mlr.press) Mnih a kol., Recurrent Models of Visual Attention (proceedings.neurips.cc)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
