Efektivně transformery a dlouhý kontext

řídká pozornost

Sparse attention je mechanismus pozornosti, který nepočíta interakci mezi každou dvojicí tokenů, ale používá omezený vzor povolených spojení. Vzor může být lokální, blokový, dilatovaný, globální nebo dynamicky vybraný podle obsahu. Cílem je snížit časovou a pameťovou náročnost plnej pozornosti při dlouhých sekvenciách. Úspora není automatická, protože nepravidelná řídkost může být pro hardware neefektívna a nesprávný vzor může odstranit důležitou závislost. Maska riedkosti může být pevná pro architekturu nebo vypočítaná zvlášť pro každý vstup.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-16

Odborná definice

Odborná definice

Sparse attention je mechanismus pozornosti, který nepočíta interakci mezi každou dvojicí tokenů, ale používá omezený vzor povolených spojení. Vzor může být lokální, blokový, dilatovaný, globální nebo dynamicky vybraný podle obsahu. Cílem je snížit časovou a pameťovou náročnost plnej pozornosti při dlouhých sekvenciách. Úspora není automatická, protože nepravidelná řídkost může být pro hardware neefektívna a nesprávný vzor může odstranit důležitou závislost. Maska riedkosti může být pevná pro architekturu nebo vypočítaná zvlášť pro každý vstup.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Plná attention nechá každý token kontrolovat všechny ostatní tokeny, co při dlouhém dokumente vytvoří obrovskou matici. Sparse attention dovolí například pozerat se zejména na blízké okolí a na několik globálnych kotiev, jako jsou nadpisy nebo špeciálne tokeny. Počet porovnání se výrazně sníží. Systém však musí vědět, které spojení může bezpečně vynechat. Pokud rozhodujúca informace leží mimo povoleného vzoru, model ji nemusí přenést tam, kde je potřebná. Dynamický výběr šetří práci jen tehdy, když jeho vlastní výpočet a presuny paměti nejsou příliš drahé.

Časté otázky

Časté otázky

Jako sparse attention snižuje složitost?

Místo matice se všemi pármi počítá pouze vybrané pozice. Podle vzoru může paměť a počet operací rásť přibližně lineární nebo subkvadraticky s délkou sekvence.

Co je lokálně attention okno?

Každý token se pripája pouze k susedným pozíciám v určenom rozsahu. Je účinné pro lokálně vezby, ale na vzdálené informace potřebuje vrstvení nebo globálně spojení.

Je sparse attention vždy rýchlejšia na GPU?

Ne. Teoreticky méně operací nemusí znamenat nižší latenci. Nepravidelné indexování, presuny paměti a slabá podpora jadier mohou úsporu snížit.

Jak se zachovávají globálně závislosti?

Používají se globálně tokeny, hierarchické bloky, náhodné spojení, retrieval nebo dynamický výběr klúčů. Každý mechanismus má jiný kompromis mezi pokrytím a nákladmi.

Může řídká pozornost změnit kvalitu výstupu?

Ano. Pokud vzor odstraní relevantní kontext, roste chyba. Proto se porovnává s plnou attention na úlohách, které vyžadují vzdálené odkazy, přesné citace a dlouhé závislosti.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Generating Long Sequences with Sparse Transformers Longformer: The Long-Document Transformer

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.