Architektury počítačového vidění

transformer pro počítačové vidění

Vision Transformer, Vit, zpracovává obraz jako sekvenci patchů. Každý patch se lineární mapuje na token, doplní se pozičná informace a série transformerových bloků používá self-attention na modelování vztahů mezi oblasťami. Původní Vit dosiahol silný výkon při velkém předtrénování, ale měl menší zabudovaný priestorový bias než CNN. Moderní varianty mění velikost patchů, hierarchiu, lokálně okna nebo token pooling. Výpočetní náročnost attention roste s počtem vizuálnych tokenů, tedy i s rozlíšením.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-17

Odborná definice

Odborná definice

Vision Transformer, Vit, zpracovává obraz jako sekvenci patchů. Každý patch se lineární mapuje na token, doplní se pozičná informace a série transformerových bloků používá self-attention na modelování vztahů mezi oblasťami. Původní Vit dosiahol silný výkon při velkém předtrénování, ale měl menší zabudovaný priestorový bias než CNN. Moderní varianty mění velikost patchů, hierarchiu, lokálně okna nebo token pooling. Výpočetní náročnost attention roste s počtem vizuálnych tokenů, tedy i s rozlíšením.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

CNN prochází obraz lokálnymi filtrami a postupně skládá větší vzory. Vision Transformer rozreže obraz na štvorčeky, z každého vytvoří token a nechá tokeny navzájem se pozerat přes attention. Oblast v rohu tak může přímo souviset s objektem v strede. Velké patchy zrýchlia výpočet, ale mohou skrýt drobný text nebo malý predmet. Malé patchy zachovají detail, ale prudko zvýšia počet tokenů. Praktický návrh proto vyvažuje rozlišení, paměť, pretrained checkpoint a typ úlohy.

Časté otázky

Časté otázky

Proč Vit potřebuje pozičné embeddingy?

Self-attention sama nerozlišuje pořadí tokenů. Pozičná informace označí, ze které části obrazu patch pochází a zachová prostorové vztahy.

Jako velikost patchu ovlivní výkon?

Menší patch zachytí jemnější detaily, ale vytvoří více tokenů a drahšiu attention. Větší patch je lacnejší, ale může stratit malé objekty.

Je Vit vždy lepší než CNN?

Ne. Výsledek závisí na dat, předtrénování, rozlišení, latence a úlohy. CNN má užitečný lokální bias a může být efektívnejšia na edge zařízení.

Co je class token?

Špeciálny token vložený do sekvence, kterého finálna reprezentace sumarizuje obraz pro klasifikační hlavu. Ne všechny varianty ho používají.

Jak se Vit přizpůsobuje jinému rozlišení?

Pozičné embeddingy se mohou interpolovat a patch projection se zachová. Změna rozlišení však mění počet tokenů, náklady a chování malých objektů.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
  • PyTorch, Vision Transformer implementation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.