Generatívna a jazyková AI · Architektúry počítačového videnia

Transformer pre počítačové videnie

Vision transformer

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-17

Odborná definícia

Význam a odborné vymedzenie pojmu

Vision Transformer, ViT, spracúva obraz ako sekvenciu patchov. Každý patch sa lineárne mapuje na token, doplní sa pozičná informácia a séria transformerových blokov používa self-attention na modelovanie vzťahov medzi oblasťami. Pôvodný ViT dosiahol silný výkon pri veľkom predtrénovaní, no mal menší zabudovaný priestorový bias než CNN. Moderné varianty menia veľkosť patchov, hierarchiu, lokálne okná alebo token pooling. Výpočtová náročnosť attention rastie s počtom vizuálnych tokenov, teda aj s rozlíšením.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

CNN prechádza obraz lokálnymi filtrami a postupne skladá väčšie vzory. Vision Transformer rozreže obraz na štvorčeky, z každého vytvorí token a nechá tokeny navzájom sa pozerať cez attention. Oblasť v rohu tak môže priamo súvisieť s objektom v strede. Veľké patchy zrýchlia výpočet, ale môžu skryť drobný text alebo malý predmet. Malé patchy zachovajú detail, no prudko zvýšia počet tokenov. Praktický návrh preto vyvažuje rozlíšenie, pamäť, pretrained checkpoint a typ úlohy.

Časté otázky

Otázky, ktoré spresňujú význam

Prečo ViT potrebuje pozičné embeddingy?

Self-attention sama nerozlišuje poradie tokenov. Pozičná informácia označí, z ktorej časti obrazu patch pochádza a zachová priestorové vzťahy.

Ako veľkosť patchu ovplyvní výkon?

Menší patch zachytí jemnejšie detaily, ale vytvorí viac tokenov a drahšiu attention. Väčší patch je lacnejší, no môže stratiť malé objekty.

Je ViT vždy lepší než CNN?

Nie. Výsledok závisí od dát, predtrénovania, rozlíšenia, latencie a úlohy. CNN má užitočný lokálny bias a môže byť efektívnejšia na edge zariadení.

Čo je class token?

Špeciálny token vložený do sekvencie, ktorého finálna reprezentácia sumarizuje obraz pre klasifikačnú hlavu. Nie všetky varianty ho používajú.

Ako sa ViT prispôsobuje inému rozlíšeniu?

Pozičné embeddingy sa môžu interpolovať a patch projection sa zachová. Zmena rozlíšenia však mení počet tokenov, náklady a správanie malých objektov.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
  • PyTorch, Vision Transformer implementation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.