Odborná definícia
Význam a odborné vymedzenie pojmu
Vision Transformer, ViT, spracúva obraz ako sekvenciu patchov. Každý patch sa lineárne mapuje na token, doplní sa pozičná informácia a séria transformerových blokov používa self-attention na modelovanie vzťahov medzi oblasťami. Pôvodný ViT dosiahol silný výkon pri veľkom predtrénovaní, no mal menší zabudovaný priestorový bias než CNN. Moderné varianty menia veľkosť patchov, hierarchiu, lokálne okná alebo token pooling. Výpočtová náročnosť attention rastie s počtom vizuálnych tokenov, teda aj s rozlíšením.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
CNN prechádza obraz lokálnymi filtrami a postupne skladá väčšie vzory. Vision Transformer rozreže obraz na štvorčeky, z každého vytvorí token a nechá tokeny navzájom sa pozerať cez attention. Oblasť v rohu tak môže priamo súvisieť s objektom v strede. Veľké patchy zrýchlia výpočet, ale môžu skryť drobný text alebo malý predmet. Malé patchy zachovajú detail, no prudko zvýšia počet tokenov. Praktický návrh preto vyvažuje rozlíšenie, pamäť, pretrained checkpoint a typ úlohy.
Časté otázky
Otázky, ktoré spresňujú význam
Prečo ViT potrebuje pozičné embeddingy?
Self-attention sama nerozlišuje poradie tokenov. Pozičná informácia označí, z ktorej časti obrazu patch pochádza a zachová priestorové vzťahy.
Ako veľkosť patchu ovplyvní výkon?
Menší patch zachytí jemnejšie detaily, ale vytvorí viac tokenov a drahšiu attention. Väčší patch je lacnejší, no môže stratiť malé objekty.
Je ViT vždy lepší než CNN?
Nie. Výsledok závisí od dát, predtrénovania, rozlíšenia, latencie a úlohy. CNN má užitočný lokálny bias a môže byť efektívnejšia na edge zariadení.
Čo je class token?
Špeciálny token vložený do sekvencie, ktorého finálna reprezentácia sumarizuje obraz pre klasifikačnú hlavu. Nie všetky varianty ho používajú.
Ako sa ViT prispôsobuje inému rozlíšeniu?
Pozičné embeddingy sa môžu interpolovať a patch projection sa zachová. Zmena rozlíšenia však mení počet tokenov, náklady a správanie malých objektov.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- PyTorch, Vision Transformer implementation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
