Odborná definice
Odborná definice
Vision encoder je neuronová síť, která mění obraz nebo video na reprezentaci vhodnou pro klasifikaci, retrieval, detekci, segmentaci nebo multimodální spájání. Může vytvořit jeden globální embedding, mriežku lokálních tokenů nebo viacúrovňové feature maps. Používá konvoluční síť, Vision Transformer nebo hybridní architekturu a může být trénovaný se štítkami, self-supervised cílem či kontrastivně s textem. Informace zachovaná v reprezentaci závisí na rozlišení, patchingu, augmentací a tréninkové úlohy.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Vision encoder je predná část systému, která preloží pixely do jazyka číselných příznaků. Při klasifikaci může vytvořit jeden súhrnný vektor pro celý obrázek. Při otázce Kde je pes? musí zachovat i polohu jednotlivých oblastí, proto vrátí mapu tokenů. Ten jistý obrázek může mít odlišnou reprezentaci v modeli učenom na objekty a v modeli učenom na páry obraz a text. Encoder tedy není neutrálna kamera, vybírá informace, které byly užitečné pro jeho tréninkový cíl.
Časté otázky
Časté otázky
Jaký je rozdíl mezi vision encoderem a image classifierom?
Encoder vytváří reprezentaci. Classifier k ní přidává rozhodovací hlavu pro konkrétně třídy. Jeden encoder lze použít ve více downstream úlohách.
Co je globální obrazový embedding?
Jeden vektor sumarizujúci celý obraz. Je vhodný na retrieval a klasifikaci, ale může stratit přesnou polohu malých objektů.
Proč multimodální model potřebuje projector?
Rozměr a distribuce vizuálnych tokenů se liší od jazykových embeddingů. Projector jejich mapuje do prostoru, který dokáže zpracovat jazykový model.
Lze vision encoder zmrazit?
Ano, čím se znížia náklady a riziko zabudnutia. Při špecifickej doméně však čiastočné nebo plné dolaďování může výrazně zlepšit reprezentaci.
Jak se ověří, či encoder vidí malé detaily?
Testuje se výkon podle velikosti objektu, rozlišení, cropů a lokalizačných úloh. Vysoká klasifikační accuracy sama o sebe nestačí.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Learning Transferable Visual Models From Natural Language Supervision, CLIP DINOv2: Learning Robust Visual Features without Supervision
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
