Odborná definícia
Odborná definícia
Vision encoder je neurónová sieť, ktorá premieňa obraz alebo video na reprezentáciu vhodnú pre klasifikáciu, retrieval, detekciu, segmentáciu alebo multimodálne spájanie. Môže vytvoriť jeden globálny embedding, mriežku lokálnych tokenov alebo viacúrovňové feature maps. Používa konvolučnú sieť, Vision Transformer alebo hybridnú architektúru a môže byť trénovaný so štítkami, self-supervised cieľom či kontrastívne s textom. Informácia zachovaná v reprezentácii závisí od rozlíšenia, patchingu, augmentácií a tréningovej úlohy.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Vision encoder je predná časť systému, ktorá preloží pixely do jazyka číselných príznakov. Pri klasifikácii môže vytvoriť jeden súhrnný vektor pre celý obrázok. Pri otázke Kde je pes? musí zachovať aj polohu jednotlivých oblastí, preto vráti mapu tokenov. Ten istý obrázok môže mať odlišnú reprezentáciu v modeli učenom na objekty a v modeli učenom na páry obraz a text. Encoder teda nie je neutrálna kamera, vyberá informácie, ktoré boli užitočné pre jeho tréningový cieľ.
Časté otázky
Časté otázky
Aký je rozdiel medzi vision encoderom a image classifierom?
Encoder vytvára reprezentáciu. Classifier k nej pridáva rozhodovaciu hlavu pre konkrétne triedy. Jeden encoder možno použiť vo viacerých downstream úlohách.
Čo je globálny obrazový embedding?
Jeden vektor sumarizujúci celý obraz. Je vhodný na retrieval a klasifikáciu, ale môže stratiť presnú polohu malých objektov.
Prečo multimodálny model potrebuje projector?
Rozmer a distribúcia vizuálnych tokenov sa líšia od jazykových embeddingov. Projector ich mapuje do priestoru, ktorý dokáže spracovať jazykový model.
Dá sa vision encoder zmraziť?
Áno, čím sa znížia náklady a riziko zabudnutia. Pri špecifickej doméne však čiastočné alebo plné dolaďovanie môže výrazne zlepšiť reprezentáciu.
Ako sa overí, či encoder vidí malé detaily?
Testuje sa výkon podľa veľkosti objektu, rozlíšenia, cropov a lokalizačných úloh. Vysoká klasifikačná accuracy sama o sebe nestačí.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Learning Transferable Visual Models From Natural Language Supervision, CLIP DINOv2: Learning Robust Visual Features without Supervision
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
