Generatívna a jazyková AI · Multimodálna AI

Vizuálno-jazykový model

Vision-language model

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-16

Odborná definícia

Význam a odborné vymedzenie pojmu

Vision-language model, VLM, spracúva obrazové a jazykové vstupy v spoločnom systéme a učí sa ich prepájať pre úlohy ako captioning, otázky nad obrazom, retrieval, grounding alebo multimodálny dialóg. Architektúra môže používať dva encodery s kontrastívnym cieľom, cross-attention fusion alebo vision encoder pripojený k veľkému jazykovému modelu. Schopnosť pomenovať objekt neznamená presné priestorové meranie ani spoľahlivú kauzálnu interpretáciu scény. Výkon závisí od vizuálneho rozlíšenia, prepojenia modalít a dátových párov.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

VLM spája dve schopnosti, pozrieť sa na obraz a pracovať s jazykom. Môže vyhľadať fotografiu podľa textu, vysvetliť graf alebo odpovedať na otázku o dokumente. Niektoré modely najprv zmenia obraz na vizuálne tokeny a vložia ich do jazykového modelu, iné porovnávajú samostatné obrazové a textové embeddingy. Model však môže správne rozpoznať typ scény a zároveň si vymyslieť malý detail. Pri nasadení sa preto testuje čítanie textu, počítanie, lokalizácia aj odmietnutie odpovede pri nejasnom obraze.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa VLM líši od multimodálneho modelu?

VLM je podtrieda zameraná na prepojenie videnia a jazyka. Multimodálny systém môže zahŕňať aj zvuk, video, senzory alebo akcie.

Čo je contrastive vision-language pretraining?

Model približuje embedding správneho páru obraz a text a odďaľuje nesprávne páry. Výsledkom je spoločný priestor vhodný na retrieval a zero-shot klasifikáciu.

Prečo VLM halucinuje objekty?

Jazykový decoder dopĺňa pravdepodobný text aj pri slabom vizuálnom dôkaze. Problém zvyšuje nízke rozlíšenie, nejasný crop a bias tréningových popisov.

Dokáže VLM čítať malé písmo?

Iba ak vstupné rozlíšenie, patching a tréning podporujú OCR detail. Dokumenty často vyžadujú delenie strán, zoom alebo špecializovaný document encoder.

Ako sa hodnotí firemný VLM use case?

Okrem benchmarku sa pripraví sada reálnych obrazov s rušivými prvkami, prázdnymi odpoveďami, citlivým obsahom a presnými kritériami lokalizácie.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Flamingo: a Visual Language Model for Few-Shot Learning Learning Transferable Visual Models From Natural Language Supervision

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.