Videnie, reč a multimodalita · Multimodálne úlohy

Odpovedanie na otázky o obraze

Visual question answering

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-19

Odborná definícia

Význam a odborné vymedzenie pojmu

Visual question answering, VQA, je úloha, v ktorej model prijme obraz a prirodzenú jazykovú otázku a vytvorí odpoveď založenú na vizuálnom obsahu. Zahŕňa rozpoznanie objektov, čítanie textu, počítanie, priestorové vzťahy, commonsense aj výber relevantného regiónu. Datasety môžu používať krátke odpovede, multiple choice alebo otvorené generovanie. Vysoké skóre môže vzniknúť využitím jazykových biasov bez skutočného pozorovania obrazu, preto sa hodnotia kontrafaktuálne páry, grounding a schopnosť priznať nedostatok dôkazu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Používateľ ukáže fotografiu skladu a opýta sa, koľko modrých paliet je pri dverách. Model musí pochopiť otázku, nájsť dvere, rozlíšiť palety podľa farby a spočítať iba správnu skupinu. Odpoveď môže zlyhať aj vtedy, keď model pozná význam všetkých slov, pretože objekt je malý alebo zakrytý. Niektoré benchmarky majú opakujúce sa vzory, napríklad otázku Aká farba? často zodpovedanú jednou farbou. Robustný test preto mení obraz aj formuláciu a sleduje, či odpoveď naozaj používa vizuálny dôkaz.

Časté otázky

Otázky, ktoré spresňujú význam

Ako sa VQA líši od image captioningu?

Captioning vytvára všeobecný opis obrazu. VQA vyberá informáciu relevantnú pre konkrétnu otázku a často vyžaduje lokalizáciu alebo výpočet.

Prečo môže model odpovedať správne bez obrazu?

Dataset môže obsahovať jazykové skratky a nerovnováhu odpovedí. Model sa naučí pravdepodobnú odpoveď z otázky bez spoľahlivého vizuálneho spracovania.

Ako sa hodnotia otvorené odpovede?

Používa sa normalizácia textu, zhoda s viacerými ľudskými odpoveďami alebo sémantické hodnotenie. Pri kritických úlohách treba kontrolovať aj dôkaz a lokalizáciu.

Čo je text VQA?

Otázky sa týkajú textu zachyteného v obraze, napríklad názvu ulice alebo ceny. Úloha kombinuje OCR, layout, jazykové porozumenie a vizuálny kontext.

Kedy má model odmietnuť odpoveď?

Keď relevantná oblasť nie je viditeľná, rozlíšenie nestačí, otázka je nejednoznačná alebo obraz neposkytuje potrebnú informáciu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • VQA: Visual Question Answering GQA: A New Dataset for Real-World Visual Reasoning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.