Multimodální úlohy

odpovídání na otázky o obraze

Visual question answering, VQA, je úloha, ve které model prijme obraz a prirodzenou jazykovou otázku a vytvoří odpověď založenou na vizuálnom obsahu. Zahrnuje rozpoznání objektů, čtení textu, počítání, prostorové vztahy, commonsense i výběr relevantného regiónu. Datasety mohou používat krátké odpovědi, multiple choice nebo otevřené generování. Vysoké skóre může vzniknout využitím jazykových biasů bez skutečného pozorování obrazu, proto se hodnotí kontrafaktuální páry, grounding a schopnost priznat nedostatok důkazu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-19

Odborná definice

Odborná definice

Visual question answering, VQA, je úloha, ve které model prijme obraz a prirodzenou jazykovou otázku a vytvoří odpověď založenou na vizuálnom obsahu. Zahrnuje rozpoznání objektů, čtení textu, počítání, prostorové vztahy, commonsense i výběr relevantného regiónu. Datasety mohou používat krátké odpovědi, multiple choice nebo otevřené generování. Vysoké skóre může vzniknout využitím jazykových biasů bez skutečného pozorování obrazu, proto se hodnotí kontrafaktuální páry, grounding a schopnost priznat nedostatok důkazu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Uživatel ukáže fotografii skladu a opýta se, kolik modrých paliet je při dverách. Model musí pochopit otázku, najít dvere, rozlíšit palety podle farby a spočítat pouze správnou skupinu. Odpověď může selhat i tehdy, když model pozná význam všech slov, protože objekt je malý nebo zakrytý. Některé benchmarky mají opakujúce se vzory, například otázku Jaká farba? často zodpovedanou jednou farbou. Robustní test proto mění obraz i formulaci a sleduje, či odpověď opravdu používá vizuální důkaz.

Časté otázky

Časté otázky

Jak se VQA liší od image captioningu?

Captioning vytváří obecný popis obrazu. VQA vybírá informaci relevantní pro konkrétní otázku a často vyžaduje lokalizaci nebo výpočet.

Proč může model odpovídat správně bez obrazu?

Dataset může obsahovat jazykové zkratky a nerovnováhu odpovědí. Model se naučí pravdepodobnou odpověď z otázky bez spolahlivého vizuálního zpracování.

Jak se hodnotí otevřené odpovědi?

Používá se normalizace textu, shoda s více ludskými odpoveďami nebo sémantické hodnocení. Při kritických úlohách je třeba kontrolovat i důkaz a lokalizaci.

Co je text VQA?

Otázky se týkají textu zachyteného v obraze, například názvu ulice nebo ceny. Úloha kombinuje OCR, layout, jazykové porozumění a vizuální kontext.

Kdy má model odmítnout odpověď?

Když relevantná oblast není viditelná, rozlišení nestačí, otázka je nejednoznačná nebo obraz neposkytuje potřebnou informaci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • VQA: Visual Question Answering GQA: A New Dataset for Real-World Visual Reasoning

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.