Odborná definice
Odborná definice
Visual question answering, VQA, je úloha, ve které model prijme obraz a prirodzenou jazykovou otázku a vytvoří odpověď založenou na vizuálnom obsahu. Zahrnuje rozpoznání objektů, čtení textu, počítání, prostorové vztahy, commonsense i výběr relevantného regiónu. Datasety mohou používat krátké odpovědi, multiple choice nebo otevřené generování. Vysoké skóre může vzniknout využitím jazykových biasů bez skutečného pozorování obrazu, proto se hodnotí kontrafaktuální páry, grounding a schopnost priznat nedostatok důkazu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Uživatel ukáže fotografii skladu a opýta se, kolik modrých paliet je při dverách. Model musí pochopit otázku, najít dvere, rozlíšit palety podle farby a spočítat pouze správnou skupinu. Odpověď může selhat i tehdy, když model pozná význam všech slov, protože objekt je malý nebo zakrytý. Některé benchmarky mají opakujúce se vzory, například otázku Jaká farba? často zodpovedanou jednou farbou. Robustní test proto mění obraz i formulaci a sleduje, či odpověď opravdu používá vizuální důkaz.
Časté otázky
Časté otázky
Jak se VQA liší od image captioningu?
Captioning vytváří obecný popis obrazu. VQA vybírá informaci relevantní pro konkrétní otázku a často vyžaduje lokalizaci nebo výpočet.
Proč může model odpovídat správně bez obrazu?
Dataset může obsahovat jazykové zkratky a nerovnováhu odpovědí. Model se naučí pravdepodobnou odpověď z otázky bez spolahlivého vizuálního zpracování.
Jak se hodnotí otevřené odpovědi?
Používá se normalizace textu, shoda s více ludskými odpoveďami nebo sémantické hodnocení. Při kritických úlohách je třeba kontrolovat i důkaz a lokalizaci.
Co je text VQA?
Otázky se týkají textu zachyteného v obraze, například názvu ulice nebo ceny. Úloha kombinuje OCR, layout, jazykové porozumění a vizuální kontext.
Kdy má model odmítnout odpověď?
Když relevantná oblast není viditelná, rozlišení nestačí, otázka je nejednoznačná nebo obraz neposkytuje potřebnou informaci.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- VQA: Visual Question Answering GQA: A New Dataset for Real-World Visual Reasoning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
