Multimodálne porozumenie

Visual grounding

vizuálne ukotvenie

Visual grounding spája jazykový výraz s konkrétnou oblasťou, objektom alebo časovým úsekom vo vizuálnom vstupe. Model môže pre opis vrátiť bounding box, masku, bod, region token alebo segment videa. Úloha vyžaduje nielen rozpoznať kategóriu, ale aj rozlíšiť referenčné vlastnosti a vzťahy, napríklad druhý červený pohár vľavo od knihy. Grounding sa používa pri interaktívnej segmentácii, robotike a vysvetlení multimodálnych odpovedí. Pozornosť modelu sama o sebe nie je dôkaz správneho groundingového rozhodnutia.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-18

Odborná definícia

Odborná definícia

Visual grounding spája jazykový výraz s konkrétnou oblasťou, objektom alebo časovým úsekom vo vizuálnom vstupe. Model môže pre opis vrátiť bounding box, masku, bod, region token alebo segment videa. Úloha vyžaduje nielen rozpoznať kategóriu, ale aj rozlíšiť referenčné vlastnosti a vzťahy, napríklad druhý červený pohár vľavo od knihy. Grounding sa používa pri interaktívnej segmentácii, robotike a vysvetlení multimodálnych odpovedí. Pozornosť modelu sama o sebe nie je dôkaz správneho groundingového rozhodnutia.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Keď používateľ povie označ poškodený ventil na fotografii, systém nemá iba odpovedať, že ventil vidí. Musí ukázať presné miesto, ktorého sa výraz týka. Pri jednoduchom objekte stačí box, pri nepravidelnej škvrne je vhodnejšia maska. Náročnosť rastie, keď sú na obraze podobné predmety a opis používa farbu, poradie alebo vzťah k inému objektu. Správny text bez správnej lokalizácie môže byť v údržbe, medicíne alebo robotike nebezpečný.

Časté otázky

Časté otázky

Ako sa visual grounding líši od object detection?

Detekcia hľadá objekty z vopred definovaných tried. Grounding lokalizuje referent opísaný prirodzeným jazykom, vrátane vlastností a vzťahov.

Čo je referring expression comprehension?

Úloha, pri ktorej model pre textový opis vyberie alebo lokalizuje zodpovedajúci objekt v obraze. Je jednou z hlavných foriem groundingu.

Stačí ako dôkaz attention mapa?

Nie. Attention môže byť rozptýlená alebo slúžiť inému výpočtovému účelu. Grounding treba hodnotiť explicitným boxom, maskou alebo bodovou anotáciou.

Aké metriky sa používajú?

Pri boxoch najmä Intersection over Union a accuracy pri zvolenom prahu, pri maskách IoU alebo Dice, pri bodoch vzdialenosť k anotovanému regiónu.

Prečo je grounding dôležitý pre VLM?

Umožňuje overiť, či odpoveď vychádza z relevantnej časti obrazu, a podporuje následnú akciu, napríklad výber objektu robotom alebo používateľom.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Visual Grounding with Transformers MDETR: Modulated Detection for End-to-End Multi-Modal Understanding

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.