Odborná definícia
Odborná definícia
Visual grounding spája jazykový výraz s konkrétnou oblasťou, objektom alebo časovým úsekom vo vizuálnom vstupe. Model môže pre opis vrátiť bounding box, masku, bod, region token alebo segment videa. Úloha vyžaduje nielen rozpoznať kategóriu, ale aj rozlíšiť referenčné vlastnosti a vzťahy, napríklad druhý červený pohár vľavo od knihy. Grounding sa používa pri interaktívnej segmentácii, robotike a vysvetlení multimodálnych odpovedí. Pozornosť modelu sama o sebe nie je dôkaz správneho groundingového rozhodnutia.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Keď používateľ povie označ poškodený ventil na fotografii, systém nemá iba odpovedať, že ventil vidí. Musí ukázať presné miesto, ktorého sa výraz týka. Pri jednoduchom objekte stačí box, pri nepravidelnej škvrne je vhodnejšia maska. Náročnosť rastie, keď sú na obraze podobné predmety a opis používa farbu, poradie alebo vzťah k inému objektu. Správny text bez správnej lokalizácie môže byť v údržbe, medicíne alebo robotike nebezpečný.
Časté otázky
Časté otázky
Ako sa visual grounding líši od object detection?
Detekcia hľadá objekty z vopred definovaných tried. Grounding lokalizuje referent opísaný prirodzeným jazykom, vrátane vlastností a vzťahov.
Čo je referring expression comprehension?
Úloha, pri ktorej model pre textový opis vyberie alebo lokalizuje zodpovedajúci objekt v obraze. Je jednou z hlavných foriem groundingu.
Stačí ako dôkaz attention mapa?
Nie. Attention môže byť rozptýlená alebo slúžiť inému výpočtovému účelu. Grounding treba hodnotiť explicitným boxom, maskou alebo bodovou anotáciou.
Aké metriky sa používajú?
Pri boxoch najmä Intersection over Union a accuracy pri zvolenom prahu, pri maskách IoU alebo Dice, pri bodoch vzdialenosť k anotovanému regiónu.
Prečo je grounding dôležitý pre VLM?
Umožňuje overiť, či odpoveď vychádza z relevantnej časti obrazu, a podporuje následnú akciu, napríklad výber objektu robotom alebo používateľom.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Visual Grounding with Transformers MDETR: Modulated Detection for End-to-End Multi-Modal Understanding
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
