Multimodální porozumění

vizuálně ukotvení

Visual grounding spojuje jazykový výraz s konkrétnou oblasťou, objektem nebo časovým úsekom ve vizuálnom vstupe. Model může pro popis vrátit bounding box, masku, bod, region token nebo segment videa. Úloha vyžaduje nejen rozpoznat kategorii, ale i rozlíšit referenční vlastnosti a vztahy, například druhý červený pohár vlavo od knihy. Grounding se používá při interaktivní segmentaci, robotike a vysvětlení multimodálnych odpovědí. Pozornost modelu sama o sebe není důkaz správného groundingového rozhodnutí.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-18

Odborná definice

Odborná definice

Visual grounding spojuje jazykový výraz s konkrétnou oblasťou, objektem nebo časovým úsekom ve vizuálnom vstupe. Model může pro popis vrátit bounding box, masku, bod, region token nebo segment videa. Úloha vyžaduje nejen rozpoznat kategorii, ale i rozlíšit referenční vlastnosti a vztahy, například druhý červený pohár vlavo od knihy. Grounding se používá při interaktivní segmentaci, robotike a vysvětlení multimodálnych odpovědí. Pozornost modelu sama o sebe není důkaz správného groundingového rozhodnutí.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Když uživatel řekne označ poškodený ventil na fotografii, systém nemá pouze odpovídat, že ventil vidí. Musí ukázat přesné místo, kterého se výraz týká. Při jednoduchom objektu stačí box, při nepravidelnej škvrne je vhodnější maska. Náročnost roste, když jsou na obraze podobné predmety a popis používá farbu, pořadí nebo vztah k jinému objektu. Správný text bez správné lokalizace může být v údržbe, medicíne nebo robotike nebezpečný.

Časté otázky

Časté otázky

Jak se visual grounding liší od object detection?

Detekce hledá objekty z předem definovaných tříd. Grounding lokalizuje referent opísaný prirodzeným jazykem, včetně vlastností a vztahů.

Co je referring expression comprehension?

Úloha, při které model pro textový popis vybere nebo lokalizuje zodpovedajúci objekt v obraze. Je jednou z hlavních foriem groundingu.

Stačí jako důkaz attention mapa?

Ne. Attention může být rozptýlená nebo slúžit jinému výpočtovému účelu. Grounding je třeba hodnotit explicitným boxom, maskou nebo bodovou anotací.

Jaké metriky se používají?

Při boxoch zejména Intersection over Union a accuracy při zvoleném prahu, při maskách Iou nebo Dice, při bodech vzdálenost k anotovanému regiónu.

Proč je grounding důležitý pro VLM?

Umožňuje ověřit, či odpověď vychází z relevantnej části obrazu, a podporuje následnou akci, například výběr objektu robotom nebo uživatelům.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Visual Grounding with Transformers MDETR: Modulated Detection for End-to-End Multi-Modal Understanding

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.