Odborná definice
Odborná definice
Visual grounding spojuje jazykový výraz s konkrétnou oblasťou, objektem nebo časovým úsekom ve vizuálnom vstupe. Model může pro popis vrátit bounding box, masku, bod, region token nebo segment videa. Úloha vyžaduje nejen rozpoznat kategorii, ale i rozlíšit referenční vlastnosti a vztahy, například druhý červený pohár vlavo od knihy. Grounding se používá při interaktivní segmentaci, robotike a vysvětlení multimodálnych odpovědí. Pozornost modelu sama o sebe není důkaz správného groundingového rozhodnutí.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Když uživatel řekne označ poškodený ventil na fotografii, systém nemá pouze odpovídat, že ventil vidí. Musí ukázat přesné místo, kterého se výraz týká. Při jednoduchom objektu stačí box, při nepravidelnej škvrne je vhodnější maska. Náročnost roste, když jsou na obraze podobné predmety a popis používá farbu, pořadí nebo vztah k jinému objektu. Správný text bez správné lokalizace může být v údržbe, medicíne nebo robotike nebezpečný.
Časté otázky
Časté otázky
Jak se visual grounding liší od object detection?
Detekce hledá objekty z předem definovaných tříd. Grounding lokalizuje referent opísaný prirodzeným jazykem, včetně vlastností a vztahů.
Co je referring expression comprehension?
Úloha, při které model pro textový popis vybere nebo lokalizuje zodpovedajúci objekt v obraze. Je jednou z hlavních foriem groundingu.
Stačí jako důkaz attention mapa?
Ne. Attention může být rozptýlená nebo slúžit jinému výpočtovému účelu. Grounding je třeba hodnotit explicitným boxom, maskou nebo bodovou anotací.
Jaké metriky se používají?
Při boxoch zejména Intersection over Union a accuracy při zvoleném prahu, při maskách Iou nebo Dice, při bodech vzdálenost k anotovanému regiónu.
Proč je grounding důležitý pro VLM?
Umožňuje ověřit, či odpověď vychází z relevantnej části obrazu, a podporuje následnou akci, například výběr objektu robotom nebo uživatelům.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Visual Grounding with Transformers MDETR: Modulated Detection for End-to-End Multi-Modal Understanding
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
